Aryn.ai
Arynは、PDF、HTML、プレゼンテーションなどの複雑な非構造化データに対応するAI搭載の文書解析およびETLシステムです。30種類以上のファイル形式を処理し、表、画像などを高品質で抽出できます。Arynを使用すると、ドキュメントのチャンク化、メタデータの抽出、ベクトル埋め込みの作成、高品質なデータを用いたElasticsearchのベクトルインデックスとキーワードインデックスのロードを行うことができます。
ArynのドキュメントETLシステムは2つのコンポーネントで構成されています。
Aryn DocParseは、文書の分割とラベル付け、光学文字認識(OCR)の実行、表や画像の抽出を行うサービスです。各文書の構造化された出力(JSONまたはMarkdown形式)を返すことができ、タイトル、表、表の行と列、画像、通常のテキストにラベル付きのバウンディングボックスを提供します。DocParseは、PDF、Microsoft Word、Microsoft PowerPoint、テキストなど、30種類以上の文書形式を処理できます。Aryn Partitionerと、8万以上のエンタープライズ文書で訓練された最先端のオープンソース深層学習AIモデルを活用しています。DocParseは生成AIアプリのドキュメントETLパイプラインや、テーブル抽出やドキュメント処理のワークフロー(この動画のように)に使用できます。
Aryn DocPrepは、複雑で非構造化データを処理し、ベクトルデータベースやElasticsearchのようなハイブリッド検索エンジンに読み込むための文書ETLパイプラインを作成するためのツールです。パイプラインはドキュメントの分割にDocParseを使用し、オープンソースのスケーラブルなSycamoreドキュメントETLライブラリを用いてPythonでETLパイプラインコードを生成します。DocPrepとSycamoreは、Elasticsearchインデックスの拡張性と信頼性の高いロードを提供し、エンティティ抽出、データクリーニング、セマンティック操作、ベクトル埋め込み生成、データ強化など、LLMを活用したさまざまな強力なデータ変換を含みます。