Aryn.ai
Aryn 是一个由 AI 驱动的文档解析和 ETL 系统,用于处理复杂的非结构化数据,如 PDF、HTML 和演示文稿等。它可以处理 30 多种文件格式,并能够高质量地提取表格、图像等。您可以用 Aryn 对文档进行分块、提取元数据、创建向量嵌入,并用高质量的数据加载您的 Elasticsearch 向量和关键词索引。
Aryn 的文档 ETL 系统有两个组件:
Aryn DocParse 是一项用于分割和标记文档、运行光学字符识别 (OCR) 以及提取表格和图像的服务。它能够以 JSON 或 Markdown 格式返回每个文档的结构化输出,并为标题、表格、表格行、列、图片和普通文本提供带标签的边界框。DocParse 可以处理超过 30 种文档格式,包括 PDF、Microsoft Word、Microsoft PowerPoint 和纯文本等。它依托于 Aryn Partitioner 及其业界尖端的开源深度学习 AI 模型(该模型基于 8 万多份企业级文档训练而成)。DocParse 可应用于 GenAI 应用的文档 ETL 管道,也可以仅用于表格提取和文档处理工作流(如本视频所示)。
Aryn DocPrep 是一款用于创建文档 ETL 管道的工具,用于处理复杂的非结构化数据,并将其加载到向量数据库和混合搜索引擎(如 Elasticsearch)。这些管道使用 DocParse 进行文档分区,并利用开源且具可扩展性的 Sycamore 文档 ETL 库生成 Python 版本的管道代码。DocPrep 与 Sycamore 能够为 Elasticsearch 索引提供可扩展且可靠的数据加载,并内置了多种利用大语言模型 (LLM) 的强大数据转换功能,包括实体提取、数据清洗、语义操作、向量嵌入生成以及数据富化。