Aryn.ai
Aryn es un sistema de análisis de documentos y ETL impulsado por IA para datos complejos y no estructurados como PDFs, HTML, presentaciones y más. Puede procesar más de 30 formatos de archivo y extraer tablas, imágenes y más con alta calidad. Puedes usar Aryn para segmentar documentos, extraer metadatos, crear incrustaciones vectoriales y cargar tus índices vectoriales y de palabras clave de Elasticsearch con datos de alta calidad.
El sistema ETL de documentos de Aryn tiene dos componentes:
Aryn DocParse es un servicio para segmentar y etiquetar documentos, ejecutar reconocimiento óptico de caracteres (OCR) y extraer tablas e imágenes. Puede devolver la salida estructurada de cada documento en JSON o Markdown y proporciona cuadros delimitadores etiquetados para títulos, tablas, filas de tablas y columnas, imágenes y texto regular. DocParse puede procesar más de 30 tipos de formatos de documentos, incluyendo PDF, Microsoft Word, Microsoft PowerPoint, texto y más. Aprovecha el Aryn Partitioner y su modelo de IA de aprendizaje profundo open source de última generación, entrenado con más de 80 000 documentos empresariales. DocParse puede usarse en pipelines de ETL de documentos para apps GenAI o simplemente para extracción de tablas y flujos de trabajo de procesamiento de documentos (como en este video).
Aryn DocPrep es una herramienta para crear pipelines ETL de documentos para procesar datos complejos y no estructurados y cargarlos en bases de datos vectoriales y motores de búsqueda híbridos como Elasticsearch. Las pipelines emplean DocParse para la partición de documentos y generan código ETL en Python empleando la biblioteca ETL de documentos Sycamore open source y de escalabilidad. DocPrep y Sycamore proporcionan una carga escalable y fiable de índices de Elasticsearch, e incluyen una variedad de poderosas transformaciones de datos que aprovechan los LLM, incluyendo extracción de entidades, limpieza de datos, operaciones semánticas, generación de incrustaciones vectoriales y enriquecimiento de datos.