Aryn.ai
O Aryn é um sistema de análise de documentos e ETL movido por IA para dados complexos e não estruturados, como PDFs, HTML, apresentações e outros. Ele pode processar mais de 30 formatos de arquivo e extrair tabelas, imagens e outros, tudo com qualidade. Você pode usar o Aryn para fragmentar documentos, extrair metadados, criar incorporações vetoriais e carregar seus índices vetoriais e de palavras-chave do Elasticsearch com dados de qualidade.
O sistema ETL de documentos de Aryn possui dois componentes:
O Aryn DocParse é um serviço para segmentar e rotular documentos, executar reconhecimento óptico de caracteres (OCR) e extrair tabelas e imagens. Ele pode retornar a saída estruturada de cada documento em JSON ou Markdown e fornece caixas delimitadoras rotuladas para títulos, tabelas, linhas de tabela e colunas, imagens e texto regular. O DocParse pode processar mais de 30 tipos de formato de documentos, incluindo PDFs, Microsoft Word, Microsoft PowerPoint e texto. Ele usa o Aryn Partitioner e seu modelo de IA de aprendizado profundo de open source de última geração, treinado em mais de 80 mil documentos empresariais. O DocParse pode ser usado em pipelines de ETL de documentos para apps de GenAI ou apenas para extração de tabelas e fluxos de trabalho de processamento de documentos (como neste vídeo).
O Aryn DocPrep é uma ferramenta para criar pipelines de ETL de documentos para processar dados não estruturados complexos e carregá-los em bancos de dados vetoriais e mecanismos de busca híbridos como o Elasticsearch. Os pipelines usam o DocParse para particionamento de documentos e geram código de pipeline ETL em Python usando a biblioteca de ETL de documentos Sycamore, open source e escalável, biblioteca de ETL de documentos Sycamore. DocPrep e Sycamore fornecem carregamento escalável e confiável de índices Elasticsearch e incluem uma variedade de transformações poderosas de dados que usam LLMs, incluindo extração de entidades, limpeza de dados, operações semânticas, geração de embeddings vetoriais e enriquecimento de dados.