Aryn.ai
Aryn est un système d’analyse de documents et d’ETL alimenté par l’IA destiné aux données complexes et non structurées telles que fichiers PDF, HTML, les présentations, etc. Il peut traiter plus de 30 formats de fichiers et extraire des tableaux, des images et plus encore en haute qualité. Vous pouvez utiliser Aryn pour segmenter des documents, extraire des métadonnées, créer des embeddings vectoriels et charger les index vectoriels et les index de mots-clés Elasticsearch avec des données de haute qualité.
Le système ETL de documents d’Aryn comporte deux composantes :
Aryn DocParse est un service de segmentation et d’étiquetage de documents, d’exécution de la reconnaissance optique de caractères (OCR) et d’extraction de tables et d’images. Il peut renvoyer le contenu structuré de chaque document en JSON ou Markdown et fournit des boîtes de sélection étiquetés pour les titres, les tableaux, les lignes et les colonnes des tableaux, les images et le texte courant. DocParse peut traiter plus de 30 types de formats de documents, notamment les PDF, Microsoft Word, Microsoft PowerPoint, le texte, et bien plus encore. Il s’appuie sur Aryn Partitioner et son modèle d’IA basé sur l’apprentissage profond, open source de pointe, basé sur plus de 80 000 documents d’entreprise. DocParse peut être utilisé dans le pipeline ETL de documents pour les applications d’IA générative ou simplement pour l’extraction de tableaux et le workflow de traitement de documents (comme dans cette vidéo).
Aryn DocPrep est un outil permettant de créer des pipelines ETL de documents pour traiter des données complexes et non structurées et les charger dans des bases de données vectorielles et des moteurs de recherche hybrides comme Elasticsearch. Les pipelines utilisent DocParse pour le partitionnement des documents et génèrent du code de pipeline ETL en Python grâce à la bibliothèque ETL de documents Sycamore, open source et évolutive. DocPrep et Sycamore offrent un chargement évolutif et fiable des indices Elasticsearch, et incluent une variété de transformations de données puissantes qui exploitent les LLM, notamment l’extraction d’entités, le nettoyage des données, les opérations sémantiques, la génération d’embeddings vectoriels et l’enrichissement des données.