Intégrations

Aryn.ai

Intégration

Aryn est un système d’analyse de documents et d’ETL alimenté par l’IA destiné aux données complexes et non structurées telles que fichiers PDF, HTML, les présentations, etc. Il peut traiter plus de 30 formats de fichiers et extraire des tableaux, des images et plus encore en haute qualité. Vous pouvez utiliser Aryn pour segmenter des documents, extraire des métadonnées, créer des embeddings vectoriels et charger les index vectoriels et les index de mots-clés Elasticsearch avec des données de haute qualité.

Le système ETL de documents d’Aryn comporte deux composantes :

  • Aryn DocParse est un service de segmentation et d’étiquetage de documents, d’exécution de la reconnaissance optique de caractères (OCR) et d’extraction de tables et d’images. Il peut renvoyer le contenu structuré de chaque document en JSON ou Markdown et fournit des boîtes de sélection étiquetés pour les titres, les tableaux, les lignes et les colonnes des tableaux, les images et le texte courant. DocParse peut traiter plus de 30 types de formats de documents, notamment les PDF, Microsoft Word, Microsoft PowerPoint, le texte, et bien plus encore. Il s’appuie sur Aryn Partitioner et son modèle d’IA basé sur l’apprentissage profond, open source de pointe, basé sur plus de 80 000 documents d’entreprise. DocParse peut être utilisé dans le pipeline ETL de documents pour les applications d’IA générative ou simplement pour l’extraction de tableaux et le workflow de traitement de documents (comme dans cette vidéo).

  • Aryn DocPrep est un outil permettant de créer des pipelines ETL de documents pour traiter des données complexes et non structurées et les charger dans des bases de données vectorielles et des moteurs de recherche hybrides comme Elasticsearch. Les pipelines utilisent DocParse pour le partitionnement des documents et génèrent du code de pipeline ETL en Python grâce à la bibliothèque ETL de documents Sycamore, open source et évolutive. DocPrep et Sycamore offrent un chargement évolutif et fiable des indices Elasticsearch, et incluent une variété de transformations de données puissantes qui exploitent les LLM, notamment l’extraction d’entités, le nettoyage des données, les opérations sémantiques, la génération d’embeddings vectoriels et l’enrichissement des données.

Commencer

  1. Blog : RAG de haute qualité avec Aryn DocPrep, DocParse et la base de données vectorielle Elasticsearch

  2. Notebook : RAG avec Aryn pour Elasticsearch.

Prêt à créer des expériences de recherche d'exception ?

Une recherche suffisamment avancée ne se fait pas avec les efforts d'une seule personne. Elasticsearch est alimenté par des data scientists, des ML ops, des ingénieurs et bien d'autres qui sont tout aussi passionnés par la recherche que vous. Mettons-nous en relation et travaillons ensemble pour construire l'expérience de recherche magique qui vous permettra d'obtenir les résultats que vous souhaitez.

Jugez-en par vous-même