Aryn.ai
Aryn은 PDF, HTML, 프레젠테이션 등 복잡한 비정형 데이터를 위한 AI 기반 문서 파싱 및 ETL 시스템입니다. 이 소프트웨어는 30가지 이상의 파일 형식을 처리하고 표, 이미지 등을 높은 품질로 추출할 수 있습니다. Aryn을 사용하여 문서를 청킹하고, 메타데이터를 추출하며, 벡터 임베딩을 생성하고, 고품질 데이터로 Elasticsearch 벡터 및 키워드 인덱스를 로드할 수 있습니다.
Aryn의 문서 ETL 시스템은 두 가지 구성 요소로 구성됩니다:
Aryn DocParse는 문서 분할 및 라벨링, 광학 문자 인식(OCR) 실행, 표 및 이미지 추출을 위한 서비스입니다. 각 문서의 구조화된 출력을 JSON 또는 마크다운으로 반환할 수 있으며, 제목, 표, 표 행 및 열, 이미지 및 일반 텍스트에 레이블이 지정된 경계 상자를 제공합니다. DocParse는 PDF, Microsoft Word, Microsoft PowerPoint, 텍스트 등 30가지 이상의 문서 형식을 처리할 수 있습니다. 이 도구는 80만 개 이상의 기업용 문서에서 학습된 최첨단 오픈 소스 딥러닝 AI 모델인 Aryn Partitioner를 활용합니다. DocParse는 GenAI 앱의 문서 ETL 파이프라인에서 사용하거나 테이블 추출 및 문서 처리 워크플로우(예: 이 동영상)에서 사용할 수 있습니다.
Aryn DocPrep은 복잡한 비정형 데이터를 처리하고 벡터 데이터베이스와 Elasticsearch 등의 하이브리드 검색 엔진에 로드하기 위한 문서 ETL 파이프라인을 생성하는 도구입니다. 파이프라인은 문서 분할에 DocParse를 사용하며, 오픈 소스이자 확장 가능한 Sycamore 문서 ETL 라이브러리를 사용하여 Python으로 ETL 파이프라인 코드를 생성합니다. DocPrep과 Sycamore는 엔티티 추출, 데이터 정리, 시맨틱 작업, 벡터 임베딩 생성 및 데이터 강화 등 LLM을 활용하는 다양하고 강력한 데이터 변환을 포함하여 Elasticsearch 인덱스의 확장 가능하고 신뢰할 수 있는 로딩을 제공합니다.