<?xml version="1.0" encoding="UTF-8"?>
<rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0">
  <channel>
    <title><![CDATA[Jina AI - Elasticsearch Labs]]></title>
    <description><![CDATA[Articles and tutorials from the Search team at Elastic]]></description>
    <copyright><![CDATA[© 2026. Elasticsearch B.V. All Rights Reserved]]></copyright>
    <image>
      <title><![CDATA[Jina AI - Elasticsearch Labs]]></title>
      <url>https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt1121c0bf0e8a6e65/6a88da6340a1841030ef456f/search-labs-thumbnail.png</url>
      <link>https://www.elastic.co/jp/search-labs/blog/category/jina-ai</link>
    </image>
    <link>https://www.elastic.co/jp/search-labs/blog/category/jina-ai</link>
    <atom:link href="https://www.elastic.co/jp/search-labs/rss/category/jina-ai.xml" rel="self" type="application/rss+xml"/>
    <language><![CDATA[jp]]></language>
    <lastBuildDate>Mon, 28 Sep 2026 23:51:33 GMT</lastBuildDate>
  <item>
    <title><![CDATA[5分未満でオンプレミスに：Jina埋め込みモデルがオンプレミス導入に対応]]></title>
    <description><![CDATA[リランカーを含む全28種類のJina AIモデルを、テレメトリなし、ライセンスサーバーなしで、すぐにデプロイ可能なDockerコンテナーとして利用できます。OpenAI、Cohere、Voyage AI、Elastic Inference ServiceのAPIとドロップイン互換です。]]></description>
    <content:encoded><![CDATA[<p>Jina AIの28種類の埋め込みモデルおよび再ランク付けモデルはすべて、<a href="https://www.elastic.co/jp/search-labs/blog/jina-embeddings-v5-omni-all-media-one-index">jina-embeddings-v5-omni</a><a href="https://www.elastic.co/jp/search-labs/blog/jina-embeddings-v5-omni-all-media-one-index"> </a>や<a href="https://www.elastic.co/jp/search-labs/tutorials/jina-tutorial/jina-reranker-v3">jina-reranker-v3</a>を含め、オンプレミス導入用の完全オフラインのDockerコンテナーとして提供されるようになりました。1つダウンロードしてオンプレミスのエアギャップ環境やファイアウォールで保護されたシステムに転送するだけで、5分未満でローカル推論を実行できます。コンテナーは完全に自己完結型であり、外部接続を一切行いません。Hugging Faceやモデルレジストリへの呼び出しは発生しません。ライセンスサーバー、テレメトリ、ログエンドポイントも一切存在しません。これにより、規制対象の業界、データ主権要件、またはインターネットアクセスが不安定あるいはまったく利用できない環境において、サードパーティのAIサービスへの依存を解消できます。Jina On-Premは、Elastic Inference Service（EIS）、OpenAI、Cohere、Voyage AI、GeminiのAPIスキーマをサポートしているため、既存のアプリケーションをコード変更なしで動作させることができます。</p><p>最も強力なAIモデルはWeb API経由でアクセスするリモートのクラウド環境で実行されるため、セキュリティ、サービスの可用性、および安定した価格に関してAIサービスプロバイダーを信頼する必要があります。信頼性、プライバシー、管理可能なコスト、優れたデータガバナンスに対する合理的な要求と、ますます強力で高度かつ多くのリソースを必要とするAIの利用を簡単に両立させることはできません。</p><p>政府の規制、裁判所の決定、他者の利益を考慮したビジネス上の判断はいずれも、最近、特定のサービスへのアクセスを制限する結果となっています。また、他のサービスに切り替えることができたとしても、AIモデルはいつでも好きなときに簡単に交換できるようなコンポーネントではありません。セマンティック埋め込みを使用するアプリケーションは、データインジェスト時と同じモデルにクエリ時にもアクセスできることに依存しています。埋め込みモデルへのアクセスを失うことは、検索システムが停止することを意味します。</p><p>AI価格設定モデルはそのリスクをさらに増大させます。主要なAIベンダーによる最近の財務情報開示は、顧客が潜在的な値上げを懸念する十分な理由となっています。予測不能なコストを伴う製品への依存は、明確なリターンを生み出さない可能性がある資本集約的なAI投資に、さらなるリスクをもたらします。</p><p>Jina On-Premは、これらの課題に対するElasticの解決策です。</p><h2>オンプレミスAIを必要とするのは誰でしょうか？</h2><p>ローカルホスティングとAIモデルの直接制御により、さまざまな技術的要求、業界の要件、ビジネス上のニーズに対応できます。</p><p>ローカルにインストールすることで、AIサービスプロバイダーに支払う費用は削減できますが、ハードウェアや信頼性の高いアクセスのコストは組織が負担することになります。利用量によっては、単純にその方が安くなる場合もあります。しかし、自社でAIを実行することを検討すべき差し迫った理由は他にもあります。以下で説明する課題のいずれかが貴社に関係する場合は、Jina On-PremのようなローカルAIソリューションをご検討ください。このリストはすべてを網羅したものではありません。</p><p>ユースケース</p><p>なぜオンプレミスなのか</p><p>例</p><p>エアギャップ/高セキュリティ</p><p>アウトバウンドデータ送信なし、完全なネットワーク分離</p><p>防衛、インテリジェンス、機密研究</p><p>規制遵守</p><p>データ主権、国境を越えた送信やサードパーティへの露出なし</p><p>ヘルスケア（医療保険の相互運用性と説明責任に関する法律［HIPAA］）、金融、EU企業（一般データ保護規制［GDPR］）</p><p>レイテンシが重要</p><p>ネットワーク依存なし、接続障害は許容されない</p><p>ロボティクス、エッジコンピューティング、車両、船舶</p><p>コストの予測可能性</p><p>固定インフラコスト vs. 将来の料金が不確実なトークンごとの価格設定</p><p>大容量かつ継続的な推論ワークロード</p><p>責任の軽減</p><p>サードパーティへのデータ露出なし、法的特権と注意義務を維持</p><p>法律事務所、政府機関</p><h3>エアギャップ環境やファイアウォールで保護されたシステムにオンプレミスAIが必要な理由</h3><p>エアギャップ環境やファイアウォールで保護されたシステムでは、外部のAI APIを使用できません。Jina On-Premは、外部接続なしでお客様のインフラ上で完全に実行されます。</p><p>特に機密性の高いデータを管理する組織にとって、セキュリティとプライバシーへの配慮は最重要課題です。十分なセキュリティ対策が講じられていなかったり、外国政府の要求に従う可能性があったりする外部のサードパーティに機密データをすぐに渡してしまうのであれば、その保護に投資してもほとんど意味がありません。</p><p>機密データを扱う組織の従業員は、安全なデータ処理に関するトレーニングを受けることがよくありますが、そのデータを扱っている最中にインターネット上のあらゆるページを開くことができるWebブラウザーを全員が使用している場合、このトレーニングはあまり効果的ではありません。エアギャップや非常に厳格なファイアウォールによる分離は、利用可能な最も効果的なセキュリティ対策ですが、それによってあらゆる種類の外部サービスを利用することが困難になります。</p><h3>レイテンシの影響を受けやすいシステムや高可用性システム向けのオンプレミスAI</h3><p>サービスとしてのソフトウェア（SaaS）やクラウドコンピューティングは、自前のコンピューターでアクセス性と信頼性の高いサービスを提供するコストと、問題を他社にアウトソーシングすることとの間の妥協案です。しかし、これらにはレイテンシの変動や障害が伴い、問題が発生した際にコントロールを完全に失うことになります。AIサービスも例外ではありません。埋め込みモデルにアクセスできないときに検索システムがオフラインになるのであれば、それはもはや優れた妥協案とは言えないかもしれません。</p><p>さらに、外部のAIに依存すると、簡単に予測や管理ができないリスクが常に伴います。政治的出来事、悪天候、または海底光ファイバーケーブルにアンカーを引っ掛ける船舶などが原因で、インターネットアクセスやネットワークのレイテンシーは予告なく悪化する可能性があります。政府機関は、AIモデルへのアクセスを突然ブロックするために輸出禁止措置を使用することがあり、実際、近年そのような事例が発生しています。AIサービスプロバイダーは、より新しいモデルへの切り替えを促すために、モデルの提供を終了することがあります。外部サービスの柔軟性と管理可能なコストは、依存に伴うリスクとのバランスを取る必要があります。</p><h3>GDPR、HIPAA、データ主権のコンプライアンスに対応するオンプレミスAI</h3><p>個人データを収集する組織は、管轄区域によって異なり、相反する要件が課されることもある、ますます厳格な規制の対象となります。特に、<a href="https://www.hhs.gov/hipaa/for-professionals/privacy/laws-regulations/index.html">HIPAAの規則</a>は米国の医療提供者に非常に厳格なデータ保護を課しており、また<a href="https://laws-lois.justice.gc.ca/eng/acts/p-8.6/">カナダ</a>、<a href="https://gdpr-info.eu/">欧州連合</a>、および<a href="https://www.japaneselawtranslation.go.jp/en/laws/view/4241">多くのアジアの管轄区域</a>における厳格な一般データ保護法では、個人情報を扱うすべての企業に対して、安全な方法で処理を行うこと、およびそのデータの他の当事者や他の管轄区域への転送を制限することが義務付けられています。これらの規則は、外国の事業者がそれらの管轄区域内に顧客を持っている場合、その事業者に対しても義務を課すことがあります。金融機関は、多くの場合、さらに厳格な規則の対象となり、他の形態の犯罪行為に対して負うのと同様に、情報セキュリティに対しても直接的な責任を負います。</p><p>規制への準拠は、特にサードパーティのAIサービスの使用に国境を越えたデータ送信が伴う場合、それらのサービスと両立しない可能性があります。</p><p>さらに、最近の出来事が示しているように、国際的なクラウド事業者が外国政府からの圧力を受けた場合、データストアの物理的な場所を制限する規則は信頼できる保護手段とならない可能性があります。国内法が管轄区域間で抵触し、ローカルでのデータストレージと処理が義務付けられ、サードパーティサービスの利用が不可能になる場合があります。場合によっては、AIシステムを含め、プロセスのすべての部分をインハウス化することだけが唯一のソリューションとなることもあります。</p><h3>サードパーティのデータ送信によるAIの法的責任リスク</h3><p>データ保護法や機密データの取り扱いに関する注意義務は、通常、法的責任を伴い、時には非常に重大なものとなることがあります。サードパーティのサービス提供業者によるデータの取り扱いについて、お客様が法的責任を負う可能性があります。裁判所や法的手続きによって、安全でないサービス提供業者からある程度事後的な保護が得られる場合もありますが、そうした救済措置は、国家安全保障機関、法執行機関、あるいは犯罪的なハッカーに対しては利用できないか、一般的にも有効ではありません。</p><p>政府に関しては、国境を越えてサービスを提供するクラウドサービスプロバイダーが、機密性の高い国家情報を外国の関係者に開示した事例がすでに発生しています。</p><p>しかし、外国の政府やハッカーについて心配しておらず、外部のAIサービスプロバイダー自体が安全である場合であっても、それらが外部にあるという事実だけで法的責任が生じる可能性があります。</p><p>例えば、ほとんどの管轄区域において、弁護士とクライアントとのコミュニケーションは特別な法的保護を受けており、法律事務所がこの情報を記録または格納する際には厳格な法的責任を負います。米国では、この「弁護士・クライアント間の秘匿特権」は非常に有名で、映画やテレビ番組のプロットの中心にもなっています。しかし、その秘匿特権が失われる理由の1つとして、特権を有しない人物と情報を共有することが挙げられ、最近の動向からは、外部のAIサービスプロバイダーがそのような人物に該当する可能性があることが示唆されています。</p><p>少なくともアメリカ合衆国においては、インデキシングサービスを提供する埋め込みモデルなど、サードパーティのAIサービスをインターネットAPI経由で利用するだけでも、重大な機密保持規則に違反する可能性があります。法律事務所は、セキュリティ侵害が発生しなかったとしても、外部でホストされているソフトウェアを使用しているというだけで、訴訟を起こされたり、懲戒処分を受けたり、弁護士資格を剥奪されたりする可能性があります。</p><h3>オフライン、エッジ、および物理的に隔離されたシステム向けのオンプレミスAI</h3><p>コンピューターシステムが分離される理由は、セキュリティ上の理由だけではありません。例えば、移動する車両は、不可欠な機能においてインターネット接続に頼ることはできません。船舶や航空機には非常に大規模なオンボードコンピューターシステムが搭載されており、インターネット接続なしで機能する必要があるため、外部のAIサービスを使用することはできません。海洋プラットフォーム、僻地にあるリモート施設、北極や南極、グローバルネットワークへの適切な物理接続がない小さな島々にあるコンピューターサービスはすべて、必要なすべてのサービスをローカルでホストすることでメリットを得られる設備の例です。エンタープライズコンピューティングにおけるAIの役割が大きくなるにつれ、これらの制限に対処することがより重要になります。</p><p>物理システムへのAIの新たな応用（ロボティクスや、物流管理システム、さらにはスーパーマーケットのレジなどの、限られた空間内で動作する、または現実世界を対象とするその他のユースケース）は、グローバルインターネットに接続されている可能性がありますが、接続障害やレイテンシーの急増を許容することはできません。運用のためにAIシステムに依存している場合、そのAIシステムは可能な限りローカルで、信頼性が高くなければなりません。</p><h2>オンプレミスAIを必要としないのは誰でしょうか？</h2><p>リモートソフトウェアサービスやオフサイトAIには、確かにメリットがあります。AIモデルの実行には、寿命が短いことで知られる、高価で消費電力の大きいプロセッサーが必要になる場合があります。市場要因や外部の経済ショックにより、現在、高品質なハードウェアの入手は特に困難になっています。このような状況下では、ローカルAIの高額な資本コストを負担する代わりに、外部APIを使用してトークン単位で支払う方が理にかなっている場合があります。</p><p>外部APIは、断続的に利用するユーザーに最も適しています。AIモデルを主に分析のためのデータのバッチ処理に使用し、常時オンラインで稼働させる必要のある検索システムを実行しない場合、多額の資本を要するハードウェアやローカル環境への投資はほとんど意味がありません。</p><p>さらに、信頼性やアクセシビリティの理由からクラウドでホストされているEC Webサイトなど、データ処理がすでにクラウドベースである場合、同じクラウドインフラ内にあるAIサービスを使用する方が、独自にライセンスを取得したAIモデルを導入するよりも費用対効果が高くなる可能性があります。すでにクラウドサービスプロバイダーに依存しているため、そのAIサービスに依存してもリスクが大幅に増えることはありません。</p><p>お客様のユースケースがこの説明に当てはまる場合は、お客様のニーズに対応するため、<a href="https://www.elastic.co/docs/explore-analyze/elastic-inference/eis">EIS</a>、<a href="https://aws.amazon.com/marketplace/seller-profile?id=seller-stch2ludm6vgy">AWS Marketplace</a>、<a href="https://console.cloud.google.com/marketplace/browse?q=jina">Google Cloud Platform</a>でJina AIモデルをご利用いただけます。</p><p>以下の表は、主な要素をまとめたものです。どちらが適しているかは、お客様のデータ、インフラ、使用パターンによって異なります。</p><p>要因</p><p>オンプレミスを優先</p><p>Cloud APIを優先</p><p>使用パターン</p><p>継続的または大量の推論</p><p>断続的な処理またはバッチ処理</p><p>データの機密性</p><p>規制対象、データ主権の対象、または機密</p><p>国境を越えたデータ移転や第三者への提供に関する制限なし</p><p>ネットワーク環境</p><p>エアギャップ、ファイアウォール保護、または不安定な環境</p><p>安定した常時接続のインターネット</p><p>既存のインフラ</p><p>GPUハードウェアを所有している、または調達できる</p><p>AIと同じ場所ですでにクラウドホストされている</p><p>コストモデル</p><p>固定ハードウェア + ライセンス、大規模でも予測可能</p><p>トークン単位；初期費用は低く、長期的には変動</p><p>レイテンシー許容度</p><p>なし（ロボティクス、エッジ、リアルタイム）</p><p>ネットワークの変動を許容可能</p><p>運用責任</p><p>お客様のチームがハードウェアと可用性を管理</p><p>プロバイダーがハードウェアとアップデートを管理し、お客様側で統合を管理</p><p>前出のセクションで取り上げた問題のうちお客様に該当するものを踏まえ、個別の状況やユースケースに照らして費用対効果を検討する必要があります。費用対効果分析は、時間の経過とともに変化することは間違いありません。短期的であっても、AI業界の未来やハードウェアの価格を予測することはできません。</p><h2>Jina On-Premのご紹介</h2><p>ローカルAIサービスを活用できるユーザー向けに、Jina AIの高性能モデルを完全に自己完結した形で導入するためのインストールスイートである<a href="https://github.com/jina-ai/jina-on-prem/wiki/">Jina On-Prem</a>をご紹介します。</p><p>Jina AIのモデルは、<a href="https://mteb-leaderboard.hf.space/benchmark/MTEB(Multilingual%2C%20v2)">何倍も大きな</a>埋め込みモデルと同等の精度を誇り、計算コスト、メモリ使用量、ハードウェア要件を削減します。そのため、AIをオンプレミスで維持したい、あるいは維持する必要があるユーザーにとって最適な選択肢となります。商用ライセンスは、あらゆる規模のユースケースに対応する、拡張性がある規模に応じた価格設定のソリューションとして提供されています。</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt190865fb3ebde472/6a6a33d0065b162508701ff9/02559ceca556a26c53eb703ae87d421452b27251-1374x1400.png" alt="MMTEB Multilingual v2 leaderboard showing Jina AI embedding model rankings: jina-embeddings-v5-omni-small and jina-embeddings-v5-text-small ranked 13th, jina-embeddings-v5-omni-nano and jina-embeddings-v5-text-nano ranked 19th, competing against models from Microsoft, Google, Tencent, NVIDIA and Qwen" /><h3>JinaオンプレミスはどのAPIスキーマをサポートしていますか？</h3><ul><li><p>ローカルインストール用の依存関係一式として、あるいは数分でインストールして実行できる<a href="https://www.docker.com/">Dockerコンテナー</a>として利用できます。</p></li><li><p>Jina On-Premインストールは、外部システムを<em>呼び出しません</em>。</p><ul><li><p>Hugging Face Hubやモデルレジストリへの呼び出しは行われません（HF_HUB_OFFLINE=1およびTRANSFORMERS_OFFLINE=1が組み込まれています）。</p></li><li><p>ライセンスサーバーはありません。</p></li><li><p>テレメトリまたはログのエンドポイントはありません。</p></li></ul></li><li><p>CPUとGPUの両方のハードウェアをサポートしており、GPUの自動検出に対応しています。</p></li><li><p>最新の<a href="https://www.elastic.co/jp/search-labs/blog/jina-embeddings-v5-omni-all-media-one-index">jina-embeddings-v5-omni</a>マルチモーダル埋め込みモデルおよび<a href="https://www.elastic.co/jp/search-labs/tutorials/jina-tutorial/jina-reranker-v3">jina-reranker-v3</a>を含む、全28種類のJina AIモデルが利用可能です。</p></li><li><p>標準的なAI APIスキーマ（<a href="https://jina.ai/api-dashboard">Jina API</a>、OpenAI、Cohere、Voyage AI、Gemini）経由でアクセスできます。Jina On-Premは、それらのスキーマ上に構築されたアプリケーション向けのドロップインソリューションです。</p></li><li><p><a href="https://www.elastic.co/docs/explore-analyze/elastic-inference/eis">EIS</a>で提供されるモデルのドロップイン代替として使用できます。Jina On-Premは、<a href="https://www.elastic.co/jp/blog/deploy-elastic-air-gapped-disconnected-environments">エアギャップ環境に導入されたElastic</a>と直接統合されます。</p></li></ul><h2>Jina AIオンプレミスモデルのハードウェア要件</h2><p>ハードウェア要件はJinaモデルによって異なります。以下の表は、GPUを使用する場合の最新モデルの推奨事項を示しています。NVIDIA L4 GPUを上回る性能は必要ありませんが、v5埋め込みモデルにはA100が推奨されます。当社の最新の埋め込みモデルには、現在最低8GBのVRAMが必要です。</p><p>モデル</p><p>最低VRAM</p><p>推奨GPU</p><p>jina-embeddings-v5-text-nano</p><p>2GB</p><p>T4 / L4</p><p>jina-embeddings-v5-text-small</p><p>3GB</p><p>L4 / A10G</p><p>jina-embeddings-v5-omni-small</p><p>8GB</p><p>L4 / A10G / A100</p><p>jina-reranker-v3</p><p>3GB</p><p>L4</p><p>jina-clip-v2</p><p>4GB</p><p>L4</p><p>jina-code-embeddings-1.5b</p><p>4GB</p><p>L4</p><p>ReaderLM-v2</p><p>4GB</p><p>L4</p><p>一度に複数のモデルを使用する場合、必要なVRAM容量が増大します。詳細については、<a href="https://github.com/jina-ai/jina-on-prem/wiki/Sizing-And-Hardware">サイジングとハードウェアのページ</a>をご参照ください。</p><h2>DockerでJina On-Premをインストールする方法</h2><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt20265d09e2d8d0f4/6a6a33d1065b162105701ffd/ada9881af407168298b1940f8537ad71a5411c89-1999x1200.png" alt="" /><p>最もすばやく利用を開始するには、（まだインストールしていない場合は）<a href="https://www.docker.com/get-started/">Dockerをインストール</a>して、<a href="https://github.com/jina-ai/jina-on-prem/wiki/QuickStart">Jina On-Premクイックスタート</a>ページの手順に従います。</p><p>全28種類のJinaモデル向けに、あらかじめ構築されたDockerコンテナーが用意されています。1つをダウンロードしてインストール先に転送すれば、5分足らずでJina AIモデルを稼働させることができます。</p><p>マルチモーダルまたはカスタムビルドの場合、あるいはコンテナー外にインストールするために依存関係一式をダウンロードする場合は、<a href="https://github.com/jina-ai/jina-on-prem/wiki/Bundling-Guide">バンドルガイド</a>に記載されている手順に従ってください。</p><p>Jina On-Premインストールは、すべてのJina APIおよびEIS機能、ならびにOpenAI、Cohere、Voyage AI、Gemini APIを介した埋め込み生成をサポートしているため、標準的なインターフェースを使用して既存のアプリケーションに統合できます。詳細については、<a href="https://github.com/jina-ai/jina-on-prem/wiki/API-Reference">APIドキュメント</a>をご参照ください。</p><p>Jina On-Premでインストールされたモデルを含むJinaモデルは、さまざまなライセンス条件で利用でき、最新モデルは<a href="https://creativecommons.org/licenses/by-nc/4.0/deed.en">CC BY-NC 4.0</a>ライセンスの下で非商用目的に無料で利用できます。Jina On-Premを商用利用するためにライセンスを取得する場合は、<a href="https://www.elastic.co/jp/contact">Elastic営業担当</a>までお問い合わせください。</p>]]></content:encoded>
    <link>https://www.elastic.co/search-labs/blog/on-prem-ai-jina-embedding-models</link>
    <guid isPermaLink="true">https://www.elastic.co/search-labs/blog/on-prem-ai-jina-embedding-models</guid>
    <category><![CDATA[Jina AI]]></category>
    <category><![CDATA[統合]]></category>
    <dc:creator><![CDATA[Scott Martens]]></dc:creator>
    <enclosure url="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt17731ab0c6ec66f6/6a6a33d140a4941014ca5c9a/09bc6dac4e6a86c7877f8ed78d68f5d581aeffa9-1999x1200.png" length="0" type="image/png"/>
    <pubDate>Thu, 23 Jul 2026 00:00:00 GMT</pubDate>
  </item>
  <item>
    <title><![CDATA[1つのインデックスですべてのメディアに対応：jina-embeddings-v5-omniの紹介]]></title>
    <description><![CDATA[jina-embeddings-v5-omniを使用すると、テキスト、画像、動画、音声を1つのElasticsearchインデックスに埋め込み、それらすべてを一度にクエリできます。]]></description>
    <content:encoded><![CDATA[<p><code>jina-embeddings-v5-omni</code> テキスト、画像、動画、音声を1つのElasticsearchインデックスにまとめます。クラス最高の<a href="https://www.elastic.co/search-labs/blog/jina-embeddings-v5-text"><code>jina-embeddings-v5-text</code></a>モデルを拡張し、v5-omniスイートは革新的なアーキテクチャを通じてビジュアルおよびオーディオのエンコードを追加します。テキスト基盤はそのままで、非常にコンパクトな埋め込みモデルで最先端クラスのパフォーマンスを提供します。</p><p><strong>テキスト</strong>、<strong>画像</strong>、<strong>動画</strong>、<strong>音声記録</strong>のための高性能なセマンティック埋め込みを作成し、<strong>100近い言語</strong>にまたがる分類、クラスタリング、意味的類似性の測定、検索のためのインデキシングに利用できます。データがテキストだけでなく、PDF、録音、動画といった形式でも存在する場合、それぞれに個別のパイプラインを用意する必要はなくなります。</p><p><code>jina-embeddings-v5-omni</code>ファミリーは<strong>画像、音声、印刷物、動画をサポートする、現在市場で最もコンパクトな埋め込みモデル</strong>です。以下を提供します。</p><ul><li><p><strong><code>jina-embeddings-v5-text</code></strong><strong>のフロンティアクラスのテキスト埋め込み</strong>を検索、分析、AIエージェント用途で使用。</p></li><li><p><strong>クラス最高の埋め込み</strong><strong>を視覚的な意味的類似性、視覚的理解、画像検索用途で使用。</strong><code>jina-embeddings-v5-omni-small</code> は、10億（10⁹）個のパラメーターを持つモデルの中で画像ベンチマークにおいて最高のパフォーマンスを発揮し、当社の以前の<a href="https://www.elastic.co/search-labs/blog/jina-models-elasticsearch-guide#jina-clip-v2"><code>jina-clip-v2</code></a>よりも優れています。このモデルに匹敵する性能を発揮できるのはパラメーター数が3倍から30倍もあるごく少数のモデルのみです。</p></li><li><p><strong>多言語の視覚的理解および検索のための最先端の埋め込み技術</strong>で、最大20倍もの規模を持つモデルを凌駕します。</p></li><li><p><strong>同サイズクラスで最高のオーディオ埋め込み</strong>であり、標準ベンチマークでより優れた性能を発揮するのは、パラメーター数が2倍以上のモデルのみです。</p></li><li><p><strong>動画のサポート</strong>、特に映像内の物体やイベントを特定する機能。</p></li></ul><p>これは、情報検索、文書処理、データ分析といったあらゆる分野に応用可能です。<code>jina-embeddings-v5-omni</code> は、異なるメディアサイロに閉じ込められた情報を開放し、AIエージェントによる検索、分析、使用を可能にします。音声・動画記録、PDF、印刷ページのスキャン画像、インフォグラフィックなどの情報は、データエコシステムにおいてデジタル化されたテキストと同等の扱いを受けます。</p><p><code>jina-embeddings-v5-text</code>と同様に、これらのモデルには<code>small</code>と<code>nano</code>の2つのサイズがあります。どちらのモデルも、音声インプットと視覚インプットをサポートする追加モジュールによって、対応するテキスト版を拡張しています。ユーザーは読み込み時にモジュールを選択できます。さらに、意味的類似性、分類、クラスタリング、情報検索向けのタスク固有の拡張は、コンパクトな低ランク適応（LoRA）アダプターとして実装され、すべて読み込まれるため、ユーザーは推論時に選択できます。</p><p>どちらのモデルも非常にコンパクトです。<code>jina-embeddings-v5-omni-small</code>従来のGPU搭載サーバーで動作可能であり、 <code>jina-embeddings-v5-omni-nano</code>は汎用ハードウェアで動作できるほど小型です。これは、計算コストの大幅な節約の可能性を示し、ライセンスされたローカルインストールとエッジ処理を可能にし、レイテンシを削減し、データの制御を強化します。</p><p>v5-omniスイートは、革新的なモデル設計と機械学習技術を用いて、以前に学習済みのモデルを再学習させることなく、新しい埋め込みモデルを構成します。既存の<code>jina-embeddings-v5-text</code>モデルスイートのインプット前処理器として、音声および動画メディア用の事前トレーニング済みの、言語に合わせた埋め込みモデルからエンコーダを使用しています。結果として得られるモデルは、画像や音声録音に対して、テキストに対して生成する埋め込み表現と意味的に互換性のある埋め込み表現を生成します。</p><p>v5-omniモデルは、<code>jina-embeddings-v5-text</code> と同一のテキスト埋め込みを生成します（つまり、<code>jina-embeddings-v5-omni-small</code> に <code>jina-embeddings-v5-text-small</code>、<code>jina-embeddings-v5-omni-nano</code> に <code>jina-embeddings-v5-text-nano</code>）。これにより、インデックスを再構築することなく、既存のテキスト検索リポジトリをマルチメディアアプリケーションに拡張できます。</p><p>内蔵エンコーダーはすべてオープンウェイトソースから派生したものです。画像と動画には<a href="https://qwen.ai/blog?id=qwen3.5">Qwen3.5</a>モデルのエンコーダーを使用しました。</p><ul><li><p><code>jina-embeddings-v5-omni-nano</code>の場合、<a href="https://huggingface.co/Qwen/Qwen3.5-0.8B">Qwen3.5-0.8B</a>の微調整された<a href="https://huggingface.co/google/siglip2-base-patch16-224">SigLIP2 Base</a>エンコーダーを使用します。</p></li><li><p><code>jina-embeddings-v5-omni-small</code>には、<a href="https://huggingface.co/Qwen/Qwen3.5-2B">Qwen3.5-2B</a>の微調整された<a href="https://huggingface.co/google/siglip2-so400m-patch14-384">SigLIP2 So400m</a>エンコーダーを使用します。</p></li><li><p>音声サポートのため、<a href="https://huggingface.co/Qwen/Qwen2.5-Omni-7B">Qwen2.5-Omni-7B</a>から抽出した<a href="https://huggingface.co/openai/whisper-large-v3">Whisper-large-v3</a>のエンコーダーを、smallバージョンとnanoバージョンの両方に追加しました。</p></li></ul><p>これらのメディア固有のエンコーダーを、訓練済みのクロスモーダルプロジェクターを備えたテキスト処理基盤に接続しました。これらのプロジェクターは、ネイティブ出力を<code>jina-embeddings-v5-text</code>と互換性のある入力埋め込みに変換します。<code>jina-embeddings-v5-omni</code>モデルで新たに学習された部分は、それらのプロジェクターの重みだけです。</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt62dc05bfa3d054b6/6a17e86eb1e113340b79f29c/4cb834b7e5fd63cdd78600de313615feffabbb1f-1999x1000.jpg" alt="" /><p>このアーキテクチャーは、4つのLoRAアダプターのそれぞれに対して、<code>jina-embeddings-v5-omni-small</code>用に約550万、<code>jina-embeddings-v5-omni-nano</code>用に350万未満のクロスモデルプロジェクターのみをトレーニングする必要があることを意味します。このアプローチでは、異なる埋め込みモデルを接続するために必要な追加トレーニングを最小限に抑え、それぞれの専門的なトレーニングを活用することで、非常にコンパクトで高性能なモジュール式の埋め込みスイートを実現します。</p><h2>選択されたモデルプロパティ</h2><h3>入力/出力</h3><p>モデル名</p><p>入力コンテキストウィンドウのサイズ</p><p>埋め込みサイズ</p><p>jina-embeddings-v5-omni-small</p><p>32,768トークン</p><p>1024ディメンション（最小：32）</p><p>jina-embeddings-v5-omni-nano</p><p>8,192 トークン*</p><p>768次元（最小：32）</p><p>* 非テキストメディアのトークン化方法については、以下の<strong>jina-embeddings-v5-omniの使用</strong>をご覧ください。</p><h3>サイズ</h3><p>モデル名</p><p>合計サイズ</p><p>jina-embeddings-v5-omni-small（テキストのみの基本モデル＋4つのLoRAアダプター）</p><p>700M パラメータ</p><p>画像/動画サポート（Qwen3.5-2Bから抽出したSigLIP2 So400Mエンコーダー）</p><p>10.06億パラメーター</p><p>音声サポート（Qwen2.5-Omni-7Bから抽出したWhisper-large-v3エンコーダー）</p><p>13.54億パラメーター</p><p>両方</p><p>16.60億パラメーター</p><p>LoRAアダプター（各）</p><p>20M</p><p>jina-embeddings-v5-omni-nano（テキストのみの基本モデル＋4つのLoRAアダプター）</p><p>266M パラメータ</p><p>画像/動画サポート（Qwen3.5-0.8Bから抽出したSigLIP2ベースエンコーダー）</p><p>354M パラメータ</p><p>音声サポート（Qwen2.5-Omni-7Bから抽出したWhisper-large-v3エンコーダー）</p><p>916M パラメータ</p><p>両方</p><p>1.004B パラメータ</p><p>LoRAアダプター（各）</p><p>7M</p><p>* 非テキストメディアのトークン化方法については、以下の<strong>jina-embeddings-v5-omniの使用</strong>をご覧ください。</p><h2>タスク特化型トレーニング</h2><p><code>jina-embeddings-v5-omni</code>ファミリーは<code>jina-embeddings-v5-text</code>と同じタスク固有のLoRAアダプタをサポートしています。</p><p>タスク</p><p>使用例</p><p>検索</p><p>情報検索は単独または他の検索および候補評価技術と組み合わせて行われます。v5-omniモデルでは、1つのインデックスから1回のクエリで音声、動画、画像を取得できます。</p><p>クラスタリング</p><p>あらゆるメディアにおけるトピックの発見と自動的なトピック整理。</p><p>分類</p><p>分類、感情分析、関連する各種タスク。</p><p>意味的類似性</p><p>メディア全体でのデータ重複除去、レコメンデーションシステム、関連メディア、音声に一致するテキストの検索、翻訳の識別、その他の類似タスク。</p><p>出力の埋め込みは選択されたタスクカテゴリに依存します。例えば、検索指向の埋め込みをクラスタリングに、または意味的類似性の埋め込みを分類に使用すべきではありません。</p><h2>マルチメディア、マルチモーダル、多言語、多機能</h2><p><code>jina-embeddings-v5-omni</code> で何ができるかを示すために、2つの小説の有名な冒頭部分を取り上げて、それらの意味的類似性を測定してみましょう。</p><p><em><strong>二都物語</strong></em><strong>（チャールズ・ディケンズ）</strong></p>It was the best of times, it was the worst of times, it was the
age of wisdom, it was the age of foolishness, 
it was the epoch of belief, it was the epoch of incredulity,
it was the season of Light, it was the season of Darkness,
it was the spring of hope, it was the winter of despair,
we had everything before us, we had nothing before us,
we were all going direct to Heaven, we were all going
direct the other way—in short, the period was so far like
the present period, that some of its noisiest authorities
insisted on its being received, for good or for evil, in 
the superlative degree of comparison only.<p><em><strong>高慢と偏見</strong></em><strong> (ジェーン・オースティン)</strong></p>It is a truth universally acknowledged, that a 
single man in possession of a good fortune must
be in want of a wife. However little known the
feelings or views of such a man may be on his first
entering a neighbourhood, this truth is so well
fixed in the minds of the surrounding families,
that he is considered as the rightful property of
some one or other of their daughters.<p>意味的類似性アダプターを備えた<code>jina-embeddings-v5-omni-small</code>を使用すると、これらのテキストの類似度は<strong>0.5329</strong>です。</p><p>この数値は比較対象がなければあまり意味がないので、同じモデルとアダプターを使用して、これら2つのテキストをフランス語訳と比較してみましょう。</p><p><strong>言語間のテキストの意味的類似度スコア</strong></p><p></p><p>『二都物語』（英語）</p><p>高慢と偏見（英語版）</p><p>二都物語（フランス語版）（Paris et Londres en 1783, tr. H. Loreau）</p><p>0.9095</p><p>0.5074</p><p>高慢と偏見（フランス語版）（Orgueil et Préjugés,tr. Leconte et Pressoir）</p><p>0.4826</p><p>0.8784</p><p>この2つのテキストは、同じ言語や別の言語の他のテキストよりも、翻訳との類似性がはるかに高いことを示しています。これは、<code>jina-embeddings-v5-omni-small</code>に変更されずに含まれた<code>jina-embeddings-v5-text-small</code>の非常に高性能な多言語セマンティック埋め込みを反映しています。</p><p>マルチメディアサポートを<code>jina-embeddings-v5-omni</code>に加えることで、この実験をまったく異なる種類のデータに拡張できるようになります。例えば、私たちは両方の小説の最初のページのスキャンを古い印刷版から入手しました。</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt95d451adb5680e20/6a17e871445de9e88a4d016c/e92d928a4813ccecc7d02639eea699e3a71c66e3-1999x1692.png" alt="古びた2枚の本のページには、『二都物語』と『高慢と偏見』の冒頭部分が記されている。左側のページには、日付不明の19世紀版『二都物語』の第1章の冒頭部分が、右側のページには、1903年マクミラン版『高慢と偏見』の第1章の冒頭部分がそれぞれ記されている。" /><p><strong>図2：</strong> <em>二都物語</em>、19世紀の年代不明版、および <em>高慢と偏見</em>、1903年マクミラン版。</p><p>意味的類似性アダプターを再度使用して、両方のテキストをスキャン画像と比較してみましょう。</p><p><strong>テキストと画像間の意味的類似度スコア</strong></p><p></p><p>二都物語（スキャン）</p><p>高慢と偏見（スキャン）</p><p>二都物語（テキスト）</p><p>0.7336</p><p>0.4891</p><p>高慢と偏見（本文）</p><p>0.4804</p><p>0.7213</p><p>意味的類似度スコアは、画像の内容に一致するテキストを強く支持することがわかります。</p><p>同じ設定を使用して、テキストをSNSの投稿のスクリーンショットやそれらのテキストを参照するミームと比較することもできます。</p><p><strong>図3：</strong>イーロン・マスクのツイート（ <em>『二都物語』</em>に言及）と<em>『高慢と偏見』</em>の有名な冒頭シーンに言及したミーム。</p><p><strong>テキストと画像間の意味的類似度スコア</strong></p><p></p><p>二都物語</p><p>高慢と偏見</p><p>マスク氏のツイート（画像）</p><p>0.7156</p><p>0.4912</p><p>「Keep calm」ミーム（画像）</p><p>0.4555</p><p>0.6244</p><p>音声でも同じことができます。英語とフランス語の両テキストの朗読録音を入手しました。</p><ul><li><p><a href="https://drive.google.com/file/d/1IK_bR6L47TSrnESdXLEpHCX6o-FzPmOx/view?usp=sharing"><em>二都物語</em></a><a href="https://drive.google.com/file/d/1IK_bR6L47TSrnESdXLEpHCX6o-FzPmOx/view?usp=sharing"> （英語音声：Librivox）</a></p></li><li><p><a href="https://drive.google.com/file/d/1KurbhD6INc6oZlq_SJcWq7MBVfJQ3pof/view?usp=sharing"><em>二都物語</em></a><a href="https://drive.google.com/file/d/1KurbhD6INc6oZlq_SJcWq7MBVfJQ3pof/view?usp=sharing">（フランス語音声、OmniVoice AI生成）</a>。</p></li><li><p><a href="https://drive.google.com/file/d/1D_G2FOCb7ct-FBVY1fyivXlY2e_yGZw1/view?usp=sharing"><em>高慢と偏見</em></a><a href="https://drive.google.com/file/d/1D_G2FOCb7ct-FBVY1fyivXlY2e_yGZw1/view?usp=sharing">（フランス語音声、Librivox）</a>。</p></li><li><p><a href="https://drive.google.com/file/d/1jutY61YSFGBIyE8m-ltEJx-8dEXNJJ5N/view?usp=sharing"><em>高慢と偏見</em></a><a href="https://drive.google.com/file/d/1jutY61YSFGBIyE8m-ltEJx-8dEXNJJ5N/view?usp=sharing">（フランス語音声、OmniVoice AI生成）</a>。</p></li></ul><p><strong>異なる言語間のテキストと音声のセマンティック類似度スコア</strong></p><p></p><p>『二都物語』（英語音声）</p><p>二都物語（フランス語音声）</p><p>高慢と偏見(英語音声)</p><p>高慢と偏見（フランス語音声）</p><p>『二都物語』 (英語テキスト)</p><p>0.3816</p><p>0.3106</p><p>0.1607</p><p>0.1774</p><p>二都物語（フランス語テキスト）</p><p>0.3528</p><p>0.3253</p><p>0.1598</p><p>0.1721</p><p>高慢と偏見(英語テキスト)</p><p>0.1910</p><p>0.1682</p><p>0.3511</p><p>0.3398</p><p>高慢と偏見（フランス語テキスト）</p><p>0.1667</p><p>0.1474</p><p>0.3018</p><p>0.3702</p><p>この多言語・マルチメディア能力は情報検索にも及びます。</p><p><code>jina-embeddings-v5-omni</code>モデルの検索アダプターは非対称検索を実装しています。これは、クエリを埋め込む方法が検索対象のドキュメントを埋め込む方法とは異なることを意味します。そのため、クロスモーダルクエリは常に一方向にあり、クエリが一方のメディアに、ドキュメントがもう一方のメディアにあるため、逆の場合とは異なるスコアが得られます。</p><p>以下の表は、<em>二都物語</em>と<em>高慢と偏見</em>のテキスト、音声、ページスキャン画像の検索スコアを示しています。これは、<em>二都物語</em>（英語）のテキストがクエリとしてエンコードされた場合です。</p><p><strong>テキストからテキスト</strong></p><p>ドキュメント</p><p>検索スコア</p><p>二都物語（フランス語テキスト抜粋）</p><p>0.7597</p><p>高慢と偏見（英語テキスト抜粋）</p><p>0.1482</p><p>高慢と偏見（フランス語テキスト抜粋）</p><p>0.0523</p><p><strong>テキストから画像</strong></p><p>ドキュメント</p><p>検索スコア</p><p>二都物語（英語ページスキャン）</p><p>0.5517</p><p>二都物語（フランス語ページスキャン）</p><p>0.3576</p><p>高慢と偏見（英語ページスキャン）</p><p>0.1917</p><p><strong>テキストから音声</strong></p><p>ドキュメント</p><p>検索スコア</p><p>『二都物語』（英語音声）</p><p>0.3277</p><p>二都物語（フランス語音声）</p><p>0.1980</p><p>高慢と偏見(英語音声)</p><p>0.1419</p><p>高慢と偏見（フランス語音声）</p><p>0.1759</p><p>ユーザーは、クエリを逆向きに実行することもでき、音声からテキストへ、画像からテキストへの検索を行うことができます。</p><p>以下は、 <em>二都物語</em>の英語音声をクエリとして、さまざまなテキストをドキュメントとして使用した場合のスコアです。</p><p><strong>画像からテキスト</strong></p><p>ドキュメント</p><p>検索スコア</p><p>二都物語（英語テキスト抜粋）</p><p>0.3352</p><p>二都物語（フランス語テキスト抜粋）</p><p>0.2650</p><p>高慢と偏見（英語テキスト抜粋）</p><p>0.1626</p><p>高慢と偏見（フランス語テキスト抜粋）</p><p>0.1385</p><p>そして、<em>二都物語</em>（英語版）の1ページ目のスキャン画像をクエリとして使用した場合のスコアは以下のとおりです。</p><p><strong>音声からテキスト</strong></p><p>ドキュメント</p><p>検索スコア</p><p>二都物語（英語テキスト抜粋）</p><p>0.5304</p><p>二都物語（フランス語テキスト抜粋）</p><p>0.4845</p><p>高慢と偏見（英語テキスト抜粋）</p><p>0.1467</p><p>高慢と偏見（フランス語テキスト抜粋）</p><p>0.0761</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt501b2c594f45f2e3/6a17e877a292992e3ad02c9a/673f5116c1d7a5a6f9adfbb2f48b9e6920e3229b-668x130.png" alt="薄い青色の背景を持つ長方形の通知ボックスには、jina-embeddings-v5-omni はテキストクエリから音声、動画、画像を見つけるようにトレーニングされており、テキスト以外のクエリでは効果が低下する可能性があることを説明するテキストの横に、黄色の警告三角形アイコンが表示されます。" /><h2>動画検索</h2><p><code>jina-embeddings-v5-omni</code>の動画インデキシングと検索機能は、Elasticsearchデータベースに新たな機能をもたらしますが、テキストに適用される多くの同じ警告の対象となります。長編映画の単一の埋め込みを生成することは、非常に長い小説を埋め込むようなものです。詳細な情報が埋もれてしまい、結果として得られる埋め込みは、多くの非常に曖昧なクエリに適合する可能性があります。</p><p><em>指輪物語</em>の全文（約50万語）を埋め込めば、探しているものが何であれ、ほとんどの検索クエリに対して適切な結果が得られる可能性が高いでしょう。同様に、2時間のハリウッド映画のインデックスを作成すると、誤ったマッチングが多く、詳細が完全に見落とされます。<code>jina-embeddings-v5-omni</code>は短いクリップに最適です。</p><p>この例では、1961年の映画<em>ティファニーで朝食を</em>の予告編をダウンロードしました。この予告編はわずか158秒で、パブリックドメインとなっています。予告編を<a href="https://archive.org/details/turner_video_311/311.mp4">インターネットアーカイブ</a>で見ることができます。</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt06633fdd1c8334dd/6a17e8790b0bed7d9add35b2/1948f585027d1342528c0dd93fe99e3ec7ba17f9-800x1200.png" alt="ヴィンテージの映画『ティファニーで朝食を』のポスターには、黒いロングドレスに黒い手袋、真珠のネックレス、シガレットホルダーを身につけ、肩に猫を乗せたオードリー・ヘプバーンの全身イラストが描かれている。背景には、街並みを背景に抱き合うカップルを描いた小さなイラストがあり、ポスターにはカラフルな縁取りとキャストおよび制作クレジットが添えられている。" /><p><strong>図4：</strong><em>ティファニーで朝食を</em>の劇場ポスター。</p><p><a href="https://www.scenedetect.com/">PySceneDetectを</a>使い、予告編を28のシーンに分割しました。長さは1.877秒（45フレーム）から18.393秒（441フレーム）までさまざまです。シーン検出は完璧ではありませんが、動画を検索しやすいように小さな断片に分割するのに十分な仕組みを提供します。次に、<code>jina-embeddings-v5-omni-small</code>を使用して、28セグメントのそれぞれについてドキュメント埋め込みを生成しました。これにより、動画内の特定の要素を見つけるためのテキストクエリの有効性をテストすることができました。</p><p>例えば、「cat」を検索すると、上位3つの結果として次のクリップが返されました。猫が登場する唯一のシーンがトップで、スコアは<strong>0.1634</strong>です。</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt6dca953a4afd5c1b/6a17e87baf47b65bf6cddfbc/82bd1759ebb65202f01a1e290447619af39f9a3d-735x426.png" alt=" 台所の床にひざまずいて開いた冷蔵庫に手を伸ばしている人物と、その近くに立っている猫を映した動画のサムネイル（スコア0.1634）。" /><p><a href="https://drive.google.com/file/d/1O3r-97rQJE7HAlUHsLygmFLwlZihRF26/view?usp=drive_link">クリップ1番目をご覧ください</a>。</p><p>次に高い一致度は<strong>0.1237</strong>で、はるかに低い値です。</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltcc2cc1ef9ff9ce4b/6a17e87d7c026e725cf146b3/de4eb704ef751cc4df2bead7faa177decd20b1b3-735x426.png" alt="「GEORGE PEPPARD」という名前が画像に重ねて表示された、カラフルなマスクを顔の近くで持っている人物の動画サムネイル（スコア0.1237）。" /><p><a href="https://drive.google.com/file/d/1DEK2H4bCpLVzyipJri9NSqE2jkeZ5jLm/view?usp=drive_link">クリップ2をご覧ください</a>。</p><p>また、アクションをクエリすることもできます。「kiss」という文字列でクエリを実行すると、上位4つの一致結果にはすべてキスが含まれています。</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt85bf55536faf5156/6a17e87f25daab4bb608a269/18efdcbbb31954dfab8eafe5055773b6b8e3de72-735x426.png" alt="屋内で3人が写っている動画のサムネイル。左側には1人がカメラの反対側を向いており、右側の2人はカーテンと出入り口の近くで抱き合っているように見えます（スコア0.2864）。" /><p><a href="https://drive.google.com/file/d/1Pmr_D4wKjUCCiq_Dzy5PQeWldJLjZ8kI/view?usp=drive_link">クリップ3をご覧ください。</a>スコアは0.2864です。</p><p>スコア：<a href="https://drive.google.com/file/d/1sS_4qTnmHU2uOwbN1fmdXeS3IvZAI_IN/view?usp=drive_link">2番目のマッチ</a>（0.2494）、<a href="https://drive.google.com/file/d/1ofsrZHTUb3huwQ0JB6Hs5dOw4myTj-sk/view?usp=drive_link">3番目のマッチ</a>（0.2099）、<a href="https://drive.google.com/file/d/1qaS4eueUCcQWdHLEjfEfneXsaWsx6P_5/view?usp=drive_link">4番目のマッチ</a>（0.2068）</p><p>また、「Buddy Ebsen」のように、一度しか表示されない動画に表示されているテキストを検索することもできます。<code>jina-embeddings-v5-omni-small</code> は<strong>0.3885</strong>というスコアで、次点の候補よりもかなり高い、最も一致する候補として容易に識別できます。</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt4c3fd86052f17ce8/6a17e886e9ea8795d8a9c601/dabcae9f44b9d4a671f88717aa21a2c6cf685f6b-735x426.png" alt="白い手すりと暗い手すりの階段の横に立つスーツ姿の男性を映した動画のサムネイル。「Buddy Ebsen」(スコア0.3885)というテキストがオーバーレイされています。" /><p><a href="https://drive.google.com/file/d/1rdQ1OqtPBD-3iGG8A900jU5DpC-muye4/view?usp=sharing">Buddy Ebsenのクリップ</a>。</p><h2>視覚的文書検索</h2><p>Jina AIのマルチモーダル埋め込みモデルは、ビジュアルドキュメント処理においてトップパフォーマーであり、多言語ビジュアルドキュメント処理においては最先端です。これは、テキスト、図、構造化情報を含む画像データを扱うことを意味します。重要なデータは、印刷スキャン、PDFファイル、図、技術図面、スクリーンショット、画像、インフォグラフィックなどの形式で存在することがよくあります。これらの画像は、しばしば機械的に構成されたり、コンピューターで生成されたりします。それらは通常、意味を損なうことなくテキストに還元することはできず、自然な風景の撮影用に設計されたコンピュータビジョンモデルには適していません。</p><p><code>jina-embeddings-v5-omni</code>埋め込みには、画像内の物体、それらに印刷されたテキスト、および両者の関係に関する情報が含まれます。視覚的文書検索により、物と関連テキストの両方を含むリッチ画像をインデックス化し、それを複数の言語間で行うことが可能になります。</p><p>例として、さまざまなECサイトから4つの商品画像を使ってみましょう。</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt620568521e2a3057/6a17e888f7018418c89a68a8/639481349aed78d4139f0d388d44f79b6ba29f88-1297x650.png" alt="" /><p>では、「ラーメン」というクエリで <code>jina-embeddings-v5-omni-small</code> がこの4枚の画像をどれだけ評価しているか見てみましょう。</p><p>Campbell’s Chunky Chicken Noodle（カナダ版パッケージ）</p><p>Kraft Dinner（カナダ版パッケージ）</p><p>マルちゃん味噌風味生ラーメン（日本版パッケージ）</p><p>Birkelスパゲッティ（ドイツ版パッケージ）</p><p>0.0872</p><p>0.0711</p><p>0.1123</p><p>0.0886</p><p>日本の製品を一致としてすぐに見つけます。</p><p>ここで、「マカロニチーズ」（日本語の<em>macaroni and cheese</em>）のクエリを試してみましょう。</p><p>Campbell’s Chunky Chicken Noodle（カナダ版パッケージ）</p><p>Kraft Dinner（カナダ版パッケージ）</p><p>マルちゃん味噌風味生ラーメン（日本版パッケージ）</p><p>Birkelスパゲッティ（ドイツ版パッケージ）</p><p>0.2207</p><p>0.3487</p><p>0.2760</p><p>0.2674</p><p>英語のクエリと同じくらい簡単に正しい一致を見つけます。</p><p><code>jina-embeddings-v5-omni</code> また、チャートのような情報豊富な画像の解釈にも優れています。実際にどのように機能するかを確認するには、次の2つの棒グラフをご覧ください。</p><p>左側の<strong>図1</strong>は世界の疾病負担に関するもので、右側の<strong>図2は</strong>犬種ごとの寿命に関するものです。</p><p>検索に<code>jina-embeddings-v5-omni-small</code>を使用した場合、それぞれが一方のチャートには関連するが両方のチャートには関連しない、2つの潜在的なテキスト質問がどれだけうまく一致するかを見てみましょう。</p><p>テキストの質問</p><p>チャート1</p><p>グラフ 2</p><p>「高齢者によく見られる健康問題にはどのようなものがありますか？」</p><p>0.2787</p><p>0.1099</p><p>「犬の寿命は？」</p><p>0.1350</p><p>0.3564</p><p>画像をクエリとして使用して、テキストを検索する逆のプロセスも可能です。以下の表は、関連する科学論文の要約から抽出された対象文書と、グラフ画像をクエリとして使用した場合の検索スコアを示しています。</p><p></p><p>テキスト1</p><p>テキスト 2</p><p></p><p>極度の貧困の中で暮らす人々の健康は、長年にわたり世界の開発努力の焦点となっており、持続可能な開発目標の時代においても引き続き優先事項となっています。しかし、この特定の集団における負担の規模と原因を定量化するための体系的な試みは、ほぼ20年間行われていません。私たちは、世界で最も貧しい10億人を対象に、原因別の疾病率を推定し、高所得層の疾病率と比較しました。</p><p>コンパニオンドッグは表現型が最も多様な種の一つです。品種間のばらつきは形態や行動の側面だけでなく、寿命にも及びます。この事実にもかかわらず、品種間の平均余命のばらつきを評価したり、長寿の系統的特徴の可能性を評価したりする研究はほとんど行われていません。</p><p>チャート1</p><p>0.2377</p><p>0.1357</p><p>グラフ 2</p><p>0.0673</p><p>0.3576</p><h2>特徴</h2><h3>切り捨て可能な埋め込み</h3><p><code>jina-embeddings-v5-omni</code> を支える基盤<code>jina-embeddings-v5-text</code> モデルを<a href="https://arxiv.org/abs/2205.13147">マトリョーシカ表現学習</a>でトレーニングしたので、これらのモデルからテキストとマルチメディアの埋め込みを切り捨てることができます。</p><p>デフォルトでは、 <code>jina-embeddings-v5-omni-small</code> 1024次元の埋め込みを生成し、16ビット精度で保存するために2KBの容量を必要とします。<code>jina-embeddings-v5-omni-nano</code>の埋め込みは768次元で、約1.5KBを占めます。これらの埋め込みのサイズを32次元（64バイト）に縮小することができます。これにより、精度は若干低下しますが、処理速度は大幅に向上し、リソースコストも削減されます。一般に、埋め込みサイズを半分に減らすと、精度が約2％低下して128次元になり、それを下回ると精度がはるかに速く低下します。</p><p>切り捨て可能な埋め込みにより、ユーザーはそれぞれのユースケースに応じて、精度、速度、コストの最適なトレードオフを決定できます。</p><h3>量子化</h3><p><code>jina-embeddings-v5-omni</code>ファミリーは、 <code>jina-embeddings-v5-text</code>基盤から量子化に対する堅牢なパフォーマンスも継承しています。これにより、処理速度がさらに向上し、より精度の低い数値を格納することで計算とストレージのコストが削減されます。これらのモデルは <a href="https://elastic.co/elasticsearch">Elasticsearch</a>の <a href="https://www.elastic.co/docs/reference/elasticsearch/mapping-reference/bbq">Better Binary Quantization</a>（BBQ）と連携するように訓練されており、量子化されていない埋め込みとほぼ同じ性能を提供します。Massive Text Embedding Benchmark（MTEB）の検索ベンチマークスイートでは、バイナリ化によるパフォーマンス低下は16ビットの完全な値を使用した場合と比較して3%未満にとどまり、同時に93%のスペースを節約し、処理速度と検索速度を劇的に向上させます。</p><h3>言語間パフォーマンス</h3><p><code>jina-embeddings-v5-text</code>の広範な多言語トレーニングは <code>jina-embeddings-v5-omni</code> にも引き継がれ、<code>jina-embeddings-v5-text-small</code> の事前トレーニングでは約100の言語、<code>jina-embeddings-v5-text-nano</code> では15の主要なグローバル言語がサポートされています。音声メディアの場合、 <code>Whisper-large-v3</code>モデルはトレーニングに約100言語を使用しており、 <code>jina-embeddings-v5-omni-small</code>および<code>-nano</code>に統合されているQwen-modified SigLip2ビジョンモデルは 201種類の言語と方言のデータを使用してトレーニングされています。</p><h2>ベンチマーク性能</h2><h3>テキスト</h3><p><code>jina-embeddings-v5-omni</code> テキストのみに使用する場合、これらのモデルは<code>jina-embeddings-v5-text</code>モデルと同一です。セマンティックテキスト埋め込みの<a href="https://huggingface.co/spaces/mteb/leaderboard">MMTEBベンチマーク</a>スイートにおいて、それぞれのサイズカテゴリーでトップパフォーマンスを示しています。</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt14d87596ca463c88/6a17e88dec0f89dfb65a664f/8687106cf82e6ec2b3f79f893cfe011e4a5b4a21-1095x1095.png" alt="棒・折れ線グラフ。9つの埋め込みモデルのMMTEBスコアとパラメータサイズを比較したもので、jina-v3-omni-smallが最高のスコアを獲得し、snowflake-arctic-embed-l-v2が最小のサイズを達成。" /><p><strong>図5</strong>：テキストベンチマークでの <code>jina-embeddings-v5-omni</code> のサイズとパフォーマンス、競合モデルとの比較。記載されているサイズは、他のメディアの読み込み拡張機能を含まないサイズです。</p><h3>視覚的な意味的類似性</h3><p>標準的な視覚的意味的類似性ベンチマークにおいて、<code>jina-embeddings-v5-omni</code> はそのサイズに近いモデルの中で最高のスコアを出しています。<code>jina-embeddings-v5-omni</code> モデルは、同等のサイズの公開オープンウェイトモデルの中で圧倒的に最良の性能を示しています。<code>jina-embeddings-v5-omni-small</code>は視覚的意味的類似性タスクにおいて、その3倍のサイズのモデルにしか負けず、 <code>jina-embeddings-v5-omni-nano</code>は<code>jina-embeddings-v5-omni-small</code>と10～25倍のサイズのモデルにしか負けません。</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt16ad3463d2aeefc5/6a17e88efaa9139b1493c8a9/f2ae56764865953bdf8c54747276189efd6d45e1-1496x877.png" alt="棒・折れ線グラフ。7つの埋め込みモデルの視覚的意味類似性スコアとパラメータサイズを比較しており、jina‑embeddings‑v5‑omni‑smallが最高の類似性スコアを達成し、laion/CLIP‑ViT‑bigG‑14が最大のモデルサイズ。" /><p><strong>図6</strong>：<code>jina-embeddings-v5-omni-small</code>、<code>jina-embeddings-v5-omni-nano</code>、および比較対象モデルの視覚的意味的類似性ベンチマーク平均スコア、ならびに視覚拡張機能を含むそれらのサイズ。</p><h3>視覚的文書検索</h3><p><code>jina-embeddings-v5-omni-small</code> は、10億パラメーター未満でありながら、30億パラメーターおよび70億パラメーターのモデルに匹敵します。<code>jina-embeddings-v5-omni-nano</code>も同様にそのサイズで際立っており、10倍から60倍も大きいモデルを凌駕しています。</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltcbabd1477ec3459c/6a17e890e317912a242d5806/cde672f18de8f4a30dd81938b08bb06e08444be0-1223x905.png" alt="棒・折れ線グラフ。複数の埋め込みモデルの選択されたViDoReスコアとパラメーターサイズを比較。LCO‑Embedding‑Omni‑7Bが最高スコアを達成し、laion/CLIP‑ViT‑bigG‑14が最大のモデルサイズ。2つのJina埋め込みモデルに焦点。" /><p><strong>図7</strong> ：6つのベンチマーク（<em>DocVQA</em>、<em>InfoVQA</em>、<em>ShiftProj</em>、<em>SynAI</em>、<em>Tabfquad</em>、<em>TatDQA</em>）における<a href="https://huggingface.co/spaces/vidore/vidore-leaderboard">ViDoRe視覚文書検索の平均スコア。</a></p><h3>音声検索</h3><p>標準的なMAEB（Massive Audio Embedding Benchmark）音声検索ベンチマークにおいて、<code>jina-embeddings-v5-omni-small</code>と<code>jina-embeddings-v5-omni-nano</code>はどちらもトップクラスのパフォーマンスを発揮しています。非常に大きなモデルのみ – <code>jina-embeddings-v5-omni-small</code>の3倍以上のサイズ – がそのスコアを上回ります。</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt80f517c1c0230031/6a17e892dbb4ff8498fb56ee/a8c896bbbd710026c7b053e38af460194e7730a6-1650x912.png" alt="棒。折れ線グラフ。x軸に沿って埋め込みモデルと音声モデルを比較し、左側のy軸にはMAEBスコアを表す青い棒グラフ、右側のy軸には数十億個のパラメータからなるモデルサイズを表す赤い線グラフを示しています。棒グラフは概ね20から55までの範囲を示し、線は0から10までの範囲を示します。" /><p><strong>図8</strong>：MAEB音声検索ベンチマークにおけるさまざまなモデルの平均スコア。</p><p>LAIONの<code>larger_clap_general</code> モデルは、jina-embeddings-v5-omni-nanoのスコアをより少ないパラメーターで改善していますが、v5-omniスイートの追加マルチモーダル機能は何もない、音声のみのモデルです。</p><h3>動画</h3><p>動画では、<code>jina-embeddings-v5-omni-small</code>がテキストクエリに合致する場所を見つけることに優れています。Charades-STAとMomentSeekerテストは、このタスクの標準的なベンチマークであり、下のグラフから<code>jina-embeddings-v5-omni-small</code>がサイズがはるかに小さいにもかかわらず、同等のオープンウェイトモデルの中で最高のスコアを獲得していることがわかります。</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltc8d7e7570b64d45a/6a17e8944b055d34e643221b/a2d7744d39fefb6b8b1f66e5b3f227828ef4ad4e-1350x672.png" alt="棒・折れ線グラフ。6つの埋め込みモデルにおけるCharades-STAスコアとモデルサイズを示しています。X軸はモデルのリスト、左のY軸は20から60までのCharades-STAスコア、右のY軸は0から10までのパラメータの億単位でのモデルサイズを示しています。青い棒はスコアを表し、マーカー付きの赤い線はモデルサイズを表しています。" /><p><strong>図9</strong>：さまざまなモデルのサイズと、それらのモデルに対するCharades-STAスコア。</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltfbce6716a3a33ca5/6a17e89525daab2e8a08a26d/cf7578863fd509edb62c15878816d39657abc715-1550x845.png" alt="棒・折れ線グラフ。MomentSeekerスコアとモデルサイズに基づいて6つの埋め込みモデルを比較し。X軸はモデルのリスト、左のY軸はおよそ44から60までのMomentSeekerのスコア、右のY軸は0から10までのパラメータの億単位でのモデルサイズを示しています。青い棒はスコアを表し、マーカー付きの赤い線はモデルのサイズを表しています。" /><p><strong>図10</strong>：さまざまなモデルのMomentSeekerスコアとそれらのサイズ。</p><p>また、 <code>jina-embeddings-v5-omni-small</code> ByteDanceの<a href="https://seed.bytedance.com/en/blog/built-on-seed1-6-flash-seed-1-6-embedding-launched">Seed 1.6</a>と比較しました。Seed 1.6は、パラメータ数が非公開のクローズドウェイトモデルです。私たちのモデルは、Charades-STAベンチマークではSeed 1.6を大きくBeatsし、MomentSeekerではほぼ同等です。</p><p>モデル</p><p>Charades-STAのスコア</p><p>MomentSeekerスコア</p><p>seed-1.6-embedding</p><p>29.30</p><p>59.30</p><p>jina-embeddings-v5-omni-small</p><p>55.57</p><p>58.93</p><h2>強みと制限事項</h2><p><code>jina-embeddings-v5-omni</code> モデルは、特に以下のようなさまざまな方法で、ユーザーがデジタル化された情報をインデックス化、検索、分析する能力を拡張します。</p><ul><li><p>テキストクエリからの多言語音声検索。</p></li><li><p>PDF、スキャン、視覚的文書検索。</p></li><li><p>動画の時間的グラウンディング、つまり、自然言語のテキスト記述と一致する動画の部分を特定すること。</p></li><li><p>音楽ジャンルを含むオーディオジャンルの分類。</p></li><li><p>シーン情報とオブジェクト識別に基づく画像分類。</p></li></ul><p>他のいくつかの分野では、パフォーマンスはやや劣ります。<code>jina-embeddings-v5-omni</code> を使ってこれらの作業をすることは可能かもしれませんが、そのためのトレーニングはしていませんし、結果は芳しくないかもしれません。</p><p>当社は以下の分野における技術向上に積極的に取り組んでいます。</p><ul><li><p>自然言語の説明から特定の動画を見つけること。</p></li><li><p>画像間の意味類似性と検索。</p></li><li><p>音声における意図の分類、例えば音声コマンドの認識など。</p></li><li><p>画像とそれに付随するテキスト、または音声、画像、テキストを組み合わせたものなど、複数のメディアからの入力を処理。</p></li></ul><h2><strong>jina-embeddings-v5-omni</strong>の使用</h2><p>このモデルスイートは、テキスト、音声、画像と動画を組み合わせた入力という3つの入力方法をサポートしています。<code>jina-embeddings-v5-omni</code>は、幅広い標準フォーマットを変換し、他の前処理を行うフレームワーク内で動作します。</p><p>画像処理には、最初のSigLip2リリースで提供された<a href="https://arxiv.org/abs/2502.14786">NaFlex方式</a>と同じものを使用します。入力画像が262,144ピクセル（512x512に相当）より小さい場合は、その最小値を超えるまで拡大されます。また、3,072,000ピクセルより大きい場合は、その最大値より小さくなるまで縮小されます。変換プロセスでは、画像の高さと幅の両方が14ピクセルの倍数になるように調整し、縦横比の歪みを最小限に抑えてその目標を達成します。結果は28×28ピクセルのパッチに分割されます。そのため、パッチの総数は画像を覆うために必要な28×28の正方形の数になります。推論時には各パッチは単一のトークンとして扱われ、各画像入力には単一の画像を区切るための特別な開始トークンと終了トークンが付随します。</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltf192cdba41155257/6a17e897abe0f2faaedfea2a/5ab7a8951780afdfe6eda9dca14add0375ae36bd-668x130.png" alt="薄い青色の背景を持つ長方形の通知ボックスには、jina-embeddings-v5-omni はテキストクエリから音声、動画、画像を見つけるようにトレーニングされており、テキスト以外のクエリでは効果が低下する可能性があることを説明するテキストの横に、黄色の警告三角形アイコンが表示されます。" /><p><code>jina-embeddings-v5-omni</code> モデルは、画像を変更するのと同じ方法で動画の解像度を変更し（上記を参照）、動画から最大32フレームを抽出します。動画に32フレーム以上ある場合（標準フォーマットは通常1秒あたり少なくとも24フレームなので、その可能性は高い）、抽出するフレームを均等な間隔で配置します。そして、動画プリプロセッサは、2フレームごとに、動画全体をカバーするのに必要な28×28ピクセルの正方形の数に等しいトークンのセットを1つ生成します。</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt0acd4ddd95a66a53/6a17e898445de966214d0176/a38491c1cc47cfc65344c786e8ab57b9abf67e0b-1999x851.png" alt="連続するビデオフレームをコラージュしたもので、進行状況を示す矢印が添えられており、オードリー・ヘプバーンのさまざまな場面が描かれ、最後に「ティファニーで朝食を」というタイトルカードが表示されたフレームで終わる。この図は、モデルが動画から等間隔に並んだ64フレームを抽出することを示していますが、動画が長い場合、コンテンツの大幅な損失が発生する可能性があります。" /><p><strong>図11：</strong> <code>jina-embeddings-v5-omni</code>は動画から等間隔の32フレームを抽出します。長い動画だと多くの部分が失われてしまいます。</p><p>動画の前処理の詳細については、 <a href="https://arxiv.org/abs/2502.14786">SigLip2の技術文書</a>をご覧ください。</p><p>音声トークン化は、Qwen-2.5-Omniに組み込まれているアプローチに従います。音声ファイルは30秒ごとに分割され、30秒を超える場合は16kHzにリサンプリングされ、128チャンネルのメルスペクトログラムに変換されます。各40ミリ秒が単一のトークンとして扱われます。そのため、30秒のセグメントごとに750トークンが処理されます。これは1トークンが40ミリ秒の音声に相当し、さらに1サンプルを区切るための特別な開始トークンと終了トークンが追加されます。</p><p>音声前処理の詳細については、<a href="https://arxiv.org/abs/2503.20215">Qwen-2.5-Omni Technical Report</a>をご覧ください。</p><h2>可用性</h2><p><code>jina-embeddings-v5-omni-small</code>と<code>jina-embeddings-v5-omni-nano</code>は、<a href="https://www.elastic.co/docs/explore-analyze/elastic-inference/eis">Elastic Inference Service</a>（EIS）上で、<a href="https://jina.ai/embeddings">Jina API</a>を通じて利用可能であり、ローカルインストールはダウンロード（<a href="https://huggingface.co/jinaai/jina-embeddings-v5-omni-small"><code>small</code></a>および<a href="https://huggingface.co/jinaai/jina-embeddings-v5-omni-nano"><code>nano</code></a>）で利用可能です。モデルの重み付けデータは、非商用ライセンスで試用できるよう無料で配布されています。商用利用については<a href="https://www.elastic.co/contact?pg=global&amp;plcmt=nav&amp;cta=205352">Elasticの営業担当</a>までお問い合わせください。</p><h2>はじめに</h2><p>テキストに<code>jina-embeddings-v5-omni</code>を使用するには、 <code>jina-embeddings-v5-text</code>の場合と同様に<code>semantic_text</code>フィールドを使用して統合できます。<code>inference_id</code> <code>.jina-embeddings-v5-omni-small</code>または<code>.jina-embeddings-v5-omni-nano</code>に設定するだけです。手順については <a href="https://www.elastic.co/docs/reference/elasticsearch/mapping-reference/semantic-text-how-tos">リファレンスガイド</a> をご覧ください。</p><p>他のメディアを<code>jina-embeddings-v5-omni</code>で埋め込むには、<a href="https://www.elastic.co/docs/api/doc/elasticsearch/operation/operation-inference-embedding">推論APIを使用</a>する必要があります。例：</p>POST _inference/embedding/.jina-embeddings-v5-omni-small
{
  "input": [
    {
      "content": { 
        "type": "image", 
        "format": "base64", 
        "value": "data:image/jpeg;base64,..." 
      } 
    }, 
    { 
      "content": { 
        "type": "text", 
        "value": "Some text to create an embedding" 
      } 
    } 
  ] 
}<p><code>jina-embeddings-v5-omni-nano</code>の場合、<code>POST</code> URIを<code>_inference/embedding/.jina-embeddings-v5-omni-nano</code>に変更してください。</p><p>他のメディアのドキュメントをエンコードしたり、分類やクラスタリングのための埋め込みを生成したりするには、<a href="https://www.elastic.co/docs/api/doc/elasticsearch-serverless/operation/operation-inference-put-jinaai"><u>推論エンドポイント</u></a>を<u><code>jinaai</code></u><a href="https://www.elastic.co/docs/api/doc/elasticsearch-serverless/operation/operation-inference-put-jinaai"><u>サービスで作成</u></a>してください。</p><p>クエリの場合は、以下の例のようにクエリビルダーを使います。<code>inference_id</code>の値を<code>.jina-embeddings-v5-omni-nano</code>に置き換えて、<code>small</code>の代わりに<code>nano</code>モデルを使用してください。</p>POST my-index/_search
{
  "knn": {
    "field": "dense-vector-field",
    "k": 10,
    "num_candidates": 100,
    "query_vector_builder": {
      "embedding": {
        "inference_id": ".jina-embeddings-v5-omni-small",
        "input": {
          "type": "image",
          "format": "base64",
          "value": "data:image/jpeg;base64,..."
        }
      }
    }
  }
}<p>詳細については、<a href="https://www.elastic.co/docs/reference/query-languages/query-dsl/query-dsl-knn-query#knn-query-builder-embedding">クエリビルダーのドキュメント</a>を参照してください。</p><p><code>jina-embeddings-v5-omni</code>でBBQを使用するには、<a href="https://www.elastic.co/docs/reference/elasticsearch/mapping-reference/bbq">BBQインデキシングの説明</a>に従います。</p><h2>詳細情報</h2><p><code>jina-embeddings-v5-omni</code>の詳細については、モデルの<a href="https://arxiv.org/html/2605.08384v2">技術レポート</a>および<a href="https://jina.ai/models/">Jina AI Webサイト</a>のページをご覧ください。Hugging Faceの<code>jina-embeddings-v5-omni</code> <a href="https://huggingface.co/collections/jinaai/jina-embeddings-v5-omni">コレクションページ</a>には、これらのモデルをローカルでダウンロードして実行するための技術情報と手順も含まれています。<code>jina-embeddings-v5-omni</code>モデルは<a href="https://creativecommons.org/licenses/by-nc/4.0/deed.en">CC-BY-NC-4.0</a>ライセンスの下でダウンロードでき、自由に試用できますが、商用利用の場合はElasticの営業担当までお問い合わせください。</p>]]></content:encoded>
    <link>https://www.elastic.co/search-labs/blog/jina-embeddings-v5-omni-all-media-one-index</link>
    <guid isPermaLink="true">https://www.elastic.co/search-labs/blog/jina-embeddings-v5-omni-all-media-one-index</guid>
    <category><![CDATA[Jina AI]]></category>
    <dc:creator><![CDATA[Scott Martens]]></dc:creator>
    <enclosure url="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt61bf5ce9de247ac5/6a17e89a7b54f9f4108b390f/b51e488ba5b90bec77f75af0b9cb4f0e25e20b91-1130x635.png" length="0" type="image/png"/>
    <pubDate>Mon, 11 May 2026 00:00:00 GMT</pubDate>
  </item>
  <item>
    <title><![CDATA[Jina embeddings v3がGeminiエンタープライズAgent Platform Model Gardenで利用可能になりました]]></title>
    <description><![CDATA[Jina検索基盤モデルであるjina-embeddings-v3のGemini Enterprise Agent Platform Model Gardenでのセルフデプロイが可能になりました。今後さらに追加される予定です。独自のVPC内の単一のL4 GPU上でjina-embeddings-v3を実行できます。]]></description>
    <content:encoded><![CDATA[<p>本日、<code>jina-embeddings-v3</code>、<a href="https://console.cloud.google.com/vertex-ai/publishers/jinaai/model-garden/jina-embeddings-v3">Gemini Enterprise Agent Platform Model</a><a href="https://console.cloud.google.com/vertex-ai/publishers/jinaai/model-garden/jina-embeddings-v3"> Garden</a>でセルフデプロイ可能なパートナーモデルとして利用できる最初のJina検索基盤モデルをリリースします。<em>セルフデプロイ</em>とは、モデルがGoogle CloudプロジェクトおよびVirtual Private Cloud（VPC）内のGPUインスタンス上で実行されることを意味します。外部API呼び出しも、トークンごとの課金も、レート制限もありません。</p><p>この統合により、Elasticsearchユーザーは、データをセキュリティ境界内に保持し、予測可能なインフラストラクチャコストを実現し、Google Cloud上でネイティブに動作する、新たなデプロイメントオプションを利用できるようになります。同時に、より広範なGoogle Cloudエコシステムで、Jinaが専用に構築した最先端の検索および取得モデルを利用できるようになります。</p><p>これは、より広範な展開の第一段階です。次に登場するモデルと合わせると、このラインナップは完全な検索スタックを形成します。データの埋め込み、クエリの埋め込み、候補の検索と再ランク付け、マルチモーダル埋め込みによる画像への検索拡張など、すべてお客様が管理するインフラストラクチャー上で実現します。<code>jina-embeddings-v3</code>の利用は今日から開始できます。このモデルはすでにElastic Inference Service（EIS）を介してElasticsearchエコシステム全体の本番検索パイプラインを支えています。</p><p>モデル</p><p>タイプ</p><p>パラメーター</p><p>主要な機能</p><p>Model Garden上のステータス</p><p>`jina-embeddings-v3`</p><p>テキスト埋め込み</p><p>572M</p><p>実績のある多言語対応の主力モデル、8,000コンテキスト、1024次元の出力、32次元まで切り捨て可能</p><p>提供中</p><p>「jina-embeddings-v5-text-small」</p><p>テキスト埋め込み</p><p>677M</p><p>最先端のサブ1B多言語モデル、32,000コンテキスト、1024次元の出力、32次元まで切り捨て可能</p><p>まもなくリリース</p><p>`jina-embeddings-v5-text-nano`</p><p>テキスト埋め込み</p><p>2億3900万</p><p>クラス最高、5億パラメーター、8,000コンテキスト、768次元の出力、32次元まで切り捨て可能</p><p>まもなくリリース</p><p>`jina-reranker-v3`</p><p>リランカー</p><p>600M</p><p>リスト別リランキング、131,000コンテキスト、最大64件の文書</p><p>まもなくリリース</p><p>`jina-clip-v2`</p><p>マルチモーダル埋め込み</p><p>900M</p><p>共有スペースのテキスト+画像、89言語、8Kのテキストコンテキスト、512×512の画像</p><p>まもなくリリース</p><p>すべてのモデルは、Google Cloudで最もコスト効率の高いGPUティアである単一のNVIDIA L4（24 GB）で動作します。Google Cloud Model Gardenの他のほとんどの埋め込みモデルではA100 80 GBまたはH100が必要となり、トークンを計算する前から、インスタンスの1時間あたりのコストのおよそ3倍の費用がかかります。</p><p>Vertex AIを介してデプロイする場合、追加の商用ライセンスは必要ありません。</p><h2><strong>Model Gardenを使用する理由とは？</strong></h2><p>APIを利用するのではなく、Model Garden経由でデプロイする理由はコントロール、コスト、コンテキストの3点にあります。</p><h3>データが外部に出ることは決してなし</h3><p>多くの開発者にとっての最大の魅力は、セルフデプロイアーキテクチャーです。Model Gardenを通じてJinaモデルをデプロイすると、Google CloudプロジェクトとVPC内のGPUインスタンス上で加重が実行されます。これは、金融や医療など、データセキュリティに関する懸念を抱える業界で働くすべての人にとって、状況を一変させるものとなるでしょう。外部API呼び出しがないため、機密データはセキュリティ境界内に留まります。</p><h3>予測によるスケーリング</h3><p>文章を埋め込んだり、ドキュメントのランキングを変更したりするたびに料金を支払うのではなく、時間単位の固定料金を支払うことになります。また、Jinaのすべてのモデルは、Google Cloudで最も手頃なGPUティアである単一のNVIDIA L4で実行できるため、参入障壁は低いです。1,000件のリクエストを処理する場合でも、10億件を処理する場合でも、インフラストラクチャーの費用は予測可能なままです。これは、トラフィックの増加に対して課金するのではなく、むしろトラフィックの増加に対して報酬を提供する仕組みです。</p><h3>すべてを一箇所で提供します</h3><p>データがすでにGoogle Cloud、BigQuery、またはCloud Storage上のElasticsearchに保存されている場合は、推論エンジンをその近くに配置しておくのが理にかなっています。Model Gardenを通じてデプロイすることで、Jinaの検索基盤モデルは、アクセス制御のためのIDとアクセス管理（IAM）、既存のGoogle Cloud請求書での統一された請求、機械学習オペレーション（MLOps）ワークフローのためのVertex AIパイプラインに接続する機能など、すでに使用しているすべてのエンタープライズ機能を継承します。</p><p>Jina AI Cloud APIとElastic Cloudはトラフィックの急増や既存の検索ワークフローに対応する最速の手段を提供する一方、Model Gardenは、厳格なデータセキュリティと大規模な運用における予測可能なコストを必要とするエンタープライズアプリケーションに最適です。Elasticは、お客様の現状に合わせてサービスを提供したいと考えています。</p><h2><strong>Jina AIモデル</strong></h2><h3><strong>jina-embeddings-v3</strong></h3><p>5億7200万個のパラメーターと8000個のトークンコンテキストを備えた、実績のある多言語埋め込みモデル。Massive Text Embedding Benchmark（MTEB）英語で65.5点を獲得しました。5つのタスク固有の低ランク適応（LoRA）アダプター（検索クエリ/パッセージ、テキストマッチング、分類、クラスタリング）と、1024次元から64次元へのマトリョーシカ切り捨てをサポートします。すでにEISを通じてElasticsearchエコシステム全体で広く採用されています。</p><p>多くの本番システムが既にv3に依存しているため、当社はいち早くv3を導入しています。v3ベースのパイプラインをGoogle Cloudに移行する場合、埋め込みの次元を変更したり、インデックスを再作成したりすることなく、同じモデルをネイティブに実行できるようになりました。</p><h3><strong>jina-embeddings-v5-text（smallおよびnano）</strong></h3><p>2026年2月にリリースされた当社の第5世代テキスト埋め込みモデルは、数倍の規模のモデルに匹敵する最高レベルの性能を実現しています。</p><p><code>v5-text-small</code> （677M）は、9つのタスクタイプの131個のタスクを含むMultilingual MTEB（MMTEB）ベンチマークスイートで67.0点、MTEB英語ベンチマークで71.7点を獲得しています。これは、MTEBリーダーボード上で、10億未満の言語を対象とした多言語埋め込みモデルの中で最も強力なモデルです。</p><p><code>v5-text-nano</code> （239M）はMMTEBで65.5点を獲得しています。5億パラメータ以下の他のモデルでこのレベルに達するものはありません。ほとんどの同等モデルの半分以下のサイズであるため、エッジ環境やレイテンシに敏感な導入環境にとって最適な選択肢となります。</p><p>両モデルとも以下をサポートしています。</p><ul><li><p><strong>4つのタスク特化型LoRAアダプター：</strong>検索、テキストマッチング、分類、クラスタリング。推論時に<code>task</code>パラメーターを介して適切なアダプターを選択します。</p></li><li><p><strong>マトリョーシカ次元切り捨て：</strong>埋め込み次元を1024（nanoの場合は768）から32に削減します。中程度の切り捨て（例えば256次元）では、品質の低下は最小限に抑えられます。次元を半分にすると、ストレージはおよそ半分になります。</p></li><li><p><strong>バイナリ量子化：</strong>1024次元の埋め込みデータをバイナリ化によって2KBから128バイトに圧縮します。特別な訓練により、この圧縮による損失は最小限に抑えられます。</p></li><li><p><strong>多言語対応：</strong>119言語（小型版）と93言語（ナノ版）。</p></li></ul><h3><strong>jina-reranker-v3</strong></h3><p><em>最後ではあるが遅くない相互作用</em>アーキテクチャーを使用して構築された、0.6Bパラメーターの多言語リスト別再ランカー。クエリと最大64件の候補一致が、131,000トークンの単一のコンテキストウィンドウに入力され、モデルはスコアリングを行う前に文書間の比較を実行します。Jina Reranker v3はBEIRで61.94 nDCG@10を達成し、サイズが6倍小さいモデルを凌駕しています。これは、各文書を個別にスコアリングするポイント別型リランカーとは根本的に異なり、特に単一文書からのパッセージ検索でより良い結果をもたらします。</p><h3><strong>jina-clip-v2</strong></h3><p>テキストと画像を共通の1024次元空間にマッピングする、0.9Bのマルチモーダル、多言語埋め込みモデル。以下をサポートします。</p><ul><li><p>テキスト画像検索に対応する<strong>89の言語</strong>。</p></li><li><p><strong>512×512の画像解像度。</strong></p></li><li><p><strong>8,000トークンのテキストインプット。</strong></p></li><li><p>両方のモダリティにおいて、<strong>マトリョーシカ法による1024から64への次元削減</strong>を行います。</p></li></ul><p>画像からテキストへのベンチマーク、特に多言語タスクにおける高い競争力。</p><h2><strong>はじめに</strong></h2><p>Jina Embeddings v3が本日、Model Gardenで利用可能になりました。実行する方法を説明します。</p><p>Vertex AI APIが有効で、少なくとも1つのg2-standard-8インスタンス（NVIDIA L4）に十分なGPU割り当てがあるGoogle Cloudプロジェクトが必要です。Google Cloudを初めて利用する場合は<a href="https://cloud.google.com/vertex-ai/docs/start/cloud-environment">まずセットアップガイドをご覧ください。</a></p><p><a href="https://console.cloud.google.com/vertex-ai/publishers/jinaai/model-garden/jina-embeddings-v3">Jina Embeddings v3のModel Gardenページ</a>では、モデルのアップロード、エンドポイントの作成、マシンタイプの選択、デプロイといった一連の流れを詳しく説明しています。自分のプロジェクトでファイルを開き、表示される手順に従ってください。地域や割り当て量によっては、A100およびH100マシンも利用可能ですが、まずはL4で十分です。</p><p>クリックから最初の埋め込みまで、すべてのプロセスは数分で完了します。</p><h2><strong>今後の対応</strong></h2><p>Jina embeddings v3は出発点です。今後数週間以内に、Jinaの検索スタックの残りの部分、すなわちv5テキスト埋め込み（smallとnano）、jina-reranker-v3、マルチモーダル検索用のjina-clip-v2をModel Gardenに導入する予定です。すべては、同じセルフデプロイモデルで単一のL4 GPU上で実行されます。</p>]]></content:encoded>
    <link>https://www.elastic.co/search-labs/blog/jina-embeddings-v3-gemini-enterprise-model-garden</link>
    <guid isPermaLink="true">https://www.elastic.co/search-labs/blog/jina-embeddings-v3-gemini-enterprise-model-garden</guid>
    <category><![CDATA[Jina AI]]></category>
    <dc:creator><![CDATA[Sa Zhang]]></dc:creator>
    <enclosure url="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt1d9669e8c7a62bf6/6a170ee7a929cf0371ae0a87/42f72633f1e5453dbfd47730b5f776429f9f633e-721x420.png" length="0" type="image/png"/>
    <pubDate>Wed, 22 Apr 2026 00:00:00 GMT</pubDate>
  </item>
  <item>
    <title><![CDATA[Elasticsearch + Jina埋め込みによる教師なし文書クラスタリング]]></title>
    <description><![CDATA[ElasticsearchとJina埋め込みを使用した教師なし文書クラスタリングへの実用的で再現可能なアプローチ。]]></description>
    <content:encoded><![CDATA[<p>ベクターサーチはクエリから始まりますが、もしクエリがなければどうすればよいのでしょうか？</p><p>組織は大量のドキュメントコレクション（サポートチケット、法的書類、ニュースフィード、研究論文など）を蓄積しており、適切な質問をする前にその内容を理解する必要があります。ラベルやトレーニングデータがなければ、何千もの文書を手動で確認するのは非現実的です。何を検索すればいいかわからない場合、従来の検索は役に立ちません。</p><p>この投稿では、この検索の問題に対処するElasticsearchネイティブのアプローチによる教師なし文書クラスタリングと時間軸に沿ったストーリー追跡について説明します。最終的には、次のようにストーリーの文脈を日々にわたってたどることができるようになります。</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blta8c243e0c5773440/6a17093fa6c2b98c86e7968c/100a60a7fb85da8ab3813fd071a82c93f2c3f318-1300x650.png" alt="2025年2月全体の時間軸に沿ったストーリーチェーン。各色のパスは複数日にわたって続くストーリーを表し、リンクの幅はkNNの重なり強度を示しています" /><p><strong>読み取れる内容：</strong></p><ul><li><p>なぜ<strong>クラスタリング埋め込み</strong>（検索埋め込みではない）が、クエリーなしでトピック発見を行いたい場合に重要なのか。</p></li><li><p>Elasticsearchのk-nearest-neighbor（kNN）とバッチ処理<code>msearch</code> を使用したトピックにより、密度探査型重心分類で文書をグループ化する方法。</p></li><li><p><a href="https://www.elastic.co/docs/reference/aggregations/search-aggregations-bucket-significanttext-aggregation"><code>significant_text</code></a> がクラスターに自動ラベルを付けることで、モデルをトレーニングしなくてもテーマを読めるようにする方法。</p></li><li><p>テーマが日々どのように変化するかを示す上で、時間軸に沿ったストーリーチェーンが日々のクラスターをどのように結び付けるのか。</p></li></ul><p>このパイプラインでは、2025年2月のBBCニュースとガーディアンの記事を約8,500件、テストコーパスとして使用しています。ニュースは明確な時間的推移を示すため便利ですが、このパターンは文書の発見が重要なあらゆる場面に適用されます：法的レビュー、コンプライアンスの監視、研究の統合、カスタマーサポートのトリアージ。</p><p><strong>スタック：</strong></p><ul><li><p><a href="https://www.elastic.co/search-labs/blog/jina-embeddings-v5-text"><strong>Jina v5</strong></a>の<strong>クラスタリング埋め込み：</strong>トピックグループ化のためのタスク固有の低ランク適応（LoRA）アダプター。<a href="https://www.elastic.co/blog/elastic-jina-ai">JinaはElasticに統合され</a>、そのモデルは<a href="https://www.elastic.co/docs/explore-analyze/elastic-inference/eis">Elastic Inference Service（EIS）</a>を通じてネイティブで利用可能です。</p></li><li><p><strong>Elasticsearch：</strong>拡張性のある<a href="https://www.elastic.co/docs/solutions/search/vector/knn">kNN</a>、<code>significant_text</code>ラベリング、ベクトルストレージ。</p></li><li><p><a href="https://www.elastic.co/search-labs/blog/diskbbq-elasticsearch-introduction"><strong>DiskBBQ：</strong></a>ディスクベースのベクトルインデックス形式で、 <a href="https://www.elastic.co/docs/reference/elasticsearch/index-settings/bbq">Better Binary Quantization（BBQ）</a>と階層的なk-平均法による分割を組み合わせ、近似最近近接傍（ANN）加速を実現します。このインデックス分割はベクトル探索の内部で行われ、本投稿で用いる密度探査型クラスタリング・アルゴリズムとは別です。<code>bbq_disk</code>はディスクに量子化されたベクトルを格納し、ヒープにはパーティションメタデータのみを保持することで、<code>bbq_hnsw</code>と比較してリソース要件を大幅に削減しながら、高い再現率を維持します。</p></li><li><p><strong>グローバルクラスタリング + 日々の時間軸に沿ったリンク付け：</strong>発見とストーリーの進化。</p></li></ul><p><strong>以下が必要です：</strong></p><ul><li><p>Elasticsearchの導入（Elastic Cloud、Elasticsearchサーバーレス、またはElastic Self-Managed 8.18+/9.0+）：<code>bbq_disk</code> 8.18以降が必要です。オプションのdiversify retrieverセクションは9.3+またはサーバーレスが必要です。</p></li><li><p><a href="https://jina.ai/embeddings/">Jina APIキー</a>：無料プランには1000万トークンが含まれており、これはコアクラスタリング・パイプライン（約425万トークン）をカバーします。オプションの検索対クラスタリング比較は、2番目の埋め込みパスを使用します。</p></li><li><p><a href="https://bonobo.capi.gutools.co.uk/register/developer">Guardian APIキー</a>（無料）。</p></li></ul><h2>セットアップ</h2><p>必要なパッケージをインストールしてください：</p>pip install elasticsearch pandas numpy plotly umap-learn python-dotenv pydantic-settings datasets requests<p>オプション（このリポジトリからスクレイピングヘルパーを実行する場合のみ）：</p>pip install beautifulsoup4<p>次に、プロジェクトのルートにある<code>.env</code>ファイルでAPIキーを設定します。</p>ELASTIC_CLOUD_ID=your-cloud-id        # or ELASTIC_HOST=https://...
ELASTIC_API_KEY=your-api-key
JINA_API_KEY=your-jina-key
GUARDIAN_API_KEY=your-guardian-key<p>このノートブックは <code>load_dotenv(override=True)</code>を呼び出し、局所的な <code>.env</code> 値が優先されます。</p>Connected to Elasticsearch<h2>パート1：ディスカバリークラスタリング - なぜ埋め込みをクラスタリングするのか？</h2><p>ほとんどのベクター検索は、<em>クエリ</em>を関連<em>文書</em>に一致させるようにトレーニングされた<strong>検索埋め込み</strong>を使用します 。これは検索には最適ですが、発見には適していません。まったくクエリーせずにコーパスに存在するトピックを見つけたい場合は、類似した文書をグループ化する埋め込みが必要です。</p><p>Jina v5では、<strong>タスク固有の低ランク適応（LoRA）アダプタ</strong>を使用してこの問題を解決します。LoRAは、ほとんどのベースモデルの重みを凍結したまま、ターゲットとなる内部層に小さな低ランクの更新を加えるため、完全な再トレーニングを行うことなく、モデルの挙動が特定のタスクにシフトします。同じベースモデルでも、<code>task</code>パラメータによって異なる埋め込みが生成されます。</p><p>タスク</p><p>訓練の目的</p><p>ユースケース</p><p>retrieval.passage</p><p>クエリーと文書のマッチング</p><p>Search、Retrieval-Augmented Generation（RAG）</p><p>クラスタリング</p><p>トピックのグループ化（密度が高いクラスタリングの最適化）</p><p>発見、分類</p><p>クラスタリング・アダプターは、同じトピックに関する文書を埋め込み空間で<em>近づけ</em>、異なるトピックに関する文書を<em>離す</em>ように訓練されています。下のビジュアル比較で、その違いが具体的にわかります。</p><h3>検索とクラスタリング：視覚的な比較</h3><p>違いを確認するために、両方のタスクタイプを含むサンプル文書を埋め込んでいます。クラスタリングは元の1024次元の埋め込み空間で実行されます。均一多様体近似と射影（UMAP）は、可視化のためそれらの埋め込みを2Dに投影する目的でのみ使用されます。東映UMAPは局所的な近傍構造を保持するため、クラスターの分離を比較する上で有用です。</p><p>以下では、同じ480件の文書のサンプルが両方のタスクタイプに埋め込まれ、UMAPで2Dに投影されています。クラスタリングパネルで、より密集していて、分離された色群を探します。</p>    Full dataset: 8,495 articles
    Sources: guardian: 5749, bbc: 2746
    Date range: 2025-02-01 to 2025-02-28


    Sample: 480 docs across 8 sections
    section
    Film              60
    World news        60
    Australia news    60
    Opinion           60
    Football          60
    US news           60
    Sport             60
    Business          60


    Clustering embeddings: 480
    Retrieval embeddings:  480


    UMAP projection complete<img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt4b3733dccad212b6/6a1709407d8d67aaeb70e6a4/9bcf7a744900560c1c6c63a2dc3af2f9bfd33e11-1100x500.png" alt="UMAPによる検索埋め込みとクラスタリング埋め込みの比較" /><p><em>検索埋め込み（左）はトピックを広く分散させます。クラスタリング埋め込み（右）は、同じドキュメントからより緊密で分離されたグループを生成します。</em></p><p>クラスタリング埋め込みは、より緊密で視覚的に際立ったグループを生み出します。検索用の埋め込みはトピックをより均等に分散させ、（きめの細かい類似性で）検索する上で理想的です。しかし、発見のためには、緊密なトピッククラスターが重要です。</p><p>このため、このチュートリアルの残りの部分では <code>task="clustering"</code> が使用されています。</p><h3>データセットの読み込み</h3><p>次のコーパスは、2025年2月の2つのニュースソースを組み合わせています。</p><ul><li><p><a href="https://huggingface.co/datasets/RealTimeData/bbc_news_alltime">RealTimeData/bbc_news_alltime</a> HuggingFaceデータセット経由の<strong>BBCニュース</strong>。</p></li><li><p><a href="https://open-platform.theguardian.com/">Guardian Open Platform API</a>経由の<strong>The Guardian</strong>。</p></li></ul><p>複数のソースがあると、クラスタリングが<em>トピック</em>ではなく<em>ソース固有のスタイル</em>を見つけることを検証するのに役立ちます。</p>    Total articles:  8,495
    
    Source breakdown:
    source
    guardian    5749
    bbc         2746
    
    Date range: 2025-02-01 → 2025-02-28
    Days covered: 28
    
    Sample article:
      Source:  guardian
      Title:   Carbon monoxide poisoning ruled out in death of Gene Hackman and wife, police sa
      Section: Film
      Text:    Authorities have ruled out that Gene Hackman and his wife, Betsy Arakawa, died from carbon monoxide poisoning earlier this week in their home in Santa Fe, New Mexico. The Santa Fe county sheriff, Adan...<h3>クラスタリングタスクによる埋め込み</h3><p>Jina v5 APIはすべての文書に対して<code>task="clustering"</code>で呼び出されます。埋め込みはディスクにキャッシュされるため、その後の実行ではAPIを完全にスキップします。</p><p>API呼び出しはシンプルです。<code>task</code>パラメータが、典型的な埋め込み使用との主な違いです。</p>payload = {
    "model": "jina-embeddings-v5-text-small",
    "input": texts,
    "task": "clustering",  # ← This selects the clustering LoRA adapter
}<p>以下のタイミングはキャッシュヒットを反映しています。APIに対する最初の実行は、コーパスサイズによって時間がかかります。</p>    Embeddings ready: 8,495 vectors of dimension 1024
    Time: 0.6s<h3>単一のElasticsearchインデックスへのインデキシング</h3><p>発見クラスタリングでは、1か月間を1つのインデックス（<code>docs-clustering-all</code>）にまとめます。日々の分割は、時間軸に沿ったストーリーリンクのために後から行われます。</p><p>インデックスマッピングでは、ベクトルフィールドに<a href="https://www.elastic.co/docs/reference/elasticsearch/index-settings/bbq"><code>bbq_disk</code></a>を使用します。</p>{
  "embedding": {
    "type": "dense_vector",
    "dims": 1024,
    "index": true,
    "similarity": "cosine",
    "index_options": {
      "type": "bbq_disk"        // hierarchical k-means partitioning for ANN index lookup; separate from this post's clustering algorithm
    }
  }
}<p>1024次元のfloat32ベクトルは4KBです。<a href="https://www.elastic.co/search-labs/blog/diskbbq-elasticsearch-introduction"><code>bbq_disk</code></a> は階層的k-means法を使用してベクトルを小さなクラスターに分割し、それらをバイナリ量子化し、再スコアリングのためにフルプレシジョンのベクトルをディスクに格納します。パーティションのメタデータのみがヒープに存在し、そのため大規模なコーパスでもメモリ要件は低く抑えられます。より多くのヒープを許容できるワークロードの場合、<a href="https://www.elastic.co/docs/reference/elasticsearch/index-settings/bbq"><code>bbq_hnsw</code></a> は、より高いリソースコストでより高速な検索を行うための階層的ナビゲーシブル・スモールワールド（HNSW）グラフを構築します。</p><p><a href="https://www.elastic.co/docs/reference/elasticsearch/mapping-reference/dense-vector"><code>dense_vector</code></a>フィールドタイプは複数の量子化戦略をサポートしています：<code>bbq_disk</code>と<code>bbq_hnsw</code>は、ここで使用されている1024次元ベクトルのような高次元埋め込みに最適です。</p>    Indexed 8,495 documents into docs-clustering-all
    Time: 57.5s<h3>クラスタリング：密度探査型重心分類</h3><p>HDBSCANのような従来型のクラスタリングアルゴリズムでは、完全なn×dベクトル行列をメモリに保持し、フルパス更新を繰り返し実行できることを前提としています。8,495件のドキュメントを1024次元で扱う場合、処理可能（最大35MB）ではあるものの、このアプローチは追加のインフラストラクチャーなしでは数百万の文書にスケールすることはできません。</p><p>このアルゴリズムは、ボロノイ領域への割り当て割り当てとノイズフロアによるKMeans++法の初期化と概念的には似ていますが、Elasticsearchの<a href="https://www.elastic.co/docs/solutions/search/vector/knn">kNN検索</a>を計算プリミティブとして使用し、ほぼ全ての作業をサーバー側で行います。</p><ol><li><p><strong>文書の5%を密度プローブとしてサンプリング</strong>します（ランダムサンプル、最低50件）。</p></li><li><p><strong>バッチ処理された　msearch　kNNによるプローブ密度。</strong>各プローブはkNNクエリを実行し、隣接プローブの平均類似度を記録します。平均類似度が高い＝埋め込み空間の密な領域。<a href="https://www.elastic.co/docs/api/doc/elasticsearch/operation/operation-msearch"><code>msearch</code></a> は単一のHTTPコールで複数の検索リクエストを送信し、これは重要です。密度プローブは数百のkNNクエリを生成し、それらをバッチ処理することでリクエストごとのオーバーヘッドを回避します。</p></li><li><p><strong>多様性を考慮した高密度シードの選択</strong>：中央値以上の密度を持つ候補は、密度の降順でソートされ、既存のすべてのシードとのコサイン類似度が分離閾値を下回る場合にのみ貪欲に受け入れられます。これがクライアント側での唯一の計算です（8,000件の文書で最大0.01秒）。</p></li><li><p><strong><code>msearch</code></strong> <strong>kNN</strong><strong>で全ての書類を重心に照らして分類します</strong>。各シードが重心として機能し、kNN検索は類似度しきい値を超える近接文書を取得します。各文書は、最も高いスコアを返した重心に割り当てられます。小さなクラスターはノイズとして処理されます。</p></li></ol><p>Elasticsearchが面倒な処理を担当します：<code>msearch</code>は密度プローブ、<code>msearch</code>は分類、<code>significant_text</code>はラベル付けを担います。このコーパス（8,495件の文書）では、5％の密度プローブサンプルが425件のkNNプローブクエリを開始し、<code>msearch</code>が9つのHTTPコール（バッチサイズ50）にバッチ処理され、プローブごとに1つのリクエストを処理することによるオーバーヘッドを回避します。<code>bbq_disk</code>ANNルックアップと組み合わせることで、クラスタリング段階を高速かつスケーラブルに保つことができます。kNNクエリは、クラスタリングパス中の速度のために最小の<a href="https://www.elastic.co/docs/deploy-manage/production-guidance/optimize-performance/approximate-knn-search"><code>num_candidates</code></a>値を使用します。本番環境の検索クエリでは、レイテンシを犠牲にしてリコールを向上させるために、より高い<code>num_candidates</code>値を使用する必要があります。</p><p>クラスターは各重心の周りの埋め込み空間の密度によって決定される実際的なサイズを持ち、厳格な<code>k</code>の上限によって決定されるものではありません。密なトピック領域はより大きなクラスターを生み出し、ニッチなトピックは小さなクラスターを生み出します。</p><h4>KMeansやHDBSCANが実用的ではない理由</h4><p>KMeans法は球状クラスターを想定しており、メモリに完全なn×d行列が必要です。メモリに収まるコーパスの場合、<a href="https://scikit-learn.org/stable/modules/generated/sklearn.cluster.HDBSCAN.html">HDBSCAN</a>は強力な代替手段です。任意のクラスタ形状に対応でき、密度に関するセマンティクスも十分に理解されています。</p><p>密度探査型重心アプローチは、異なるニッチをターゲットとしています。ストレージ、検索、およびクラスタリングを1つのシステムで行いたい場合や、スケールがクライアント側の行列操作を実用的でなくするようなコーパスです。これは、Elasticsearch kNNを計算プリミティブとして使用し、任意のクラスターサイズを処理し、ほぼすべての計算をサーバー側で行います。</p>    Clustered global index in 31.6s
      Total clusters: 82
      Total noise:    2420 (28.5%)
      Density probes: 425 kNN queries via 9 _msearch HTTP calls<h4>ノイズレートについて理解する</h4><p>最大28%のノイズ率は設計によるもので、故障モードではありません。設定された<code>similarity_threshold</code>でどの高密度クラスターにも適合しない文書は、一致率が低いと強制的に判断されるのではなく、割り当てられずに残されます。これは品質ゲートの役割を果たします：意見を記したコラム、短い記事、そして一回限りのストーリーは、一貫したグループを定義する主題の密度が不足しているため、クラスタリングに抵抗する性質があります。</p><p>しきい値は調整可能です。<code>similarity_threshold</code>を下げると、より積極的なクラスタリングが生成されます（より多くの文書が割り当てられますが、クラスターは緩くなります）。一方、これを上げると、クラスターが引き締まり、ノイズの割合が増加します。こうした様々なニュースコンテンツを含むコーパスにおいては、約30％のノイズは妥当な動作基点と言えます。本番環境での導入は、分野固有の品質基準に合わせてしきい値を調整することが推奨されます。</p><h3>significant_textを使用した自動ラベル付け</h3><p>各クラスターには人間が読みやすいラベルが必要です。Elasticsearchの<code>significant_text</code>アグリゲーションは、フォアグラウンドセット（クラスター）とバックグラウンドセット（完全なコーパス）を比較して、異常に頻繁に現れる用語を見つけます。</p><p>内部的には、絶対頻度の変動と相対頻度の変動のバランスを取る統計的ヒューリスティック（デフォルトではJLHスコア）を使用しており、機械学習や大規模言語モデル（LLM）の呼び出しは行っていません。英国の政治に関するクラスターでは、<code>starmer</code>、<code>labour</code>、<code>downing</code>のような用語が浮かび上がる可能性があります。これらの用語は、全体的なニュースコーパスと比較して、そのクラスターで不釣り合いに頻出しているためです。</p><p>このグローバルパスでは、ラベルは<code>docs-clustering-all</code>に対して直接計算されるため、前景と背景の両方が月全体のデータから描画されます。パート2では、ラベル付けに日次インデックスパターン（<code>docs-clustering-*</code>）を使用します。これは、クエリで一致するすべてのインデックスを同時に対象にできるワイルドカードで、<code>significant_text</code>により広い背景を与えてコントラストを高めます。</p><p>最小クエリー形状は次のようになります。</p>{
  "size": 0,
  "query": { "term": { "cluster_id": "72" } },
  "aggs": {
    "label_terms": {
      "significant_text": {
        "field": "text",
        "size": 5,
        "filter_duplicate_text": true
      }
    }
  }
}<p><code>significant_text</code> また、品質ゲートの役割も果たします。有意な用語を生成しないクラスターには、特徴的な語彙がありません。これらはまとまりのないグループであり、誤解を招くようなラベルを付けるのではなく、ノイズとして分解する必要があります。</p><p>軽量で決定論的なクリーンアップステップで、ノイズの多いラベルの用語（数値トークン、一般的な単語）を削除し、必要に応じて代表的な見出しに切り替えます。これにより、ラベルをElasticsearchネイティブのまま維持しつつ、可読性を向上させます。</p>    Sample cluster labels:
      cluster   3  (200 docs)  arsenal | mikel | villa
      cluster   1  (198 docs)  volodymyr | ukrainian | kyiv
      cluster   0  (196 docs)  hostages | hamas | israeli
      cluster   4  (187 docs)  scrum | rugby | borthwick
      cluster  52  (185 docs)  fossil | renewable | renewables
      cluster  10  (156 docs)  labour | gwynne | mps
      cluster  40  (151 docs)  novel | novels | literary
      cluster  11  (149 docs)  mewis | sarina | wiegman
      cluster  44  (143 docs)  flooding | rainfall | rain
      cluster  13  (131 docs)  doge | musk | elon
      cluster  12  (128 docs)  murder | insp | knockholt
      cluster   5  (124 docs)  putin | backstop | starmer


    Reassigned 35 docs from incoherent clusters to noise
    Total docs: 8,495
    Clustered:  6,040 (71.1%)
    Noise:      2,455 (28.9%)<h3>クラスターの可視化</h3><p>以下の可視化は、グローバルクラスタリングパスが発見した内容を示しています：クラスター化された文書とノイズ文書の日付ごとの内訳、全月のUMAP投影、およびクラスターがソースではなくトピックを反映していることを確認するソースミックスチャート。</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt4ed087d8b6dac2a0/6a17094260084b44543c4501/99099f5adaa945ae4097c50b0d7151c7dd28872e-1000x400.png" alt="クラスター化された文書とノイズ文書の日次分布" /><p>2025年2月におけるクラスター化された文書とノイズ文書の日次分布。</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltf5ca320bc91131ab/6a17094366c4f95828f8bfbf/477c6c7177942955a942f85f5c881da50e517915-1100x700.png" alt="全文書を含む1か月分のUMAP投影" /><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt5f554a6bc2bc367b/6a170945a929cfa7a1ae0947/4f4302556c8974c416842452cf33bca06e90b966-1100x700.png" alt="クラスター化された文書のみを表示するUMAP投影" /><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt8e40c26f89ce5523/6a17094747d49c147d2d8974/327f96a79e382ef30614cb0570aa7fccd822b8f8-1100x700.png" alt="[単一のクラスターを強調表示したUMAP投影" /><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltf1dd2c19ae628f1d/6a1709481949f7a630e7a9a3/acfb1524a10e24d6ff2412e7c3ec0f2b3ac75193-900x600.png" alt="トピックベースのグループ化を示すクラスターごとのソースミックス" /><p>UMAPの色のついた島はそれぞれがクラスターを表しています。クラスターは、純粋に類似性を埋め込むことで発見された、同じトピックに関する記事の集合です。灰色のノイズポイントは、いずれのクラスターにもきれいに収まらなかった記事（多くの場合、短い記事、意見記事、または一回限りのストーリー）です。</p><p>情報源の内訳図を見ると、各クラスターにはBBCニュースとガーディアンの<strong>両方</strong>からの記事が含まれていることが確認できます。クラスタリングは、<em>ソース</em>ではなく<em>トピック</em>を見つけ出すものであり、まさに教師なし学習から期待される結果です。</p><h3>Diversify Retrieverによるクラスター幅の調査</h3><p>通常のkNNは、クラスターの重心（密なコア）に最も類似した文書を返します。しかし、実際のクラスターはサブトピックも対象にします。The <a href="https://www.elastic.co/docs/reference/elasticsearch/rest-apis/retrievers/diversify-retriever"><strong>Diversify Retriever</strong></a>は、Maximal Marginal Relevance（MMR） を使用して、重心に関連するだけでなく、<em>互いに異なる</em>文書を抽出します。</p><p>鍵となるパラメータは <strong>λ（ラムダ）</strong>です。</p><ul><li><p>λ = 1.0 → 純粋な関連性（通常のkNNと同じ）。</p></li><li><p>λ = 0.0 → 純粋多様性（最大限に分散された結果）。</p></li><li><p>λ = 0.5 → バランスが取れている：トピックに関連しているが、異なる角度をカバーしている。</p></li></ul><p>最小Retrieverリクエストの形状は次のようになります。</p>{
  "size": 8,
  "retriever": {
    "diversify": {
      "type": "mmr",
      "field": "embedding",
      "lambda": 0.5,
      "query_vector": "&lt;cluster-centroid-vector&gt;",
      "retriever": {
        "knn": {
          "field": "embedding",
          "query_vector": "&lt;cluster-centroid-vector&gt;",
          "k": 50,
          "num_candidates": 100
        }
      }
    }
  }
}<p><code>type</code>、<code>field</code>、および <code>query_vector</code> パラメーターは、diversifyレベルで必要です。<code>field</code> はMMRに結果間の類似性に使用する dense_vector フィールドを指示し、<code>query_vector</code> は関連性スコアリングの参照点を提供します。</p><p>これにより、単に「その中心は何か？」という問いではなく、「このクラスターは実際に何を対象としているのか？」という問いに答えることができます。</p>    Exploring cluster 52 (185 docs)
    Label: fossil | renewable | renewables
    Centroid computed (dim=1024)


    ========================================================================
    Plain kNN (closest to centroid)
    ========================================================================
      1. [0.9738] Green campaigners fear ministers are poised to award billions of pounds in fresh subsidies to Drax power station, despite strong concerns...
      2. [0.9710] Thirteen more oil and gas licences could be cancelled as ministers decide new guidance for fossil fuel extraction after a landmark court...
      3. [0.9699] Experts have accused the fossil fuel industry of seeking special treatment after lobbyists argued greenhouse gas emissions from oilfields...
      4. [0.9681] Burning wood is a terrible way of producing electricity . Chopping down trees destroys habitats for wildlife, and growing new trees cannot...
      5. [0.9649] Keir Starmer will do huge damage to the global fight against climate change if he gives in to political pressure and allows the development...
      6. [0.9641] Labour will next week be confronted with stark policy choices that threaten to expose the fault lines between the Treasury and the...
      7. [0.9638] The Drax power station near Selby in north Yorkshire burns imported wood pellets  The government has agreed a new funding arrangement with...
      8. [0.9581] If you care about the world we are handing on to future generations, the news on Thursday morning was dramatic. This January was the...
    
    ========================================================================
    Diversify retriever (MMR, lambda=0.5)
    ========================================================================
      1. [0.9738] Green campaigners fear ministers are poised to award billions of pounds in fresh subsidies to Drax power station, despite strong concerns...
      2. [0.9434] Oil and gas interests have waged a coordinated campaign to kill pro-electrification policies that ban gas connections in new buildings ,...
      3. [0.9303] It was interesting to read that new licences for oil and gas production in the North Sea are being delayed by legal action ( Thirteen more...
      4. [0.9139] The US energy secretary, Chris Wright, has said he “would love to see Australia get in the game of supplying uranium and maybe going down...
      5. [0.9077] Rachel Reeves was facing criticism on Saturday night as it was confirmed that a report she cited as evidence that a third ­runway at...
      6. [0.8996] When Margaret Thatcher opened the Hadley Centre for Climate Change in 1990 journalists suggested she was attempting to appear to be doing...
      7. [0.8993] The vast majority of governments are likely to miss a looming deadline to file vital plans that will determine whether or not the world has...
      8. [0.8987] European imports of seaborne gas shipments fell by a fifth last year to their lowest level since the pandemic, according to a new report,...
    
    Overlap: 1/8 documents appear in both result sets
    
    Avg pairwise similarity (lower = more diverse):
      Plain kNN:          0.9057
      Diversify retriever: 0.6965<p>プレーンなkNNは、トピックの1つの角度、つまり中心点および互いに最も類似したドキュメントの周りにクラスターを形成します。Diversify Retrieverは、同じクラスターの異なるファセット、つまりサブトピック、異なるソース、多様な視点を提示します。</p><p>多様性指標はこれを定量的に裏付けます。Diversify Retrieverの結果では、平均ペアワイズ類似度が低く、これは返された文書がより広範囲をカバーしていることを意味します。</p><p>これは以下の用途に役立ちます。</p><ul><li><p><strong>クラスターが実際に対象としている内容を理解</strong>。その中心だけでなく端も含め理解します。</p></li><li><p><strong>要約の生成</strong>。多様で代表的な文書は、LLMにより良い材料を提供します。</p></li><li><p>人によるレビューや下流工程でのラベリングのために、<strong>代表的な例を発見</strong>。</p></li><li><p><strong>品質チェック</strong>。多様な結果が一貫性に欠けている場合、クラスターの分割が必要かもしれません。</p></li></ul><h2>パート2：時間軸に沿ったストーリーチェーン</h2><h3>日をまたいだデータストーリーの追跡</h3><p>パート1では、トピック発見のために1か月全体をグローバルにクラスタリングしました。時間軸に沿ったフローでは、同じ密度プローブの重心分類が<strong>日次インデックス</strong>ごとに1日単位で独立して実行され、その後、クラスターが隣接する日々にわたってリンクされます。注意：日々のクラスターはパート1のグローバルクラスターとは独立しており、それぞれの1日はその日のコンテンツに合わせて独自のクラスター割り当てとラベルを生成します。</p><h4><strong>関連付けの手法：サンプルとクエリ</strong></h4><p>A日目の各クラスターについて：</p><ol><li><p>いくつかの代表的な文書をサンプルとして選択します。</p></li><li><p>kNNをB日目のインデックスに対して実行します。</p></li><li><p>B日目のクラスターごとにヒット数を数えます。</p></li><li><p>ヒット率がしきい値（kNNの割合≥ 0.4）を超える場合は、リンクを記録します。</p></li></ol><p>この処理は高速で（クラスターごとにわずかなドキュメントのみがクエリされ、すべてではありません）、ElasticsearchのネイティブkNNを使用し、外部ツールは必要ありません。</p>Preparing daily indices for temporal linkage...


Indexed 8,495 docs into 28 daily indices


Temporal links found: 808 in 145.4s

Strongest links:
  2025.02.01 'league | arsenal | premier' -&gt; 2025.02.02 'league | season | striker'  (100%)
  2025.02.03 'league | striker | loan' -&gt; 2025.02.04 'league | striker | season'  (100%)
  2025.02.03 'score | operator | gedling' -&gt; 2025.02.04 'league | striker | season'  (100%)
  2025.02.12 'playoff | leg | bayern' -&gt; 2025.02.13 'league | players | injury'  (100%)
  2025.02.14 'league | injury | football' -&gt; 2025.02.15 'league | premier | football'  (100%)
  2025.02.18 'russia | ukraine | talks' -&gt; 2025.02.19 'saudi | russia | arabia'  (100%)
  2025.02.18 'football | league | bayern' -&gt; 2025.02.19 'league | manchester | players'  (100%)
  2025.02.21 'league | premier | manchester' -&gt; 2025.02.22 'game | players | defeat'  (100%)
  2025.02.21 'rugby | calcutta | brilliant' -&gt; 2025.02.22 'game | players | defeat'  (100%)
  2025.02.26 'metals | kyiv | ukrainian' -&gt; 2025.02.27 'ukraine | russia | talks'  (100%)<p>kNN分数が100％ということは、ソースクラスターからサンプリングされたすべてのドキュメントが同じターゲットクラスターに到達していることを意味し、これは異なる日付間のリンクが理論上最も強くなります。ほとんどの上のリンクはフットボール関連で、これは理にかなっています。プレミアリーグは毎日報道され、高いトピックの一貫性があります。</p><p>The <code>score | operator | gedling</code> → <code>league | striker | season</code> リンクは、ニッチなローカルフットボールクラスター（Gedling はノンリーグクラブです）が翌日に広範なプレミアリーグクラスターに吸収される例であり、これは異なる粒度での日々の再クラスタリングの自然な効果です。</p><h3>ストーリーチェーンの構築</h3><p>ストーリーチェーンとは、連日にわたって連続した一連のクラスターです。</p><p>個々のペアワイズリンクは、月曜日の「UK politics」クラスターが火曜日のクラスターにリンクしていることを示しています。チェーンはストーリー全体を明らかにします。月曜日に始まり、週を通して展開し、金曜日までに消えていくストーリーです。</p><p>チェーンは、kNN分数が0.4以上のリンクから貪欲に構築されます。これは、ソースクラスターからサンプリングされたドキュメントの少なくとも40％が単一のターゲットクラスターに到達したことを意味します。最も古いクラスターから開始し、アルゴリズムは常に最も強い発信リンクを追跡します。
</p>    Strong links (kNN fraction &gt;= 0.4): 244
    Story chains spanning 3+ days: 18
      Chain 1: 'ukrainian | kyiv | eastern' (19 days: Feb 3 → Feb 21)
      Chain 2: 'playing | opposition' (19 days: Feb 10 → Feb 28)
      Chain 3: 'tadhg | maro | cadan' (10 days: Feb 1 → Feb 10)
      Chain 4: 'invade | china | putin' (8 days: Feb 21 → Feb 28)
      Chain 5: 'elected | labour | leader' (7 days: Feb 12 → Feb 18)
      Chain 6: 'film | swift | awards' (6 days: Feb 2 → Feb 7)
      Chain 7: 'amendment | termination | reporting' (6 days: Feb 12 → Feb 17)
      Chain 8: 'officers | scene | police' (5 days: Feb 1 → Feb 5)<p>最も長いチェーンは、ウクライナとロシアに関する報道を19日間連続で追跡していますが、2025年2月の地政学的な緊張が持続していることを考えると、これは驚くべきことではありません。2番目に長いチェーンは、19日間にわたるプレミアリーグのサッカーを追跡するものです。より短いチェーンは、映画賞シーズン（6日間）、シックス・ネーションズラグビー（10日間）、英国の政治指導者に関する報道（7日間）を追跡しています。それぞれのチェーンは、アルゴリズムが日々のインデックス全体にわたる埋め込み類似性のみから発見したストーリー展開を表しています。</p><h3>サンキー：ストーリーの流れを可視化する</h3><p>サンキーダイアグラムは、リンクの幅がつながりの強さを表す流れの可視化です。ここでは、各垂直バンドが1日を表し、各ノードは日々のクラスター（ドキュメント数によってサイズが決まる）であり、各色のパスは時間の経過に沿って1つのストーリーチェーンを追跡します。リンク幅はkNNのオーバーラップ強度をエンコードします。リンクが太いほど、サンプリングされたドキュメントの数がより多くターゲットクラスターに到達したことになります。色はチェーンごとに分かれているので、左から右へ流れる1つのカラーパスで1つのストーリーの進行がわかります。</p><p>たとえば、ウクライナとロシアのチェーン（比較的長い経路の一つとして示されている）は、2月初旬から第3週まで途切れることなく続いており、一貫して太い線で結ばれていることから、日々の話題の連続性が強いことがわかります。</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blta8c243e0c5773440/6a17093fa6c2b98c86e7968c/100a60a7fb85da8ab3813fd071a82c93f2c3f318-1300x650.png" alt="2025年2月に流れる時間軸に沿ったストーリーチェーン" /><p><em>2025年2月に流れる時間軸に沿ったストーリーチェーン各色のパスは、複数日にわたって続くストーリーを表し、リンクの幅はkNNの重なりの強さを示します。</em></p><h2>このアプローチがもたらすメリット</h2><p>このウォークスルーでは、Elasticsearch上に構築された完全な教師なしドキュメントクラスタリング・パイプラインについて説明しました。</p><ol><li><p><strong>クラスタリング埋め込み</strong>：Jina v5のタスク固有のアダプターは、トピックのグループ化に最適化された埋め込みを生成し、単なるクエリと文書のマッチングだけではありません。</p></li><li><p><strong>グローバルな発見クラスタリング</strong>：1つのインデックスで1か月間をクラスタリングすることで、日をまたいだトピックの発見を最大化します。</p></li><li><p><strong>密度プローブによる重心分類</strong>：5％をサンプリングし、<code>msearch</code> kNNを介して密度をプローブし、多様な高密度シードを選択し、すべての文書を重心に対して分類します。Elasticsearchは負荷の高い計算を処理します。シード選択のみがクライアント側で実行されます（最大0.01秒）。</p></li><li><p><a href="https://www.elastic.co/docs/reference/aggregations/search-aggregations-bucket-significanttext-aggregation"><strong><code>significant_text</code></strong></a><strong>ラベリング</strong>：有意性テストは、MLモデルや手動アノテーションなしで意味のあるクラスタラベルを生成します。有意な項を生み出さないクラスタは非整合となり、ノイズに格下げされます。これは内蔵された品質ゲートです。</p></li><li><p><strong>時間軸に沿ったストーリーのリンク付け</strong>：日次インデックスとサンプルおよびクエリのクロスインデックスkNNは、ストーリーが時間とともにどのように進化するかを追跡します。</p></li></ol><p><strong>重要なポイント</strong></p><ul><li><p>埋め込みタスクの種類が重要です。クラスタリング埋め込みは、測定可能かつより緊密な話題のグループを生成します。</p></li><li><p>Elasticsearchはストレージ層<em>および</em>クラスタリングエンジンの両方として<a href="https://www.elastic.co/docs/solutions/search/vector/knn">kNN検索</a>を通じて機能します。</p></li><li><p>密度探査型重心分類は、ほぼすべての計算をサーバー側で行い、埋め込み空間の密度によって決定される合理的なサイズのクラスターを生成します。</p></li><li><p><code>significant_text</code> 高速で解釈可能で、自動ラベリングと品質管理の両方に効果的です。</p></li></ul><p><strong>このアプローチは、以下の場合に有用です。</strong></p><ul><li><p>タイムスタンプ付きのテキストがあり、ラベル付きトレーニングデータを使用せずにトピックを発見したい場合があります。</p></li><li><p>ストレージ、ベクトル検索、ラベル付け、および時間軸に沿ったリンク付けのために、1つのスタックが必要な場合があります。</p></li></ul><p><strong>検討すべき拡張機能：</strong></p><ul><li><p>複数期間クラスタリング（週間、月間集計）。</p></li><li><p>リアルタイムのインジェストと段階的なクラスター割り当て。</p></li><li><p>LLM生成のクラスタサマリーは、significant_text項をシードとして用います。</p></li><li><p>より大規模なスケールでは、サンプリングされたKMeansの重心が密度ベースのクラスタリングのウォームスタートシードとして機能し、探査フェーズのコストを削減できます。</p></li></ul><h2>はじめましょう</h2><p>タイムスタンプ付きの文書コーパスを差し替えます。日付のあるテキストのコレクションであれば、このパイプラインで利用可能です。完全なノートブックとサポートコードは、<a href="https://github.com/elastic/elasticsearch-labs/tree/main/supporting-blog-content/unsupervised-document-clustering-elasticsearch-jina-embeddings">付属レポジトリ</a>で入手できます。</p><ul><li><p><a href="https://cloud.elastic.co/registration?onboarding_token=vectorsearch&amp;cta=cloud-registration&amp;tech=trial&amp;plcmt=article%20content&amp;pg=search-labs"><strong>Elastic Cloudの無料トライアルを開始</strong></a>：<code>bbq_disk</code>サポート付きのマネージドクラスターを数分でご利用いただけます。</p></li><li><p><a href="https://www.elastic.co/elasticsearch/serverless"><strong>Elasticsearch Serverlessをお試しください</strong></a>：クラスターの管理は不要で、自動的にスケールし、このウォークスルーのすべてをサポートします。</p></li></ul>]]></content:encoded>
    <link>https://www.elastic.co/search-labs/blog/unsupervised-document-clustering-elasticsearch-jina-embeddings</link>
    <guid isPermaLink="true">https://www.elastic.co/search-labs/blog/unsupervised-document-clustering-elasticsearch-jina-embeddings</guid>
    <category><![CDATA[Vector Database]]></category>
    <category><![CDATA[MLの調査]]></category>
    <category><![CDATA[Jina AI]]></category>
    <dc:creator><![CDATA[Matthew Adams]]></dc:creator>
    <enclosure url="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt4bd7dd10a7cd6dc8/6a17094a14b270581de3c5b6/662c00694c3e0c2fb2128098bdb6813df9e86a72-1280x720.png" length="0" type="image/png"/>
    <pubDate>Fri, 10 Apr 2026 00:00:00 GMT</pubDate>
  </item>
  <item>
    <title><![CDATA[jina-embeddings-v5-text：検索やインテリジェントアプリケーション向けのコンパクトで最先端のテキスト埋め込み]]></title>
    <description><![CDATA[jina-embeddings-v5-text-smallとjina-embeddings-v5-text-nanoを含むjina-embeddings-v5-textモデルを紹介し、Elastic Inference Service（EIS）を介してこれらの多言語埋め込みモデルを使用する方法を説明します。]]></description>
    <content:encoded><![CDATA[<p>Jina AIとElasticは、<code>jina-embeddings-v5-text</code>をリリースします。これは、すべての主要なタスクタイプにおいて、同等サイズのモデルの中で最先端のパフォーマンスを備えた、新しい高性能でコンパクトなテキスト埋め込みモデルのファミリーです。</p><p>このファミリーには2つのモデルが含まれます。</p><ul><li><p><code>jina-embeddings-v5-text-small</code></p></li><li><p><code>jina-embeddings-v5-text-nano</code></p></li></ul><p>これらのモデルは、埋め込みモデルの革新的な新しいトレーニングレシピの成果です。いずれも、同等サイズのモデルよりも何倍も優れたパフォーマンスを発揮し、メモリとコンピューティングリソースを節約し、リクエストへの応答を高速化します。</p><p><code>jina-embeddings-v5-text-small</code>モデルは6億7700万パラメーターを持ち、32768トークンのインプットコンテキストウィンドウをサポートし、デフォルトで1024次元の埋め込みを生成します。</p><p><code>jina-embeddings-v5-text-nano</code> はその兄弟の約3分の1のサイズで、239Mのパラメーターと8192トークンのインプットコンテキストウィンドウを持ち、スリムな768次元の埋め込みを生成します。</p><p>モデル名</p><p>合計サイズ</p><p>インプットコンテキストウィンドウサイズ</p><p>埋め込みサイズ</p><p>jina-v5-text-small</p><p>677M パラメータ</p><p>32768トークン</p><p>1024次元</p><p>jina-v5-text-nano</p><p>2億3900万パラメーター</p><p>8192 トークン</p><p>768次元</p><p>これら2つのモデルは、MMTEB（<a href="https://huggingface.co/spaces/mteb/leaderboard">Multilingual MTEB</a>）ベンチマークの総合的なパフォーマンスにおいてクラス最高です。5億未満のパラメーターを持つモデルの中で<code>jina-embeddings-v5-text-nano</code>はトップパフォーマーであり、2億5000万未満のパラメータを持ちながらも、7億5000万未満のパラメータを持つ多言語埋め込みモデルの中で<code>jina-embeddings-v5-text-small</code>モデルがリーダーです。</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltb2f2be8618f5e240/6a17dbb83e9e45b7f3ba1344/d97126285fa196c3045b1913b7754e4b186c1e4c-1300x1100.png" alt="jina-embeddings-v5-text MMTEBスコア" /><p>これらのモデルは、Elastic Inference Service（EIS）やオンラインAPIを介して利用でき、ローカルホスティングでも利用できます。<code>jina-embeddings-v5-text</code>モデルにアクセスする方法については、以下の「<strong>はじめに</strong>」セクションを参照してください。</p><p>埋め込みモデルとセマンティックインデックスにより、検索アルゴリズムの精度が劇的に向上するだけでなく、以下のようなセマンティック類似性や意味抽出を伴うタスクにもさまざまな用途があります。</p><ul><li><p>重複したテキストの検索。</p></li><li><p>言い換えや翻訳の認識。</p></li><li><p>トピックの発見。</p></li><li><p>推奨エンジン。</p></li><li><p>感情分析と意図分析。</p></li><li><p>スパムフィルタリング。</p></li><li><p>その他多数。</p></li></ul><h2><strong>特徴</strong></h2><p>この新しいモデルファミリーには、関連性を高め、コストを削減するために設計された多くの特徴があります。</p><h3>タスクの最適化</h3><p>私たちは、<code>jina-embeddings-v5-text</code> のモデルを4つの幅広いタスクタイプに最適化しました。</p><p>タスク</p><p>ユースケースの例</p><p>検索</p><p>自然言語クエリを使用して検索し、ドキュメントのコレクション内で最も関連性の高い一致を取得。</p><p>テキストマッチング</p><p>意味的類似性、重複除去、言い換えや翻訳の整合性など。</p><p>クラスタリング</p><p>トピックの検出、ドキュメントコレクションの自動整理。</p><p>分類</p><p>ドキュメントの分類、感情と意図の検出、同様のタスク。</p><p>あるタスクを最適化するということは、通常、別のタスクを妥協する必要があることを意味します。そのため、ほとんどの埋め込みモデルは、1種類のタスクに対してのみ競争力のあるパフォーマンスを発揮します。しかし、<code>jina-embeddings-v5-text</code>モデルは、タスク固有の<a href="https://arxiv.org/abs/2106.09685">Low-Rank Adaptation（LoRA）アダプター</a>をトレーニングすることで、妥協することなく4つのすべての分野に特化できます。</p><p>LoRAアダプターはAIモデルのプラグインの一種であり、全体のサイズをわずかに増やすだけでAIモデルの動作を劇的に変化させます。<code>jina-embeddings-v5-text</code> モデルファミリーでは、タスクごとにモデル全体を用意し、それぞれに何億ものパラメーターを持たせる代わりに、各タスクにコンパクトなLoRaアダプターを備えた1つのモデルだけを使用できます。これによりメモリ、ストレージ容量、推論コストを節約できます。</p><h3>埋め込みの切り捨て</h3><p>私たちは、 <a href="https://arxiv.org/abs/2205.13147">Matryoshka Representation Learning</a>を使用して<code>jina-embeddings-v5-text</code>モデルをトレーニングしました。これにより、品質への影響を最小限に抑えながら、埋め込みを小さなサイズに削減できます。</p><p>デフォルトでは、<code>jina-embeddings-v5-text-small</code> は1024次元の埋め込みベクトルを生成し、各ベクトルは16ビットで表されます。大量のドキュメントコレクションの場合、格納するデータ量が多くなり、埋め込みで満たされたベクトルデータベースでの検索は、データベースのサイズと各格納されたベクトルが持つ次元の数に比例します。</p><p>しかし、埋め込みのサイズを半分に減らす（1024次元のうち512次元を切り捨てる）だけで、占有スペースを半分にしながら検索速度を2倍にすることができます。これはパフォーマンスに影響を与えます。情報を捨てると精度が低下しますが、下のグラフが示すように、埋め込みの半分を取り除いてもパフォーマンスはわずかしか低下しません。</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt8deea6ee69a6b77d/6a17dbba0b0bed2217dd347e/f11969682c81bcf22b5b29a6204ba6ec40471b3d-900x700.png" alt="jina-embeddings-v5-text-small &amp; jina-embeddings-v5-text-nano 埋め込みサイズ" /><p>埋め込みが少なくとも256次元であれば、精度の損失は比較的小さいはずです。しかし、そのレベルを下回ると、関連性と正確性はすぐに低下します。</p><p>このような埋め込みの切り捨てにより、ユーザーは精度と計算コストのバランスを自分で管理できるようになり、検索AIから大きな効率の向上と大幅なコスト削減を実現するツールを提供します。</p><h3>堅牢な量子化</h3><p><em>量子化</em>は埋め込みのサイズを縮小するもう一つの方法です。量子化では、各埋め込みの一部を破棄するのではなく、埋め込み内の数値の精度を下げます。<code>jina-embeddings-v5-text</code> モデルは16ビット数値で埋め込みを生成しますが、これらの数値を四捨五入して精度と格納に必要なビット数を減らすことができます。最も極端な場合では、各数値を1ビット（0または1）に減らすことで、<code>jina-embeddings-v5-text</code>のデフォルトの1024次元の埋め込みを2キロバイトから128バイトに圧縮できます。これは、バイナリ量子化だけで94％の削減になります。切り捨ての場合と同様に、これによりメモリと計算コストが大幅に節約されますが、切り捨てと同様に、量子化によって埋め込みの精度は低下します。</p><p><code>jina-embeddings-v5-text</code>モデルは<a href="https://www.elastic.co/jp/elasticsearch">Elasticsearch</a>の<a href="https://www.elastic.co/docs/reference/elasticsearch/mapping-reference/bbq">Better Binary Quantization</a>に対応し、精度の損失を最小限に抑えるようにトレーニングされており、これらのモデルからの二値化埋め込みのベンチマークテストでは、非二値化モデルとほぼ同等の性能を示しています。二値化性能に関する詳細なアブレーション研究については<a href="https://arxiv.org/abs/2602.15547">テクニカルレポートを</a>ご参照ください。</p><h3>多言語パフォーマンス</h3><p>多くの埋め込みモデルは、多数の言語を含む素材でトレーニングされているため、多言語対応です。しかし、サポートされているすべての言語で、すべてが同じように優れたパフォーマンスを発揮するわけではありません。</p><p>MMTEBの多言語ベンチマークで211の言語を特定し、それらを分離して、言語ごとにモデルを類似のモデルと比較できるようにしました。下の画像は、私たちの結果をヒートマップとしてまとめたものです。各パッチは言語（ISO-639コードで識別）であり、緑色が濃くなるほど、類似モデルの平均と比較してモデルのパフォーマンスが優れていることを示します。</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltee08033102f46c4f/6a17dbbc420229503229f4c8/852ac5d0f1977bb0c1124d87f8863a9bb94eb7da-1600x765.png" alt="jina-embeddings-v5-text-nanoおよびjina-embeddings-v5-text-small言語（MMTEB多言語ベンチマーク）" /><p>正確さは言語によって異なりますが、<code>jina-embeddings-v5-text</code> モデルは最先端か、世界のほとんどの言語でほぼ最新です。</p><p>詳細な多言語パフォーマンスについては、<a href="https://arxiv.org/abs/2602.15547"><code>jina-embeddings-v5-text</code></a><a href="https://arxiv.org/abs/2602.15547">テクニカルレポート</a>を参照してください。</p><h2><strong>ElasticにおけるJina：最先端のネイティブAIによる検索</strong></h2><p><code>jina-embeddings-v5-text</code>モデルをEISで使用することで、<a href="https://www.elastic.co/jp/elasticsearch">Elasticsearch</a>でネイティブに高パフォーマンスの多言語埋め込みモデルを実行できます。これは、完全に管理されたGPUアクセラレーションによる推論で、インフラを提供したりスケールする必要はありません。<code>jina-embeddings-v5-text</code> モデルは、最新のAI開発によって強化されたコンパクトで多言語対応のモデルで、成長するEISモデルカタログを拡張します。これらのモデルは、情報検索と標準データ分析ベンチマークにおいて最先端のパフォーマンスを発揮し、他に類を見ない世界規模の多言語サポートを提供します。</p><p>サイズが大きく異なる2つのモデルが用意されているため、ユーザーは用途や予算に応じてどちらが最適かを判断できます。さらに、より小さなサイズに切り詰められたり、より低い精度に量子化されたりしてもパフォーマンスを維持する堅牢な埋め込みにより、<code>jina-embeddings-v5-text </code>モデルはストレージと計算コストおよび処理遅延においてさらなる具体的な節約の機会を提供します。</p><p><code>jina-embeddings-v5-text</code>ファミリー、Jina Reranker、Elasticの高速ベクトルおよびBM25検索により、ユーザーはElasticのエンドツーエンドの最先端の<a href="https://www.elastic.co/docs/solutions/search/hybrid-search">ハイブリッド検索</a>にアクセスできるようになりました。最も関連性の高い結果が必要な場合、Retrieval-Augmented Generation（RAG）パイプライン、検索アプリケーション、またはデータ分析において、ElasticとJinaの検索AIモデルは、堅固で費用対効果の高い品質を提供します。</p><h2><strong>はじめに</strong></h2><p><code>jina-embeddings-v5-text</code>モデルは<a href="https://www.elastic.co/docs/explore-analyze/elastic-inference/eis">EIS</a>に完全に統合されており、インデックス作成時に<strong><code>type</code></strong>フィールドを<strong><code>semantic_text</code></strong>に設定し、<code>inference_id</code>フィールドでモデル（<code>jina-embeddings-v5-text-small</code>または<code>jina-embeddings-v5-text-nano</code>）を指定することで使用できます（次の例を参照）</p>PUT multilingual-semantic-index
{
  "mappings": {
    "properties": {
      "content": {
        "type": "semantic_text",
        "inference_id": ".jina-embeddings-v5-text-small"
      }
    }
  }
}

# Ingest data about France
POST multilingual-semantic-index/_doc
{
  "content": "The capital of France is Paris"}

GET multilingual-semantic-index/_search
{
  "query": {
    "semantic": {
      "field": "content",
      "query": "What is the French capital?"
    }
  }
}<p><a href="https://www.elastic.co/jp/elasticsearch">Elasticsearch</a>はインデキシングおよび検索時に適切なLoRAアダプターを自動的に選択します。埋め込み次元（上記の「<strong>埋め込みの切り捨て</strong>」セクション参照）は、<a href="https://www.elastic.co/docs/api/doc/elasticsearch/operation/operation-inference-put">カスタム推論エンドポイントを作成</a>する際に設定できます。</p><p><strong><code>jina-embeddings-v5-text</code></strong>モデルの利用については <a href="https://www.elastic.co/docs/reference/elasticsearch/mapping-reference/dense-vector">Elasticsearchのドキュメント</a>を参照してください。</p><h2><strong>詳細情報</strong></h2><p><code>jina-embeddings-v5-text</code>モデルについて詳しくは、<a href="https://jina.ai/news/jina-embeddings-v5-text-distilling-4b-quality-into-sub-1b-multilingual-embeddings/">Jina AIブログのリリースノート</a>と<a href="https://arxiv.org/abs/2602.15547">テクニカルレポート</a>をお読みください。パフォーマンスとJina AIの革新的な新しいトレーニング手順に関するより詳細な技術情報が記載されています。これらのモデルのローカルダウンロードや運用については、Hugging Faceの<a href="https://huggingface.co/collections/jinaai/jina-embeddings-v5-text"><code>jina-embeddings-v5-text</code></a><a href="https://huggingface.co/collections/jinaai/jina-embeddings-v5-text">コレクションページ</a>をご覧ください。</p><p>Jina AIモデルは <a href="https://spdx.org/licenses/CC-BY-NC-4.0">CC-BY-NC-4.0ライセンス</a>の下で利用可能ですので、自由にダウンロードして試すことができますが、商用利用の場合は <a href="https://www.elastic.co/contact?pg=global&amp;plcmt=nav&amp;cta=205352">Elastic Sales</a>までお問い合わせください。</p>]]></content:encoded>
    <link>https://www.elastic.co/search-labs/blog/jina-embeddings-v5-text</link>
    <guid isPermaLink="true">https://www.elastic.co/search-labs/blog/jina-embeddings-v5-text</guid>
    <category><![CDATA[Jina AI]]></category>
    <dc:creator><![CDATA[Scott Martens,Sofia Vasileva]]></dc:creator>
    <enclosure url="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltfd81be89ffe5b036/6a17dbbd445de9b55e4cffd1/e98dd30ab925b4bb32830228d71a1a51d02a0917-1600x840.png" length="0" type="image/png"/>
    <pubDate>Mon, 23 Feb 2026 00:00:00 GMT</pubDate>
  </item>
  <item>
    <title><![CDATA[Jinaモデル、その機能とElasticsearchでの使用方法の紹介]]></title>
    <description><![CDATA[Jinaのマルチモーダル埋め込み、リランカーv3、セマンティック埋め込みモデル、さらにそれらをElasticsearchでネイティブに使用する方法を探ります。]]></description>
    <content:encoded><![CDATA[<p>Jina by Elasticは、アプリケーションとビジネスプロセスの自動化のための検索基盤モデルを提供します。これらのモデルは、Elasticsearchアプリケーションや革新的なAIプロジェクトにAIを導入するためのコア機能を提供します。</p><p>Jinaモデルは、情報処理、整理、検索をサポートするように設計された大きく3つのカテゴリーに分類されます。</p><ul><li><p>セマンティック埋め込みモデル</p></li><li><p>リランキングモデル</p></li><li><p>小規模な生成言語モデル</p></li></ul><h2>セマンティック埋め込みモデル</h2><p>セマンティック埋め込みの背後にある考え方は、AIモデルがインプットの意味的側面を高次元空間の幾何学の観点から表現することを学習できるというものです。</p><p>セマンティック埋め込みは、高次元空間内の点（技術的には<em>ベクトル</em>）と考えることができます。埋め込みモデルは、ニューラルネットワークの一種で、デジタルデータ（テキストや画像など、あらゆるものが入力となりえますが、最も一般的なのはテキストや画像）を入力として受け取り、対応する高次元点の位置を一連の数値座標として出力します。モデルが適切に機能している場合、2つのセマンティック埋め込み間の距離は、対応するデジタルオブジェクトがどの程度同じ意味を持つかに比例します。</p><p>これが検索アプリケーションにとっていかに重要であるかを理解するには、「dog」という単語の埋め込みと「cat」という単語の埋め込みを空間上の点として想像してみましょう。</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltbad74e5d8292a60e/6a17db73abe0f2114edfe8d2/802cf9bbcb82180d3fc91009f9f62027eee8f031-615x615.png" alt="" /><p>優れた埋め込みモデルは、「feline」という単語に対して「dog」よりも「cat」にずっと近い埋め込みを生成し、「canine」は「cat」よりも「dog」にずっと近い埋め込みを生成するはずです。なぜなら、これらの単語はほぼ同じ意味だからです。</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltdb2b25691801a881/6a17db747b54f946d28b37a5/bce49daf9a31b8fb7ce1c6ef7ae4e8117a4e8b33-615x615.png" alt="" /><p>モデルが多言語対応であれば、「cat」と「dog」の翻訳でも同じ結果が期待できます。</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt976ba40be7776449/6a17db75be6086c2bd0045f2/ce4d030385324526cbd7539140e0e634d939371c-615x615.png" alt="" /><p>埋め込みモデルは、物事間の意味の類似性や不一致を埋め込み間の空間的関係に翻訳します。上の図は2次元のみであるため、画面上で確認できますが、埋め込みモデルでは数十から数千の次元のベクトルが生成されます。これにより、数千語以上を含む文書に対して、何百または何千もの次元を持つ空間上の点を割り当てることで、全体のテキストの意味の微妙なニュアンスをエンコードすることが可能になります。</p><h2>マルチモーダル埋め込み</h2><p>マルチモーダルモデルは、セマンティック埋め込みの概念をテキスト以外のもの、特に画像にも拡張します。画像の埋め込みは、その画像の忠実な記述の埋め込みに近いものとなることが期待されます。</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt66dc8895485734ec/6a17db77b1e11318d279f155/1ac6aef5b1423e5fe4853e8a547a74e66b0885c2-615x615.png" alt="" /><p>セマンティック埋め込みには多くの用途があります。とりわけ、効率的な分類器の構築、データのクラスタリング、データの重複排除やデータの多様性の調査などのさまざまなタスクの実行に使用できます。いずれも、手作業では管理できないほど大量のデータを扱うビッグデータアプリケーションにとって重要です。</p><p>埋め込みの最大の直接的な利用は情報検索です。Elasticsearchでは、埋め込みを含む検索オブジェクトをキーとして格納できます。クエリは埋め込みベクトルに変換され、検索によって埋め込みに最も近いキーを持つ格納オブジェクトが返されます。</p><p>従来の<em>ベクトルベースの検索</em>（<em>低密度ベクトル検索</em>とも呼称）が、ドキュメントやクエリの単語やメタデータに基づくベクトルを使用するのに対し、<em>埋め込みベースの検索</em>（<em>高密度ベクトル検索</em>とも呼称）は、単語ではなくAIによって評価された意味を使用します。これにより、一般に従来の検索方法よりもはるかに柔軟かつ正確になります。</p><h2>マトリョーシカ表現学習</h2><p>埋め込みの次元数や数値の精度はパフォーマンスに大きな影響を与えます。空間が非常に高次元で数値が非常に高精度な場合、非常に詳細で複雑な情報を表すことができますが、トレーニングと実行に費用がかかる、より大規模なAIモデルが必要となります。生成されるベクトルはより多くのストレージ容量を必要とし、距離を計算するのにより多くの計算サイクルが必要です。セマンティック埋め込みモデルを使用するには、精度とリソース消費の間で重要なトレードオフを行う必要があります。</p><p>ユーザーの柔軟性を最大化するために、Jinaモデルは<a href="https://arxiv.org/abs/2205.13147">マトリョーシカ表現学習</a>と呼ばれる技術で訓練されています。これにより、モデルは最も重要な意味的区別を埋め込みベクトルの最初の次元に前もってロードするため、より高い次元を切り捨てても良好なパフォーマンスを得ることができます。</p><p>実際には、これはJinaモデルのユーザーが埋め込みの次元数を選択できることを意味します。次元を少なく選択すると精度は低下しますが、パフォーマンスの低下は軽微です。ほとんどのタスクで、Jinaモデルのパフォーマンス指標は、埋め込みサイズを50％縮小するたびに1〜2％低下し、サイズが約95％小さくなります。</p><h2>非対称検索</h2><p>意味的類似性は通常、対称的に測定されます。「cat」と「dog」を比較したときに得られる値は、「dog」と「cat」を比較したときに得られる値と同じです。しかし、情報検索に埋め込みを使用する場合、対称性を破り、検索オブジェクトをエンコードする方法とは異なる方法でクエリをエンコードすると、埋め込みがより効果的に機能します。</p><p>これは、埋め込みモデルをトレーニングする方法によるものです。トレーニングデータには、単語のような同じ要素が多くの異なるコンテキストでインスタンスとして含まれており、モデルは要素間のコンテキスト上の類似点と相違点を比較することで意味論を学習します。</p><p>例えば、「animal」という単語は、「cat」や「dog」と同じ文脈にはあまり出てこないので、「animal」の埋め込みは「cat」や「dog」に特に近いわけではない可能性があります。</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltf219074e18a6290a/6a17db78be6086cf060045f6/9a33163405af6c71ee7f4ba8ebc86af39e295a69-615x615.png" alt="" /><p>これにより、「animal」のクエリで猫や犬に関するドキュメントが検索される可能性が低くなります。これは目標とは逆の結果となります。そのため、代わりに、クエリの場合と検索のターゲットの場合で「animal」を異なる方法でエンコードします。</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt33438b4964001467/6a17db79b1e113101c79f159/363992d4f0affba7937c0c8a9f82c9a531fcd3ba-615x615.png" alt="" /><p><em>非対称検索</em>とは、クエリに異なるモデルを使用したり、埋め込みモデルを特別に訓練して、検索のために格納する際に一方向にエンコードし、クエリを別の方向にエンコードすることを意味します。</p><h2>マルチベクトル埋め込み</h2><p>単一の埋め込みは、インデックス付きデータベースの基本的なフレームワークに適合するため、情報検索に適しています。検索キーとして単一の埋め込みベクトルを使用して、検索用のオブジェクトを格納します。ユーザーがドキュメントストアをクエリする際、そのクエリは埋め込みベクトルに変換され、そのキーが（高次元の埋め込み空間において）クエリ埋め込みに最も近いドキュメントが一致候補として取得されます。</p><p>マルチベクトル埋め込みの動作は少し異なります。クエリと格納されたオブジェクト全体を示す固定長のベクトルを生成する代わりに、それらの小さな部分を表す埋め込みのシーケンスを生成します。これらの部分は通常、テキストの場合はトークンまたは単語、視覚データの場合は画像タイルです。これらの埋め込みは、その文脈における部分の意味を反映しています。</p><p>例えば、次の文を考えてみましょう。</p><ul><li><p>She had a heart of gold（彼女は心優しい人でした）.</p></li><li><p>She had a change of heart（彼女は心変わりしたのです）.</p></li><li><p>彼女は心臓発作を起こしました。</p></li></ul><p>表面的には非常によく似ているように見えますが、マルチベクトルモデルでは「heart」の各インスタンスに対して非常に異なる埋め込みが生成され、文全体の文脈の中でそれぞれが別の意味を持つことが示されます。</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt5c81f089771e6029/6a17db7b7f6f157601c099ec/a33e60c8d8ee3d312bca8375ca2a8b0a0cd40ba9-615x615.png" alt="" /><p>2つのオブジェクトのマルチベクトル埋め込みを比較する場合、多くの場合、面取り距離の測定が必要になります。つまり、1 つのマルチベクトル埋め込みの各部分を別のマルチベクトル埋め込みの各部分と比較し、それらの間の最小距離を合計します。以下に説明するJinaリランカーを含む他のシステムでは、類似性を評価するために特別にトレーニングされたAIモデルにそれらを入力します。マルチベクトル埋め込みには単一ベクトル埋め込みよりもはるかに詳細な情報が含まれているため、通常、両方のアプローチは単一ベクトル埋め込みを単純に比較するよりも精度が高くなります。</p><p>しかし、マルチベクトル埋め込みはインデキシングにはあまり適していません。次のセクションの<code>jina-colbert-v2</code>モデルで説明するように、これらはタスクのリランキングによく使用されます。</p><h2>Jina埋め込みモデル</h2><h3>Jina埋め込みv4</h3><p><a href="https://jina.ai/news/jina-embeddings-v4-universal-embeddings-for-multimodal-multilingual-retrieval/"><strong>jina-embeddings-v4</strong></a>は、広く使用されているさまざまな言語の画像とテキストをサポートする、38億（3.8x10⁹）パラメーターの多言語およびマルチモーダル埋め込みモデルです。視覚的知識と言語的知識を活用する新しいアーキテクチャを使用して両方のタスクのパフォーマンスを向上させ、画像検索、特に<a href="https://huggingface.co/tasks/visual-document-retrieval">視覚的ドキュメント検索</a>で優れた性能を発揮します。これは、チャート、スライド、マップ、スクリーンショット、ページスキャン、ダイアグラムなどの画像を処理することを意味します。これらは一般的な種類の画像で、しばしば重要な埋め込まれたテキストが含まれており、実世界のシーンの画像で訓練されたコンピュータービジョンモデルの範囲外にあります。</p><p>コンパクトな<a href="https://huggingface.co/docs/peft/en/package_reference/lora">Low-Rank Adaptation（LoRA）アダプター</a>を使って、このモデルを複数の異なるタスクに最適化しました。これにより、メモリや処理の追加コストを最小限に抑えながら、いずれのタスクでもパフォーマンスを犠牲にすることなく、単一のモデルを複数のタスクに特化させることができます。</p><p>主な機能には以下のようなものがあります。</p><ul><li><p>ビジュアルドキュメント検索における最先端のパフォーマンス、および大規模モデルをはるかに凌駕する多言語テキストと通常の画像のパフォーマンス。</p></li><li><p>大きなインプットコンテキストサイズのサポート：32,768トークンは約80ページのダブルスペースの英語テキストに相当し、20メガピクセルは4,500 x 4,500ピクセルの画像に相当します。</p></li><li><p>最大2048次元から128次元まで、ユーザーが選択した埋め込みサイズ。経験的に、そのしきい線を下回るとパフォーマンスが劇的に低下することがわかりました。</p></li><li><p>単一埋め込みとマルチベクトル埋め込みの両方をサポートします。テキストの場合、マルチベクトル出力は、インプットトークンごとに1つの128次元埋め込みで構成されます。画像の場合、28x28ピクセルタイルごとに1つの128次元埋め込みを生成します。</p></li><li><p>目的のために特別に訓練された2つのLoRAアダプターによる非対称検索最適化。</p></li><li><p>意味的類似度計算に最適化されたLoRAアダプター。</p></li><li><p>プログラミング言語とITフレームワークへの特別なサポート。LoRAアダプターを介してのサポートも提供します。</p></li></ul><p>私たちは、幅広い一般的な検索、自然言語理解、AI分析タスクのための汎用的な多目的ツールとして<code>jina-embeddings-v4</code>を開発しました。機能を考えると比較的小規模なモデルですが、導入には依然としてかなりのリソースが必要であり、クラウドAPI経由または高ボリューム環境での使用に最適です。</p><h3>Jina embeddings v3</h3><p><a href="https://jina.ai/news/jina-embeddings-v3-a-frontier-multilingual-embedding-model/"><strong>jina-embeddings-v3</strong></a>は、6億未満のパラメーターを持つ、コンパクトで高性能な多言語のテキストのみの埋め込みモデルです。最大8192トークンのテキストインプットをサポートし、デフォルトの1024次元から64次元まで、ユーザーが選択したサイズの単一ベクトル埋め込みを出力します。</p><p>私たちは、情報検索や意味的類似性だけでなく、感情分析やコンテンツモデレーションなどの分類タスク、ニュースの集約や推奨などのクラスタリングタスクなど、さまざまなテキストタスク向けに<code>jina-embeddings-v3</code>をトレーニングしてきました。<code>jina-embeddings-v4</code>と同様に、このモデルは次の使用カテゴリーに特化したLoRAアダプターを提供します。</p><ul><li><p>非対称検索</p></li><li><p>意味的類似性</p></li><li><p>分類</p></li><li><p>クラスタリング</p></li></ul><p><code>jina-embeddings-v3</code> は <code>jina-embeddings-v4</code>よりもはるかに小さいモデルであり、インプットコンテキストのサイズが大幅に削減されていますが、操作にかかるコストは少なくなります。それにもかかわらず、テキストに関しては非常に競争力のあるパフォーマンスを有し、多くのユースケースにとってより良い選択肢です。</p><h3>Jinaコード埋め込み</h3><p>Jinaの専門的なコード埋め込みモデルである<a href="https://jina.ai/models/jina-code-embeddings-1.5b"><strong>jina-code-embeddings（0.5bおよび1.5b）</strong></a>は、15プログラミング方式とフレームワーク、さらにコンピューティングや情報技術に関連する英語のテキストをサポートしています。これらは、それぞれ5億 （0.5x10⁹）と15億（1.5x10⁹）のパラメーターを持つコンパクトなモデルです。どちらのモデルも、最大32,768トークンのインプットコンテキストサイズをサポートしており、ユーザーは出力の埋め込みサイズを選択（小さいモデルでは896から64次元、大きいモデルでは1536から128次元）できます。</p><p>これらのモデルは、LoRAアダプターではなく<a href="https://arxiv.org/abs/2101.00190">プレフィックスチューニング</a>を使用して、5つのタスク固有の特殊化のための非対称検索をサポートしています。</p><ul><li><p><strong>コードからコードへ。</strong>さまざまなプログラミング言語で同様のコードを取得できます。コードの調整、コードの重複排除、移植とリファクタリングのサポートに使用されます。</p></li><li><p><strong>自然言語からコードへ。</strong>自然言語クエリ、コメント、説明、ドキュメントに合わせたコードを取得します。</p></li><li><p><strong>コードから自然言語へ。</strong>コードをドキュメントまたはその他の自然言語テキストと一致させます。</p></li><li><p><strong>コード間の補完。</strong>既存のコードを完成させたり強化したりするために、関連するコードを提案します。</p></li><li><p><strong>技術的な内容のQ＆A。</strong>情報技術に関する質問に対する自然言語による回答を特定します。テクニカルサポートのユースケースに最適です。</p></li></ul><p>これらのモデルは、比較的小さい計算コストで、コンピューターのドキュメント作成やプログラミング資料に関連するタスクに優れたパフォーマンスを提供します。開発環境やコードアシスタントに統合するのに適しています。</p><h3>Jina ColBERT v2</h3><p><a href="https://jina.ai/models/jina-colbert-v2"><strong>jina-colbert-v2</strong></a>は、5億6000万のパラメーターを持つマルチベクトルテキスト埋め込みモデルです。多言語対応で、89言語の素材を使用してトレーニングされており、可変の埋め込みサイズと非対称検索をサポートしています。</p><p>前述のように、マルチベクトル埋め込みはインデックス作成にはあまり適していませんが、他の検索戦略の結果の精度を高めるのに非常に役立ちます。<code>jina-colbert-v2</code>を使用すると<strong>、</strong>マルチベクトル埋め込みを事前に計算し、それを使用してクエリ時に検索候補をリランキングすることができます。このアプローチは、次のセクションのリランキングモデルの1つを使用するほど正確ではありませんが、クエリや候補の一致ごとにAIモデル全体を呼び出すのではなく、格納されているマルチベクター埋め込みを比較するだけなので、はるかに効率的です。これは、リランキングモデルを使用する際の遅延や計算オーバーヘッドが大きすぎる、または比較する候補の数が多すぎるユースケースに最適です。</p><p>このモデルは、インプットトークンごとに埋め込みのシーケンスを出力し、ユーザーは128次元、96次元、または64次元の埋め込みのトークンを選択できます。候補テキストの一致は8,192トークンに制限されます。クエリは非対称にエンコードされるため、ユーザーはテキストがクエリか候補一致かを指定する必要があり、クエリは32トークンに制限する必要があります。</p><h3>Jina CLIP v2</h3><p><a href="https://jina.ai/news/jina-clip-v2-multilingual-multimodal-embeddings-for-text-and-images/"><strong>jina-clip-v2</strong></a>は、9億パラメーターのマルチモーダル埋め込みモデルであり、テキストが画像のコンテンツを説明する場合に、テキストと画像が近い埋め込みを生成するようにトレーニングされています。その主な用途は、テクスチャクエリに基づいて画像を取得することですが、テキストからテキストへの検索とテキストから画像への検索に別々のモデルを必要としないため、高性能のテキストのみのモデルでもあり、ユーザーのコスト削減に役立ちます。</p><p>このモデルは8,192トークンのテキストインプットコンテキストをサポートし、画像は埋め込みを生成する前に512x512ピクセルに拡大されます。</p><p>対照言語画像事前トレーニング（CLIP）アーキテクチャは、トレーニングと操作が簡単で、非常にコンパクトなモデルを作成できますが、基本的な制限がいくつかあります。あるメディアの知識を別のメディアでのパフォーマンスの向上に活用することはできません。あるメディアを利用して別のメディアのパフォーマンスを向上させることはできません。そのため、「dog」と「cat」という単語の意味はどちらも「car」よりも近いことはわかっていても、犬の写真と猫の写真はどちらも車の写真よりも関連性が高いことは必ずしもわかっていません。</p><p>また、これらは<em>モダリティギャップ</em>と呼ばれる問題も抱えています。これはつまり、犬に関するテキストの埋め込みは、犬の画像の埋め込みよりも、猫に関するテキストの埋め込みに近い可能性が高いということです。この制限のため、CLIPはテキストから画像への検索モデルとして、またはテキストのみのモデルとして使用し、1つのクエリ内でこれら2つを混在させないことをお勧めします。</p><h2>リランキングモデル</h2><p>リランキングモデルは、1つまたは複数の候補一致と、クエリをモデルへのインプットとして取り、それらを直接比較して、はるかに高い精度の一致を生成します。</p><p>原理的には、各クエリを保存されている各ドキュメントと比較することで、情報検索にリランキングを直接使用できますが、これは計算コストが非常に高く、最小のコレクション以外では実用的ではありません。そのため、リランカーは、埋め込みベースの検索やその他の検索アルゴリズムなど、他の手段によって見つかった候補一致の比較的短いリストを評価するために使用される傾向があります。リランキングモデルは、検索を実行するとクエリが異なるデータセットを持つ個別の検索システムに送信され、それぞれが異なる結果を返す可能性があるハイブリッド検索スキームやフェデレーション検索スキームに最適です。多様な結果を1つの高品質な結果に統合する場合に非常に効果的です。</p><p>埋め込みベースの検索は、保存されているすべてのデータの再インデックスや、結果に対するユーザーの期待の変更など、大きな負担を伴う可能性があります。既存の検索スキームにリランカーを追加することで、検索ソリューション全体を再構築することなく、AIの利点の多くを追加することができます。</p><h2>Jinaリランカーモデル</h2><h3>Jinaリランカーm0</h3><p><a href="https://jina.ai/models/jina-reranker-m0/"><strong>jina-reranker-m0</strong></a>は、24億（2.4x10⁹）パラメーターのマルチモーダルリランカーで、テキストクエリとテキストや画像からなる候補一致をサポートします。これはビジュアルドキュメント検索の主要モデルであり、PDF、テキストのスキャン、スクリーンショット、テキストなど半構造化情報を含むコンピュータ生成または修正された画像、加えてテキストドキュメントと画像からなる混合データの格納に理想的なソリューションです。</p><p>このモデルは、単一のクエリと候補一致を受け取り、スコアを返します。同じクエリを異なる候補で使用すると、スコアは比較可能となり、それらのランク付けに使用できます。クエリテキストや候補テキストや画像を含む最大10,240トークンのインプットサイズをサポートします。画像をカバーするために必要な28x28ピクセルのタイルはすべて、入力サイズを計算するためのトークンとしてカウントされます。</p><h3>Jinaリランカーv3</h3><p><a href="https://jina.ai/models/jina-reranker-v3/"><strong>jina-reranker-v3</strong></a>は、同等のサイズのモデルに対して最先端のパフォーマンスを備えた6億パラメーターのテキストリランカーです。<code>jina-reranker-m0</code>とは異なり、1つのクエリと最大64件の一致候補のリストを受け取り、ランキング順を返します。クエリとすべてのテキスト候補を含む131,000トークンの入力コンテキストがあります。</p><h3>Jinaリランカーv2</h3><p><a href="https://jina.ai/models/jina-reranker-v2"><strong>jina-reranker-v2-base-multilingual</strong></a>は非常にコンパクトで汎用的なリランカーで、関数呼び出しやSQLクエリをサポートする追加の機能を備えています。3億弱のパラメーターで、高速、効率的、正確な多言語テキストリランキングを提供し、テキストクエリにマッチするSQLテーブルと外部関数を選択するための追加サポートもあり、エージェント的なユースケースに適しています。</p><h2>小規模な生成言語モデル</h2><p>生成言語モデルは、OpenAIのChatGPT、Google Gemini、AnthropicのClaudeのように、テキストまたはマルチメディアのインプットを受け取り、テキスト出力で応答するモデルです。<em>大規模</em>言語モデル（LLM）と<em>小規模</em>言語モデル（SLM）を明確に区別する境界はありませんが、最先端のLLMを開発、運用、使用する際の実用的な問題はよく知られています。最もよく知られているものは一般公開されていないため、そのサイズを推定することしかできませんが、ChatGPT、Gemini、Claudeは1～3兆（1～3x10¹²）のパラメーター範囲にあると予想されます。</p><p>これらのモデルを実行することは、たとえ公開されたものであっても、従来のハードウェアの範囲をはるかに超えており、広大な並列アレイに配置された最先端のチップを必要とします。有料のAPIを使ってLLMにアクセスすることもできますが、これには大きなコストがかかり、レイテンシーも大きく、データ保護、デジタル主権、クラウドの本国送還などの要求と整合させるのは困難です。さらに、その規模のモデルのトレーニングとカスタマイズに関連するコストはかなりの額になる可能性があります。</p><p>その結果、最大規模のLLMのすべての機能は備えていないものの、特定の種類のタスクを低コストで同様に実行できる小規模モデルの開発に多大な研究が行われてきました。一般的に、企業は特定の問題に対処するためにソフトウェアをデプロイしますが、AIソフトウェアも同様で、LLMよりもSLMベースのソリューションの方が望ましい場合が多いのです。これらは通常、一般的なハードウェア上で実行でき、実行速度が速く、消費電力が少なく、カスタマイズがはるかに簡単です。</p><p>JinaのSLMサービスは、AIを実用的な検索ソリューションに最も効果的に組み込む方法に重点を置いて拡大しています。</p><h2>Jina SLM</h2><h3>ReaderLM v2</h3><p><a href="https://jina.ai/models/ReaderLM-v2"><strong>ReaderLM-v2</strong></a>は、ユーザーが提供したJSONスキーマや自然言語命令に基づいて、HTMLをMarkdownまたはJSONに変換する生成言語モデルです。</p><p>データの前処理と正規化はデジタルデータの優れた検索ソリューションを開発する上で不可欠な部分ですが、現実世界のデータ、特にウェブから得られる情報は混沌としていることが多く、単純な変換戦略では非常に脆弱になることがよくあります。代わりに、<code>ReaderLM-v2</code> はウェブページのDOMツリーダンプの混沌を理解し、有用な要素を堅牢に識別できるインテリジェントなAIモデルソリューションを提供します。</p><p>15億（1.5x10⁹）パラメーターを持つこのシステムは最先端のLLMよりも3桁コンパクトですが、この1つの狭義のタスクにおいては最先端のLLMと同等のパフォーマンスを発揮します。</p><h3>Jina VLM</h3><p><a href="https://jina.ai/models/jina-vlm"><strong>JINA-VLM</strong></a>は、画像に関する自然言語の質問に答えるために訓練された24億（2.4×10⁹）パラメーターの生成言語モデルです。視覚的ドキュメント分析、つまりスキャン、スクリーンショット、スライド、図表、類似の非自然画像データに関する質問に回答する機能を非常に強力にサポートしています。</p><p>例：</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt124b9932e01dcd40/6a17db7d4202291eca29f4bc/adfa1420d079ca4fd5582eef4349b1265b378e76-950x500.png" alt="" /><p>画像内のテキストの読み取りにも非常に優れています。</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt1a862a9c9a0e42ce/6a17db7fb1e1133a2979f15d/ea3956e7ad86f8e171841cab2c28c8b3498da1d4-1002x500.png" alt="" /><p>しかし、<code>jina-vlm</code>の真に優れた点は、情報収集や人工画像の内容を理解することです。</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt761cf621ea32e4ae/6a17db8163baff7730741b26/f68606f9d2d99e2cd616d4ff81db3574dc4e26a5-1020x700.png" alt="" /><p>または：</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt4df4d31e574df7e3/6a17db82e3179134e02d56e9/297e85e7e78f296388a02301e1e08fed70827423-1000x500.png" alt="" /><p><code>jina-vlm</code> 自動キャプション生成、製品の説明、画像の代替テキスト、視覚障害者向けのアクセシビリティ用途に最適です。また、検索拡張生成（RAG）システムが視覚情報を使用したり、AIエージェントが人間の助けを借りずに画像を処理したりする可能性も生まれます。</p>]]></content:encoded>
    <link>https://www.elastic.co/search-labs/blog/jina-models-elasticsearch-guide</link>
    <guid isPermaLink="true">https://www.elastic.co/search-labs/blog/jina-models-elasticsearch-guide</guid>
    <category><![CDATA[統合]]></category>
    <category><![CDATA[Jina AI]]></category>
    <dc:creator><![CDATA[Scott Martens]]></dc:creator>
    <enclosure url="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blta03919124faf767a/6a17db84ec0f89b8fe5a64d8/407b4c862b51ebdfc7f26db4e25950a65caf1673-656x442.png" length="0" type="image/png"/>
    <pubDate>Thu, 01 Jan 2026 00:00:00 GMT</pubDate>
  </item>
  </channel>
</rss>