<?xml version="1.0" encoding="UTF-8"?>
<rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0">
  <channel>
    <title><![CDATA[Scott Martens - Elasticsearch Labs]]></title>
    <description><![CDATA[Articles and tutorials from the Search team at Elastic]]></description>
    <copyright><![CDATA[© 2026. Elasticsearch B.V. All Rights Reserved]]></copyright>
    <image>
      <title><![CDATA[Scott Martens - Elasticsearch Labs]]></title>
      <url>https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt1121c0bf0e8a6e65/6a88da6340a1841030ef456f/search-labs-thumbnail.png</url>
      <link>https://www.elastic.co/cn/search-labs/author/scott-martens</link>
    </image>
    <link>https://www.elastic.co/cn/search-labs/author/scott-martens</link>
    <atom:link href="https://www.elastic.co/cn/search-labs/rss/author/scott-martens.xml" rel="self" type="application/rss+xml"/>
    <language><![CDATA[cn]]></language>
    <lastBuildDate>Tue, 22 Sep 2026 13:47:29 GMT</lastBuildDate>
  <item>
    <title><![CDATA[不到 5 分钟即可完成本地部署：Jina 嵌入模型现已支持本地部署]]></title>
    <description><![CDATA[所有 28 个 Jina AI 模型（包括重排序器）均作为可随时部署的 Docker 容器提供，零遥测且无许可证服务器。即插即用兼容 OpenAI、Cohere、Voyage AI 和 Elastic 推理服务 API。]]></description>
    <content:encoded><![CDATA[<p>所有 28 个 Jina AI 嵌入和重排序模型现已作为完全离线的 Docker 容器提供，用于本地部署，其中包括 <a href="https://www.elastic.co/cn/search-labs/blog/jina-embeddings-v5-omni-all-media-one-index">jina-embeddings-v5-omni</a><a href="https://www.elastic.co/cn/search-labs/blog/jina-embeddings-v5-omni-all-media-one-index"></a> 和 <a href="https://www.elastic.co/cn/search-labs/tutorials/jina-tutorial/jina-reranker-v3">jina-reranker-v3</a>。下载一个，将其传输到本地隔离的或受防火墙保护的系统中，本地推理即可在五分钟内运行起来。这些容器是完全独立的，不会建立任何外部连接。不会对 Hugging Face 或任何模型注册表进行调用。同时也没有许可证服务器、遥测或日志记录终端。对于受监管行业、有数据主权要求或互联网访问不可靠或根本无法使用的环境，这消除了对第三方 AI 服务的依赖。Jina 本地部署支持 Elastic 推理服务 (EIS)、OpenAI、Cohere、Voyage AI 和 Gemini API 模式，因此现有应用程序无需修改代码即可运行。</p><p>最强大的 AI 模型在远程云安装上运行，通过 Web API 进行访问，这意味着您必须信任您的 AI 服务提供商的安全、服务可用性和稳定的价格。您很难兼顾对可靠性、隐私、可控成本和良好数据治理的合理需求，与日益强大、复杂且资源密集型的 AI 使用。</p><p>政府监管、法院裁决以及出于他人利益考虑而做出的商业决策，最近都导致对特定服务的访问受限。而且，即使您可以切换到其他服务，AI 模型也不是那种只要您想换就能随时替换的组件。使用语义嵌入的应用程序依赖于在查询时和数据摄取时能够访问相同的模型。无法访问嵌入模型意味着您的搜索系统将陷入瘫痪。</p><p>AI 定价模式加剧了这种风险。主要 AI 供应商最近披露的财务信息，让客户有充分理由对潜在的价格上涨感到担忧。依赖成本不可预测的产品，会给可能无法产生明确回报的资本密集型 AI 投资增加更多风险。</p><p>Jina 本地部署是 Elastic 应对这些挑战的解决方案。</p><h2>谁需要本地部署 AI？</h2><p>对您的 AI 模型进行本地托管和直接控制，支持各种技术需求、行业要求和商业利益。</p><p>本地安装可以减少您支付给 AI 服务提供商的费用，但会将硬件和可靠访问的成本转嫁给您的组织。根据您的使用量，它可能确实更便宜。但还有其他紧迫的原因促使您考虑自行运行 AI。如果下面描述的任何问题涉及您的企业，请考虑采用像 Jina 本地部署这样的本地 AI 解决方案。此列表并非详尽无遗。</p><p>用例</p><p>为什么选择本地部署</p><p>示例</p><p>隔离/高安全</p><p>无出站数据传输；完全网络隔离</p><p>国防、情报、机密研究</p><p>监管合规性</p><p>数据主权；无跨境传输或第三方暴露</p><p>医疗保健（《健康保险流通与责任法案》[HIPAA]）、金融、欧盟企业（《通用数据保护条例》[GDPR]）</p><p>延迟关键型</p><p>零网络依赖；对连接故障零容忍</p><p>机器人技术、边缘计算、车辆、船舶</p><p>成本可预测性</p><p>固定基础架构成本与按代币定价且未来费率不确定</p><p>高容量连续推理工作负载</p><p>责任降低</p><p>无第三方数据泄露；维护法律特权与注意义务</p><p>律师事务所、政府机构</p><h3>为什么隔离的和受防火墙保护的系统需要本地部署 AI</h3><p>隔离的和受防火墙保护的系统无法使用外部 AI API。Jina 本地部署完全在您的基础架构内运行，无出站连接。</p><p>对于管理特别敏感数据的组织而言，安全和隐私考量至关重要。如果您将敏感数据随意提供给可能缺乏足够安全措施或可能受制于外国政府要求的远程第三方，那么在保护敏感数据方面的投入就毫无意义。</p><p>处理敏感数据的组织中的员工通常会接受一些安全数据处理方面的培训，但是当他们在处理数据时，他们的 Web 浏览器可能会打开互联网上的任何页面，因此这种培训效果并不理想。无论是通过隔离网络还是限制极为严格的防火墙，隔离都是最有效的安全措施，但这使得使用任何类型的外部服务都变得困难。</p><h3>适用于对延迟敏感和高可用性系统的本地部署 AI</h3><p>软件即服务和云计算代表了一种折衷方案，既能保证在自己的计算机上提供高度便捷、可靠的服务，又能降低将问题外包给其他人的成本。但它们也存在延迟不稳定、服务中断以及出现故障时完全失控等问题。AI 服务也不例外。如果无法访问嵌入模型时搜索系统离线，那么这可能不再是一个好的折衷方案。</p><p>此外，依赖外部 AI 始终会带来一些难以预见或管理的风险。由于政治事件、恶劣天气或船舶拖锚压住水下光纤电缆等原因，互联网访问和网络延迟可能会在毫无预警的情况下下降。政府可以且近期已经通过出口禁令突然封锁对 AI 模型的访问。AI 服务提供商有时会撤回模型，以促使您切换到较新的模型。必须在外部服务的灵活性和可控成本与依赖风险之间进行权衡。</p><h3>满足 GDPR、HIPAA 和数据主权合规要求的本地部署 AI</h3><p>收集个人数据的组织受到越来越严格的监管，这些监管在不同司法管辖区之间往往有所不同，并且可能存在相互矛盾的要求。值得注意的是，<a href="https://www.hhs.gov/hipaa/for-professionals/privacy/laws-regulations/index.html">HIPAA 规则</a>对美国医疗保健提供商施加了非常严格的数据保护要求，而<a href="https://laws-lois.justice.gc.ca/eng/acts/p-8.6/">加拿大</a>、<a href="https://gdpr-info.eu/">欧盟</a>以及<a href="https://www.japaneselawtranslation.go.jp/en/laws/view/4241">许多亚洲司法管辖区</a>强大的通用数据保护法律则要求所有处理个人信息的企业都必须安全地进行操作，并限制将此类数据传输给其他方或其他司法管辖区。如果外国实体在这些司法管辖区内有任何客户，这些规则甚至可以对其施加义务。金融机构通常会受到更为严格的规则约束，并且对于信息安全承担着与防范其他形式犯罪活动相同的直接责任。</p><p>监管合规性可能与第三方 AI 服务不兼容，尤其是在使用这些服务涉及跨境数据传输的情况下。</p><p>此外，近期发生的事件表明，当国际云运营商面临外国政府压力时，限制数据存储物理位置的规定可能并非可靠的保护手段。不同司法管辖区之间的本地法律可能会发生冲突，这不仅要求在本地进行数据存储和处理，还可能导致无法使用第三方服务。在某些情况下，唯一的解决方案是将您流程的所有部分（包括您的 AI 系统）都转为内部自主运营。</p><h3>来自第三方数据传输的 AI 责任风险</h3><p>数据保护法和公认的对敏感数据的注意义务通常会产生法律责任，有时甚至会产生非常严重的责任。您可能需要对第三方服务提供商处理您数据的行为承担责任。虽然法院和法律程序可能对不安全的服务提供商提供一些追溯保护，但这些补救措施对国家安全机构、执法部门或犯罪黑客来说既不可用，也通常无效。</p><p>对于政府而言，已经出现过跨境云服务提供商向外国行为体泄露敏感国家信息的情况。</p><p>但即使你不担心外国政府或黑客，而且你的外部 AI 服务提供商本身也是安全的，仅仅是他们是外部人员这一事实就可能造成责任风险。</p><p>例如，在大多数司法管辖区，律师与客户之间的沟通享有特殊的法律保护，律师事务所在记录或存储此类信息时承担着严格的责任。在美国，这种“律师与客户交流保密特权”非常著名，甚至成为了电影和电视剧情节的核心。但失去特权的一种途径是与没有特权的人交流信息，而最近的发展表明，外部 AI 服务提供商可能符合失去特权的条件。</p><p>至少在美国，仅仅通过互联网 API 使用第三方 AI 服务（例如嵌入提供索引服务的模型）就可能违反关键的保密规则。即使没有发生安全漏洞，律师事务所也可能仅仅因为使用外部托管软件而被起诉、受到处分或被吊销执照。</p><h3>适用于离线、边缘和物理隔离系统的本地部署 AI</h3><p>计算机系统隔离不仅仅是出于安全原因。例如，行驶中的车辆不能在任何关键功能上依赖互联网连接。船舶和飞机都拥有非常庞大的机载计算机系统，这些系统必须在没有互联网连接的情况下运行，因此无法使用外部 AI 服务。海上平台、荒野地区的远程设施，以及北极、南极和小岛上缺乏与全球网络充分物理连接的计算机服务，都是受益于在本地托管其所需全部服务的安装实例。随着 AI 在企业计算中的作用日益增强，解决这些局限性变得更加重要。</p><p>AI 在物理系统中的新兴应用（机器人技术和其他空间受限或以外部世界为中心的用例，如物流管理系统甚至超市收银台）可能会连接到全球互联网，但它们无法容忍连接故障或延迟峰值。如果它们依赖 AI 系统来运行，该 AI 系统就需要尽可能做到本地化和可靠。</p><h2>谁不需要本地部署 AI？</h2><p>远程软件服务和场外 AI 确实具有优势。运行 AI 模型可能需要昂贵且支持大量电力、以寿命极短而闻名的处理器。由于市场因素和外部经济冲击，目前获取高质量硬件尤为困难。在这种情况下，使用外部 API 支付代币费用，而不是承担本地 AI 高昂的资本成本，可能是明智之举。</p><p>对于偶尔使用的用户来说，外部 API 是最合理的选择。如果您使用 AI 模型主要是为了批量处理数据以进行分析，而不是运行一个必须时刻在线的搜索系统，那么投资资本密集型硬件和本地安装就没有什么意义。</p><p>此外，如果您的数据处理已经基于云，例如，出于可靠性和可访问性的原因，电子商务网站托管在云端，那么使用位于同一云基础架构中的 AI 服务可能比引入您自己的授权 AI 模型部署更具性价比。您已经依赖于云服务提供商，因此依赖其 AI 服务并不会增加太多的风险。</p><p>如果您的用例符合此描述，您可以在 <a href="https://www.elastic.co/docs/explore-analyze/elastic-inference/eis">EIS</a>、<a href="https://aws.amazon.com/marketplace/seller-profile?id=seller-stch2ludm6vgy">AWS Marketplace</a> 和 <a href="https://console.cloud.google.com/marketplace/browse?q=jina">Google Cloud Platform</a> 上获取 Jina AI 模型，以专门满足您的需求。</p><p>下表总结了关键因素。您的答案取决于您的数据、基础架构以及使用模式。</p><p>因素</p><p>首选本地部署</p><p>首选云 API</p><p>使用模式</p><p>连续或高容量推理</p><p>间歇性处理或批量处理</p><p>数据敏感性</p><p>受监管、主权或机密</p><p>无跨境或第三方限制</p><p>网络环境</p><p>隔离、受防火墙保护或不可靠</p><p>稳定、始终在线的互联网</p><p>现有基础架构</p><p>拥有或能够采购 GPU 硬件</p><p>已在云端托管，并配备同地部署的 AI</p><p>成本模型</p><p>固定硬件 + 许可；规模化生产可预测</p><p>按代币定价；前期投入较低，长期收益可变</p><p>延迟容忍度</p><p>无（机器人技术、边缘、实时）</p><p>网络波动是可接受的</p><p>运营责任</p><p>您的团队负责管理硬件和可用性</p><p>提供商负责管理硬件和更新；您负责管理集成</p><p>您必须根据自身具体情况和用例来考虑成本和收益，同时考虑到前一节中强调的适用于您的问题。成本效益分析无疑会随时间而变化。我们甚至无法预测 AI 行业的未来或硬件价格的短期走势。</p><h2>推出 Jina 本地部署</h2><p>对于能够从本地 AI 服务中受益的用户，我们推出了 <a href="https://github.com/jina-ai/jina-on-prem/wiki/">Jina 本地部署</a>，这是一个完全独立的安装套件，用于 Jina AI 的高性能模型。</p><p>Jina AI 的模型准确度可与<a href="https://mteb-leaderboard.hf.space/benchmark/MTEB(Multilingual%2C%20v2)">规模大得多的</a>嵌入式模型相媲美，从而降低了计算成本、内存占用和硬件要求。这使得它们成为希望或需要保持 AI 本地部署的用户的理想选择。针对各种规模的用例提供商业许可以及按比例定价的可扩展解决方案。</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt190865fb3ebde472/6a6a33d0065b162508701ff9/02559ceca556a26c53eb703ae87d421452b27251-1374x1400.png" alt="MMTEB Multilingual v2 leaderboard showing Jina AI embedding model rankings: jina-embeddings-v5-omni-small and jina-embeddings-v5-text-small ranked 13th, jina-embeddings-v5-omni-nano and jina-embeddings-v5-text-nano ranked 19th, competing against models from Microsoft, Google, Tencent, NVIDIA and Qwen" /><h3>Jina 本地部署支持哪些 API 模式？</h3><ul><li><p>可以作为完整的依赖集合进行本地安装，也可以作为 <a href="https://www.docker.com/">Docker 容器</a>进行安装和运行，几分钟即可完成。</p></li><li><p>Jina 本地部署安装<em>不会</em>调用外部系统。</p><ul><li><p>不会调用 Hugging Face Hub 或任何模型注册表（已内置 HF_HUB_OFFLINE=1 和 TRANSFORMERS_OFFLINE=1）。</p></li><li><p>没有许可证服务器。</p></li><li><p>没有遥测或日志记录终端。</p></li></ul></li><li><p>支持 CPU 和 GPU 硬件，并支持 GPU 自动检测。</p></li><li><p>所有 28 个 Jina AI 模型均已提供，包括最新的 <a href="https://www.elastic.co/cn/search-labs/blog/jina-embeddings-v5-omni-all-media-one-index">jina-embeddings-v5-omni</a> 多模态嵌入模型和 <a href="https://www.elastic.co/cn/search-labs/tutorials/jina-tutorial/jina-reranker-v3">jina-reranker-v3</a>。</p></li><li><p>通过标准 AI API 模式访问：<a href="https://jina.ai/api-dashboard">Jina API</a>、OpenAI、Cohere、Voyage AI 和 Gemini。Jina 本地部署是一个即插即用的解决方案，适用于基于这些模式构建的应用程序。</p></li><li><p>可直接替代 <a href="https://www.elastic.co/docs/explore-analyze/elastic-inference/eis">EIS</a> 提供的模型。Jina 本地部署可直接与<a href="https://www.elastic.co/cn/blog/deploy-elastic-air-gapped-disconnected-environments">隔离的 Elastic 部署</a>集成。</p></li></ul><h2>Jina AI 本地部署模型的硬件要求</h2><p>不同的 Jina 模型所需的硬件要求各有不同。下表展示了使用 GPU 设置的最新模型的推荐配置。您不需要比 NVIDIA L4 GPU 更强大的设备，不过对于 v5 嵌入模型，建议使用 A100。我们最新的嵌入模型目前至少需要 8 GB 的 VRAM。</p><p>模型</p><p>最小 VRAM</p><p>推荐 GPU</p><p>jina-embeddings-v5-text-nano</p><p>2 GB</p><p>T4 / L4</p><p>jina-embeddings-v5-text-small</p><p>3 GB</p><p>L4 / A10G</p><p>jina-embeddings-v5-omni-small</p><p>8 GB</p><p>L4 / A10G / A100</p><p>jina-reranker-v3</p><p>3 GB</p><p>L4</p><p>jina-clip-v2</p><p>4 GB</p><p>L4</p><p>jina-code-embeddings-1.5b</p><p>4 GB</p><p>L4</p><p>ReaderLM-v2</p><p>4 GB</p><p>L4</p><p>如果同时使用多个模型，则 VRAM 需求将会增加。有关更多信息，请参阅<a href="https://github.com/jina-ai/jina-on-prem/wiki/Sizing-And-Hardware">规模和硬件页面</a>。</p><h2>如何使用 Docker 安装 Jina 本地部署</h2><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt20265d09e2d8d0f4/6a6a33d1065b162105701ffd/ada9881af407168298b1940f8537ad71a5411c89-1999x1200.png" alt="" /><p>最快的开始方法是<a href="https://www.docker.com/get-started/">安装 Docker</a>（如果您尚未安装），并按照 <a href="https://github.com/jina-ai/jina-on-prem/wiki/QuickStart">Jina 本地部署快速入门</a>页面上的说明进行操作。</p><p>所有 28 个 Jina 模型均提供预构的 Docker 容器。下载其中一个并将其传输至您的安装目标，即可在不到 5 分钟的时间内运行 Jina AI 模型。</p><p>对于多模态或自定义构建，或者要下载在容器外部安装所需的完整依赖集，请按照<a href="https://github.com/jina-ai/jina-on-prem/wiki/Bundling-Guide">打包指南</a>中概述的步骤进行操作。</p><p>您的 Jina 本地部署安装支持所有 Jina API 和 EIS 功能以及通过 OpenAI、Cohere、Voyage AI 和 Gemini API 生成嵌入，因此可以使用标准接口集成到已有应用程序中。有关更多信息，请参阅 <a href="https://github.com/jina-ai/jina-on-prem/wiki/API-Reference">API 文档</a>。</p><p>Jina 模型（包括通过 Jina 本地部署安装的模型）按多种许可条款提供，其中最新的模型可在 <a href="https://creativecommons.org/licenses/by-nc/4.0/deed.en">CC BY-NC 4.0</a> 许可证下免费用于非商业用途。如需获得 Jina 本地部署的商业许可，请联系 <a href="https://www.elastic.co/cn/contact">Elastic 销售</a>。</p>]]></content:encoded>
    <link>https://www.elastic.co/search-labs/blog/on-prem-ai-jina-embedding-models</link>
    <guid isPermaLink="true">https://www.elastic.co/search-labs/blog/on-prem-ai-jina-embedding-models</guid>
    <category><![CDATA[Jina AI]]></category>
    <category><![CDATA[集成]]></category>
    <dc:creator><![CDATA[Scott Martens]]></dc:creator>
    <enclosure url="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt17731ab0c6ec66f6/6a6a33d140a4941014ca5c9a/09bc6dac4e6a86c7877f8ed78d68f5d581aeffa9-1999x1200.png" length="0" type="image/png"/>
    <pubDate>Thu, 23 Jul 2026 00:00:00 GMT</pubDate>
  </item>
  <item>
    <title><![CDATA[一个索引，涵盖所有媒体：jina-embeddings-v5-omni 正式发布]]></title>
    <description><![CDATA[jina-embeddings-v5-omni 可让您将文本、图片、视频和音频嵌入到单个 Elasticsearch 索引中，并同时对所有这些内容进行查询。]]></description>
    <content:encoded><![CDATA[<p><code>jina-embeddings-v5-omni</code> 将文本、图像、视频和音频整合到单个 Elasticsearch 索引中。v5-omni 套件扩展了同类最佳的<a href="https://www.elastic.co/search-labs/blog/jina-embeddings-v5-text"><code>jina-embeddings-v5-text</code></a> 模型，通过创新的架构增加了视觉和音频编码，使文本主干完全相同，在一个非常紧凑的嵌入模型中提供了前沿的性能。</p><p>您现在可以为<strong>文本</strong>、<strong>图像</strong>、<strong>视频</strong>和<strong>录音</strong>创建高性能语义嵌入，涵盖<strong>近 100 种语言</strong>，并将它们用于分类、聚类、语义相似度测量和检索索引。如果您的数据以 PDF、录音、视频和文本的形式存在，您不再需要为每种格式单独建立数据管道。</p><p><code>jina-embeddings-v5-omni</code> 系列是<strong>目前市场上最紧凑的嵌入模型，支持图片、语音、文本和视频</strong>。它提供：</p><ul><li><p><strong><code>jina-embeddings-v5-text</code></strong><strong>的前沿级文本嵌入</strong>，用于检索、分析和 AI 代理应用。</p></li><li><p>用于视觉语义相似性、视觉理解和图像检索的<strong>同类最佳嵌入</strong> <strong>。</strong>在所有参数规模为 10 亿（10⁹）的模型中，<code>jina-embeddings-v5-omni-small</code> 在图像基准测试中表现最佳，且优于我们之前的 <a href="https://www.elastic.co/search-labs/blog/jina-models-elasticsearch-guide#jina-clip-v2"><code>jina-clip-v2</code></a> 。只有少数几个具有 3 到 30 倍参数的模型可以击败它。</p></li><li><p><strong>用于多语种视觉理解和检索的最先进嵌入技术</strong>，可击败规模比它大 20 倍的模型。</p></li><li><p><strong>同类最佳的音频嵌入</strong>，在标准基准测试中，只有参数量是其两倍或更多的模型才能表现得更好。</p></li><li><p><strong>支持视频</strong>，特别擅长定位视频片段中的物体和事件。</p></li></ul><p>这项技术可应用于信息检索、文档处理和数据分析等各个领域。<code>jina-embeddings-v5-omni</code> 可打破存储在不同媒体孤岛中的信息壁垒，使其能够被 AI 智能体进行检索、分析和利用。在您的数据生态系统中，音频和视频、PDF、打印页面的扫描件以及信息图表中的信息，都与数字化文本处于同等地位。</p><p>和 <code>jina-embeddings-v5-text</code> 一样，这些模型有两种尺寸：<code>small</code> 和 <code>nano</code>。这两个模型都在其对应的纯文本版本基础上，通过增加额外的模块，实现了对音频和视觉输入的支持用户可以在加载时选择模块。此外，针对语义相似度、分类、聚类和信息检索等特定任务的扩展功能通过紧凑的低秩适配器 (LoRAs) 实现；这些适配器均已预载，用户可以在推理时直接选择使用。</p><p>两个模型的尺寸都非常精简。<code>jina-embeddings-v5-omni-small</code> 可以在配备常规 GPU 的服务器上运行，而 <code>jina-embeddings-v5-omni-nano</code> 的体积很小，可以在通用硬件上运行。这意味着可以节省大量的计算成本，并使得获得许可的本地安装及边缘处理成为可能，从而降低延迟并增强对自身数据的控制。</p><p>v5-omni 套件采用创新的模型设计和机器技术，能够通过已有的预训练模型来组合成新的嵌入模型，无需对它们进行重新训练。我们使用来自预训练且经过语言对齐的嵌入模型的编码器作为音频和视频媒体的输入预处理器，用于我们现有的 <code>jina-embeddings-v5-text</code> 模型套件。生成的模型能够为图像和录音生成嵌入，这些嵌入在语义上与其为文本生成的嵌入是兼容的。</p><p>v5-omni 模型生成的文本嵌入与 <code>jina-embeddings-v5-text</code> 相同（即，<code>jina-embeddings-v5-omni-small</code> 与 <code>jina-embeddings-v5-text-small</code>；以及 <code>jina-embeddings-v5-omni-nano</code> 与 <code>jina-embeddings-v5-text-nano</code>），因此您可以将现有的文本检索存储库扩展到多媒体应用程序，而无需重建索引。</p><p>集成的编码器全部源自开源权重模型。对于图像和视频，我们使用来自 <a href="https://qwen.ai/blog?id=qwen3.5">Qwen3.5</a> 模型的编码器：</p><ul><li><p>对于<code>jina-embeddings-v5-omni-nano</code> ，我们使用来自 <a href="https://huggingface.co/Qwen/Qwen3.5-0.8B">Qwen3.5-0.8B</a> 中经过微调的 <a href="https://huggingface.co/google/siglip2-base-patch16-224">SigLIP2 Base</a> 编码器。</p></li><li><p>对于 <code>jina-embeddings-v5-omni-small</code> ，我们使用来自 <a href="https://huggingface.co/Qwen/Qwen3.5-2B">Qwen3.5-2B</a> 中经过微调的 <a href="https://huggingface.co/google/siglip2-so400m-patch14-384">SigLIP2 So400m</a> 编码器。</p></li><li><p>为了实现音频支持，我们为 small 和 nano 版添加了从 <a href="https://huggingface.co/Qwen/Qwen2.5-Omni-7B">Qwen2.5-Omni-7B</a> 中提取的 <a href="https://huggingface.co/openai/whisper-large-v3">Whisper-large-v3</a> 编码器。</p></li></ul><p>我们通过训练跨模态投影器，将这些媒体专用的编码器与文本处理主干网络连接了起来。这些投影器将其原生输出转换为与 <code>jina-embeddings-v5-text</code> 兼容的输入嵌入。<code>jina-embeddings-v5-omni</code> 模型中唯一新训练的部分是这些投影器中的权重。</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt62dc05bfa3d054b6/6a17e86eb1e113340b79f29c/4cb834b7e5fd63cdd78600de313615feffabbb1f-1999x1000.jpg" alt="" /><p>这种架构意味着我们只需要为四个 LoRA 适配器中的每一个训练跨模态投影器，其参数量在 <code>jina-embeddings-v5-omni-small</code> 模型中约为 550 万，在 <code>jina-embeddings-v5-omni-nano</code> 模型中则低于 350 万。这种方法可最大限度地减少连接不同嵌入模型所需的额外训练，通过利用各模型原有的专业化训练成果，打造出了一套极其精简、高性能且模块化的嵌入套件。</p><h2>选定的模型属性</h2><h3>输入/输出</h3><p>型号名称</p><p>输入上下文窗口大小</p><p>嵌入大小</p><p>jina-embeddings-v5-omni-small</p><p>32,768 个词元*</p><p>1024 维（最小值：32）</p><p>jina-embeddings-v5-omni-nano</p><p>8,192 个标记*</p><p>768 个维度（最小值：32）</p><p>* 请参见下文的 <strong>使用 jina-embeddings-v5-omni</strong> 部分，了解非文本媒体如何进行切片化的更多信息。</p><h3>大小</h3><p>型号名称</p><p>总大小</p><p>jina-embeddings-v5-omni-small（纯文本基础模型 + 4 个 LoRA 适配器）</p><p>700M 参数</p><p>图像/视频支持（SigLIP2 So400m 编码器提取自 Qwen3.5-2B）</p><p>1.006B 参数</p><p>音频支持（Whisper-large-v3 编码器提取自 Qwen2.5-Omni-7B）</p><p>1.354B 参数</p><p>亦或是两种情况都有</p><p>1.660B 个参数</p><p>LoRA适配器（每个）</p><p>20M</p><p>jina-embeddings-v5-omni-nano（纯文本基础模型 + 4 个 LoRA 适配器）</p><p>266M 参数</p><p>图像/视频支持（SigLIP2 Base 编码器提取自 Qwen 3.5-0.8B）</p><p>354M 个参数</p><p>音频支持（Whisper-large-v3 编码器提取自 Qwen2.5-Omni-7B）</p><p>916M 参数</p><p>亦或是两种情况都有</p><p>1.004B 个参数</p><p>LoRA适配器（每个）</p><p>7M</p><p>* 请参见下文的 <strong>使用 jina-embeddings-v5-omni</strong> 部分，了解非文本媒体如何进行切片化的更多信息。</p><h2>特定任务训练</h2><p><code>jina-embeddings-v5-omni</code> 系列支持与 <code>jina-embeddings-v5-text</code> 相同的任务专用 LoRA 适配器：</p><p>任务</p><p>示例用法</p><p>检索</p><p>信息检索既可以独立使用，也可以结合其他检索和候选评估技术共同使用。借助 v5-omni 模型，您只需通过一个索引、一次查询，即可同时检索音频、视频和图像。</p><p>聚类</p><p>跨所有媒体的主题发现与自动主题组织。</p><p>分类</p><p>分类、情感分析和相关任务。</p><p>语义相似度</p><p>跨媒体数据去重、推荐系统、相关媒体、查找与语音匹配的文本、识别翻译以及类似任务。</p><p>输出嵌入取决于选定的任务类别。例如，您不应该将检索导向的嵌入用于聚类任务，也不应该将语义相似度的嵌入用于分类任务。</p><h2>多媒体、多模态、多语言、多功能</h2><p>为了展示 <code>jina-embeddings-v5-omni</code> 的功能，我们以两部小说的著名开篇为例，并测量它们的语义相似度：</p><p><em><strong>《双城记》</strong></em><strong>（查尔·狄更斯）</strong></p>It was the best of times, it was the worst of times, it was the
age of wisdom, it was the age of foolishness, 
it was the epoch of belief, it was the epoch of incredulity,
it was the season of Light, it was the season of Darkness,
it was the spring of hope, it was the winter of despair,
we had everything before us, we had nothing before us,
we were all going direct to Heaven, we were all going
direct the other way—in short, the period was so far like
the present period, that some of its noisiest authorities
insisted on its being received, for good or for evil, in 
the superlative degree of comparison only.<p><em><strong>《傲慢与偏见》</strong></em><strong>（简·奥斯汀）</strong></p>It is a truth universally acknowledged, that a 
single man in possession of a good fortune must
be in want of a wife. However little known the
feelings or views of such a man may be on his first
entering a neighbourhood, this truth is so well
fixed in the minds of the surrounding families,
that he is considered as the rightful property of
some one or other of their daughters.<p>使用 <code>jina-embeddings-v5-omni-small</code>及其语义相似度适配器，这些文本的相似度为 <strong>0.5329</strong>。</p><p>如果不进行对比，这个数值就没有太大意义。因此，让我们使用相同的模型和适配器，将这两段文本与它们的法语翻译版本进行对比：</p><p><strong>跨语言文本的语义相似度分数</strong></p><p></p><p>《双城记》（英语）</p><p>傲慢与偏见（英语）</p><p>《双城记》（法语）（《Paris et Londres en 1783》，翻译：H. Loreau）</p><p>0.9095</p><p>0.5074</p><p>《傲慢与偏见》（法语）（《Orgueil et Préjugés》，翻译：Leconte 和 Pressoir）</p><p>0.4826</p><p>0.8784</p><p>这两段文本与其对应的翻译版本之间表现出了极高的相似度，远高于它们与同语言或其他语言下的不同文本之间的相似度。这反映了 <code>jina-embeddings-v5-text-small</code> 极其出色的多语言语义嵌入性能，而这一性能已被原封不动地整合进了 <code>jina-embeddings-v5-omni-small</code> 中。</p><p>向 <code>jina-embeddings-v5-omni</code> 增加多媒体支持，意味着我们可以将这一实验扩展到完全不同类型的数据上。例如，我们从旧印刷版本中获取了两本小说的第一页扫描图：</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt95d451adb5680e20/6a17e871445de9e88a4d016c/e92d928a4813ccecc7d02639eea699e3a71c66e3-1999x1692.png" alt="两页古老的书页展示了《双城记》和《傲慢与偏见》的开篇段落，左页显示了一本未注明日期的19世纪版《双城记》第一章的开头，右页显示了1903年麦克米伦版《傲慢与偏见》第一章的开头。" /><p><strong>图 2：</strong><em>《双城记》</em>，19 世纪无日期版本；<em>《傲慢与偏见》</em>，1903 年麦克米伦版。</p><p>让我们再次使用语义相似度适配器，将文本与扫描件进行比较：</p><p><strong>文本和图像之间的语义相似度评分</strong></p><p></p><p>双城记》（扫描版）</p><p>《傲慢与偏见》（扫描版）</p><p>《双城记》（文本）</p><p>0.7336</p><p>0.4891</p><p>《傲慢与偏见》（文本）</p><p>0.4804</p><p>0.7213</p><p>您会发现，语义相似度分值明显更倾向于那些与图像内容相匹配的文本。</p><p>我们还可以将文本与引用这些文本的社交媒体帖子和模因的截图进行比较，并使用相同的设置：</p><p><strong>图 3：</strong>Elon Musk 引用<em>《双城记》</em>的推文，以及引用<em>《傲慢与偏见》</em>著名开篇的表情包。</p><p><strong>文本和图像之间的语义相似度评分</strong></p><p></p><p>双城记</p><p>傲慢与偏见</p><p>马斯克推文（图片）</p><p>0.7156</p><p>0.4912</p><p>Keep Calm 梗图（图片）</p><p>0.4555</p><p>0.6244</p><p>我们也可以对语音执行相同的操作。我们获得了两种文本的英语和法语朗读录音：</p><ul><li><p><a href="https://drive.google.com/file/d/1IK_bR6L47TSrnESdXLEpHCX6o-FzPmOx/view?usp=sharing"><em>《双城记》</em></a><a href="https://drive.google.com/file/d/1IK_bR6L47TSrnESdXLEpHCX6o-FzPmOx/view?usp=sharing">（Librivox 英文音频）</a>。</p></li><li><p><a href="https://drive.google.com/file/d/1KurbhD6INc6oZlq_SJcWq7MBVfJQ3pof/view?usp=sharing"><em>《双城记》</em></a><a href="https://drive.google.com/file/d/1KurbhD6INc6oZlq_SJcWq7MBVfJQ3pof/view?usp=sharing">（由 OmniVoice AI 生成的法语音频）</a>。</p></li><li><p><a href="https://drive.google.com/file/d/1D_G2FOCb7ct-FBVY1fyivXlY2e_yGZw1/view?usp=sharing"><em>《傲慢与偏见》</em></a><a href="https://drive.google.com/file/d/1D_G2FOCb7ct-FBVY1fyivXlY2e_yGZw1/view?usp=sharing">（Librivox 英文音频）。</a></p></li><li><p><a href="https://drive.google.com/file/d/1jutY61YSFGBIyE8m-ltEJx-8dEXNJJ5N/view?usp=sharing"><em>《傲慢与偏见》</em></a><a href="https://drive.google.com/file/d/1jutY61YSFGBIyE8m-ltEJx-8dEXNJJ5N/view?usp=sharing">（由 OmniVoice AI 生成的法语音频）</a>。</p></li></ul><p><strong>跨语言的文本与音频之间的语义相似度分值</strong></p><p></p><p>双城记（英语音频）</p><p>双城记 (法语有声)</p><p>傲慢与偏见（英语音频）</p><p>傲慢与偏见（法语配音）</p><p>《双城记》（英文文本）</p><p>0.3816</p><p>0.3106</p><p>0.1607</p><p>0.1774</p><p>《双城记》（法语文本）</p><p>0.3528</p><p>0.3253</p><p>0.1598</p><p>0.1721</p><p>《傲慢与偏见》（英语文本）</p><p>0.1910</p><p>0.1682</p><p>0.3511</p><p>0.3398</p><p>《傲慢与偏见》（法语文本）</p><p>0.1667</p><p>0.1474</p><p>0.3018</p><p>0.3702</p><p>这种多语言和多媒体能力也延伸到信息检索。</p><p><code>jina-embeddings-v5-omni</code> 模型的检索适配器实现了非对称检索。这意味着它们嵌入查询的方式与嵌入检索目标文档的方式不同，因此跨模式查询总是具有“方向性”的，即查询在一种媒体中，文档在另一种媒体中，这导致如果您将两者调换（即反向查询），得到的分值也会有所不同。</p><p>下表显示了<em>《双城记》</em>和<em>《傲慢与偏见》</em>的文本、音频和页面扫描图像的检索得分，其中<em>《双城记》</em>的文本（英文）被编码为查询：</p><p><strong>（文本搜文本）</strong></p><p>文档</p><p>检索得分</p><p>《双城记》（法语文本节选）</p><p>0.7597</p><p>《傲慢与偏见》（英文文本节选）</p><p>0.1482</p><p>《傲慢与偏见》（法语文本节选）</p><p>0.0523</p><p><strong>文本搜图像</strong></p><p>文档</p><p>检索得分</p><p>《双城记》（英文页面扫描件）</p><p>0.5517</p><p>《双城记》（法文版扫描）</p><p>0.3576</p><p>《傲慢与偏见》（英文版扫描图）</p><p>0.1917</p><p><strong>文本到音频</strong></p><p>文档</p><p>检索得分</p><p>双城记（英语音频）</p><p>0.3277</p><p>双城记 (法语有声)</p><p>0.1980</p><p>傲慢与偏见（英语音频）</p><p>0.1419</p><p>傲慢与偏见（法语配音）</p><p>0.1759</p><p>用户还可以反向运行查询，进行音频搜文本和图像搜文本的检索。</p><p>以下是使用<em>《双城记》</em>的英语音频作为查询以及各种文本作为文档的分数：</p><p><strong>图片搜文本</strong></p><p>文档</p><p>检索得分</p><p>《双城记》（英文文本节选）</p><p>0.3352</p><p>《双城记》（法语文本节选）</p><p>0.2650</p><p>《傲慢与偏见》（英文文本节选）</p><p>0.1626</p><p>《傲慢与偏见》（法语文本节选）</p><p>0.1385</p><p>使用<em>《双城记》</em>（英文）第一页扫描页作为查询得出的分数：</p><p><strong>音频转文本</strong></p><p>文档</p><p>检索得分</p><p>《双城记》（英文文本节选）</p><p>0.5304</p><p>《双城记》（法语文本节选）</p><p>0.4845</p><p>《傲慢与偏见》（英文文本节选）</p><p>0.1467</p><p>《傲慢与偏见》（法语文本节选）</p><p>0.0761</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt501b2c594f45f2e3/6a17e877a292992e3ad02c9a/673f5116c1d7a5a6f9adfbb2f48b9e6920e3229b-668x130.png" alt="一个浅蓝色背景的矩形通知框显示黄色警告三角形图标，旁边的文本解释：jina-embeddings-v5-omni 的训练重点是“以文本搜音频”、“以文本搜视频”和“以文本搜图片”，因此使用“非文本”作为查询词时，效果可能会稍逊一筹。" /><h2>视频搜索</h2><p><code>jina-embeddings-v5-omni</code>的视频索引与搜索功能为 Elasticsearch 数据库带来了新的能力，但它也受到许多与处理文本时相同的限制/警告约束。为一部长篇电影生成单一的嵌入就像为一部长篇小说生成单一的嵌入一样：详细的信息会被淹没，导致生成的嵌入可能会与许多风马牛不相及的查询产生虚假匹配。</p><p>如果您对<em>《指环王》</em>的全文（约 50 万字）进行嵌入，无论您搜什么，它可能都会显示“高度匹配”。同样，如果您为一部两小时的好莱坞电影编制索引，您会得到很多虚假的匹配并丢失所有细节。因此 <code>jina-embeddings-v5-omni</code> 是处理短视频剪辑的理想选择。</p><p>在这个示例中，我们下载了 1961 年电影<em>《蒂凡尼的早餐》</em>的预告片。这段预告片时长仅为 158 秒，且属于公共领域。您可以在<a href="https://archive.org/details/turner_video_311/311.mp4">互联网档案馆</a>上观看这段预告片。</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt06633fdd1c8334dd/6a17e8790b0bed7d9add35b2/1948f585027d1342528c0dd93fe99e3ec7ba17f9-800x1200.png" alt="一张复古的《蒂凡尼的早餐》电影海报印着奥黛丽·赫本的全身插图，她身穿黑色长裙，戴着黑色手套和珍珠项链，手里拿着烟嘴，肩上趴着一只猫。一幅较小的背景插图显示了一对情侣在城市景观附近相拥，海报上附有彩色边框以及演员和制作人员名单。" /><p><strong>图 4：</strong><em>《蒂凡尼的早餐》</em>剧场版海报。</p><p>我们使用 <a href="https://www.scenedetect.com/">PySceneDetect </a> 将预告片分割成 28 个独立场景，长度从 1.877 秒（45 帧）到 18.393 秒（441 帧）不等。场景检测虽然不完美，但它提供了一种足够的机制，可以将视频分割成易于检索的小片段。然后我们使用 <code>jina-embeddings-v5-omni-small</code> 为 28 个片段中的每个片段生成了文档嵌入，以便测试文本查询在寻找视频中特定元素的有效性。</p><p>例如，查询 “cat” 会返回以下片段作为前三个结果。包含猫的那一个场景位于顶部，得分为 <strong>0.1634</strong>：</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt6dca953a4afd5c1b/6a17e87baf47b65bf6cddfbc/82bd1759ebb65202f01a1e290447619af39f9a3d-735x426.png" alt=" 视频缩略图显示一个人跪在厨房的地板上向打开的冰箱伸出手，一只猫站在附近（得分 0.1634）。" /><p><a href="https://drive.google.com/file/d/1O3r-97rQJE7HAlUHsLygmFLwlZihRF26/view?usp=drive_link">观看片段一</a>。</p><p>次高匹配的片段得分为 <strong>0.1237</strong>，要低得多：</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltcc2cc1ef9ff9ce4b/6a17e87d7c026e725cf146b3/de4eb704ef751cc4df2bead7faa177decd20b1b3-735x426.png" alt="视频缩略图显示一个人手持彩色面具靠近脸部，图像上覆盖了 “GEORGE PEPPARD” 的名字（得分 0.1237）。" /><p><a href="https://drive.google.com/file/d/1DEK2H4bCpLVzyipJri9NSqE2jkeZ5jLm/view?usp=drive_link">观看片段二</a>。</p><p>您还可以查询动作。如果使用字符串“kiss”进行查询，前四个匹配结果都包含亲吻动作：</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt85bf55536faf5156/6a17e87f25daab4bb608a269/18efdcbbb31954dfab8eafe5055773b6b8e3de72-735x426.png" alt="视频缩略图显示了三个人在室内，其中一个人站在左边，背对着摄像机，右边的两个人似乎在窗帘和门口附近拥抱 (得分 0.2864)。" /><p><a href="https://drive.google.com/file/d/1Pmr_D4wKjUCCiq_Dzy5PQeWldJLjZ8kI/view?usp=drive_link">观看片段三。</a> 其得分为0.2864。</p><p>分数：分别对应<a href="https://drive.google.com/file/d/1sS_4qTnmHU2uOwbN1fmdXeS3IvZAI_IN/view?usp=drive_link">第二匹配项</a>（0.2494）、<a href="https://drive.google.com/file/d/1ofsrZHTUb3huwQ0JB6Hs5dOw4myTj-sk/view?usp=drive_link">第三匹配项</a>（0.2099）和<a href="https://drive.google.com/file/d/1qaS4eueUCcQWdHLEjfEfneXsaWsx6P_5/view?usp=drive_link">第四匹配项</a>（0.2068）</p><p>而且您可以搜索视频中显示的文本，比如“Buddy Ebsen”，它只出现一次。<code>jina-embeddings-v5-omni-small</code> 能够轻松将其识别为最佳匹配项，得分为 <strong>0.3885</strong>，显著高于次佳匹配项：</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt4c3fd86052f17ce8/6a17e886e9ea8795d8a9c601/dabcae9f44b9d4a671f88717aa21a2c6cf685f6b-735x426.png" alt="视频缩略图显示一名穿西装的男子站在带有白色栏杆和深色扶手的楼梯旁，叠加文字“Buddy Ebsen”（得分 0.3885）。" /><p><a href="https://drive.google.com/file/d/1rdQ1OqtPBD-3iGG8A900jU5DpC-muye4/view?usp=sharing">巴迪·埃布森剪辑</a>。</p><h2>可视化文档检索</h2><p>Jina AI 多模态嵌入模型在视觉文档处理方面表现优异，在多语言视觉文档处理方面处于最先进水平。这意味着要处理包含文本、图形和结构化信息的图像数据。重要数据通常以印刷扫描件、PDF文件、图表、技术图纸、截图、图片、信息图表等形式存在。这类图像通常是机械合成或计算机生成的。它们通常无法在不损失含义的情况下还原为文本，且不适合那些专为自然场景摄影设计的计算机视觉模型。</p><p><code>jina-embeddings-v5-omni</code>的嵌入包括图像中的事物、印在图像上的文字以及两者之间的关系。视觉文档检索使得对包含物体和相关文本的丰富图像进行索引成为可能，并且可以跨语言进行索引。</p><p>我们使用来自不同电子商务网站的四张产品图片举例：</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt620568521e2a3057/6a17e888f7018418c89a68a8/639481349aed78d4139f0d388d44f79b6ba29f88-1297x650.png" alt="" /><p>现在，让我们看看 <code>jina-embeddings-v5-omni-small</code> 对这四张图片在“拉面”这个查询词上的得分表现如何：</p><p>Campbell's Chunky 鸡肉面（加拿大包装）</p><p>Kraft Dinner (加拿大包装)</p><p>Maruchan 味噌口味新鲜拉面（日本包装）</p><p>Birkel 意面（德国包装）</p><p>0.0872</p><p>0.0711</p><p>0.1123</p><p>0.0886</p><p>它很快就找到了日本产品的匹配项。</p><p>现在，让我们尝试查询“マカロニチーズ”（日语的<em>通心粉和奶酪</em>）：</p><p>Campbell's Chunky 鸡肉面（加拿大包装）</p><p>Kraft Dinner (加拿大包装)</p><p>Maruchan 味噌口味新鲜拉面（日本包装）</p><p>Birkel 意面（德国包装）</p><p>0.2207</p><p>0.3487</p><p>0.2760</p><p>0.2674</p><p>它能像英语查询一样轻松地找到正确的匹配。</p><p><code>jina-embeddings-v5-omni</code> 也擅长解读信息丰富的图像，例如图表。如需查看实际效果，请参阅以下两个柱状图：</p><p>两张图表，左边的<strong>图表 1</strong> 关于全球疾病负担，右边的<strong>图表 2</strong> 关于犬种寿命。</p><p>让我们看看使用 <code>jina-embeddings-v5-omni-small</code> 进行检索时，这两张图表与两个特定的文本问题（每个问题仅与其中一张图表相关）的匹配程度如何：</p><p>文本问题</p><p>图表 1</p><p>图表2</p><p>“老年人常见的健康问题有哪些？”</p><p>0.2787</p><p>0.1099</p><p>“狗能活多久？”</p><p>0.1350</p><p>0.3564</p><p>您还可以反向搜索，使用图像作为查询来查找文本。下表显示了从主题相关的科学论文摘要中提取的目标文档及其检索分数，使用图表图像作为查询：</p><p></p><p>文本 1</p><p>文本2</p><p></p><p>长期以来，生活在极端贫困中的人群健康一直是全球发展工作的重点，在可持续发展目标时代，这仍然是一个优先事项。然而，近二十年来，尚未有人系统地尝试量化这一特定人群中疾病负担的程度和原因。我们按病因估算了全球最贫困的十亿人口的患病率，并将其与高收入人群的相应患病率进行比较。</p><p>伴侣犬是表型多样性最为丰富的物种之一。品种间的差异不仅体现在形态和行为方面，还体现在寿命上。尽管如此，很少有研究致力于评估不同品种之间的寿命期望变化或评估长寿的系统发育特征的潜力。</p><p>图表 1</p><p>0.2377</p><p>0.1357</p><p>图表2</p><p>0.0673</p><p>0.3576</p><h2>功能</h2><h3>可截断嵌入</h3><p>我们利用 <a href="https://arxiv.org/abs/2205.13147">Matryoshka 表征学习技术</a>训练了支撑 <code>jina-embeddings-v5-omni</code> 的骨干 <code>jina-embeddings-v5-text</code> 模型，因此您可以从这些模型中截断文本和多媒体嵌入。</p><p>默认情况下，<code>jina-embeddings-v5-omni-small</code> 生成 1024 维的嵌入，以 16 位精度存储时，每个嵌入占用 2KB 的存储空间。<code>jina-embeddings-v5-omni-nano</code> 的嵌入有 768 个维度，占用大约 1.5KB。您可以将这些嵌入的大小减少到 32 维（64 字节），在一定程度上牺牲了准确性，但大大提高了处理速度并降低了资源使用成本。通常情况下，将嵌入大小减半会使准确率下降约 2%，降至 128 维以下时，准确率下降速度会更快。</p><p>截断嵌入允许用户根据自身的用例，在准确性、速度和成本之间做出最佳权衡。</p><h3>量化</h3><p><code>jina-embeddings-v5-omni</code> 系列还继承了其 <code>jina-embeddings-v5-text</code>骨干在量化处理下的强大性能。通过存储精度较低的数值，这能进一步提升速度，并降低计算和存储成本。我们已经训练他们使用 <a href="https://elastic.co/elasticsearch">Elasticsearch</a> 的 <a href="https://www.elastic.co/docs/reference/elasticsearch/mapping-reference/bbq">Better Binary Quantization</a> (BBQ) ，以提供与未量化嵌入几乎相同的性能。在大规模文本嵌入基准测试 (MTEB) 检索基准套件中，二值化与完整的 16 位值相比，性能降低不到 3%，却节省了 93% 的空间，并显著提升了处理和检索速度。</p><h3>跨语言性能</h3><p><code>jina-embeddings-v5-text</code>的广泛多语言训练延续到了 <code>jina-embeddings-v5-omni</code> 中，其中 <code>jina-embeddings-v5-text-small</code> 的预训练涵盖近 100 种语言，而 <code>jina-embeddings-v5-text-nano</code> 则涵盖了 15 种主要全球语言。对于音频媒体，<code>Whisper-large-v3</code> 模型在其训练中大约涵盖了 100 种语言，而集成在 <code>jina-embeddings-v5-omni-small</code> 和 <code>-nano</code> 中经过 Qwen 修改后的 SigLip2 视觉模型则使用来自 201 种不同语言和方言的数据进行训练。</p><h2>基准性能</h2><h3>文本</h3><p><code>jina-embeddings-v5-omni</code> 模型在仅用于文本时与 <code>jina-embeddings-v5-text</code> 模型相同。在语义文本嵌入领域，它们在各自的参数规模类别中，均是 <a href="https://huggingface.co/spaces/mteb/leaderboard">MMTEB 基准</a>测试套件中的佼佼者。</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt14d87596ca463c88/6a17e88dec0f89dfb65a664f/8687106cf82e6ec2b3f79f893cfe011e4a5b4a21-1095x1095.png" alt="柱状图和折线图比较了九种嵌入模型的 MMTEB 分数和参数大小，其中 jina-v3-omni-small 分数最高，snowflake-arctic-embed-l-v2 的参数最小。" /><p><strong>图 5</strong>：与竞争模型相比，<code>jina-embeddings-v5-omni</code> 在文本基准测试中的大小和性能。所引用的大小未加载其他媒体的扩展。</p><h3>视觉语义相似度</h3><p>在标准的视觉语义相似度基准测试中，<code>jina-embeddings-v5-omni</code> 的得分在同等规模的模型中名列前茅。<code>jina-embeddings-v5-omni</code> 模型在同等规模的公开开放权重模型中表现出迄今为止最佳的性能。<code>jina-embeddings-v5-omni-small</code> 在视觉语义相似度任务中仅被三倍其大小的模型击败，而 <code>jina-embeddings-v5-omni-nano</code> 仅被 <code>jina-embeddings-v5-omni-small</code> 和比它大 10–25 倍的模型击败。</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt16ad3463d2aeefc5/6a17e88efaa9139b1493c8a9/f2ae56764865953bdf8c54747276189efd6d45e1-1496x877.png" alt="柱状图和折线图比较了七个嵌入模型的视觉语义相似度得分和参数大小，其中 jina-embeddings-v5-omni-small 的相似度得分最高，laion/CLIP-ViT-bigG-14 的模型最大。" /><p><strong>图 6</strong>：<code>jina-embeddings-v5-omni-small</code> 、<code>jina-embeddings-v5-omni-nano</code> 和可比模型的视觉语义相似度基准平均得分，以及它们的大小（包括视觉扩展）。</p><h3>可视化文档检索</h3><p><code>jina-embeddings-v5-omni-small</code> 在参数量保持在 10 亿以下的同时，它的性能足以媲美参数量为 30 亿和 70 亿的模型。<code>jina-embeddings-v5-omni-nano</code> 在同类规模中同样表现出众，其性能甚至超越了规模比它大 10 到 60 倍的模型。</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltcbabd1477ec3459c/6a17e890e317912a242d5806/cde672f18de8f4a30dd81938b08bb06e08444be0-1223x905.png" alt="柱状图和折线图比较了选定的 ViDoRe 分数和多个嵌入模型的参数大小，其中 LCO-Embedding-Omni-7B 得分最高，laion/CLIP-ViT-bigG-14 拥有最大的模型大小。重点是两个 jina-embeddings 模型。" /><p><strong>图 7</strong>：<a href="https://huggingface.co/spaces/vidore/vidore-leaderboard">ViDoRe 视觉文档检索</a>在六个基准测试中的平均得分：<em>DocVQA</em>、<em>InfoVQA</em>、<em>ShiftProj</em>、<em>SynAI</em>、<em>Tabfquad</em> 和 <em>TatDQA</em>。</p><h3>音频检索</h3><p>在标准 MAEB（大规模音频嵌入基准测）音频检索基准测试中，<code>jina-embeddings-v5-omni-small</code> 和 <code>jina-embeddings-v5-omni-nano</code> 均名列前茅。只有非常大的模型——比 <code>jina-embeddings-v5-omni-small</code> 大三倍以上——才能超过它的得分。</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt80f517c1c0230031/6a17e892dbb4ff8498fb56ee/a8c896bbbd710026c7b053e38af460194e7730a6-1650x912.png" alt="柱状图和折线图沿 X 轴比较嵌入和音频模型，左侧 Y 轴显示蓝色条形表示 MAEB 得分，右侧 Y 轴显示红色线条表示模型大小（以十亿个参数为单位）。柱状图的数值范围约为 20 到 55，线条的数值范围为 0 到 10。" /><p><strong>图 8</strong>：MAEB 音频检索基准测试中各种模型的平均分数。</p><p>虽然LAION的 <code>larger_clap_general</code> 模型在参数更少的情况下比jina-embeddings-v5-omni-nano的分数有所提升，但它是一个纯音频模型，没有v5-omni套件中额外的多模态功能。</p><h3>视频</h3><p>在视频方面，<code>jina-embeddings-v5-omni-small</code> 擅长找到视频中与文本查询匹配的位置。Charades-STA 和 MomentSeeker 测试是该任务的标准基准测试。从下方图表可以看出，尽管 <code>jina-embeddings-v5-omni-small</code> 的尺寸要小得多， 但它在同类开放权重模型中得分最高。</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltc8d7e7570b64d45a/6a17e8944b055d34e643221b/a2d7744d39fefb6b8b1f66e5b3f227828ef4ad4e-1350x672.png" alt="条形图和折线图显示了六个嵌入模型的 Charades‑STA 得分和模型大小。X 轴列出模型，左 Y 轴显示 20–60 的 Charades‑STA 分数，右 Y 轴显示 0–10 的模型大小（以十亿为单位）。蓝色条代表分数，带标记的红线代表模型大小。" /><p><strong>图 9</strong>：不同模型的 Charades-STA 分数及大小。</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltfbce6716a3a33ca5/6a17e89525daab2e8a08a26d/cf7578863fd509edb62c15878816d39657abc715-1550x845.png" alt="条形图和折线图使用 MomentSeeker 分数和模型大小比较了六个嵌入模型。X 轴列出模型，左 Y 轴显示 MomentSeeker 分数，大约从 44 到 60，右 Y 轴显示 0 到 10 D 模型大小（单位为十亿）。蓝色条代表分数，带标记的红线代表模型大小。" /><p><strong>图 10</strong>：不同模型的 MomentSeeker 分数及大小。</p><p>我们还将 <code>jina-embeddings-v5-omni-small</code> 与 ByteDance 的 <a href="https://seed.bytedance.com/en/blog/built-on-seed1-6-flash-seed-1-6-embedding-launched">Seed 1.6</a> 进行比较，后者是一个参数规模未披露的封闭权重模型。在 Charades-STA 基准测试中，我们的模型大幅领先于 Seed 1.6；在 MomentSeeker 上我们的模型则几乎与其持平。</p><p>模型</p><p>Charades-STA 得分</p><p>MomentSeeker 分数</p><p>seed-1.6-embedding</p><p>29.30</p><p>59.30</p><p>jina-embeddings-v5-omni-small</p><p>55.57</p><p>58.93</p><h2>优势与局限性</h2><p><code>jina-embeddings-v5-omni</code> 模型通过多种方式扩展用户对数字化信息的索引、搜索和分析能力，特别是：</p><ul><li><p>从文本查询中进行多语言语音检索。</p></li><li><p>PDF、扫描和可视化文档搜索。</p></li><li><p>视频时序定位，即从视频中识别出与自然语言文本描述相匹配的部分。</p></li><li><p>音频类型分类，包括音乐类型。</p></li><li><p>基于场景信息与目标识别的图像分类。</p></li></ul><p>在其他一些领域的表现则较为有限。也许可以使用 <code>jina-embeddings-v5-omni</code> 来完成这些任务，但我们尚未进行相关训练，结果可能不佳。</p><p>我们正在积极改进这些领域的技术：</p><ul><li><p>根据自然语言描述查找特定视频。</p></li><li><p>图像到图像的语义相似度与检索。</p></li><li><p>语音中的意图分类，例如识别语音指令。</p></li><li><p>处理混合媒体输入，即图像和随附的文本，或音频、图像和文本的组合。</p></li></ul><h2>使用 <strong>jina-embeddings-v5-omni</strong></h2><p>此模型套件支持通过三个入口点输入：文本、音频以及图像和视频。<code>jina-embeddings-v5-omni</code> 运行于一个框架内，该框架可转换各种标准格式并进行其他预处理。</p><p>我们使用初始 SigLip2 版本中提供的相同 <a href="https://arxiv.org/abs/2502.14786">NaFlex 方法</a>来处理图像：如果输入图像小于 262,144 像素（相当于 512x512 分辨率），则会将其放大，直到超过这个最小值；如果图像大于 3,072,000 像素，则会将其缩小，直到小于这个最大值。转换过程确保图像的高度和宽度均为 14 像素的倍数，并尽可能减少宽高比变形以实现这一目标。结果被分割成 28x28 像素的块，因此总块数是覆盖图像所需的 28x28 方块的数量。每一块在推理时被视为单个词元，并且每个图像输入都由特殊的开始和结束词元来划分单个图像。</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltf192cdba41155257/6a17e897abe0f2faaedfea2a/5ab7a8951780afdfe6eda9dca14add0375ae36bd-668x130.png" alt="一个浅蓝色背景的矩形通知框显示黄色警告三角形图标，旁边的文本解释：jina-embeddings-v5-omni 的训练重点是“以文本搜音频”、“以文本搜视频”和“以文本搜图片”，因此使用“非文本”作为查询词时，效果可能会稍逊一筹。" /><p><code>jina-embeddings-v5-omni</code> 模型修改视频分辨率的方式与修改图像的方式相同（见上文），我们从视频中最多提取 32 个帧。如果视频有超过 32 帧（这很可能，因为标准格式通常至少每秒 24 帧），我们会均匀分布我们提取的帧。然后，视频预处理器每两帧生成一组词元，这组词元的数量等同于覆盖视频画面所需的 28x28 像素方块的总数。</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt0acd4ddd95a66a53/6a17e898445de966214d0176/a38491c1cc47cfc65344c786e8ab57b9abf67e0b-1999x851.png" alt="一张由连续视频帧组成的拼贴图，画面按箭头指示的顺序排列，描绘了奥黛丽·赫本在不同时刻的一系列场景，并以显示“《蒂凡尼的早餐》”片名卡的画面作为结尾。该布局图展示了模型是从视频中提取 64 帧等间距的画面，当视频较长时，这种方式会导致严重的内容丢失。" /><p><strong>图11：</strong><code>jina-embeddings-v5-omni</code> 从视频中提取 32 个等距帧。如果您的视频很长，这意味着会丢失很多内容。</p><p>有关视频预处理的更多详细信息，请参阅 <a href="https://arxiv.org/abs/2502.14786">Siglip 2 技术文档</a>。</p><p>音频词元化遵循 Qwen-2.5-Omni 内置的方法：声音文件被切割成 30 秒的段落；如果长于 30 秒，则重新采样到 16kHz，转换为 128 通道的梅尔频谱图。每 40 毫秒被视为一个词元，因此每 30 秒的片段被处理为 750 个词元，每 40 毫秒音频一个词元，此外还带有专门的开始和结束标记，用以划分单个样本。</p><p>有关音频预处理的更多详细信息，请参阅 <a href="https://arxiv.org/abs/2503.20215">Qwen-2.5-Omni 技术报告</a>。</p><h2>可用性</h2><p><code>jina-embeddings-v5-omni-small</code> 和 <code>jina-embeddings-v5-omni-nano</code> 均可通过 <a href="https://www.elastic.co/docs/explore-analyze/elastic-inference/eis">Elastic Inference Service</a>（EIS）、调用 <a href="https://jina.ai/embeddings">Jina API</a> 和下载进行本地安装（<a href="https://huggingface.co/jinaai/jina-embeddings-v5-omni-small"><code>small</code></a> 和 <a href="https://huggingface.co/jinaai/jina-embeddings-v5-omni-nano"><code>nano</code></a>）进行使用。模型权重可免费分发，供用户在非商业许可下试用。如需商业用途，请联系 <a href="https://www.elastic.co/contact?pg=global&amp;plcmt=nav&amp;cta=205352">Elastic 销售</a> 。</p><h2>开始使用</h2><p>如要将 <code>jina-embeddings-v5-omni</code> 用于文本，您可以像使用 <code>jina-embeddings-v5-text</code> 一样，通过 <code>semantic_text</code> 字段进行集成。只需将 <code>inference_id</code> 设置为 <code>.jina-embeddings-v5-omni-small</code> 或 <code>.jina-embeddings-v5-omni-nano</code> 即可。请参阅<a href="https://www.elastic.co/docs/reference/elasticsearch/mapping-reference/semantic-text-how-tos">参考指南</a>以获取说明。</p><p>要使用 <code>jina-embeddings-v5-omni</code> 为其他媒体生成嵌入，您需要<a href="https://www.elastic.co/docs/api/doc/elasticsearch/operation/operation-inference-embedding">使用推理 API</a>。例如：</p>POST _inference/embedding/.jina-embeddings-v5-omni-small
{
  "input": [
    {
      "content": { 
        "type": "image", 
        "format": "base64", 
        "value": "data:image/jpeg;base64,..." 
      } 
    }, 
    { 
      "content": { 
        "type": "text", 
        "value": "Some text to create an embedding" 
      } 
    } 
  ] 
}<p>对于 <code>jina-embeddings-v5-omni-nano</code>，请将 <code>POST</code> URI 更改为 <code>_inference/embedding/.jina-embeddings-v5-omni-nano</code>。</p><p>如要对其他媒体中的文档进行编码，或生成用于分类或集群的嵌入，您需要<a href="https://www.elastic.co/docs/api/doc/elasticsearch-serverless/operation/operation-inference-put-jinaai"><u>创建推理端点并使用 </u></a><u><code>jinaai</code></u><a href="https://www.elastic.co/docs/api/doc/elasticsearch-serverless/operation/operation-inference-put-jinaai"><u> 服务</u></a>。</p><p>对于查询，请使用如下示例中的查询构建器。将 <code>inference_id</code> 的值替换为 <code>.jina-embeddings-v5-omni-nano</code>，即可使用 <code>nano</code> 模型，而不是 <code>small</code> 模型。</p>POST my-index/_search
{
  "knn": {
    "field": "dense-vector-field",
    "k": 10,
    "num_candidates": 100,
    "query_vector_builder": {
      "embedding": {
        "inference_id": ".jina-embeddings-v5-omni-small",
        "input": {
          "type": "image",
          "format": "base64",
          "value": "data:image/jpeg;base64,..."
        }
      }
    }
  }
}<p>有关更多信息，请参阅<a href="https://www.elastic.co/docs/reference/query-languages/query-dsl/query-dsl-knn-query#knn-query-builder-embedding">查询生成器文档</a>。</p><p>如要通过 <code>jina-embeddings-v5-omni</code> 使用 BBQ，请按照 <a href="https://www.elastic.co/docs/reference/elasticsearch/mapping-reference/bbq">BBQ 索引的说明操作</a>。</p><h2>更多信息</h2><p>如需有关 <code>jina-embeddings-v5-omni</code> 的更多信息，请参阅模型的<a href="https://arxiv.org/html/2605.08384v2">技术报告</a>及 <a href="https://jina.ai/models/">Jina AI 网站</a>上的页面。<a href="https://huggingface.co/collections/jinaai/jina-embeddings-v5-omni">Hugging Face 上的 jina-embeddings-v5-omni 系列页面</a>还包含下载和本地运行这些模型的技术信息和说明。<code>jina-embeddings-v5-omni</code> 模型可以在 <a href="https://creativecommons.org/licenses/by-nc/4.0/deed.en">CC-BY-NC-4.0</a> 许可下下载，因此您可以自由试用，但如需商业用途，请联系 Elastic 销售人员。</p>]]></content:encoded>
    <link>https://www.elastic.co/search-labs/blog/jina-embeddings-v5-omni-all-media-one-index</link>
    <guid isPermaLink="true">https://www.elastic.co/search-labs/blog/jina-embeddings-v5-omni-all-media-one-index</guid>
    <category><![CDATA[Jina AI]]></category>
    <dc:creator><![CDATA[Scott Martens]]></dc:creator>
    <enclosure url="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt61bf5ce9de247ac5/6a17e89a7b54f9f4108b390f/b51e488ba5b90bec77f75af0b9cb4f0e25e20b91-1130x635.png" length="0" type="image/png"/>
    <pubDate>Mon, 11 May 2026 00:00:00 GMT</pubDate>
  </item>
  <item>
    <title><![CDATA[jina-embeddings-v5-text：用于搜索和智能应用的紧凑且最先进的文本嵌入]]></title>
    <description><![CDATA[介绍 jina-embeddings-v5-text 模型，包括 jina-embeddings-v5-text-small 和 jina-embeddings-v5-text-nano，并解释如何通过 Elastic 推理服务 (EIS) 使用这些多语言嵌入模型。]]></description>
    <content:encoded><![CDATA[<p>Jina AI 和 Elastic 正在发布 <code>jina-embeddings-v5-text</code>，这是一系列新的、高性能、紧凑的文本嵌入模型，在所有主要任务类型中，其性能在同等规模的模型中处于最先进水平。</p><p>该系列包括两个型号：</p><ul><li><p><code>jina-embeddings-v5-text-small</code></p></li><li><p><code>jina-embeddings-v5-text-nano</code></p></li></ul><p>这些模型是创新的嵌入模型新训练方法的成功结果。它们的性能优于规模是其数倍的模型，节省了内存和计算资源，并更快地响应请求。</p><p><code>jina-embeddings-v5-text-small</code> 模型拥有 6.77 亿个参数，支持 32,768 个令牌的输入上下文窗口，并默认生成 1,024 维的嵌入。</p><p><code>jina-embeddings-v5-text-nano</code> 其大小约为同类产品的三分之一，拥有 2.39 亿个参数和 8,192 个令牌的输入上下文窗口，并生成 768 维的嵌入。</p><p>型号名称</p><p>总大小</p><p>输入上下文窗口大小</p><p>嵌入大小</p><p>jina-v5-text-small</p><p>677M 参数</p><p>32,768 个令牌</p><p>1024 维度</p><p>jina-v5-text-nano</p><p>239M 参数</p><p>8,192 个令牌</p><p>768 维度</p><p>这两个模型在整体 MMTEB（<a href="https://huggingface.co/spaces/mteb/leaderboard">多语言 MTEB</a>）基准性能方面是同类中最好的。在参数量少于 5 亿的模型中，<code>jina-embeddings-v5-text-nano</code> 表现最佳，尽管其参数量不足 2.5 亿，而 <code>jina-embeddings-v5-text-small</code> 模型是参数量少于 7.5 亿的多语言嵌入模型中的领先者。</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltb2f2be8618f5e240/6a17dbb83e9e45b7f3ba1344/d97126285fa196c3045b1913b7754e4b186c1e4c-1300x1100.png" alt="jina-embeddings-v5-text MMTEB 分数" /><p>这些模型可通过 Elastic 推断服务 (EIS)、在线 API 获得，并支持本地托管。有关如何访问 <code>jina-embeddings-v5-text</code> 模型的说明，请参阅以下“<strong>入门</strong>”部分。</p><p>嵌入模型和语义索引显著提高了搜索算法的准确性，但在涉及语义相似性和意义提取的任务中也有各种其他用途，例如：</p><ul><li><p>查找重复文本。</p></li><li><p>识别释义和翻译。</p></li><li><p>发现主题。</p></li><li><p>推荐引擎。</p></li><li><p>情感和意图分析。</p></li><li><p>垃圾邮件过滤。</p></li><li><p>还有更多。</p></li></ul><h2><strong>功能</strong></h2><p>这个新型号系列具有多项旨在提高相关性和降低成本的功能。</p><h3>任务优化</h3><p>我们针对四种广泛的任务类型优化了 <code>jina-embeddings-v5-text</code> 模型：</p><p>任务</p><p>示例用例</p><p>检索</p><p>使用自然语言查询进行搜索，并从文档集合中检索出最相关的匹配项。</p><p>文本匹配</p><p>语义相似性、去重、释义与翻译对齐等。</p><p>聚类</p><p>发现主题，自动组织文件集合。</p><p>分类</p><p>文档分类、情感和意图检测、类似任务。</p><p>针对一项任务进行优化通常意味着必须在另一项任务上做出妥协，因此大多数嵌入模型仅在某一种任务上具有竞争力。但 <code>jina-embeddings-v5-text</code> 模型能够通过训练特定任务的<a href="https://arxiv.org/abs/2106.09685">低秩适配 (LoRA) 适配器</a>在所有四个领域实现专业化，而不会相互影响。</p><p>LoRA 适配器是一种用于 AI 模型的插件，它可以显著改变模型的行为，同时仅略微增加模型的总体大小。与为每个任务都配备一个拥有数亿参数的完整模型不同，<code>jina-embeddings-v5-text</code> 模型系列允许您仅使用一个带有紧凑型 LoRa 适配器的模型来完成每项任务。这节省了内存、存储空间和推理成本。</p><h3>截断嵌入</h3><p>我们使用<a href="https://arxiv.org/abs/2205.13147">套娃式表征学习</a>对 <code>jina-embeddings-v5-text</code> 模型进行了训练，这种方法能让您在几乎不影响嵌入质量的情况下将其压缩到更小的尺寸。</p><p>默认情况下，<code>jina-embeddings-v5-text-small</code> 会生成 1024 维嵌入向量，每个向量由 16 位数字表示，使每个嵌入大小为 2KB。对于大量文档集合而言，这可能需要存储大量数据，而在充满嵌入向量的向量数据库中进行搜索，其复杂度与数据库的大小以及每个存储向量的维度数都成正比。</p><p>但您可以将嵌入的大小减半（丢弃 1,024 维度中的 512 维），这样占用的空间减半，而搜索速度将翻倍。这会对性能产生影响。丢弃信息会降低精确度。但如下图所示，即使去掉一半的嵌入，性能也只是略有下降：</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt8deea6ee69a6b77d/6a17dbba0b0bed2217dd347e/f11969682c81bcf22b5b29a6204ba6ec40471b3d-900x700.png" alt="jina-embeddings-v5-text-small 和 jina-embeddings-v5-text-nano 嵌入尺寸" /><p>只要您的嵌入至少有 256 维，精确度损失就会相当小。然而，如果低于这一水平，相关性和准确性就会迅速下降。</p><p>通过这种截断嵌入方法，用户可以在准确性和计算成本之间自行权衡。它为您提供了从搜索 AI 中大幅提高效率和节约成本的工具。</p><h3>稳健量化</h3><p><em>量化</em>是另一种缩小嵌入尺寸的方法。量化不是丢弃嵌入中的部分数据，而是降低嵌入中数字的精度。<code>jina-embeddings-v5-text</code> 模型以 16 位数字生成嵌入，但我们可以对这些数字进行四舍五入，从而降低其精度和存储所需的位数。在最极端的情况下，我们可以将每个数字缩减为一位（0 或 1），将 <code>jina-embeddings-v5-text</code> 的默认 1024 维嵌入从 2 千字节压缩到 128 字节，仅通过二进制量化就实现了 94% 的压缩率。这与截断一样，能大幅节省内存和计算成本。然而，和截断一样，量化也会使嵌入的准确性降低。</p><p>我们已训练了 <code>jina-embeddings-v5-text</code> 模型，通过将精度损失降至最低，使这些模型与 <a href="https://www.elastic.co/cn/elasticsearch">Elasticsearch</a> 的<a href="https://www.elastic.co/docs/reference/elasticsearch/mapping-reference/bbq">更优的二进制量化</a>一起工作。对这些模型的二值化嵌入进行的基准测试表明，其性能几乎与未二值化的等效模型相当。请参阅<a href="https://arxiv.org/abs/2602.15547">技术报告</a>，以获取有关二值化性能的详细消融研究。</p><h3>多语言性能</h3><p>许多嵌入模型是多语言的，因为它们已在包含大量语言的材料上进行了训练。但这并不意味着它们在所有支持的语言中都有同样出色的表现。</p><p>我们在 MMTEB 多语言基准测试中确定了 211 种语言，并将它们区分开来，以便能够逐个语言地将我们的模型与类似模型进行比较。下图以热力图的形式总结了我们的结果。每个补丁都是一种语言（通过 ISO-639 编码识别），颜色越绿，表明该模型的表现与同类模型的平均表现相比越好：</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltee08033102f46c4f/6a17dbbc420229503229f4c8/852ac5d0f1977bb0c1124d87f8863a9bb94eb7da-1600x765.png" alt="jina-embeddings-v5-text-nano 和 jina-embeddings-v5-text-small 语言在 MMTEB 多语言基准测试中的表现" /><p>虽然不同语言的准确性各不相同，但 <code>jina-embeddings-v5-text</code> 模型在世界大多数语言中都处于领先或接近领先地位。</p><p>有关多语言性能的详细信息，请参阅 <a href="https://arxiv.org/abs/2602.15547"><code>jina-embeddings-v5-text</code></a> <a href="https://arxiv.org/abs/2602.15547">技术报告</a>。</p><h2><strong>Elastic 中的 Jina：用于搜索的最先进的原生 AI</strong></h2><p>借助 EIS 上的 <code>jina-embeddings-v5-text</code> 模型，您可以在 <a href="https://www.elastic.co/cn/elasticsearch">Elasticsearch</a> 中原生运行高性能多语言嵌入模型，并享受完全托管、GPU 加速的推理服务，而无需配置或扩展基础设施。<code>jina-embeddings-v5-text</code> 模型通过采用最新的 AI 技术，以紧凑的多语言模型扩展了不断增长的 EIS 模型目录。这些模型在信息检索和标准数据分析基准方面拥有最先进的性能，并提供了无与伦比的全球多语言支持。</p><p>两种模型的大小相差很大，用户可以根据自己的应用需求和预算来选择最合适的模型。此外，<code>jina-embeddings-v5-text </code> 模型拥有强大的嵌入功能，即使截断为较小尺寸或量化为较低精度时仍能保持性能，从而为进一步节省存储和计算成本以及处理延迟提供了机会。</p><p>借助 <code>jina-embeddings-v5-text</code> 系列、Jina Reranker 以及 Elastic 的快速向量和 BM25 搜索，用户现在可以使用 Elastic 提供的端到端、最先进的<a href="https://www.elastic.co/docs/solutions/search/hybrid-search">混合搜索</a>功能。当您需要最相关的结果时，无论是用于检索增强生成 (RAG) 管道、搜索应用程序还是数据分析，Elastic 与 Jina 搜索 AI 模型都能提供可靠且经济高效的优质服务。</p><h2><strong>开始使用</strong></h2><p><code>jina-embeddings-v5-text</code> 模型已完全集成到 <a href="https://www.elastic.co/docs/explore-analyze/elastic-inference/eis">EIS</a> 中，您可以在创建索引时将 <strong><code>type</code></strong>字段设置为<strong><code>semantic_text</code></strong>，并在 <code>inference_id</code> 字段中指定模型（<code>jina-embeddings-v5-text-small</code> 或<code>jina-embeddings-v5-text-nano</code>），如本示例所示：</p>PUT multilingual-semantic-index
{
  "mappings": {
    "properties": {
      "content": {
        "type": "semantic_text",
        "inference_id": ".jina-embeddings-v5-text-small"
      }
    }
  }
}

# Ingest data about France
POST multilingual-semantic-index/_doc
{
  "content": "The capital of France is Paris"}

GET multilingual-semantic-index/_search
{
  "query": {
    "semantic": {
      "field": "content",
      "query": "What is the French capital?"
    }
  }
}<p><a href="https://www.elastic.co/cn/elasticsearch">Elasticsearch</a> 在索引和检索过程中会自动选择合适的 LoRA 适配器。嵌入维度（请参阅上文“<strong>截断嵌入</strong>”部分）可以在<a href="https://www.elastic.co/docs/api/doc/elasticsearch/operation/operation-inference-put">创建自定义推理端点</a>时设置。</p><p>有关使用 <strong><code>jina-embeddings-v5-text</code></strong>模型的更多信息，请参阅 <a href="https://www.elastic.co/docs/reference/elasticsearch/mapping-reference/dense-vector">Elasticsearch 文档</a>。</p><h2><strong>更多信息</strong></h2><p>要了解有关 <code>jina-embeddings-v5-text</code> 模型的更多信息，请阅读 <a href="https://jina.ai/news/jina-embeddings-v5-text-distilling-4b-quality-into-sub-1b-multilingual-embeddings/">Jina AI 博客上的发行说明</a>和<a href="https://arxiv.org/abs/2602.15547">技术报告</a>，其中包含有关性能和 Jina AI 创新的新训练程序的更详细技术信息。有关在本地下载和运行这些模型的信息，请访问 Hugging Face 上的<a href="https://huggingface.co/collections/jinaai/jina-embeddings-v5-text"><code>jina-embeddings-v5-text</code></a> <a href="https://huggingface.co/collections/jinaai/jina-embeddings-v5-text">集合页面</a>。</p><p>Jina AI 模型在 <a href="https://spdx.org/licenses/CC-BY-NC-4.0">CC-BY-NC-4.0 许可证</a>下可用，因此您可以免费下载并试用它们，但如需用于商业用途，请联系 <a href="https://www.elastic.co/contact?pg=global&amp;plcmt=nav&amp;cta=205352">Elastic 销售人员</a>。</p>]]></content:encoded>
    <link>https://www.elastic.co/search-labs/blog/jina-embeddings-v5-text</link>
    <guid isPermaLink="true">https://www.elastic.co/search-labs/blog/jina-embeddings-v5-text</guid>
    <category><![CDATA[Jina AI]]></category>
    <dc:creator><![CDATA[Scott Martens,Sofia Vasileva]]></dc:creator>
    <enclosure url="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltfd81be89ffe5b036/6a17dbbd445de9b55e4cffd1/e98dd30ab925b4bb32830228d71a1a51d02a0917-1600x840.png" length="0" type="image/png"/>
    <pubDate>Mon, 23 Feb 2026 00:00:00 GMT</pubDate>
  </item>
  </channel>
</rss>