博客

不到 5 分钟即可完成本地部署:Jina 嵌入模型现已支持本地部署

所有 28 个 Jina AI 模型(包括重排序器)均作为可随时部署的 Docker 容器提供,零遥测且无许可证服务器。即插即用兼容 OpenAI、Cohere、Voyage AI 和 Elastic 推理服务 API。

所有 28 个 Jina AI 嵌入和重排序模型现已作为完全离线的 Docker 容器提供,用于本地部署,其中包括 jina-embeddings-v5-omnijina-reranker-v3。下载一个,将其传输到本地隔离的或受防火墙保护的系统中,本地推理即可在五分钟内运行起来。这些容器是完全独立的,不会建立任何外部连接。不会对 Hugging Face 或任何模型注册表进行调用。同时也没有许可证服务器、遥测或日志记录终端。对于受监管行业、有数据主权要求或互联网访问不可靠或根本无法使用的环境,这消除了对第三方 AI 服务的依赖。Jina 本地部署支持 Elastic 推理服务 (EIS)、OpenAI、Cohere、Voyage AI 和 Gemini API 模式,因此现有应用程序无需修改代码即可运行。

最强大的 AI 模型在远程云安装上运行,通过 Web API 进行访问,这意味着您必须信任您的 AI 服务提供商的安全、服务可用性和稳定的价格。您很难兼顾对可靠性、隐私、可控成本和良好数据治理的合理需求,与日益强大、复杂且资源密集型的 AI 使用。

政府监管、法院裁决以及出于他人利益考虑而做出的商业决策,最近都导致对特定服务的访问受限。而且,即使您可以切换到其他服务,AI 模型也不是那种只要您想换就能随时替换的组件。使用语义嵌入的应用程序依赖于在查询时和数据摄取时能够访问相同的模型。无法访问嵌入模型意味着您的搜索系统将陷入瘫痪。

AI 定价模式加剧了这种风险。主要 AI 供应商最近披露的财务信息,让客户有充分理由对潜在的价格上涨感到担忧。依赖成本不可预测的产品,会给可能无法产生明确回报的资本密集型 AI 投资增加更多风险。

Jina 本地部署是 Elastic 应对这些挑战的解决方案。

谁需要本地部署 AI?

对您的 AI 模型进行本地托管和直接控制,支持各种技术需求、行业要求和商业利益。

本地安装可以减少您支付给 AI 服务提供商的费用,但会将硬件和可靠访问的成本转嫁给您的组织。根据您的使用量,它可能确实更便宜。但还有其他紧迫的原因促使您考虑自行运行 AI。如果下面描述的任何问题涉及您的企业,请考虑采用像 Jina 本地部署这样的本地 AI 解决方案。此列表并非详尽无遗。

用例

为什么选择本地部署

示例

隔离/高安全

无出站数据传输;完全网络隔离

国防、情报、机密研究

监管合规性

数据主权;无跨境传输或第三方暴露

医疗保健(《健康保险流通与责任法案》[HIPAA])、金融、欧盟企业(《通用数据保护条例》[GDPR])

延迟关键型

零网络依赖;对连接故障零容忍

机器人技术、边缘计算、车辆、船舶

成本可预测性

固定基础架构成本与按代币定价且未来费率不确定

高容量连续推理工作负载

责任降低

无第三方数据泄露;维护法律特权与注意义务

律师事务所、政府机构

为什么隔离的和受防火墙保护的系统需要本地部署 AI

隔离的和受防火墙保护的系统无法使用外部 AI API。Jina 本地部署完全在您的基础架构内运行,无出站连接。

对于管理特别敏感数据的组织而言,安全和隐私考量至关重要。如果您将敏感数据随意提供给可能缺乏足够安全措施或可能受制于外国政府要求的远程第三方,那么在保护敏感数据方面的投入就毫无意义。

处理敏感数据的组织中的员工通常会接受一些安全数据处理方面的培训,但是当他们在处理数据时,他们的 Web 浏览器可能会打开互联网上的任何页面,因此这种培训效果并不理想。无论是通过隔离网络还是限制极为严格的防火墙,隔离都是最有效的安全措施,但这使得使用任何类型的外部服务都变得困难。

适用于对延迟敏感和高可用性系统的本地部署 AI

软件即服务和云计算代表了一种折衷方案,既能保证在自己的计算机上提供高度便捷、可靠的服务,又能降低将问题外包给其他人的成本。但它们也存在延迟不稳定、服务中断以及出现故障时完全失控等问题。AI 服务也不例外。如果无法访问嵌入模型时搜索系统离线,那么这可能不再是一个好的折衷方案。

此外,依赖外部 AI 始终会带来一些难以预见或管理的风险。由于政治事件、恶劣天气或船舶拖锚压住水下光纤电缆等原因,互联网访问和网络延迟可能会在毫无预警的情况下下降。政府可以且近期已经通过出口禁令突然封锁对 AI 模型的访问。AI 服务提供商有时会撤回模型,以促使您切换到较新的模型。必须在外部服务的灵活性和可控成本与依赖风险之间进行权衡。

满足 GDPR、HIPAA 和数据主权合规要求的本地部署 AI

收集个人数据的组织受到越来越严格的监管,这些监管在不同司法管辖区之间往往有所不同,并且可能存在相互矛盾的要求。值得注意的是,HIPAA 规则对美国医疗保健提供商施加了非常严格的数据保护要求,而加拿大欧盟以及许多亚洲司法管辖区强大的通用数据保护法律则要求所有处理个人信息的企业都必须安全地进行操作,并限制将此类数据传输给其他方或其他司法管辖区。如果外国实体在这些司法管辖区内有任何客户,这些规则甚至可以对其施加义务。金融机构通常会受到更为严格的规则约束,并且对于信息安全承担着与防范其他形式犯罪活动相同的直接责任。

监管合规性可能与第三方 AI 服务不兼容,尤其是在使用这些服务涉及跨境数据传输的情况下。

此外,近期发生的事件表明,当国际云运营商面临外国政府压力时,限制数据存储物理位置的规定可能并非可靠的保护手段。不同司法管辖区之间的本地法律可能会发生冲突,这不仅要求在本地进行数据存储和处理,还可能导致无法使用第三方服务。在某些情况下,唯一的解决方案是将您流程的所有部分(包括您的 AI 系统)都转为内部自主运营。

来自第三方数据传输的 AI 责任风险

数据保护法和公认的对敏感数据的注意义务通常会产生法律责任,有时甚至会产生非常严重的责任。您可能需要对第三方服务提供商处理您数据的行为承担责任。虽然法院和法律程序可能对不安全的服务提供商提供一些追溯保护,但这些补救措施对国家安全机构、执法部门或犯罪黑客来说既不可用,也通常无效。

对于政府而言,已经出现过跨境云服务提供商向外国行为体泄露敏感国家信息的情况。

但即使你不担心外国政府或黑客,而且你的外部 AI 服务提供商本身也是安全的,仅仅是他们是外部人员这一事实就可能造成责任风险。

例如,在大多数司法管辖区,律师与客户之间的沟通享有特殊的法律保护,律师事务所在记录或存储此类信息时承担着严格的责任。在美国,这种“律师与客户交流保密特权”非常著名,甚至成为了电影和电视剧情节的核心。但失去特权的一种途径是与没有特权的人交流信息,而最近的发展表明,外部 AI 服务提供商可能符合失去特权的条件。

至少在美国,仅仅通过互联网 API 使用第三方 AI 服务(例如嵌入提供索引服务的模型)就可能违反关键的保密规则。即使没有发生安全漏洞,律师事务所也可能仅仅因为使用外部托管软件而被起诉、受到处分或被吊销执照。

适用于离线、边缘和物理隔离系统的本地部署 AI

计算机系统隔离不仅仅是出于安全原因。例如,行驶中的车辆不能在任何关键功能上依赖互联网连接。船舶和飞机都拥有非常庞大的机载计算机系统,这些系统必须在没有互联网连接的情况下运行,因此无法使用外部 AI 服务。海上平台、荒野地区的远程设施,以及北极、南极和小岛上缺乏与全球网络充分物理连接的计算机服务,都是受益于在本地托管其所需全部服务的安装实例。随着 AI 在企业计算中的作用日益增强,解决这些局限性变得更加重要。

AI 在物理系统中的新兴应用(机器人技术和其他空间受限或以外部世界为中心的用例,如物流管理系统甚至超市收银台)可能会连接到全球互联网,但它们无法容忍连接故障或延迟峰值。如果它们依赖 AI 系统来运行,该 AI 系统就需要尽可能做到本地化和可靠。

谁不需要本地部署 AI?

远程软件服务和场外 AI 确实具有优势。运行 AI 模型可能需要昂贵且支持大量电力、以寿命极短而闻名的处理器。由于市场因素和外部经济冲击,目前获取高质量硬件尤为困难。在这种情况下,使用外部 API 支付代币费用,而不是承担本地 AI 高昂的资本成本,可能是明智之举。

对于偶尔使用的用户来说,外部 API 是最合理的选择。如果您使用 AI 模型主要是为了批量处理数据以进行分析,而不是运行一个必须时刻在线的搜索系统,那么投资资本密集型硬件和本地安装就没有什么意义。

此外,如果您的数据处理已经基于云,例如,出于可靠性和可访问性的原因,电子商务网站托管在云端,那么使用位于同一云基础架构中的 AI 服务可能比引入您自己的授权 AI 模型部署更具性价比。您已经依赖于云服务提供商,因此依赖其 AI 服务并不会增加太多的风险。

如果您的用例符合此描述,您可以在 EISAWS MarketplaceGoogle Cloud Platform 上获取 Jina AI 模型,以专门满足您的需求。

下表总结了关键因素。您的答案取决于您的数据、基础架构以及使用模式。

因素

首选本地部署

首选云 API

使用模式

连续或高容量推理

间歇性处理或批量处理

数据敏感性

受监管、主权或机密

无跨境或第三方限制

网络环境

隔离、受防火墙保护或不可靠

稳定、始终在线的互联网

现有基础架构

拥有或能够采购 GPU 硬件

已在云端托管,并配备同地部署的 AI

成本模型

固定硬件 + 许可;规模化生产可预测

按代币定价;前期投入较低,长期收益可变

延迟容忍度

无(机器人技术、边缘、实时)

网络波动是可接受的

运营责任

您的团队负责管理硬件和可用性

提供商负责管理硬件和更新;您负责管理集成

您必须根据自身具体情况和用例来考虑成本和收益,同时考虑到前一节中强调的适用于您的问题。成本效益分析无疑会随时间而变化。我们甚至无法预测 AI 行业的未来或硬件价格的短期走势。

推出 Jina 本地部署

对于能够从本地 AI 服务中受益的用户,我们推出了 Jina 本地部署,这是一个完全独立的安装套件,用于 Jina AI 的高性能模型。

Jina AI 的模型准确度可与规模大得多的嵌入式模型相媲美,从而降低了计算成本、内存占用和硬件要求。这使得它们成为希望或需要保持 AI 本地部署的用户的理想选择。针对各种规模的用例提供商业许可以及按比例定价的可扩展解决方案。

Massive Multilingual Text Embedding Benchmark (MMTEB) leaderboard, as of July 8, 2026.

Jina 本地部署支持哪些 API 模式?

  • 可以作为完整的依赖集合进行本地安装,也可以作为 Docker 容器进行安装和运行,几分钟即可完成。

  • Jina 本地部署安装不会调用外部系统。

    • 不会调用 Hugging Face Hub 或任何模型注册表(已内置 HF_HUB_OFFLINE=1 和 TRANSFORMERS_OFFLINE=1)。

    • 没有许可证服务器。

    • 没有遥测或日志记录终端。

  • 支持 CPU 和 GPU 硬件,并支持 GPU 自动检测。

  • 所有 28 个 Jina AI 模型均已提供,包括最新的 jina-embeddings-v5-omni 多模态嵌入模型和 jina-reranker-v3

  • 通过标准 AI API 模式访问:Jina API、OpenAI、Cohere、Voyage AI 和 Gemini。Jina 本地部署是一个即插即用的解决方案,适用于基于这些模式构建的应用程序。

  • 可直接替代 EIS 提供的模型。Jina 本地部署可直接与隔离的 Elastic 部署集成。

Jina AI 本地部署模型的硬件要求

不同的 Jina 模型所需的硬件要求各有不同。下表展示了使用 GPU 设置的最新模型的推荐配置。您不需要比 NVIDIA L4 GPU 更强大的设备,不过对于 v5 嵌入模型,建议使用 A100。我们最新的嵌入模型目前至少需要 8 GB 的 VRAM。

模型

最小 VRAM

推荐 GPU

jina-embeddings-v5-text-nano

2 GB

T4 / L4

jina-embeddings-v5-text-small

3 GB

L4 / A10G

jina-embeddings-v5-omni-small

8 GB

L4 / A10G / A100

jina-reranker-v3

3 GB

L4

jina-clip-v2

4 GB

L4

jina-code-embeddings-1.5b

4 GB

L4

ReaderLM-v2

4 GB

L4

如果同时使用多个模型,则 VRAM 需求将会增加。有关更多信息,请参阅规模和硬件页面

如何使用 Docker 安装 Jina 本地部署

最快的开始方法是安装 Docker(如果您尚未安装),并按照 Jina 本地部署快速入门页面上的说明进行操作。

所有 28 个 Jina 模型均提供预构的 Docker 容器。下载其中一个并将其传输至您的安装目标,即可在不到 5 分钟的时间内运行 Jina AI 模型。

对于多模态或自定义构建,或者要下载在容器外部安装所需的完整依赖集,请按照打包指南中概述的步骤进行操作。

You’ll need a GitHub account and access token to download Jina On-Prem. To create a free account, go to https://github.com/signup. To generate or manage your access tokens, follow the instructions in the GitHub documentation.

您的 Jina 本地部署安装支持所有 Jina API 和 EIS 功能以及通过 OpenAI、Cohere、Voyage AI 和 Gemini API 生成嵌入,因此可以使用标准接口集成到已有应用程序中。有关更多信息,请参阅 API 文档

Jina 模型(包括通过 Jina 本地部署安装的模型)按多种许可条款提供,其中最新的模型可在 CC BY-NC 4.0 许可证下免费用于非商业用途。如需获得 Jina 本地部署的商业许可,请联系 Elastic 销售

相关内容

一个索引,涵盖所有媒体:jina-embeddings-v5-omni 正式发布

Scott Martens

Jina Embeddings v3 现已登陆 Gemini Enterprise Agent Platform Model Garden

Sa Zhang

基于 Elasticsearch + Jina 嵌入的无监督文档集群

Matthew Adams

jina-embeddings-v5-text:用于搜索和智能应用的紧凑且最先进的文本嵌入

Scott Martens

准备好打造最先进的搜索体验了吗?

足够先进的搜索不是一个人的努力就能实现的。Elasticsearch 由数据科学家、ML 操作员、工程师以及更多和您一样对搜索充满热情的人提供支持。让我们联系起来,共同打造神奇的搜索体验,让您获得想要的结果。

亲自试用