Blog

No local em menos de 5 minutos: modelos de embedding Jina agora disponíveis para implantação no local

Todos os 28 modelos do Jina AI, incluindo rerankers, como containers do Docker prontos para implantação, com zero telemetria e sem servidor de licença. Compatível diretamente com as APIs da OpenAI, Cohere, Voyage AI e Elastic Inference Service.

Todos os 28 modelos de embedding e reclassificação do Jina AI agora são enviados como containers do Docker totalmente offline para implantação no local, incluindo jina-embeddings-v5-omni e jina-reranker-v3. Baixe um, transfira-o para um sistema air-gapped ou com firewall no local, e a inferência local estará em execução em menos de cinco minutos. Os containers são totalmente autocontidos e não fazem conexões externas. Não há chamadas para a Hugging Face nem para nenhum registro de modelos. Também não há servidor de licença, telemetria nem endpoints de logging. Para setores regulamentados, requisitos de soberania de dados ou ambientes em que o acesso à internet é instável ou simplesmente indisponível, isso elimina a dependência de serviços de IA de terceiros. O Jina On-Prem é compatível com os esquemas de API do Elastic Inference Service (EIS), da OpenAI, da Cohere, da Voyage AI e do Gemini, para que as aplicações existentes funcionem sem alterações de código.

Os modelos de IA mais poderosos são executados em instalações remotas na nuvem com acesso por meio de uma API web, o que significa que você precisa confiar no seu provedor de serviços de IA para segurança, disponibilidade do serviço e preços estáveis. Você não consegue alinhar facilmente demandas razoáveis de confiabilidade, privacidade, custos gerenciáveis e boa governança de dados com o uso de IA cada vez mais poderoso, sofisticado e intensivo em recursos.

Regulamentações governamentais, decisões judiciais e considerações comerciais feitas no interesse de terceiros recentemente resultaram na restrição do acesso a serviços específicos. E mesmo que você possa alternar para outros serviços, os modelos de IA não são componentes que podem simplesmente ser trocados sempre que você quiser. Aplicações que usam embeddings semânticos dependem de ter acesso aos mesmos modelos no momento da consulta e no momento da ingestão de dados. Perder o acesso ao seu modelo de embedding significa que seu sistema de busca para completamente.

Os modelos de precificação de IA agravam esse risco. Divulgações financeiras recentes de grandes fornecedores de IA dão aos clientes bons motivos para se preocuparem com potenciais aumentos de preços. A dependência de produtos com custos imprevisíveis adiciona mais risco a investimentos em IA que exigem uso intensivo de capital e podem não produzir retornos claros.

O Jina On-Prem é a resposta da Elastic para esses desafios.

Quem precisa de IA no local?

A hospedagem local e o controle direto sobre seus modelos de IA são compatíveis com uma variedade de demandas técnicas, requisitos do setor e interesses de negócios.

A instalação local reduz o que você paga aos seus provedores de serviços de IA, mas transfere o custo de hardware e de acesso confiável para a sua organização. Dependendo do seu volume de uso, pode simplesmente ser mais barato. Mas há outras razões urgentes para considerar a execução da sua própria IA. Se algum dos problemas descritos abaixo afetar a sua empresa, considere uma solução de IA local como o Jina On-Prem. Esta lista não é exaustiva.

Caso de uso

Por que no local

Exemplo

Air-gapped / alta segurança

Sem transmissão de dados de saída; isolamento completo de rede

Defesa, inteligência, pesquisas classificadas

Conformidade regulatória

Soberania de dados; sem transmissão transfronteiriça ou exposição a terceiros

Saúde (Health Insurance Portability and Accountability Act [HIPAA]), finanças, empresas da UE (Regulamento Geral de Proteção de Dados [GDPR])

Crítico para a latência

Zero dependência de rede; nenhuma tolerância a falhas de conexão

Robótica, computação de borda, veículos, navios

Previsibilidade de custo

Custo fixo de infraestrutura vs. preço por token com taxas futuras incertas

Cargas de trabalho de inferência contínua de alto volume

Redução de passivos

Sem exposição de dados a terceiros; mantém o privilégio legal e o dever de cuidado

Escritórios de advocacia, agências governamentais

Por que sistemas air-gapped e com firewall precisam de IA no local

Sistemas air-gapped e com firewall não podem usar APIs de IA externas. O Jina On-Prem é executado inteiramente em sua infraestrutura, sem conexões de saída.

Para organizações que gerenciam dados especialmente sensíveis, as considerações de segurança e privacidade são fundamentais. Pouco adianta investir na proteção dos seus dados sensíveis se você os entrega prontamente a terceiros remotos que podem ter segurança insuficiente ou estar sujeitos às exigências de um governo estrangeiro.

Funcionários de organizações que lidam com dados sensíveis costumam receber algum treinamento sobre o tratamento seguro de dados, mas isso não é muito eficaz quando todos eles têm navegadores web que podem estar abertos em qualquer página da internet enquanto lidam com esses dados. O isolamento é a medida de segurança mais eficaz disponível, seja por meio de air-gapping ou de firewalls muito restritivos, mas isso dificulta o uso de serviços externos de qualquer tipo.

IA no local para sistemas sensíveis à latência e de alta disponibilidade

O software como serviço e a computação em nuvem representam um meio-termo entre o custo de oferecer serviços altamente acessíveis e confiáveis em seus próprios computadores e a terceirização do problema para outra pessoa. Mas eles vêm acompanhados de latência variável, interrupções e uma perda total de controle quando algo dá errado. Os serviços de IA não são exceção. Se o seu sistema de busca ficar offline quando você não puder acessar seu modelo de embedding, isso pode não parecer mais um bom meio-termo.

Além disso, confiar em IA externa sempre envolverá riscos que você não pode prever ou gerenciar facilmente. O acesso à internet e a latência da rede podem se deteriorar sem aviso prévio, como resultado de eventos políticos, mau tempo ou navios arrastando suas âncoras sobre cabos de fibra óptica submarinos. Os governos podem, e recentemente o fizeram, usar proibições de exportação para bloquear de repente o acesso a modelos de IA. Às vezes, os provedores de serviços de IA descontinuam modelos para induzir você a mudar para outros mais recentes. A flexibilidade e os custos gerenciados dos serviços externos precisam ser ponderados em relação aos riscos de dependência.

IA no local para conformidade com o GDPR, a HIPAA e a soberania dos dados

Organizações que coletam dados pessoais estão sujeitas a regulamentações cada vez mais rigorosas, que geralmente diferem entre as jurisdições e podem ter requisitos contraditórios. Notavelmente, as regras da HIPAA impõem proteções de dados muito rigorosas aos provedores de saúde norte-americanos, e leis gerais de proteção de dados fortes no Canadá, na União Europeia e em muitas jurisdições asiáticas exigem que todas as empresas que lidam com informações pessoais o façam de forma segura e limitem a transmissão desses dados a outras partes ou outras jurisdições. Essas regras podem até impor obrigações a entidades estrangeiras se elas tiverem clientes nessas jurisdições. As instituições financeiras estão frequentemente sujeitas a regras ainda mais rigorosas e possuem a mesma responsabilidade direta pela segurança da informação que têm para se protegerem contra outras formas de atividade criminosa.

A conformidade regulatória pode ser incompatível com serviços de IA de terceiros, especialmente se usá-los envolver a transmissão transfronteiriça de dados.

Além disso, eventos recentes mostram que regras que restringem a localização física dos armazenamentos de dados podem não ser uma fonte confiável de proteção quando operadores internacionais de nuvem estão sujeitos à pressão de governos estrangeiros. Leis locais podem entrar em conflito entre jurisdições, exigindo o armazenamento e processamento local de dados e tornando impossível o uso de serviços de terceiros. Em alguns casos, a única solução é internalizar todas as partes dos seus processos, incluindo seus sistemas de IA.

Riscos de responsabilidade por IA na transmissão de dados de terceiros

Leis de proteção de dados e deveres de cuidado reconhecidos em relação a dados sensíveis rotineiramente têm implicações de responsabilidade, às vezes muito severas. Você pode ser responsabilizado pelo tratamento dos seus dados por provedores de serviços terceirizados. Embora os tribunais e procedimentos legais possam fornecer algumas proteções retrospectivas contra provedores de serviços inseguros, esses recursos não estão disponíveis nem são geralmente eficazes contra agentes de segurança nacional, autoridades policiais ou hackers criminosos.

Para os governos, já houve casos em que provedores de serviços em nuvem internacionais liberaram informações estatais sensíveis para agentes estrangeiros.

Mas mesmo que você não se preocupe com governos estrangeiros ou hackers, e mesmo que seus provedores de serviços de IA externos sejam seguros, o simples fato de serem externos pode criar responsabilidades.

Por exemplo, na maioria das jurisdições, as comunicações dos advogados com seus clientes contam com proteções jurídicas especiais, e os escritórios de advocacia têm responsabilidades rígidas ao gravar ou armazenar essas informações. Nos Estados Unidos, esse "sigilo advogado-cliente" é tão famoso que é central nos enredos de filmes e séries de TV. Mas uma das maneiras pelas quais esse privilégio pode ser perdido é ao comunicar informações a alguém que não seja protegido por ele, e desenvolvimentos recentes sugerem que provedores externos de serviços de IA podem se enquadrar nisso.

É possível, pelo menos nos Estados Unidos, que o simples uso de serviços de IA de terceiros por meio de uma API de internet, como modelos de incorporação que oferecem serviços de indexação, viole regras críticas de confidencialidade. Um escritório de advocacia pode ser processado, punido disciplinarmente ou ter o registro cassado só por usar software hospedado externamente, mesmo que nenhuma violação de segurança ocorra.

IA no local para sistemas offline, de borda e fisicamente isolados

Os sistemas de computador não são isolados apenas por motivos de segurança. Por exemplo, veículos em movimento não podem depender do acesso à internet para nenhuma função essencial. Navios e aeronaves têm sistemas de computador de bordo muito extensos que precisam funcionar sem conexões com a internet e, portanto, não podem usar serviços de IA externos. Plataformas offshore, instalações remotas em áreas selvagens, serviços de computador no Ártico, na Antártida e em pequenas ilhas sem conexões físicas adequadas com redes globais são todos exemplos de instalações que se beneficiam ao hospedar localmente todos os serviços de que precisam. À medida que o papel da IA na computação empresarial cresce, torna-se mais importante abordar essas limitações.

Aplicações emergentes de IA em sistemas físicos (robótica e outros casos de uso delimitados espacialmente ou focados no mundo externo, como sistemas de gestão de logística ou até mesmo caixas de supermercado) podem estar conectadas à internet global, mas não têm tolerância a falhas de conexão ou picos de latência. Se elas dependem de um sistema de IA para operar, esse sistema de IA precisa ser o mais local e confiável possível.

Quem não precisa de IA em ambiente local?

Serviços de software remotos e IA fora do local têm benefícios. Executar modelos de IA pode exigir processadores caros, de alto consumo de energia e com vida útil notoriamente curta. O acesso a hardware de alta qualidade é particularmente difícil no momento devido a fatores de mercado e choques econômicos externos. Diante das circunstâncias, pode fazer sentido pagar por token para usar uma API externa em vez de arcar com os altos custos de capital da IA local.

APIs externas fazem mais sentido para usuários intermitentes. Se você usa modelos de IA principalmente para processar dados em lote para análise, em vez de executar um sistema de busca que precise ficar online o tempo todo, faz pouco sentido investir em hardware de alto custo de capital e instalações locais.

Além disso, quando o seu processamento de dados já é baseado na nuvem, por exemplo, um website de e-commerce hospedado na nuvem por motivos de confiabilidade e acessibilidade, usar serviços de IA localizados na mesma infraestrutura de nuvem pode proporcionar um melhor custo-benefício do que introduzir a sua própria implantação de modelo de IA licenciado. Você já depende do seu provedor de serviços em nuvem, então depender dos serviços de IA dele não adiciona muito risco.

Se o seu caso de uso se encaixa nessa descrição, os modelos Jina AI estão disponíveis no EIS, no AWS Marketplace e no Google Cloud Platform especificamente para atender às suas necessidades.

A tabela abaixo resume os principais fatores. Sua resposta depende dos seus dados, da sua infraestrutura e do seu padrão de uso.

Fator

No local preferido

API da Nuvem Preferida

Padrão de uso

Inferência contínua ou de alto volume

Processamento intermitente ou em lote

Sensibilidade dos dados

Regulado, soberano ou confidencial

Sem restrições transfronteiriças ou de terceiros

Ambiente de rede

Air-gapped, com firewall ou instáveis

Internet estável, sempre ativa

Infraestrutura existente

Possuir ou poder adquirir hardware de GPU

Já hospedado na nuvem com IA colocalizada

Modelo de custo

Hardware fixo + licença; previsível em escala

Por token; menor custo inicial, variável a longo prazo

Tolerância a latência

Nenhum (robótica, edge, tempo real)

A variabilidade da rede é aceitável

Responsabilidade operacional

Sua equipe gerencia o hardware e a disponibilidade

O provedor gerencia o hardware e as atualizações; você gerencia a integração

Você precisa considerar os custos e benefícios à luz de suas circunstâncias específicas e casos de uso, levando em consideração os problemas destacados na seção anterior que se aplicam a você. A análise de custo-benefício sem dúvida mudará ao longo do tempo. Não podemos prever o futuro do setor de IA ou os preços de hardware, mesmo no curto prazo.

Apresentando Jina no Local

Para usuários que podem se beneficiar de serviços de IA locais, estamos apresentando o Jina On-Prem, um conjunto de instalação totalmente independente para os modelos de alto desempenho da Jina AI.

Os modelos do Jina AI correspondem à precisão de modelos de embedding muitas vezes maiores que eles, reduzindo custos computacionais, uso de memória e requisitos de hardware. Isso os torna uma escolha ideal para usuários que desejam ou precisam manter sua IA no local. Licenças comerciais estão disponíveis com solutions escaláveis e de preços proporcionais para casos de uso de todos os tamanhos.

Massive Multilingual Text Embedding Benchmark (MMTEB) leaderboard, as of July 8, 2026.

A quais esquemas de API o Jina no local oferece suporte?

  • Disponível como uma coleção completa de dependências para instalação local ou como um container do Docker que você pode instalar e executar em minutos.

  • Instalações Jina no local não fazem chamadas para sistemas externos.

    • Nenhuma chamada ao Hugging Face Hub ou a qualquer registro de modelo (HF_HUB_OFFLINE=1 e TRANSFORMERS_OFFLINE=1 estão embutidos).

    • Não há servidor de licença.

    • Não há endpoints de telemetria ou logging.

  • Oferece suporte a hardware de CPU e GPU, com detecção automática de GPU.

  • Todos os 28 modelos Jina AI disponíveis, incluindo os mais recentes modelos de embedding multimodal jina-embeddings-v5-omni e o jina-reranker-v3.

  • Acesso via esquemas padrão de API de IA: Jina API, OpenAI, Cohere, Voyage AI e Gemini. O Jina On-Prem é uma solução de substituição direta para aplicações construídas com base nesses esquemas.

  • Substituição direta para modelos servidos pelo EIS. O Jina On-Prem se integra diretamente com implantações da Elastic em ambientes isolados.

Requisitos de hardware para modelos Jina AI no local

Os requisitos de hardware variam para diferentes modelos Jina. A tabela abaixo mostra as recomendações para os modelos mais recentes usando configurações de GPU. Você não precisa de nada mais potente do que uma GPU NVIDIA L4, embora uma A100 seja recomendada para os modelos de embedding v5. Nosso modelo de embedding mais recente exige atualmente no mínimo 8 GB de VRAM.

Modelo

VRAM mínima

GPU Recomendada

jina-embeddings-v5-text-nano

2 GB

T4 / L4

jina-embeddings-v5-text-small

3 GB

L4 / A10G

jina-embeddings-v5-omni-small

8 GB

L4 / A10G / A100

jina-reranker-v3

3 GB

L4

jina-clip-v2

4 GB

L4

jina-code-embeddings-1.5b

4 GB

L4

ReaderLM-v2

4 GB

L4

Se você usar mais de um modelo por vez, os requisitos de VRAM aumentarão. Consulte a página de dimensionamento e hardware para obter mais informações.

Como Instalar o Jina no Local com o Docker

A maneira mais rápida de começar é instalar o Docker (se você ainda não o fez) e seguir as instruções na página do Guia rápido do Jina no local.

Há containers do Docker pré-compostos para todos os 28 modelos Jina. Baixe um e transfira-o para o seu destino de instalação, e você poderá ter os modelos Jina AI em execução em menos de cinco minutos.

Para compilações multimodais ou personalizadas, ou para baixar o conjunto completo de dependências para instalação fora de um container, siga as etapas descritas no guia de empacotamento.

You’ll need a GitHub account and access token to download Jina On-Prem. To create a free account, go to https://github.com/signup. To generate or manage your access tokens, follow the instructions in the GitHub documentation.

Sua instalação Jina no local oferece suporte a todas as funcionalidades da Jina API e do EIS e à geração de embeddings por meio das APIs da OpenAI, Cohere, Voyage AI e Gemini, de modo que ela pode ser integrada a aplicativos preexistentes usando interfaces padrão. Consulte a documentação da API para obter mais informações.

Os modelos Jina, incluindo os modelos instalados com o Jina no local, estão disponíveis sob vários termos de licenciamento, sendo que os modelos mais recentes são gratuitos para uso não comercial sob uma licença CC BY-NC 4.0. Para licenciar o Jina no local para uso comercial, entre em contato com as vendas da Elastic.

Conteúdo relacionado

Um índice, todas as mídias: Apresentando jina-embeddings-v5-omni

Scott Martens

Jina embeddings v3 agora disponível no Gemini Enterprise Agent Platform Model Garden

Sa Zhang

Clustering não supervisionado de documentos com Elasticsearch + embeddings Jina

Matthew Adams

jina-embeddings-v5-text: Incorporações de texto compactas e de última geração para busca e aplicações inteligentes

Scott Martens

Uma introdução aos modelos Jina, sua funcionalidade e seus usos no Elasticsearch

Scott Martens

Pronto para criar buscas de última geração?

Uma pesquisa suficientemente avançada não se consegue apenas com o esforço de uma só pessoa. O Elasticsearch é impulsionado por cientistas de dados, especialistas em operações de aprendizado de máquina, engenheiros e muitos outros que são tão apaixonados por buscas quanto você. Vamos nos conectar e trabalhar juntos para construir a experiência de busca mágica que lhe trará os resultados desejados.

Experimente você mesmo(a)