<?xml version="1.0" encoding="UTF-8"?>
<rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0">
  <channel>
    <title><![CDATA[Scott Martens - Elasticsearch Labs]]></title>
    <description><![CDATA[Articles and tutorials from the Search team at Elastic]]></description>
    <copyright><![CDATA[© 2026. Elasticsearch B.V. All Rights Reserved]]></copyright>
    <image>
      <title><![CDATA[Scott Martens - Elasticsearch Labs]]></title>
      <url>https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt1121c0bf0e8a6e65/6a88da6340a1841030ef456f/search-labs-thumbnail.png</url>
      <link>https://www.elastic.co/pt/search-labs/author/scott-martens</link>
    </image>
    <link>https://www.elastic.co/pt/search-labs/author/scott-martens</link>
    <atom:link href="https://www.elastic.co/pt/search-labs/rss/author/scott-martens.xml" rel="self" type="application/rss+xml"/>
    <language><![CDATA[pt]]></language>
    <lastBuildDate>Mon, 28 Sep 2026 08:27:45 GMT</lastBuildDate>
  <item>
    <title><![CDATA[No local em menos de 5 minutos: modelos de embedding Jina agora disponíveis para implantação no local]]></title>
    <description><![CDATA[Todos os 28 modelos do Jina AI, incluindo rerankers, como containers do Docker prontos para implantação, com zero telemetria e sem servidor de licença. Compatível diretamente com as APIs da OpenAI, Cohere, Voyage AI e Elastic Inference Service.]]></description>
    <content:encoded><![CDATA[<p>Todos os 28 modelos de embedding e reclassificação do Jina AI agora são enviados como containers do Docker totalmente offline para implantação no local, incluindo <a href="https://www.elastic.co/pt/search-labs/blog/jina-embeddings-v5-omni-all-media-one-index">jina-embeddings-v5-omni</a><a href="https://www.elastic.co/pt/search-labs/blog/jina-embeddings-v5-omni-all-media-one-index"> </a>e <a href="https://www.elastic.co/pt/search-labs/tutorials/jina-tutorial/jina-reranker-v3">jina-reranker-v3</a>. Baixe um, transfira-o para um sistema air-gapped ou com firewall no local, e a inferência local estará em execução em menos de cinco minutos. Os containers são totalmente autocontidos e não fazem conexões externas. Não há chamadas para a Hugging Face nem para nenhum registro de modelos. Também não há servidor de licença, telemetria nem endpoints de logging. Para setores regulamentados, requisitos de soberania de dados ou ambientes em que o acesso à internet é instável ou simplesmente indisponível, isso elimina a dependência de serviços de IA de terceiros. O Jina On-Prem é compatível com os esquemas de API do Elastic Inference Service (EIS), da OpenAI, da Cohere, da Voyage AI e do Gemini, para que as aplicações existentes funcionem sem alterações de código.</p><p>Os modelos de IA mais poderosos são executados em instalações remotas na nuvem com acesso por meio de uma API web, o que significa que você precisa confiar no seu provedor de serviços de IA para segurança, disponibilidade do serviço e preços estáveis. Você não consegue alinhar facilmente demandas razoáveis de confiabilidade, privacidade, custos gerenciáveis e boa governança de dados com o uso de IA cada vez mais poderoso, sofisticado e intensivo em recursos.</p><p>Regulamentações governamentais, decisões judiciais e considerações comerciais feitas no interesse de terceiros recentemente resultaram na restrição do acesso a serviços específicos. E mesmo que você possa alternar para outros serviços, os modelos de IA não são componentes que podem simplesmente ser trocados sempre que você quiser. Aplicações que usam embeddings semânticos dependem de ter acesso aos mesmos modelos no momento da consulta e no momento da ingestão de dados. Perder o acesso ao seu modelo de embedding significa que seu sistema de busca para completamente.</p><p>Os modelos de precificação de IA agravam esse risco. Divulgações financeiras recentes de grandes fornecedores de IA dão aos clientes bons motivos para se preocuparem com potenciais aumentos de preços. A dependência de produtos com custos imprevisíveis adiciona mais risco a investimentos em IA que exigem uso intensivo de capital e podem não produzir retornos claros.</p><p>O Jina On-Prem é a resposta da Elastic para esses desafios.</p><h2>Quem precisa de IA no local?</h2><p>A hospedagem local e o controle direto sobre seus modelos de IA são compatíveis com uma variedade de demandas técnicas, requisitos do setor e interesses de negócios.</p><p>A instalação local reduz o que você paga aos seus provedores de serviços de IA, mas transfere o custo de hardware e de acesso confiável para a sua organização. Dependendo do seu volume de uso, pode simplesmente ser mais barato. Mas há outras razões urgentes para considerar a execução da sua própria IA. Se algum dos problemas descritos abaixo afetar a sua empresa, considere uma solução de IA local como o Jina On-Prem. Esta lista não é exaustiva.</p><p>Caso de uso</p><p>Por que no local</p><p>Exemplo</p><p>Air-gapped / alta segurança</p><p>Sem transmissão de dados de saída; isolamento completo de rede</p><p>Defesa, inteligência, pesquisas classificadas</p><p>Conformidade regulatória</p><p>Soberania de dados; sem transmissão transfronteiriça ou exposição a terceiros</p><p>Saúde (Health Insurance Portability and Accountability Act [HIPAA]), finanças, empresas da UE (Regulamento Geral de Proteção de Dados [GDPR])</p><p>Crítico para a latência</p><p>Zero dependência de rede; nenhuma tolerância a falhas de conexão</p><p>Robótica, computação de borda, veículos, navios</p><p>Previsibilidade de custo</p><p>Custo fixo de infraestrutura vs. preço por token com taxas futuras incertas</p><p>Cargas de trabalho de inferência contínua de alto volume</p><p>Redução de passivos</p><p>Sem exposição de dados a terceiros; mantém o privilégio legal e o dever de cuidado</p><p>Escritórios de advocacia, agências governamentais</p><h3>Por que sistemas air-gapped e com firewall precisam de IA no local</h3><p>Sistemas air-gapped e com firewall não podem usar APIs de IA externas. O Jina On-Prem é executado inteiramente em sua infraestrutura, sem conexões de saída.</p><p>Para organizações que gerenciam dados especialmente sensíveis, as considerações de segurança e privacidade são fundamentais. Pouco adianta investir na proteção dos seus dados sensíveis se você os entrega prontamente a terceiros remotos que podem ter segurança insuficiente ou estar sujeitos às exigências de um governo estrangeiro.</p><p>Funcionários de organizações que lidam com dados sensíveis costumam receber algum treinamento sobre o tratamento seguro de dados, mas isso não é muito eficaz quando todos eles têm navegadores web que podem estar abertos em qualquer página da internet enquanto lidam com esses dados. O isolamento é a medida de segurança mais eficaz disponível, seja por meio de air-gapping ou de firewalls muito restritivos, mas isso dificulta o uso de serviços externos de qualquer tipo.</p><h3>IA no local para sistemas sensíveis à latência e de alta disponibilidade</h3><p>O software como serviço e a computação em nuvem representam um meio-termo entre o custo de oferecer serviços altamente acessíveis e confiáveis em seus próprios computadores e a terceirização do problema para outra pessoa. Mas eles vêm acompanhados de latência variável, interrupções e uma perda total de controle quando algo dá errado. Os serviços de IA não são exceção. Se o seu sistema de busca ficar offline quando você não puder acessar seu modelo de embedding, isso pode não parecer mais um bom meio-termo.</p><p>Além disso, confiar em IA externa sempre envolverá riscos que você não pode prever ou gerenciar facilmente. O acesso à internet e a latência da rede podem se deteriorar sem aviso prévio, como resultado de eventos políticos, mau tempo ou navios arrastando suas âncoras sobre cabos de fibra óptica submarinos. Os governos podem, e recentemente o fizeram, usar proibições de exportação para bloquear de repente o acesso a modelos de IA. Às vezes, os provedores de serviços de IA descontinuam modelos para induzir você a mudar para outros mais recentes. A flexibilidade e os custos gerenciados dos serviços externos precisam ser ponderados em relação aos riscos de dependência.</p><h3>IA no local para conformidade com o GDPR, a HIPAA e a soberania dos dados</h3><p>Organizações que coletam dados pessoais estão sujeitas a regulamentações cada vez mais rigorosas, que geralmente diferem entre as jurisdições e podem ter requisitos contraditórios. Notavelmente, as <a href="https://www.hhs.gov/hipaa/for-professionals/privacy/laws-regulations/index.html">regras da HIPAA</a> impõem proteções de dados muito rigorosas aos provedores de saúde norte-americanos, e leis gerais de proteção de dados fortes no <a href="https://laws-lois.justice.gc.ca/eng/acts/p-8.6/">Canadá</a>, na <a href="https://gdpr-info.eu/">União Europeia</a> e em <a href="https://www.japaneselawtranslation.go.jp/en/laws/view/4241">muitas jurisdições asiáticas</a> exigem que todas as empresas que lidam com informações pessoais o façam de forma segura e limitem a transmissão desses dados a outras partes ou outras jurisdições. Essas regras podem até impor obrigações a entidades estrangeiras se elas tiverem clientes nessas jurisdições. As instituições financeiras estão frequentemente sujeitas a regras ainda mais rigorosas e possuem a mesma responsabilidade direta pela segurança da informação que têm para se protegerem contra outras formas de atividade criminosa.</p><p>A conformidade regulatória pode ser incompatível com serviços de IA de terceiros, especialmente se usá-los envolver a transmissão transfronteiriça de dados.</p><p>Além disso, eventos recentes mostram que regras que restringem a localização física dos armazenamentos de dados podem não ser uma fonte confiável de proteção quando operadores internacionais de nuvem estão sujeitos à pressão de governos estrangeiros. Leis locais podem entrar em conflito entre jurisdições, exigindo o armazenamento e processamento local de dados e tornando impossível o uso de serviços de terceiros. Em alguns casos, a única solução é internalizar todas as partes dos seus processos, incluindo seus sistemas de IA.</p><h3>Riscos de responsabilidade por IA na transmissão de dados de terceiros</h3><p>Leis de proteção de dados e deveres de cuidado reconhecidos em relação a dados sensíveis rotineiramente têm implicações de responsabilidade, às vezes muito severas. Você pode ser responsabilizado pelo tratamento dos seus dados por provedores de serviços terceirizados. Embora os tribunais e procedimentos legais possam fornecer algumas proteções retrospectivas contra provedores de serviços inseguros, esses recursos não estão disponíveis nem são geralmente eficazes contra agentes de segurança nacional, autoridades policiais ou hackers criminosos.</p><p>Para os governos, já houve casos em que provedores de serviços em nuvem internacionais liberaram informações estatais sensíveis para agentes estrangeiros.</p><p>Mas mesmo que você não se preocupe com governos estrangeiros ou hackers, e mesmo que seus provedores de serviços de IA externos sejam seguros, o simples fato de serem externos pode criar responsabilidades.</p><p>Por exemplo, na maioria das jurisdições, as comunicações dos advogados com seus clientes contam com proteções jurídicas especiais, e os escritórios de advocacia têm responsabilidades rígidas ao gravar ou armazenar essas informações. Nos Estados Unidos, esse "sigilo advogado-cliente" é tão famoso que é central nos enredos de filmes e séries de TV. Mas uma das maneiras pelas quais esse privilégio pode ser perdido é ao comunicar informações a alguém que não seja protegido por ele, e desenvolvimentos recentes sugerem que provedores externos de serviços de IA podem se enquadrar nisso.</p><p>É possível, pelo menos nos Estados Unidos, que o simples uso de serviços de IA de terceiros por meio de uma API de internet, como modelos de incorporação que oferecem serviços de indexação, viole regras críticas de confidencialidade. Um escritório de advocacia pode ser processado, punido disciplinarmente ou ter o registro cassado só por usar software hospedado externamente, mesmo que nenhuma violação de segurança ocorra.</p><h3>IA no local para sistemas offline, de borda e fisicamente isolados</h3><p>Os sistemas de computador não são isolados apenas por motivos de segurança. Por exemplo, veículos em movimento não podem depender do acesso à internet para nenhuma função essencial. Navios e aeronaves têm sistemas de computador de bordo muito extensos que precisam funcionar sem conexões com a internet e, portanto, não podem usar serviços de IA externos. Plataformas offshore, instalações remotas em áreas selvagens, serviços de computador no Ártico, na Antártida e em pequenas ilhas sem conexões físicas adequadas com redes globais são todos exemplos de instalações que se beneficiam ao hospedar localmente todos os serviços de que precisam. À medida que o papel da IA na computação empresarial cresce, torna-se mais importante abordar essas limitações.</p><p>Aplicações emergentes de IA em sistemas físicos (robótica e outros casos de uso delimitados espacialmente ou focados no mundo externo, como sistemas de gestão de logística ou até mesmo caixas de supermercado) podem estar conectadas à internet global, mas não têm tolerância a falhas de conexão ou picos de latência. Se elas dependem de um sistema de IA para operar, esse sistema de IA precisa ser o mais local e confiável possível.</p><h2>Quem não precisa de IA em ambiente local?</h2><p>Serviços de software remotos e IA fora do local têm benefícios. Executar modelos de IA pode exigir processadores caros, de alto consumo de energia e com vida útil notoriamente curta. O acesso a hardware de alta qualidade é particularmente difícil no momento devido a fatores de mercado e choques econômicos externos. Diante das circunstâncias, pode fazer sentido pagar por token para usar uma API externa em vez de arcar com os altos custos de capital da IA local.</p><p>APIs externas fazem mais sentido para usuários intermitentes. Se você usa modelos de IA principalmente para processar dados em lote para análise, em vez de executar um sistema de busca que precise ficar online o tempo todo, faz pouco sentido investir em hardware de alto custo de capital e instalações locais.</p><p>Além disso, quando o seu processamento de dados já é baseado na nuvem, por exemplo, um website de e-commerce hospedado na nuvem por motivos de confiabilidade e acessibilidade, usar serviços de IA localizados na mesma infraestrutura de nuvem pode proporcionar um melhor custo-benefício do que introduzir a sua própria implantação de modelo de IA licenciado. Você já depende do seu provedor de serviços em nuvem, então depender dos serviços de IA dele não adiciona muito risco.</p><p>Se o seu caso de uso se encaixa nessa descrição, os modelos Jina AI estão disponíveis no <a href="https://www.elastic.co/docs/explore-analyze/elastic-inference/eis">EIS</a>, no <a href="https://aws.amazon.com/marketplace/seller-profile?id=seller-stch2ludm6vgy">AWS Marketplace</a> e no <a href="https://console.cloud.google.com/marketplace/browse?q=jina">Google Cloud Platform</a> especificamente para atender às suas necessidades.</p><p>A tabela abaixo resume os principais fatores. Sua resposta depende dos seus dados, da sua infraestrutura e do seu padrão de uso.</p><p>Fator</p><p>No local preferido</p><p>API da Nuvem Preferida</p><p>Padrão de uso</p><p>Inferência contínua ou de alto volume</p><p>Processamento intermitente ou em lote</p><p>Sensibilidade dos dados</p><p>Regulado, soberano ou confidencial</p><p>Sem restrições transfronteiriças ou de terceiros</p><p>Ambiente de rede</p><p>Air-gapped, com firewall ou instáveis</p><p>Internet estável, sempre ativa</p><p>Infraestrutura existente</p><p>Possuir ou poder adquirir hardware de GPU</p><p>Já hospedado na nuvem com IA colocalizada</p><p>Modelo de custo</p><p>Hardware fixo + licença; previsível em escala</p><p>Por token; menor custo inicial, variável a longo prazo</p><p>Tolerância a latência</p><p>Nenhum (robótica, edge, tempo real)</p><p>A variabilidade da rede é aceitável</p><p>Responsabilidade operacional</p><p>Sua equipe gerencia o hardware e a disponibilidade</p><p>O provedor gerencia o hardware e as atualizações; você gerencia a integração</p><p>Você precisa considerar os custos e benefícios à luz de suas circunstâncias específicas e casos de uso, levando em consideração os problemas destacados na seção anterior que se aplicam a você. A análise de custo-benefício sem dúvida mudará ao longo do tempo. Não podemos prever o futuro do setor de IA ou os preços de hardware, mesmo no curto prazo.</p><h2>Apresentando Jina no Local</h2><p>Para usuários que podem se beneficiar de serviços de IA locais, estamos apresentando o <a href="https://github.com/jina-ai/jina-on-prem/wiki/">Jina On-Prem</a>, um conjunto de instalação totalmente independente para os modelos de alto desempenho da Jina AI.</p><p>Os modelos do Jina AI correspondem à precisão de modelos de embedding <a href="https://mteb-leaderboard.hf.space/benchmark/MTEB(Multilingual%2C%20v2)">muitas vezes maiores que eles</a>, reduzindo custos computacionais, uso de memória e requisitos de hardware. Isso os torna uma escolha ideal para usuários que desejam ou precisam manter sua IA no local. Licenças comerciais estão disponíveis com solutions escaláveis e de preços proporcionais para casos de uso de todos os tamanhos.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt190865fb3ebde472/6a6a33d0065b162508701ff9/02559ceca556a26c53eb703ae87d421452b27251-1374x1400.png" alt="MMTEB Multilingual v2 leaderboard showing Jina AI embedding model rankings: jina-embeddings-v5-omni-small and jina-embeddings-v5-text-small ranked 13th, jina-embeddings-v5-omni-nano and jina-embeddings-v5-text-nano ranked 19th, competing against models from Microsoft, Google, Tencent, NVIDIA and Qwen" /><h3>A quais esquemas de API o Jina no local oferece suporte?</h3><ul><li><p>Disponível como uma coleção completa de dependências para instalação local ou como um <a href="https://www.docker.com/">container do Docker</a> que você pode instalar e executar em minutos.</p></li><li><p>Instalações Jina no local <em>não</em> fazem chamadas para sistemas externos.</p><ul><li><p>Nenhuma chamada ao Hugging Face Hub ou a qualquer registro de modelo (HF_HUB_OFFLINE=1 e TRANSFORMERS_OFFLINE=1 estão embutidos).</p></li><li><p>Não há servidor de licença.</p></li><li><p>Não há endpoints de telemetria ou logging.</p></li></ul></li><li><p>Oferece suporte a hardware de CPU e GPU, com detecção automática de GPU.</p></li><li><p>Todos os 28 modelos Jina AI disponíveis, incluindo os mais recentes modelos de embedding multimodal <a href="https://www.elastic.co/pt/search-labs/blog/jina-embeddings-v5-omni-all-media-one-index">jina-embeddings-v5-omni</a> e o <a href="https://www.elastic.co/pt/search-labs/tutorials/jina-tutorial/jina-reranker-v3">jina-reranker-v3</a>.</p></li><li><p>Acesso via esquemas padrão de API de IA: <a href="https://jina.ai/api-dashboard">Jina API</a>, OpenAI, Cohere, Voyage AI e Gemini. O Jina On-Prem é uma solução de substituição direta para aplicações construídas com base nesses esquemas.</p></li><li><p>Substituição direta para modelos servidos pelo <a href="https://www.elastic.co/docs/explore-analyze/elastic-inference/eis">EIS</a>. O Jina On-Prem se integra diretamente com <a href="https://www.elastic.co/pt/blog/deploy-elastic-air-gapped-disconnected-environments">implantações da Elastic em ambientes isolados</a>.</p></li></ul><h2>Requisitos de hardware para modelos Jina AI no local</h2><p>Os requisitos de hardware variam para diferentes modelos Jina. A tabela abaixo mostra as recomendações para os modelos mais recentes usando configurações de GPU. Você não precisa de nada mais potente do que uma GPU NVIDIA L4, embora uma A100 seja recomendada para os modelos de embedding v5. Nosso modelo de embedding mais recente exige atualmente no mínimo 8 GB de VRAM.</p><p>Modelo</p><p>VRAM mínima</p><p>GPU Recomendada</p><p>jina-embeddings-v5-text-nano</p><p>2 GB</p><p>T4 / L4</p><p>jina-embeddings-v5-text-small</p><p>3 GB</p><p>L4 / A10G</p><p>jina-embeddings-v5-omni-small</p><p>8 GB</p><p>L4 / A10G / A100</p><p>jina-reranker-v3</p><p>3 GB</p><p>L4</p><p>jina-clip-v2</p><p>4 GB</p><p>L4</p><p>jina-code-embeddings-1.5b</p><p>4 GB</p><p>L4</p><p>ReaderLM-v2</p><p>4 GB</p><p>L4</p><p>Se você usar mais de um modelo por vez, os requisitos de VRAM aumentarão. Consulte a <a href="https://github.com/jina-ai/jina-on-prem/wiki/Sizing-And-Hardware">página de dimensionamento e hardware</a> para obter mais informações.</p><h2>Como Instalar o Jina no Local com o Docker</h2><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt20265d09e2d8d0f4/6a6a33d1065b162105701ffd/ada9881af407168298b1940f8537ad71a5411c89-1999x1200.png" alt="" /><p>A maneira mais rápida de começar é <a href="https://www.docker.com/get-started/">instalar o Docker</a> (se você ainda não o fez) e seguir as instruções na página do <a href="https://github.com/jina-ai/jina-on-prem/wiki/QuickStart">Guia rápido do Jina no local</a>.</p><p>Há containers do Docker pré-compostos para todos os 28 modelos Jina. Baixe um e transfira-o para o seu destino de instalação, e você poderá ter os modelos Jina AI em execução em menos de cinco minutos.</p><p>Para compilações multimodais ou personalizadas, ou para baixar o conjunto completo de dependências para instalação fora de um container, siga as etapas descritas no <a href="https://github.com/jina-ai/jina-on-prem/wiki/Bundling-Guide">guia de empacotamento</a>.</p><p>Sua instalação Jina no local oferece suporte a todas as funcionalidades da Jina API e do EIS e à geração de embeddings por meio das APIs da OpenAI, Cohere, Voyage AI e Gemini, de modo que ela pode ser integrada a aplicativos preexistentes usando interfaces padrão. Consulte a <a href="https://github.com/jina-ai/jina-on-prem/wiki/API-Reference">documentação da API</a> para obter mais informações.</p><p>Os modelos Jina, incluindo os modelos instalados com o Jina no local, estão disponíveis sob vários termos de licenciamento, sendo que os modelos mais recentes são gratuitos para uso não comercial sob uma licença <a href="https://creativecommons.org/licenses/by-nc/4.0/deed.en">CC BY-NC 4.0</a>. Para licenciar o Jina no local para uso comercial, entre em contato com as <a href="https://www.elastic.co/pt/contact">vendas da Elastic</a>.</p>]]></content:encoded>
    <link>https://www.elastic.co/search-labs/blog/on-prem-ai-jina-embedding-models</link>
    <guid isPermaLink="true">https://www.elastic.co/search-labs/blog/on-prem-ai-jina-embedding-models</guid>
    <category><![CDATA[Jina AI]]></category>
    <category><![CDATA[Integrações]]></category>
    <dc:creator><![CDATA[Scott Martens]]></dc:creator>
    <enclosure url="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt17731ab0c6ec66f6/6a6a33d140a4941014ca5c9a/09bc6dac4e6a86c7877f8ed78d68f5d581aeffa9-1999x1200.png" length="0" type="image/png"/>
    <pubDate>Thu, 23 Jul 2026 00:00:00 GMT</pubDate>
  </item>
  <item>
    <title><![CDATA[Um índice, todas as mídias: Apresentando jina-embeddings-v5-omni]]></title>
    <description><![CDATA[O jina-embeddings-v5-omni permite incorporar texto, imagens, vídeos e áudio em um único índice do Elasticsearch e realizar consultas em todos eles simultaneamente.]]></description>
    <content:encoded><![CDATA[<p><code>jina-embeddings-v5-omni</code> reúne texto, imagens, vídeo e áudio em um único índice do Elasticsearch. Estendendo os modelos líderes da categoria <a href="https://www.elastic.co/search-labs/blog/jina-embeddings-v5-text"><code>jina-embeddings-v5-text</code></a>, suíte v5-omni adiciona codificação visual e de áudio por meio de uma arquitetura inovadora que mantém a estrutura principal de texto inalterado, oferecendo desempenho de ponta em um único modelo de embedding muito compacto.</p><p>Agora você pode criar embeddings semânticos de alto desempenho para <strong>texto</strong>, <strong>imagens</strong>, <strong>vídeos</strong> e <strong>gravações de áudio</strong>, abrangendo <strong>quase 100 idiomas</strong>, e utilizá-los para classificação, clustering, medição de similaridade semântica e indexação para recuperação de informações. Se seus dados estão em PDFs, gravações e vídeos junto com texto, você não precisa mais de pipelines separados para cada um.</p><p>A família <code>jina-embeddings-v5-omni</code> é o <strong>modelo de embedding mais compacto atualmente no mercado, com suporte para imagens, fala, documentos impressos e vídeo</strong>. Ela oferece:</p><ul><li><p><strong><code>jina-embeddings-v5-text</code></strong><strong>Embeddings de texto de última geração</strong> para aplicações de recuperação, análise e agentes de IA.</p></li><li><p><strong>Embeddings com o melhor desempenho da categoria em termos de tamanho</strong> <strong>para similaridade semântica visual, compreensão visual e recuperação de imagens.</strong> <code>jina-embeddings-v5-omni-small</code> tem o melhor desempenho em benchmarks de imagem de qualquer modelo nos parâmetros de 1 bilhão (10⁹) e é superior ao nosso próprio <a href="https://www.elastic.co/search-labs/blog/jina-models-elasticsearch-guide#jina-clip-v2"><code>jina-clip-v2</code></a> anterior. Apenas alguns modelos com três a trinta vezes mais parâmetros conseguem superá-lo.</p></li><li><p><strong>Embeddings de última geração para compreensão e recuperação visual multilíngue</strong>, superando modelos até 20 vezes maiores.</p></li><li><p><strong>Os melhores embeddings de áudio da categoria de tamanho</strong>, com apenas modelos que têm o dobro ou mais de parâmetros apresentando melhor desempenho em benchmarks padrão.</p></li><li><p><strong>Suporte a vídeo</strong>, especialmente para localizar objetos e eventos em vídeos.</p></li></ul><p>Isso tem aplicações em todas as áreas de recuperação de informações, processamento de documentos e análise de dados. O <code>jina-embeddings-v5-omni</code> abre o acesso a informações bloqueadas em diferentes silos de mídia e as torna acessíveis para recuperação, análise e uso por agentes de IA. As informações em gravações de áudio e vídeo, PDF, digitalizações de páginas impressas e infográficos estão em pé de igualdade com os textos digitalizados em seu ecossistema de dados.</p><p>Assim como <code>jina-embeddings-v5-text</code>, esses modelos vêm em dois tamanhos: <code>small</code> e <code>nano</code>. Ambos os modelos estendem suas versões em texto com módulos adicionais que suportam entrada de áudio e vídeo. Os usuários podem selecionar módulos no momento do carregamento. Além disso, extensões específicas de tarefa para similaridade semântica, classificação, agrupamento e recuperação de informações são implementadas como adaptadores compactos de baixo nível (LoRAs) e todas são carregadas, para que os usuários possam selecioná-las no momento da inferência.</p><p>Ambos os modelos são muito compactos. <code>jina-embeddings-v5-omni-small</code> pode ser executado em servidores convencionais com GPU, e <code>jina-embeddings-v5-omni-nano</code> é pequeno o suficiente para executar em hardware comum. Isso representa uma grande economia potencial nos custos de computação e possibilita a instalação local licenciada e o processamento na borda, reduzindo a latência e aumentando o controle de seus próprios dados.</p><p>A suíte v5-omni usa técnicas inovadoras de design de modelos e Machine Learning para compor novos modelos de embedding a partir de modelos previamente treinados, sem precisar treiná-los novamente. Usamos codificadores de modelos pré-treinados, alinhados linguisticamente e incorporados para mídia de áudio e vídeo como pré-processadores de entrada para nosso conjunto de modelos <code>jina-embeddings-v5-text</code> existente. Os modelos resultantes geram embeddings para imagens e gravações de som que são semanticamente compatíveis com as embeddings gerados para textos.</p><p>Os modelos v5-omni produzem embeddings de texto idênticas a <code>jina-embeddings-v5-text</code> (isto é, <code>jina-embeddings-v5-omni-small</code> com <code>jina-embeddings-v5-text-small</code>; e <code>jina-embeddings-v5-omni-nano</code> com <code>jina-embeddings-v5-text-nano</code>), para que você possa estender repositórios de recuperação de texto existentes para aplicativos multimídia sem reconstruir seus índices.</p><p>Os codificadores integrados são todos derivados de modelos de pesos abertos. Para imagens e vídeos, utilizamos codificadores dos modelos <a href="https://qwen.ai/blog?id=qwen3.5">Qwen3.5</a>:</p><ul><li><p>Para <code>jina-embeddings-v5-omni-nano</code>, o codificador <a href="https://huggingface.co/google/siglip2-base-patch16-224">SigLIP2 Base</a> ajustado de <a href="https://huggingface.co/Qwen/Qwen3.5-0.8B">Qwen3.5-0.8B</a>.</p></li><li><p>Para <code>jina-embeddings-v5-omni-small</code>, o codificador <a href="https://huggingface.co/google/siglip2-so400m-patch14-384">SigLIP2 So400m</a> ajustado de <a href="https://huggingface.co/Qwen/Qwen3.5-2B">Qwen3.5-2B</a>.</p></li><li><p>Para suporte de áudio, adicionamos o codificador do <a href="https://huggingface.co/openai/whisper-large-v3">Whisper-large-v3</a>, extraído do <a href="https://huggingface.co/Qwen/Qwen2.5-Omni-7B">Qwen2.5-Omni-7B</a>, às versões small e nano.</p></li></ul><p>Conectamos esses codificadores específicos de mídia ao backbone de processamento de texto com projetores multimodais treinados. Esses projetores traduzem suas saídas nativas para embeddings de entrada compatíveis com <code>jina-embeddings-v5-text</code>. As únicas partes recém-treinadas dos modelos <code>jina-embeddings-v5-omni</code> são os pesos nesses projetores.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt62dc05bfa3d054b6/6a17e86eb1e113340b79f29c/4cb834b7e5fd63cdd78600de313615feffabbb1f-1999x1000.jpg" alt="" /><p>Essa arquitetura significa que só precisamos treinar os projetores entre modelos, cerca de 5,5 milhões de parâmetros para <code>jina-embeddings-v5-omni-small</code> e menos de 3,5 milhões para <code>jina-embeddings-v5-omni-nano</code>, para cada um dos quatro adaptadores de Low-Rank Adaptation (LoRA). Essa abordagem minimiza o treinamento adicional necessário para conectar diferentes modelos de embedding, aproveitando o treinamento especializado de cada um para produzir um conjunto modular de embedding extremamente compacto e de alto desempenho.</p><h2>Propriedades selecionadas do modelo</h2><h3>Entrada/saída</h3><p>Nome do modelo</p><p>Tamanho da janela de contexto de entrada</p><p>Tamanho do embedding</p><p>jina-embeddings-v5-omni-small</p><p>32.768 tokens*</p><p>1024 dimensões (mínimo: 32)</p><p>jina-embeddings-v5-omni-nano</p><p>8.192 tokens*</p><p>768 dimensões (mínimo: 32)</p><p>* Consulte <strong>Usando jina-embeddings-v5-omni</strong> abaixo para obter mais informações sobre como mídias não textuais são tokenizadas.</p><h3>Tamanho</h3><p>Nome do modelo</p><p>Tamanho total</p><p>jina-embeddings-v5-omni-small (modelo base apenas texto + 4 adaptadores LoRA)</p><p>700M params</p><p>Suporte a imagens/vídeos (codificador SigLIP2 So400m extraído do Qwen3.5-2B)</p><p>1.006B params</p><p>suporte a áudio (encoder Whisper-large-v3 extraído do Qwen2.5-Omni-7B)</p><p>1.354B params</p><p>ambos</p><p>1.660B params</p><p>adaptadores LoRA (cada)</p><p>20M</p><p>jina-embeddings-v5-omni-nano (modelo base apenas texto + 4 adaptadores LoRA)</p><p>266M params</p><p>Suporte a imagens/vídeos (codificador base SigLIP2 extraído de Qwen3.5-0,8B)</p><p>354M params</p><p>suporte a áudio (encoder Whisper-large-v3 extraído do Qwen2.5-Omni-7B)</p><p>916M params</p><p>ambos</p><p>1.004B params</p><p>adaptadores LoRA (cada)</p><p>7M</p><p>* Consulte <strong>Usando jina-embeddings-v5-omni</strong> abaixo para obter mais informações sobre como mídias não textuais são tokenizadas.</p><h2>Treinamento específico para tarefas</h2><p>A família <code>jina-embeddings-v5-omni</code> dá suporte aos mesmos adaptadores LoRA específicos para tarefas que <code>jina-embeddings-v5-text</code>:</p><p>Tarefa</p><p>Exemplos de uso</p><p>Recuperação</p><p>Recuperação de informações, isoladamente ou em conjunto com outras técnicas de recuperação e avaliação de resultados. Com os modelos v5-omni, você pode recuperar áudio, vídeo e imagens em uma única consulta de um único índice.</p><p>Clustering</p><p>Descoberta de tópicos e organização automática de conteúdos em todas as mídias.</p><p>Classificação</p><p>Categorização, análise de sentimento e tipos de tarefas relacionadas.</p><p>Similaridade semântica</p><p>Deduplicação de dados em diferentes mídias, sistemas de recomendação, mídias relacionadas, encontrar textos para corresponder à fala, identificar traduções e tarefas similares.</p><p>Os embeddings de saída dependem da categoria de tarefa selecionada. Por exemplo, você não deve usar embeddings orientados à recuperação para agrupamento nem embeddings de similaridade semântica para classificação.</p><h2>Multimídia, multimodal, multilíngue, multifuncional</h2><p>Para mostrar o que <code>jina-embeddings-v5-omni</code> é capaz, vamos pegar as famosas passagens iniciais de dois romances e medir sua semelhança semântica:</p><p><em><strong>Um Conto de Duas Cidades</strong></em><strong> (Charles Dickens)</strong></p>It was the best of times, it was the worst of times, it was the
age of wisdom, it was the age of foolishness, 
it was the epoch of belief, it was the epoch of incredulity,
it was the season of Light, it was the season of Darkness,
it was the spring of hope, it was the winter of despair,
we had everything before us, we had nothing before us,
we were all going direct to Heaven, we were all going
direct the other way—in short, the period was so far like
the present period, that some of its noisiest authorities
insisted on its being received, for good or for evil, in 
the superlative degree of comparison only.<p><em><strong>Orgulho e Preconceito</strong></em><strong> (Jane Austen)</strong></p>It is a truth universally acknowledged, that a 
single man in possession of a good fortune must
be in want of a wife. However little known the
feelings or views of such a man may be on his first
entering a neighbourhood, this truth is so well
fixed in the minds of the surrounding families,
that he is considered as the rightful property of
some one or other of their daughters.<p>Usando <code>jina-embeddings-v5-omni-small</code>, com seu adaptador de similaridade semântica, esses textos têm uma similaridade de <strong>0,5329</strong>.</p><p>Esse número não significa muito sem algo para comparar, então vamos comparar esses dois textos com suas traduções francesas usando o mesmo modelo e adaptador:</p><p><strong>Pontuações de similaridade semântica para textos entre línguas</strong></p><p></p><p>Um Conto de Duas Cidades (inglês)</p><p>Orgulho e Preconceito (inglês)</p><p>Um Conto de Duas Cidades (francês)(Paris et Londres en 1783, trad. H. Loreau)</p><p>0,9095</p><p>0,5074</p><p>Orgulho e Preconceito (Francês) (Orgueil et Préjugés, tr. Leconte et Pressoir)</p><p>0,4826</p><p>0,8784</p><p>Os dois textos mostram muito mais similaridade com suas traduções do que com outros textos no mesmo idioma ou em outro idioma. Isso reflete os embeddings semânticos multilíngues de altíssimo desempenho de <code>jina-embeddings-v5-text-small</code>, incluídas inalteradas em <code>jina-embeddings-v5-omni-small</code>.</p><p>Adicionar suporte multimídia ao <code>jina-embeddings-v5-omni</code> significa que podemos estender este experimento para outros tipos de dados. Por exemplo, obtivemos digitalizações das primeiras páginas de ambos os romances em edições impressas antigas:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt95d451adb5680e20/6a17e871445de9e88a4d016c/e92d928a4813ccecc7d02639eea699e3a71c66e3-1999x1692.png" alt="Duas páginas envelhecidas de livros exibem as passagens iniciais de &quot;Um Conto de Duas Cidades&quot; e &quot;Orgulho e Preconceito&quot;, com a página da esquerda mostrando o início do primeiro capítulo de uma edição do século XIX sem data de &quot;Um Conto de Duas Cidades&quot; e a página da direita mostrando o início do primeiro capítulo da edição de 1903 da Macmillan de &quot;Orgulho e Preconceito&quot;." /><p><strong>Figura 2:</strong> <em>Um Conto de Duas Cidades</em>, edição do século XIX sem data, e <em>Orgulho e Preconceito</em>, edição Macmillan de 1903.</p><p>Vamos comparar os dois textos com as digitalizações, usando novamente o adaptador de similaridade semântica:</p><p><strong>Pontuações de similaridade semântica entre textos e imagens</strong></p><p></p><p>Um Conto de Duas Cidades (digitalização)</p><p>Orgulho e Preconceito (digitalização)</p><p>Um Conto de Duas Cidades (texto)</p><p>0,7336</p><p>0,4891</p><p>Orgulho e Preconceito (texto)</p><p>0,4804</p><p>0,7213</p><p>Você vê que as pontuações de similaridade semântica favorecem fortemente textos que correspondem ao conteúdo das imagens.</p><p>Podemos também comparar os textos com uma captura de tela de uma postagem nas redes sociais e um meme que fazem referência a esses textos, usando a mesma estrutura:</p><p><strong>Figura 3:</strong> Um tuíte de Elon Musk que faz referência a <em>A Tale of Two Cities (Um Conto de Duas Cidades)</em> e um meme que faz referência à famosa abertura de <em>Pride and Prejudice (Orgulho e Preconceito)</em>.</p><p><strong>Pontuações de similaridade semântica entre textos e imagens</strong></p><p></p><p>Um Conto de Duas Cidades</p><p>Orgulho e Preconceito</p><p>Tweet de Musk (imagem)</p><p>0,7156</p><p>0,4912</p><p>Meme Keep Calm (imagem)</p><p>0,4555</p><p>0,6244</p><p>Podemos fazer o mesmo para a fala. Obtivemos gravações da leitura de ambos os textos, em inglês e francês:</p><ul><li><p><a href="https://drive.google.com/file/d/1IK_bR6L47TSrnESdXLEpHCX6o-FzPmOx/view?usp=sharing"><em>A Tale of Two Cities</em></a><a href="https://drive.google.com/file/d/1IK_bR6L47TSrnESdXLEpHCX6o-FzPmOx/view?usp=sharing"> (áudio em inglês da Librivox)</a>.</p></li><li><p><a href="https://drive.google.com/file/d/1KurbhD6INc6oZlq_SJcWq7MBVfJQ3pof/view?usp=sharing"><em>Um Conto de Duas Cidades</em></a><a href="https://drive.google.com/file/d/1KurbhD6INc6oZlq_SJcWq7MBVfJQ3pof/view?usp=sharing"> (áudio em francês gerado pela OmniVoice AI).</a></p></li><li><p><a href="https://drive.google.com/file/d/1D_G2FOCb7ct-FBVY1fyivXlY2e_yGZw1/view?usp=sharing"><em>Orgulho e Preconceito</em></a><a href="https://drive.google.com/file/d/1D_G2FOCb7ct-FBVY1fyivXlY2e_yGZw1/view?usp=sharing"> (áudio em inglês da Librivox).</a></p></li><li><p><a href="https://drive.google.com/file/d/1jutY61YSFGBIyE8m-ltEJx-8dEXNJJ5N/view?usp=sharing"><em>Orgulho e Preconceito</em></a><a href="https://drive.google.com/file/d/1jutY61YSFGBIyE8m-ltEJx-8dEXNJJ5N/view?usp=sharing"> (áudio em francês gerado pela OmniVoice AI).</a></p></li></ul><p><strong>Pontuações de similaridade semântica entre textos e áudios entre línguas</strong></p><p></p><p>Um Conto de Duas Cidades (áudio em inglês)</p><p>Um Conto de Duas Cidades (áudio em francês)</p><p>Orgulho e Preconceito (áudio em inglês)</p><p>Orgulho e Preconceito (áudio em francês)</p><p>Um Conto de Duas Cidades (texto em inglês)</p><p>0,3816</p><p>0,3106</p><p>0,1607</p><p>0,1774</p><p>Um Conto de Duas Cidades (texto em francês)</p><p>0,3528</p><p>0,3253</p><p>0,1598</p><p>0,1721</p><p>Orgulho e Preconceito (texto em inglês)</p><p>0,1910</p><p>0,1682</p><p>0,3511</p><p>0,3398</p><p>Orgulho e Preconceito (texto em francês)</p><p>0,1667</p><p>0,1474</p><p>0,3018</p><p>0,3702</p><p>Essa capacidade multilíngue e multimídia se estende à recuperação de informações.</p><p>Os adaptadores de recuperação para os modelos <code>jina-embeddings-v5-omni</code> implementam recuperação assimétrica. Isso significa que eles codificam consultas de maneira diferente da forma como incorporam documentos-alvo de recuperação, então as consultas multimodais estão sempre em alguma direção, com consultas em uma mídia e documentos em outra, dando pontuações diferentes de quando são invertidas.</p><p>As tabelas abaixo mostram as pontuações de recuperação para texto, áudio e imagens de digitalização de páginas de <em>Um Conto de Duas Cidades</em> e <em>Orgulho e Preconceito</em>, quando o texto de <em>Um Conto de Duas Cidades</em> (em inglês) é codificado como a consulta:</p><p><strong>Texto para texto</strong></p><p>Documento</p><p>Pontuação de recuperação</p><p>Um Conto de Duas Cidades (trecho de texto em francês)</p><p>0,7597</p><p>Orgulho e Preconceito (trecho do texto em inglês)</p><p>0,1482</p><p>Orgulho e Preconceito (trecho de texto em francês)</p><p>0,0523</p><p><strong>Texto para imagem</strong></p><p>Documento</p><p>Pontuação de recuperação</p><p>Um Conto de Duas Cidades (digitalização da página em inglês)</p><p>0,5517</p><p>Um Conto de Duas Cidades (digitalização da página em francês)</p><p>0,3576</p><p>Orgulho e Preconceito (digitalização da página em inglês)</p><p>0,1917</p><p><strong>Texto para áudio</strong></p><p>Documento</p><p>Pontuação de recuperação</p><p>Um Conto de Duas Cidades (áudio em inglês)</p><p>0,3277</p><p>Um Conto de Duas Cidades (áudio em francês)</p><p>0,1980</p><p>Orgulho e Preconceito (áudio em inglês)</p><p>0,1419</p><p>Orgulho e Preconceito (áudio em francês)</p><p>0,1759</p><p>Os usuários também podem executar a consulta no sentido oposto, realizando recuperação de áudio-texto e imagem-texto.</p><p>Abaixo estão as pontuações usando o áudio em inglês de <em>Um Conto de Duas Cidades</em> como consulta e vários textos como documentos:</p><p><strong>Imagem para texto</strong></p><p>Documento</p><p>Pontuação de recuperação</p><p>Um Conto de Duas Cidades (trecho do texto em inglês)</p><p>0,3352</p><p>Um Conto de Duas Cidades (trecho de texto em francês)</p><p>0,2650</p><p>Orgulho e Preconceito (trecho do texto em inglês)</p><p>0,1626</p><p>Orgulho e Preconceito (trecho de texto em francês)</p><p>0,1385</p><p>E as pontuações usando uma digitalização da primeira página de <em>Um Conto de Duas Cidades</em> (em inglês) como consulta:</p><p><strong>Áudio para texto</strong></p><p>Documento</p><p>Pontuação de recuperação</p><p>Um Conto de Duas Cidades (trecho do texto em inglês)</p><p>0,5304</p><p>Um Conto de Duas Cidades (trecho de texto em francês)</p><p>0,4845</p><p>Orgulho e Preconceito (trecho do texto em inglês)</p><p>0,1467</p><p>Orgulho e Preconceito (trecho de texto em francês)</p><p>0,0761</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt501b2c594f45f2e3/6a17e877a292992e3ad02c9a/673f5116c1d7a5a6f9adfbb2f48b9e6920e3229b-668x130.png" alt="Uma caixa de notificação retangular com fundo azul claro exibe um ícone amarelo de triângulo de advertência ao lado do texto, explicando que jina-embeddings-v5-omni é treinado para encontrar áudio, vídeo e imagens de consultas de texto e que consultas sem texto podem ser menos eficazes." /><h2>Busca de vídeo</h2><p>As capacidades do <code>jina-embeddings-v5-omni</code> para indexação de vídeo e busca trazem novas capacidades aos bancos de dados Elasticsearch, mas estão sujeitas a muitos dos mesmos avisos que se aplicam aos textos. Gerar um único embedding para um filme longo é como incorporar um romance muito longo: informações detalhadas serão diluídas, e o embedding resultante será uma boa correspondência para muitas consultas muito espúrias.</p><p>Se você incorporar o texto completo de <em>O Senhor dos Anéis</em> (aproximadamente 500.000 palavras), é provável que ele corresponda à maioria das consultas, independentemente do que você esteja procurando. Da mesma forma, se você indexar um filme de Hollywood de duas horas, obterá muitas correspondências espúrias e detalhes totalmente perdidos. <code>jina-embeddings-v5-omni</code> é ideal com clipes curtos.</p><p>Para este exemplo, baixamos o trailer do filme <em>Bonequinha de Luxo</em>, de 1961, que tem apenas 158 segundos de duração e está em domínio público. Você pode assistir ao trailer <a href="https://archive.org/details/turner_video_311/311.mp4">no Internet Archive</a>.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt06633fdd1c8334dd/6a17e8790b0bed7d9add35b2/1948f585027d1342528c0dd93fe99e3ec7ba17f9-800x1200.png" alt="Um pôster vintage do filme Bonequinha de Luxo apresenta uma imagem ilustrada de corpo inteiro de Audrey Hepburn usando um vestido preto longo, luvas pretas, um colar de pérolas e um porta-cigarros, com um gato no ombro. Uma ilustração de fundo menor mostra um casal se abraçando perto de uma paisagem urbana, e o pôster inclui bordas coloridas junto com os créditos do elenco e da produção." /><p><strong>Figura 4: </strong>O pôster teatral de <em>Bonequinha de Luxo</em>.</p><p>Nós usamos <a href="https://www.scenedetect.com/">PySceneDetect </a>para dividir o trailer em 28 cenas individuais, com durações variando de 1,877 segundos (45 quadros) a 18,393 segundos (441 quadros). A detecção de cena é imperfeita, mas fornece um mecanismo adequado para dividir o vídeo em trechos menores para recuperação. Então, geramos embeddings de documentos para cada um dos 28 segmentos, usando <code>jina-embeddings-v5-omni-small</code>, para que pudéssemos testar a eficácia das consultas de texto na localização de elementos específicos no vídeo.</p><p>Por exemplo, a consulta por “cat” retornou os seguintes trechos como os três principais resultados. A única cena com um gato está no topo, com uma pontuação de <strong>0,1634</strong>:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt6dca953a4afd5c1b/6a17e87baf47b65bf6cddfbc/82bd1759ebb65202f01a1e290447619af39f9a3d-735x426.png" alt=" Uma miniatura de vídeo mostra uma pessoa ajoelhada no chão da cozinha estendendo a mão em direção a uma geladeira aberta enquanto um gato está por perto (pontuação 0,1634)." /><p><a href="https://drive.google.com/file/d/1O3r-97rQJE7HAlUHsLygmFLwlZihRF26/view?usp=drive_link">Assista ao primeiro vídeo</a>.</p><p>A próxima melhor correspondência, com uma pontuação de <strong>0,1237</strong>, é muito menor:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltcc2cc1ef9ff9ce4b/6a17e87d7c026e725cf146b3/de4eb704ef751cc4df2bead7faa177decd20b1b3-735x426.png" alt="Uma miniatura de vídeo mostra uma pessoa segurando uma máscara colorida perto do rosto com o nome “GEORGE PEPPARD” sobreposto na imagem (pontuação 0,1237)." /><p><a href="https://drive.google.com/file/d/1DEK2H4bCpLVzyipJri9NSqE2jkeZ5jLm/view?usp=drive_link">Assista ao clipe 2</a>.</p><p>Você também pode buscar ações. Se você pesquisar por "beijo", as quatro melhores correspondências mostram beijos:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt85bf55536faf5156/6a17e87f25daab4bb608a269/18efdcbbb31954dfab8eafe5055773b6b8e3de72-735x426.png" alt="Uma miniatura de vídeo mostra três pessoas em um ambiente interno, com uma pessoa de pé à esquerda de costas para a câmera e duas pessoas à direita parecendo se abraçar perto de uma cortina e uma porta (pontuação: 0,2864)." /><p><a href="https://drive.google.com/file/d/1Pmr_D4wKjUCCiq_Dzy5PQeWldJLjZ8kI/view?usp=drive_link">Assista ao clipe 3.</a> Sua pontuação é 0,2864.</p><p>Pontuações: Para a <a href="https://drive.google.com/file/d/1sS_4qTnmHU2uOwbN1fmdXeS3IvZAI_IN/view?usp=drive_link">segunda correspondência</a> (0,2494), <a href="https://drive.google.com/file/d/1ofsrZHTUb3huwQ0JB6Hs5dOw4myTj-sk/view?usp=drive_link">terceira correspondência</a> (0,2099) e <a href="https://drive.google.com/file/d/1qaS4eueUCcQWdHLEjfEfneXsaWsx6P_5/view?usp=drive_link">quarta correspondência</a> (0,2068), respectivamente.</p><p>E você pode buscar textos exibidos em vídeos, como "Buddy Ebsen", que só aparece uma vez. <code>jina-embeddings-v5-omni-small</code> identifica-o prontamente como o melhor resultado com uma pontuação de <strong>0,3885</strong>, consideravelmente maior do que o próximo melhor resultado:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt4c3fd86052f17ce8/6a17e886e9ea8795d8a9c601/dabcae9f44b9d4a671f88717aa21a2c6cf685f6b-735x426.png" alt="Uma miniatura de vídeo mostrando um homem de terno ao lado de uma escada com balaústres brancos e um corrimão escuro, com o texto sobreposto “Buddy Ebsen&quot; (pontuação 0,3885)." /><p><a href="https://drive.google.com/file/d/1rdQ1OqtPBD-3iGG8A900jU5DpC-muye4/view?usp=sharing">Clipe do Buddy Ebsen</a>.</p><h2>Recuperação visual de documentos</h2><p>Os modelos multimodais de embedding da Jina AI estão entre os melhores em processamento de documentos visuais e são de última geração em processamento visual multilíngue de documentos. Isso significa lidar com dados de imagens que contenham texto, figuras e informações estruturadas. Os dados importantes geralmente estão na forma de digitalizações impressas, arquivos PDF, diagramas, desenhos técnicos, capturas de tela, imagens, infográficos e similares. Esses tipos de imagens geralmente são compostos mecanicamente ou gerados por computador. Eles geralmente não podem ser reduzidos a texto sem perda de significado e são pouco adequados para modelos de visão computacional projetados para fotografar cenas naturais.</p><p><code>jina-embeddings-v5-omni</code>Os embeddings abrangem informações sobre os objetos na imagem, o texto impresso neles e as relações entre eles. A recuperação visual de documentos possibilita indexar imagens ricas em informações que contêm tanto elementos quanto texto relevante, inclusive em diferentes idiomas.</p><p>Como exemplo, vamos usar quatro imagens de produtos de vários sites de comércio eletrônico:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt620568521e2a3057/6a17e888f7018418c89a68a8/639481349aed78d4139f0d388d44f79b6ba29f88-1297x650.png" alt="" /><p>Agora, vamos ver como <code>jina-embeddings-v5-omni-small</code> avalia essas quatro imagens para a consulta "miocarrão ramen":</p><p>Campbell’s Frango com Macarrão Grosso (embalagem canadense)</p><p>Kraft Dinner (embalagem canadense)</p><p>Ramen fresco sabor Maruchan Miso (embalagem japonesa)</p><p>Birkel Spaghetti (embalagem alemã)</p><p>0,0872</p><p>0,0711</p><p>0,1123</p><p>0,0886</p><p>Ele encontra facilmente a correspondência japonesa.</p><p>Agora, vamos tentar uma consulta para "マカロニチーズ" (japonês para <em>macarrão com queijo</em>):</p><p>Campbell’s Frango com Macarrão Grosso (embalagem canadense)</p><p>Kraft Dinner (embalagem canadense)</p><p>Ramen fresco sabor Maruchan Miso (embalagem japonesa)</p><p>Birkel Spaghetti (embalagem alemã)</p><p>0,2207</p><p>0,3487</p><p>0,2760</p><p>0,2674</p><p>Ele encontra a correspondência correta com a mesma facilidade que uma consulta em inglês.</p><p><code>jina-embeddings-v5-omni</code> também se destaca na interpretação de imagens ricas em informações, como gráficos. Para ver isso em ação, veja estes dois gráficos de barras:</p><p>Dois gráficos, <strong>Gráfico 1</strong> à esquerda, sobre a carga global de doenças, e <strong>Gráfico 2</strong> à direita, sobre a longevidade das raças de cães.</p><p>Vamos ver como eles correspondem a duas questões de texto potenciais, cada uma relevante para um, mas não para ambos os gráficos, usando <code>jina-embeddings-v5-omni-small</code> para recuperação:</p><p>Pergunta de texto</p><p>Gráfico 1</p><p>Gráfico 2</p><p>“Quais são alguns problemas médicos comuns para idosos?”</p><p>0,2787</p><p>0,1099</p><p>"Quanto tempo os cachorros vivem?"</p><p>0,1350</p><p>0,3564</p><p>Você também pode reverter a busca, usando imagens como consultas para encontrar textos. A tabela abaixo mostra documentos-alvo extraídos dos resumos de artigos científicos relacionados ao tópico e suas pontuações de recuperação, usando as imagens do gráfico como consultas:</p><p></p><p>Texto 1</p><p>Texto 2</p><p></p><p>A saúde das populações que vivem em extrema pobreza tem sido um foco de longa data dos esforços de desenvolvimento global e continua sendo uma prioridade durante a era dos Objetivos de Desenvolvimento Sustentável. No entanto, não houve uma tentativa sistemática de quantificar a magnitude e as causas da carga nessa população específica por quase duas décadas. Estimamos as taxas de doenças por causa para o bilhão mais pobre do mundo e comparamos essas taxas com as de populações de alta renda.</p><p>O cão de companhia é uma das espécies mais fenotipicamente diversas. A variabilidade entre raças se estende não apenas à morfologia e aspectos do comportamento, mas também à longevidade. Apesar desse fato, poucas pesquisas têm sido dedicadas à avaliação da variação na expectativa de vida entre raças ou à avaliação do potencial para caracterização filogenética da longevidade.</p><p>Gráfico 1</p><p>0,2377</p><p>0,1357</p><p>Gráfico 2</p><p>0,0673</p><p>0,3576</p><h2>Recursos</h2><h3>Embeddings truncáveis</h3><p>Treinamos os modelos de base <code>jina-embeddings-v5-text</code> que sustentam <code>jina-embeddings-v5-omni</code> com <a href="https://arxiv.org/abs/2205.13147">Aprendizado de Representação Matryoshka</a>, para que você possa truncar embeddings de texto e multimídia desses modelos.</p><p>Por padrão, <code>jina-embeddings-v5-omni-small</code> gera embeddings com 1.024 dimensões, consumindo 2KB para armazenar com precisão de 16 bits. Os embeddings do <code>jina-embeddings-v5-omni-nano</code> têm 768 dimensões, ocupando cerca de 1,5KB. Você pode reduzir o tamanho desses embeddings para 32 dimensões (64 bytes) a algum custo para a precisão, mas com grande ganho na velocidade de processamento e redução dos custos de recursos. Em geral, reduzir o tamanho dos embeddings pela metade diminui a precisão em cerca de 2%, até 128 dimensões, abaixo das quais a precisão cai muito mais rápido.</p><p>Embeddings truncáveis permitem que os usuários decidam o melhor compromisso entre precisão, velocidade e custo, de acordo com seus casos de uso.</p><h3>Quantização</h3><p>A família <code>jina-embeddings-v5-omni</code> também herda desempenho robusto com quantização de sua estrutura principal <code>jina-embeddings-v5-text</code>. Isso aumenta ainda mais a velocidade e reduz os custos de computação e armazenamento ao armazenar números menos precisos. Nós os treinamos para funcionar com <a href="https://elastic.co/elasticsearch">Elasticsearch</a>e sua <a href="https://www.elastic.co/docs/reference/elasticsearch/mapping-reference/bbq">Quantização Binária Aprimorada</a> (BBQ), para fornecer desempenho quase idêntico ao de embeddings não quantizados. No conjunto de benchmarks de recuperação Massive Text Embedding Benchmark (MTEB), a binarização reduz o desempenho em menos de 3% em comparação com valores completos de 16 bits, enquanto economiza 93% do espaço e aumenta drasticamente as velocidades de processamento e recuperação.</p><h3>Desempenho multilíngue</h3><p><code>jina-embeddings-v5-text</code>O extenso treinamento multilíngue também está presente em <code>jina-embeddings-v5-omni</code>, com quase 100 idiomas na pré-formação de <code>jina-embeddings-v5-text-small</code> e 15 principais línguas globais em <code>jina-embeddings-v5-text-nano</code>. Para mídia de áudio, o modelo <code>Whisper-large-v3</code> possui aproximadamente 100 idiomas em seu treinamento, e os modelos de visão SigLip2 modificados por Qwen, integrados em <code>jina-embeddings-v5-omni-small</code> e <code>-nano</code>, foram treinados com dados de 201 idiomas e dialetos distintos.</p><h2>Desempenho em benchmarks</h2><h3>Texto</h3><p><code>jina-embeddings-v5-omni</code> Os modelos são idênticos aos modelos <code>jina-embeddings-v5-text</code> quando usados apenas para texto. São os modelos com melhor desempenho no conjunto <a href="https://huggingface.co/spaces/mteb/leaderboard">de benchmarks MMTEB</a> em suas respectivas categorias de tamanho para embeddings semânticos de texto.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt14d87596ca463c88/6a17e88dec0f89dfb65a664f/8687106cf82e6ec2b3f79f893cfe011e4a5b4a21-1095x1095.png" alt="Um gráfico de barras e linhas compara as pontuações MMTEB e os tamanhos dos parâmetros para nove modelos de embedding, com jina-v3-omni-small alcançando a maior pontuação e snowflake-arctic-embed-l-v2 tendo o menor tamanho." /><p><strong>Figura 5</strong>: Tamanho e desempenho de <code>jina-embeddings-v5-omni</code>em benchmarks de texto, em comparação com modelos concorrentes. O tamanho citado é sem carregar extensões para outras mídias.</p><h3>Similaridade semântica visual</h3><p>Nos benchmarks padrão de similaridade semântica visual, <code>jina-embeddings-v5-omni</code> apresenta as melhores pontuações de qualquer modelo próximo ao seu tamanho. <code>jina-embeddings-v5-omni</code> modelos apresentam, de longe, o melhor desempenho entre os modelos públicos de pesos abertos de tamanho comparável. <code>jina-embeddings-v5-omni-small</code> só é superado por um modelo três vezes maior em tarefas de similaridade semântica visual, e <code>jina-embeddings-v5-omni-nano</code> é superado apenas por <code>jina-embeddings-v5-omni-small</code> e por modelos 10 a 25 vezes maiores.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt16ad3463d2aeefc5/6a17e88efaa9139b1493c8a9/f2ae56764865953bdf8c54747276189efd6d45e1-1496x877.png" alt="Um gráfico de barras e linhas compara as pontuações visuais de similaridade semântica e os tamanhos dos parâmetros para sete modelos de embedding, com jina-embeddings-v5-omni-small alcançando a maior pontuação de similaridade e laion/CLIP-ViT-bigG-14 apresentando o maior tamanho de modelo." /><p><strong>Figura 6</strong>: Benchmark de pontuação média de similaridade semântica visual para os modelos <code>jina-embeddings-v5-omni-small</code>, <code>jina-embeddings-v5-omni-nano</code> e comparáveis, além de seus tamanhos, incluindo extensões de visão.</p><h3>Recuperação visual de documentos</h3><p><code>jina-embeddings-v5-omni-small</code> é competitivo com modelos de três e sete bilhões de parâmetros, permanecendo abaixo de um bilhão de parâmetros. <code>jina-embeddings-v5-omni-nano</code> também se destaca pelo tamanho, superando modelos de dez a sessenta vezes maiores.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltcbabd1477ec3459c/6a17e890e317912a242d5806/cde672f18de8f4a30dd81938b08bb06e08444be0-1223x905.png" alt="Um gráfico de barras e linhas compara pontuações ViDoRe selecionadas e tamanhos de parâmetros para múltiplos modelos de embedding, com LCO‑Embedding‑Omni‑7B alcançando a maior pontuação e laion/CLIP‑ViT‑bigG‑14 com o maior tamanho de modelo. O foco está em dois modelos de jina-embeddings." /><p><strong>Figura 7</strong>: Pontuações médias <a href="https://huggingface.co/spaces/vidore/vidore-leaderboard">de recuperação visual de documentos do ViDoRe</a> em seis benchmarks: <em>DocVQA</em>, <em>InfoVQA</em>, <em>ShiftProj</em>, <em>SynAI</em>, <em>Tabfquad</em> e <em>TatDQA</em>.</p><h3>Recuperação de áudio</h3><p>Nos benchmarks padrão de recuperação de áudio MAEB (Massive Audio Embedding Benchmark), tanto <code>jina-embeddings-v5-omni-small</code> quanto <code>jina-embeddings-v5-omni-nano</code> estão entre os melhores desempenhos. Apenas modelos muito grandes — mais de três vezes maiores que <code>jina-embeddings-v5-omni-small</code> — superam sua pontuação.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt80f517c1c0230031/6a17e892dbb4ff8498fb56ee/a8c896bbbd710026c7b053e38af460194e7730a6-1650x912.png" alt="Um gráfico de barras e linhas compara modelos de incorporação e de áudio ao longo do eixo x, mostrando barras azuis para o MAEB Score no eixo y esquerdo e uma linha vermelha para o tamanho do modelo em bilhões de parâmetros no eixo y direito. As barras variam de aproximadamente 20 a 55, e a linha varia de 0 a 10." /><p><strong>Figura 8</strong>: Pontuação média para vários modelos nos benchmarks de recuperação de áudio MAEB.</p><p>Embora o modelo <code>larger_clap_general</code> da LAION melhore a pontuação do jina-embeddings-v5-omni-nano ao ter menos parâmetros, é um modelo apenas de áudio, sem nenhum dos recursos multimodais adicionais do conjunto v5-omni.</p><h3>Vídeo</h3><p>No vídeo, <code>jina-embeddings-v5-omni-small</code> se destaca em encontrar o lugar em um vídeo que corresponde a uma consulta de texto. Os testes Charades-STA e MomentSeeker são os benchmarks padrão para essa tarefa, e você pode ver nos gráficos abaixo que <code>jina-embeddings-v5-omni-small</code> é o modelo com melhor pontuação entre modelos de pesos abertos comparáveis, apesar de seu tamanho muito menor.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltc8d7e7570b64d45a/6a17e8944b055d34e643221b/a2d7744d39fefb6b8b1f66e5b3f227828ef4ad4e-1350x672.png" alt="Um gráfico de barras e linhas mostra as pontuações do Charades-STA e os tamanhos do modelo para seis modelos de embedding. O eixo X lista os modelos, o eixo Y esquerdo mostra as pontuações do Charades-STA de 20 a 60 e o eixo Y direito mostra o tamanho do modelo (em bilhões de parâmetros) de 0 a 10. As barras azuis representam as pontuações, e uma linha vermelha com marcadores representa os tamanhos dos modelos." /><p><strong>Figura 9</strong>: Pontuações Charades-STA para vários modelos, junto com seus tamanhos.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltfbce6716a3a33ca5/6a17e89525daab2e8a08a26d/cf7578863fd509edb62c15878816d39657abc715-1550x845.png" alt="Um gráfico de barras e linhas compara seis modelos de embedding usando as pontuações do MomentSeeker e o tamanho do modelo. O eixo X lista os modelos, o eixo Y esquerdo mostra as pontuações do MomentSeeker de aproximadamente 44 a 60, e o eixo Y direito mostra o tamanho do modelo em bilhões de parâmetros de 0 a 10. As barras azuis representam as pontuações, e uma linha vermelha com marcadores representa os tamanhos dos modelos." /><p><strong>Figura 10</strong>: Pontuações do MomentSeeker para vários modelos, junto com seus tamanhos.</p><p>Também comparamos <code>jina-embeddings-v5-omni-small</code> com o <a href="https://seed.bytedance.com/en/blog/built-on-seed1-6-flash-seed-1-6-embedding-launched">Seed 1.6</a> da ByteDance, um modelo de peso fechado com contagem de parâmetros não divulgada. Nosso modelo supera o Seed 1.6 por uma grande margem no benchmark Charades-STA e quase iguala no MomentSeeker.</p><p>Modelo</p><p>Pontuação Charades-STA</p><p>Pontuação do MomentSeeker</p><p>seed-1.6-embedding</p><p>29,30</p><p>59,30</p><p>jina-embeddings-v5-omni-small</p><p>55,57</p><p>58,93</p><h2>Pontos fortes e limitações</h2><p><code>jina-embeddings-v5-omni</code> Os modelos ampliam a capacidade dos usuários de indexar, buscar e analisar informações digitalizadas de várias maneiras, particularmente:</p><ul><li><p>Recuperação de fala multilíngue a partir de consultas de texto.</p></li><li><p>PDF, digitalizações e busca visual de documentos.</p></li><li><p>Localização temporal em vídeos, ou seja, identificar trechos dos vídeos que correspondem a descrições em linguagem natural.</p></li><li><p>Classificação de gêneros de áudio, incluindo gêneros musicais.</p></li><li><p>Classificação de imagem baseada em informações da cena e identificação de objetos.</p></li></ul><p>O desempenho é mais limitado em outras áreas. Pode ser possível usar <code>jina-embeddings-v5-omni</code> para realizar essas tarefas, mas não treinamos para elas e os resultados podem ser ruins.</p><p>Estamos trabalhando ativamente para aprimorar nossa tecnologia nestas áreas:</p><ul><li><p>Encontrar vídeos específicos a partir de descrições em linguagem natural.</p></li><li><p>Similaridade semântica e recuperação de imagens (imagem para imagem).</p></li><li><p>Classificação de intenção na fala, como reconhecer comandos verbais.</p></li><li><p>Processamento de entradas multimídia, ou seja, imagens e textos acompanhantes, ou áudio, imagens e textos combinados.</p></li></ul><h2>Usando <strong>jina-embeddings-v5-omni</strong></h2><p>Este conjunto de modelos permite entrada por meio de três pontos de entrada: texto, áudio, imagens e vídeo juntos. <code>jina-embeddings-v5-omni</code> é executado em um framework que converte uma ampla variedade de formatos padronizados e realiza outros pré-processamentos.</p><p>Processamos as imagens usando a mesma <a href="https://arxiv.org/abs/2502.14786">abordagem NaFlex</a> fornecida na versão inicial do SigLip2: se a entrada for menor que 262.144 pixels (equivalente a 512x512), ela é ampliada até ficar maior que esse mínimo; e se for maior que 3.072.000 pixels, ela é reduzida até ficar menor que esse máximo. O processo de conversão garante que a altura e a largura da imagem sejam múltiplas de 14 pixels, com a menor distorção possível na proporção para atingir esse objetivo. O resultado é dividido em patches de 28x28 pixels, então o número total de patches é quantos quadrados de 28x28 forem necessários para cobrir a imagem. Cada patch é tratado como um único token no momento da inferência, e cada entrada de imagem é acompanhada por tokens especiais de início e fim para delimitar uma única imagem.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltf192cdba41155257/6a17e897abe0f2faaedfea2a/5ab7a8951780afdfe6eda9dca14add0375ae36bd-668x130.png" alt="Uma caixa de notificação retangular com fundo azul claro exibe um ícone amarelo de triângulo de advertência ao lado do texto, explicando que jina-embeddings-v5-omni é treinado para encontrar áudio, vídeo e imagens de consultas de texto e que consultas sem texto podem ser menos eficazes." /><p>Os modelos <code>jina-embeddings-v5-omni</code> modificam a resolução do vídeo da mesma forma que as imagens são modificadas (veja acima), e extraímos até 32 quadros do vídeo. Se o vídeo tiver mais de 32 quadros (o que é provável, já que os formatos padrão geralmente têm pelo menos 24 quadros por segundo), espaçaremos uniformemente os quadros que extraímos. Então, para cada dois quadros, o pré-processador de vídeo gera um conjunto de tokens igual ao número de quadrados 28x28 necessários para cobrir o vídeo.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt0acd4ddd95a66a53/6a17e898445de966214d0176/a38491c1cc47cfc65344c786e8ab57b9abf67e0b-1999x851.png" alt="Uma colagem de quadros de vídeo sequenciais é organizada com setas mostrando a progressão, representando uma série de cenas com Audrey Hepburn em diferentes momentos, terminando com um quadro exibindo o título &quot;Bonequinha de Luxo&quot;. O layout mostra que o modelo extrai 64 quadros igualmente espaçados de um vídeo, o que pode causar perda significativa de informações quando o vídeo é longo." /><p><strong>Figura 11:</strong> <code>jina-embeddings-v5-omni</code> extrai 32 quadros igualmente espaçados do vídeo. Se você tiver um vídeo longo, isso significa que muita coisa será perdida.</p><p>Para mais detalhes sobre pré-processamento de vídeo, veja a <a href="https://arxiv.org/abs/2502.14786">documentação técnica do SigLip2</a>.</p><p>A tokenização de áudio segue a abordagem incorporada ao Qwen-2.5-Omni: Os arquivos de som são cortados em segmentos de 30 segundos; se tiverem mais de 30 segundos, serão reamostrados para 16 kHz e transformados em um mel espectrograma de 128 canais Cada 40 ms é tratado como um único token, portanto, cada segmento de 30 segundos é tratado como 750 tokens, um token por 40 ms de áudio, além de tokens especiais de início e fim para delimitar uma única amostra.</p><p>Para mais detalhes sobre pré-processamento de áudio, veja o <a href="https://arxiv.org/abs/2503.20215">Relatório Técnico Qwen-2.5-Omni</a>.</p><h2>Disponibilidade</h2><p>Tanto <code>jina-embeddings-v5-omni-small</code> quanto <code>jina-embeddings-v5-omni-nano</code> estão disponíveis no <a href="https://www.elastic.co/docs/explore-analyze/elastic-inference/eis">Elastic Inference Service</a> (EIS), por meio da <a href="https://jina.ai/embeddings">API Jina</a>, e para instalação local por download (<a href="https://huggingface.co/jinaai/jina-embeddings-v5-omni-small"><code>small</code></a> e <a href="https://huggingface.co/jinaai/jina-embeddings-v5-omni-nano"><code>nano</code></a>). Os pesos dos modelos são distribuídos gratuitamente para teste em uma licença não comercial. Entre em contato com <a href="https://www.elastic.co/contact?pg=global&amp;plcmt=nav&amp;cta=205352">as vendas da Elastic</a> para uso comercial.</p><h2>Para começar</h2><p>Para usar <code>jina-embeddings-v5-omni</code> para texto, você pode integrar usando o campo <code>semantic_text</code> assim como com <code>jina-embeddings-v5-text</code>. Basta definir o <code>inference_id</code> para <code>.jina-embeddings-v5-omni-small</code> ou <code>.jina-embeddings-v5-omni-nano</code>. Consulte o <a href="https://www.elastic.co/docs/reference/elasticsearch/mapping-reference/semantic-text-how-tos">Guia de Referência</a> para obter instruções.</p><p>Para incorporar outras mídias com <code>jina-embeddings-v5-omni</code>, você precisa <a href="https://www.elastic.co/docs/api/doc/elasticsearch/operation/operation-inference-embedding">usar a API de inferência</a>. Por exemplo:</p>POST _inference/embedding/.jina-embeddings-v5-omni-small
{
  "input": [
    {
      "content": { 
        "type": "image", 
        "format": "base64", 
        "value": "data:image/jpeg;base64,..." 
      } 
    }, 
    { 
      "content": { 
        "type": "text", 
        "value": "Some text to create an embedding" 
      } 
    } 
  ] 
}<p>Para <code>jina-embeddings-v5-omni-nano</code>, mude o URI <code>POST</code> para <code>_inference/embedding/.jina-embeddings-v5-omni-nano</code>.</p><p>Para codificar documentos em outras mídias ou gerar embeddings para classificação ou clustering, você precisa <a href="https://www.elastic.co/docs/api/doc/elasticsearch-serverless/operation/operation-inference-put-jinaai"><u>criar um endpoint de inferência com o </u></a><a href="https://www.elastic.co/docs/api/doc/elasticsearch-serverless/operation/operation-inference-put-jinaai"><u>serviço</u></a> <u><code>jinaai</code></u>.</p><p>Para consultas, use o construtor de consultas como no exemplo abaixo. Troque o valor <code>inference_id</code> por <code>.jina-embeddings-v5-omni-nano</code> para usar o modelo <code>nano</code> em vez de <code>small</code>.</p>POST my-index/_search
{
  "knn": {
    "field": "dense-vector-field",
    "k": 10,
    "num_candidates": 100,
    "query_vector_builder": {
      "embedding": {
        "inference_id": ".jina-embeddings-v5-omni-small",
        "input": {
          "type": "image",
          "format": "base64",
          "value": "data:image/jpeg;base64,..."
        }
      }
    }
  }
}<p>Saiba mais na <a href="https://www.elastic.co/docs/reference/query-languages/query-dsl/query-dsl-knn-query#knn-query-builder-embedding">documentação do construtor de consultas</a>.</p><p>Para usar BBQ com <code>jina-embeddings-v5-omni</code>, siga<a href="https://www.elastic.co/docs/reference/elasticsearch/mapping-reference/bbq"> as instruções para indexação BBQ</a>.</p><h2>Mais informações</h2><p>Para mais informações sobre <code>jina-embeddings-v5-omni</code>, consulte o <a href="https://arxiv.org/html/2605.08384v2">relatório técnico</a> e a página do modelo no <a href="https://jina.ai/models/">website da Jina AI</a>. A <a href="https://huggingface.co/collections/jinaai/jina-embeddings-v5-omni">página da coleção jina-embeddings-v5-omni no Hugging Face</a> também contém informações técnicas e instruções para baixar e executar esses modelos localmente. Os modelos <code>jina-embeddings-v5-omni</code> podem ser baixados sob uma licença <a href="https://creativecommons.org/licenses/by-nc/4.0/deed.en">CC-BY-NC-4.0</a>, portanto, você pode experimentá-los livremente, mas para uso comercial, por favor, entre em contato com a equipe de vendas da Elastic.</p>]]></content:encoded>
    <link>https://www.elastic.co/search-labs/blog/jina-embeddings-v5-omni-all-media-one-index</link>
    <guid isPermaLink="true">https://www.elastic.co/search-labs/blog/jina-embeddings-v5-omni-all-media-one-index</guid>
    <category><![CDATA[Jina AI]]></category>
    <dc:creator><![CDATA[Scott Martens]]></dc:creator>
    <enclosure url="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt61bf5ce9de247ac5/6a17e89a7b54f9f4108b390f/b51e488ba5b90bec77f75af0b9cb4f0e25e20b91-1130x635.png" length="0" type="image/png"/>
    <pubDate>Mon, 11 May 2026 00:00:00 GMT</pubDate>
  </item>
  <item>
    <title><![CDATA[jina-embeddings-v5-text: Incorporações de texto compactas e de última geração para busca e aplicações inteligentes]]></title>
    <description><![CDATA[Apresentação dos modelos jina-embeddings-v5-text models, including jina-embeddings-v5-text-small e jina-embeddings-v5-text-nano explicando como usar esses modelos de incorporação multilíngue por meio do Elastic Inference Service (EIS).]]></description>
    <content:encoded><![CDATA[<p>A Jina AI e a Elastic estão lançando <code>jina-embeddings-v5-text</code>, uma família de novos modelos compactos de incorporação de texto de alto desempenho, com desempenho de última geração para modelos de tamanho comparável em todos os principais tipos de tarefas.</p><p>A família inclui dois modelos:</p><ul><li><p><code>jina-embeddings-v5-text-small</code></p></li><li><p><code>jina-embeddings-v5-text-nano</code></p></li></ul><p>Esses modelos são o resultado bem-sucedido de uma nova receita inovadora de treinamento para incorporação de modelos. Ambos superam modelos muitas vezes maiores que eles, gerando economia de memória e recursos computacionais e respondendo mais rápido a solicitações.</p><p>O modelo <code>jina-embeddings-v5-text-small</code> possui 677 milhões de parâmetros, é compatível com uma janela de contexto de entrada de 32.768 tokens e gera embeddings de 1.024 dimensões por padrão.</p><p><code>jina-embeddings-v5-text-nano</code> Pesa cerca de um terço do tamanho da nova versão, com 239 milhões de parâmetros e uma janela de contexto de entrada de 8.192 tokens, resultando em embeddings de dimensão 768 compactos.</p><p>Nome do modelo</p><p>Tamanho total</p><p>Tamanho da janela de contexto de entrada</p><p>Tamanho do embedding</p><p>jina-v5-text-small</p><p>677M params</p><p>32.768 tokens</p><p>1.024 dims</p><p>jina-v5-text-nano</p><p>239M params</p><p>8.192 tokens</p><p>768 dimensões</p><p>Esses dois modelos são os melhores da categoria para o desempenho geral do benchmark MMTEB (<a href="https://huggingface.co/spaces/mteb/leaderboard">Multilingual MTEB</a>). Entre os modelos com menos de 500M, <code>jina-embeddings-v5-text-nano</code> é o de melhor desempenho, apesar de ter menos de 250M, e o modelo <code>jina-embeddings-v5-text-small</code> é o líder entre os modelos de embedding multilíngue com menos de 750M.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltb2f2be8618f5e240/6a17dbb83e9e45b7f3ba1344/d97126285fa196c3045b1913b7754e4b186c1e4c-1300x1100.png" alt="jina-embeddings-v5-text pontuações MMTEB" /><p>Esses modelos estão disponíveis por meio do Elastic Inference Service (EIS), de uma API online e para hospedagem local. Para instruções sobre como acessar os modelos <code>jina-embeddings-v5-text</code>, veja a seção "<strong>Começar</strong>" abaixo.</p><p>Modelos de incorporação e indexação semântica aumentam muito a precisão dos algoritmos de busca, mas também têm uma variedade de outros usos para tarefas envolvendo similaridade semântica e extração de significado, por exemplo:</p><ul><li><p>Encontrando textos duplicados.</p></li><li><p>Reconhecendo paráfrases e traduções.</p></li><li><p>Descoberta de tópicos.</p></li><li><p>Mecanismos de recomendação.</p></li><li><p>Análise de sentimentos e intenções.</p></li><li><p>Filtragem de spam.</p></li><li><p>E muitos outros.</p></li></ul><h2><strong>Recursos</strong></h2><p>Essa nova família de modelos possui uma série de recursos projetados para aumentar a relevância e reduzir custos.</p><h3>Otimização de tarefas</h3><p>Otimizamos os modelos <code>jina-embeddings-v5-text</code> para quatro tipos amplos de tarefas:</p><p>Tarefa</p><p>Exemplos de casos de uso</p><p>Recuperação</p><p>Busca com consultas em linguagem natural e recuperação das correspondências mais relevantes em um conjunto de documentos.</p><p>Correspondência de texto</p><p>Similaridade semântica, desduplicação, alinhamento de paráfrases e traduções, e muito mais.</p><p>Clustering</p><p>Descoberta de tópicos, organização automática de coleções de documentos.</p><p>Classificação</p><p>Categorização de documentos, detecção de sentimentos e intenções, tarefas similares.</p><p>Otimizar para uma tarefa geralmente significa ter que ceder em outra, então a maioria dos modelos de embedding só tem desempenho competitivo para um tipo de tarefa. Mas os modelos <code>jina-embeddings-v5-text</code> são capazes de se especializar em todas as quatro áreas sem comprometer o desempenho, treinando <a href="https://arxiv.org/abs/2106.09685">adaptadores compactos de Low-Rank Adaptation (LoRA)</a> específicos para cada tarefa.</p><p>Adaptadores LoRA são uma espécie de plugin para um modelo de IA que muda o comportamento, aumentando ligeiramente o tamanho total. Em vez de ter um modelo inteiro para cada tarefa, cada um com centenas de milhões de parâmetros, a família de modelos <code>jina-embeddings-v5-text</code> permite que você use um modelo com um adaptador compacto LoRA para cada tarefa. Isso economiza memória, espaço de armazenamento e custos de inferência.</p><h3>Truncando embeddings</h3><p>Treinamos os modelos <code>jina-embeddings-v5-text</code> usando o <a href="https://arxiv.org/abs/2205.13147">Aprendizado de representação Matryoshka</a>, que permite reduzir seus embeddings para tamanhos menores com um custo mínimo para a qualidade deles.</p><p>Por padrão, <code>jina-embeddings-v5-text-small</code> gera vetores de embedding de 1024 dimensões, cada um representado por um número de 16 bits, fazendo com que cada embedding tenha 2KB de tamanho. Para um grande conjunto de documentos, isso pode representar uma grande quantidade de dados para armazenar, e a busca em um banco de dados vetorial repleto de embeddings é proporcional tanto ao tamanho do banco de dados quanto ao número de dimensões que cada vetor armazenado possui.</p><p>Mas você pode reduzir pela metade o tamanho dos embeddings (descartar 512 das 1024 dimensões) e ocupar metade do espaço enquanto dobra a velocidade das buscas. Isso tem um impacto no desempenho. Descartar informações reduz a precisão. Mas, como mostra o gráfico abaixo, mesmo ao eliminar metade do embedding, a redução de desempenho é mínima:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt8deea6ee69a6b77d/6a17dbba0b0bed2217dd347e/f11969682c81bcf22b5b29a6204ba6ec40471b3d-900x700.png" alt="tamanho de embedding jina-embeddings-v5-text-small &amp; jina-embeddings-v5-text-nano" /><p>Desde que suas embeddings tenham pelo menos 256 dimensões, a perda de precisão deve permanecer relativamente pequena. Abaixo desse nível, porém, a relevância e a precisão se deterioram rapidamente.</p><p>Truncar embeddings como esse permite aos usuários gerenciar as próprias trocas entre precisão e custos computacionais. Ela oferece ferramentas para ter grandes ganhos de eficiência e grandes economias de custos com a IA de busca.</p><h3>Quantização robusta</h3><p><em>Quantização </em>é outra forma de reduzir o tamanho das embeddings. Em vez de descartar parte de cada incorporação, a quantização reduz a precisão dos números na embedding. Os modelos <code>jina-embeddings-v5-text</code> geram embeddings com números de 16 bits, mas podemos arredondar esses números, reduzindo a precisão e o número de bits necessários para armazená-los. No caso mais extremo, podemos reduzir cada número a um bit (0 ou 1), comprimindo as embeddings padrão de 1024 dimensões de <code>jina-embeddings-v5-text</code>de 2 kilobytes para 128 bytes, uma redução de 94% apenas com a quantização binária. Assim como para a truncagem, isso produz grandes economias em memória e custos computacionais. No entanto, assim como a truncagem, a quantização torna as embeddings menos precisas.</p><p>Treinamos os modelos <code>jina-embeddings-v5-text</code> para funcionar com a <a href="https://www.elastic.co/docs/reference/elasticsearch/mapping-reference/bbq">Better Binary Quantization (BBQ)</a> do <a href="https://www.elastic.co/pt/elasticsearch">Elasticsearch</a>, minimizando a perda de precisão. Os testes de benchmark de embeddings binarizados desses modelos mostram desempenho quase igual aos equivalentes não binarizados. Consulte <a href="https://arxiv.org/abs/2602.15547">o relatório técnico</a> para estudos detalhados de ablação sobre o desempenho da binarização.</p><h3>Desempenho multilíngue</h3><p>Muitos modelos de embedding são multilíngues porque foram treinados com materiais que incluem um grande número de linguagens. Mas isso não significa que todos tenham o mesmo desempenho em todas as linguagens disponíveis.</p><p>Identificamos 211 linguagens no benchmark multilíngue MMTEB e os separamos para que pudéssemos comparar nossos modelos com modelos semelhantes linguagem por linguagem. A imagem abaixo resume nossos resultados como um mapa de calor. Cada patch é uma linguagem (identificada pelo código ISO-639), e quanto mais verde ela é, melhor o modelo teve desempenho em comparação com a média de modelos similares:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltee08033102f46c4f/6a17dbbc420229503229f4c8/852ac5d0f1977bb0c1124d87f8863a9bb94eb7da-1600x765.png" alt="As linguagens ina-embeddings-v5-text-nano e jina-embeddings-v5-text-small no benchmark multilíngue MMTEB" /><p>Embora a precisão varie entre as linguagens, os modelos <code>jina-embeddings-v5-text</code> são de ponta ou quase isso na maioria das linguagens do mundo.</p><p>Para saber detalhes sobre o desempenho multilíngue, consulte o <a href="https://arxiv.org/abs/2602.15547"><code>jina-embeddings-v5-text</code></a><a href="https://arxiv.org/abs/2602.15547"> relatório técnico</a>.</p><h2><strong>Jina no Elastic: IA nativa de última geração para busca</strong></h2><p>Com <code>jina-embeddings-v5-text</code> modelos no EIS, você pode executar modelos de embedding multilíngue de alto desempenho de forma nativa no <a href="https://www.elastic.co/pt/elasticsearch">Elasticsearch</a>, com inferência totalmente gerenciada e acelerada por GPU, sem infraestrutura para provisão ou redimensionamento. <code>jina-embeddings-v5-text</code> modelos ampliam o catálogo cada vez maior de modelos EIS com modelos compactos e multilíngues, impulsionados pelos mais recentes avanços em IA. Esses modelos têm desempenho de ponta em recuperação de informações e benchmarks padrão de análise de dados, além de oferecer suporte multilíngue incomparável e global.</p><p>Com dois modelos de tamanhos muito diferentes, os usuários podem definir qual é o mais adequado para as aplicações e orçamentos. Além disso, com embeddings robustas que mantêm o desempenho quando truncadas para tamanhos menores ou quantizadas com menor precisão, <code>jina-embeddings-v5-text </code>modelos oferecem oportunidades para economias concretas adicionais em custos de armazenamento e computação, bem como na latência de processamento.</p><p>Com a família <code>jina-embeddings-v5-text</code> , Jina Reranker e a busca vetorial rápida e BM25 da Elastic, os usuários agora têm acesso à <a href="https://www.elastic.co/docs/solutions/search/hybrid-search">busca híbrida</a> de ponta a ponta e de última geração da Elastic. Quando você precisa dos resultados mais relevantes, seja para pipelines de Retrieval-Augmented Generation (RAG), aplicações de busca ou análise de dados, a Elastic com modelos de IA de busca Jina oferece qualidade sólida e econômica.</p><h2><strong>Para começar</strong></h2><p>Os modelos <code>jina-embeddings-v5-text</code> estão totalmente integrados ao <a href="https://www.elastic.co/docs/explore-analyze/elastic-inference/eis">EIS</a> e você pode usá-los definindo o <strong><code>type</code></strong>campo para<strong><code>semantic_text</code></strong> ao criar seu índice e especificar o modelo (<code>jina-embeddings-v5-text-small</code> ou <code>jina-embeddings-v5-text-nano</code>) no <code>inference_id</code>campo, como neste exemplo:</p>PUT multilingual-semantic-index
{
  "mappings": {
    "properties": {
      "content": {
        "type": "semantic_text",
        "inference_id": ".jina-embeddings-v5-text-small"
      }
    }
  }
}

# Ingest data about France
POST multilingual-semantic-index/_doc
{
  "content": "The capital of France is Paris"}

GET multilingual-semantic-index/_search
{
  "query": {
    "semantic": {
      "field": "content",
      "query": "What is the French capital?"
    }
  }
}<p>O <a href="https://www.elastic.co/pt/elasticsearch">Elasticsearch</a> seleciona automaticamente o adaptador LoRA apropriado durante a indexação e a recuperação. As dimensões de embedding (veja a seção "<strong>Truncando embeddings</strong> ", acima) podem ser definidas ao <a href="https://www.elastic.co/docs/api/doc/elasticsearch/operation/operation-inference-put">criar um endpoint de inferência personalizado</a>.</p><p>Consulte a <a href="https://www.elastic.co/docs/reference/elasticsearch/mapping-reference/dense-vector">documentação do Elasticsearch</a> para saber mais informações sobre como usar os modelos <strong><code>jina-embeddings-v5-text</code></strong> .</p><h2><strong>Mais informações</strong></h2><p>Para saber mais sobre os modelos <code>jina-embeddings-v5-text</code> , leia as <a href="https://jina.ai/news/jina-embeddings-v5-text-distilling-4b-quality-into-sub-1b-multilingual-embeddings/">notas de lançamento no blog da Jina AI</a> e o <a href="https://arxiv.org/abs/2602.15547">relatório técnico</a>, que contém informações técnicas mais detalhadas sobre o desempenho e o novo procedimento de treinamento inovador da Jina AI. Para saber informações sobre como fazer download e executar esses modelos de forma local, acesse a<a href="https://huggingface.co/collections/jinaai/jina-embeddings-v5-text"> página da coleção</a> <a href="https://huggingface.co/collections/jinaai/jina-embeddings-v5-text"><code>jina-embeddings-v5-text</code></a>na Hugging Face.</p><p>Os modelos de Jina AI estão disponíveis sob a <a href="https://spdx.org/licenses/CC-BY-NC-4.0">licença CC-BY-NC-4.0</a>, portanto, você pode baixá-los e experimentá-los de forma livre, mas para uso comercial, entre em contato com a <a href="https://www.elastic.co/contact?pg=global&amp;plcmt=nav&amp;cta=205352">equipe de vendas da Elastic</a>.</p>]]></content:encoded>
    <link>https://www.elastic.co/search-labs/blog/jina-embeddings-v5-text</link>
    <guid isPermaLink="true">https://www.elastic.co/search-labs/blog/jina-embeddings-v5-text</guid>
    <category><![CDATA[Jina AI]]></category>
    <dc:creator><![CDATA[Scott Martens,Sofia Vasileva]]></dc:creator>
    <enclosure url="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltfd81be89ffe5b036/6a17dbbd445de9b55e4cffd1/e98dd30ab925b4bb32830228d71a1a51d02a0917-1600x840.png" length="0" type="image/png"/>
    <pubDate>Mon, 23 Feb 2026 00:00:00 GMT</pubDate>
  </item>
  <item>
    <title><![CDATA[Uma introdução aos modelos Jina, sua funcionalidade e seus usos no Elasticsearch]]></title>
    <description><![CDATA[Confira os embeddings multimodais Jina, o Reranker v3 e os modelos semânticos de embedding, além de como usá-los nativamente no Elasticsearch.]]></description>
    <content:encoded><![CDATA[<p>O Jina by Elastic fornece modelos de base para busca voltados a aplicações e automação de processos de negócio. Esses modelos oferecem funcionalidades essenciais para levar IA a aplicações no Elasticsearch e a projetos inovadores baseados em IA.</p><p>Os modelos Jina se enquadram em três grandes categorias, projetadas para dar suporte ao processamento, à organização e à recuperação de informações:</p><ul><li><p>Modelos de embedding semântico</p></li><li><p>Modelos de reclassificação</p></li><li><p>Modelos de linguagem generativos de pequeno porte</p></li></ul><h2>Modelos de embedding semântico</h2><p>A ideia por trás dos embeddings semânticos é que um modelo de IA pode aprender a representar aspectos do significado de suas entradas em termos da geometria de espaços de alta dimensionalidade.</p><p>É possível pensar em um embedding semântico como um ponto (tecnicamente, um <em>vetor</em>) em um espaço de alta dimensionalidade. Um modelo de embedding é uma rede neural que recebe algum tipo de dado digital como entrada, potencialmente qualquer tipo, mas mais comumente texto ou imagem, e produz a localização de um ponto correspondente em um espaço de alta dimensionalidade, representada por um conjunto de coordenadas numéricas. Quando o modelo executa bem sua função, a distância entre dois embeddings semânticos é proporcional ao quanto os objetos digitais correspondentes compartilham o mesmo significado.</p><p>Para entender por que isso é importante para aplicações de busca, imagine um embedding para a palavra “cão” e outro para a palavra “gato” como pontos em um espaço.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltbad74e5d8292a60e/6a17db73abe0f2114edfe8d2/802cf9bbcb82180d3fc91009f9f62027eee8f031-615x615.png" alt="" /><p>Um bom modelo de embedding deve gerar um embedding para a palavra “felino” muito mais próximo de “gato” do que de “cão”, e “canino” deve ter um embedding muito mais próximo de “cão” do que de “gato”, porque essas palavras têm praticamente o mesmo significado.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltdb2b25691801a881/6a17db747b54f946d28b37a5/bce49daf9a31b8fb7ce1c6ef7ae4e8117a4e8b33-615x615.png" alt="" /><p>Se um modelo for multilíngue, espera-se o mesmo comportamento para traduções de “gato” e “cão” em outros idiomas.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt976ba40be7776449/6a17db75be6086c2bd0045f2/ce4d030385324526cbd7539140e0e634d939371c-615x615.png" alt="" /><p>Modelos de embedding traduzem similaridade ou dissimilaridade de significado entre elementos em relações espaciais entre embeddings. As imagens acima têm apenas duas dimensões para que seja possível visualizá-las na tela, mas modelos de embedding produzem vetores com dezenas a milhares de dimensões. Isso permite codificar sutilezas de significado para textos inteiros, atribuindo um ponto em um espaço com centenas ou milhares de dimensões a documentos com milhares de palavras ou mais.</p><h2>Embeddings multimodais</h2><p>Modelos multimodais estendem o conceito de embeddings semânticos para além de textos, especialmente para imagens. Espera-se que o embedding de uma imagem fique próximo ao embedding de uma descrição fiel dessa imagem.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt66dc8895485734ec/6a17db77b1e11318d279f155/1ac6aef5b1423e5fe4853e8a547a74e66b0885c2-615x615.png" alt="" /><p>Embeddings semânticos têm muitos usos. Entre outras aplicações, é possível usá-los para criar classificadores eficientes, realizar clustering de dados e executar diversas tarefas, como deduplicação de dados e investigação da diversidade dos dados, ambas importantes para aplicações de big data que lidam com volumes de informação grandes demais para serem gerenciados manualmente.</p><p>O principal uso direto de embeddings está na recuperação de informações. O Elasticsearch pode armazenar objetos de recuperação com embeddings como chaves. As consultas são convertidas em vetores de embedding, e a busca retorna os objetos armazenados cujas chaves estão mais próximas do embedding da consulta.</p><p>Enquanto <em>a recuperação tradicional baseada em vetores</em> (às vezes chamada de <em>recuperação por vetores esparsos</em>) usa vetores baseados em palavras ou metadados presentes em documentos e consultas, a <em>recuperação baseada em embeddings</em> (também conhecida como <em>recuperação por vetores densos</em>) usa significados avaliados por IA em vez de palavras. Isso a torna, em geral, muito mais flexível e mais precisa do que métodos tradicionais de busca.</p><h2>Aprendizado de representação Matryoshka</h2><p>O número de dimensões de um embedding, assim como a precisão dos valores numéricos que o compõem, tem impactos significativos na performance. Espaços de dimensionalidade muito alta e números de precisão extremamente elevada podem representar informações altamente detalhadas e complexas, mas exigem modelos de IA maiores, mais caros para treinar e para executar. Os vetores que esses modelos geram requerem mais espaço de armazenamento, e são necessários mais ciclos de computação para calcular as distâncias entre eles. Usar modelos de embedding semântico envolve fazer concessões importantes entre precisão e consumo de recursos.</p><p>Para maximizar a flexibilidade para os usuários, os modelos Jina são treinados com uma técnica chamada <a href="https://arxiv.org/abs/2205.13147">Aprendizado de Representação Matryoshka</a>. Essa abordagem faz com que os modelos concentrem as distinções semânticas mais importantes nas primeiras dimensões do vetor de embedding, de modo que seja possível descartar as dimensões mais altas e ainda assim obter bom desempenho.</p><p>Na prática, isso significa que usuários dos modelos Jina podem escolher quantas dimensões desejam que seus embeddings tenham. Escolher menos dimensões reduz a precisão, mas a degradação de performance é pequena. Na maioria das tarefas, as métricas de performance dos modelos Jina caem entre 1% e 2% sempre que o tamanho do embedding é reduzido em 50%, até uma redução total de cerca de 95% no tamanho.</p><h2>Recuperação assimétrica</h2><p>A similaridade semântica geralmente é medida de forma simétrica. O valor obtido ao comparar “gato” com “cão” é o mesmo que ao comparar “cão” com “gato”. No entanto, quando embeddings são usados para recuperação de informações, o desempenho melhora quando essa simetria é quebrada e as consultas são codificadas de forma diferente dos objetos de recuperação.</p><p>Isso ocorre por causa da forma como treinamos modelos de embedding. Os dados de treinamento contêm ocorrências dos mesmos elementos, como palavras, em muitos contextos diferentes, e os modelos aprendem semântica comparando similaridades e diferenças contextuais entre esses elementos.</p><p>Assim, por exemplo, pode acontecer de a palavra “animal” não aparecer em muitos dos mesmos contextos que “gato” ou “cão”, e, portanto, o embedding de “animal” não ficar particularmente próximo de “gato” ou “cão”.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltf219074e18a6290a/6a17db78be6086cf060045f6/9a33163405af6c71ee7f4ba8ebc86af39e295a69-615x615.png" alt="" /><p>Isso torna menos provável que uma consulta por “animal” recupere documentos sobre gatos e cães — justamente o oposto do nosso objetivo. Por isso, em vez disso, codificamos “animal” de forma diferente quando ele aparece como consulta do que quando é um alvo de recuperação.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt33438b4964001467/6a17db79b1e113101c79f159/363992d4f0affba7937c0c8a9f82c9a531fcd3ba-615x615.png" alt="" /><p><em>Recuperação assimétrica</em> significa usar um modelo diferente para consultas ou treinar especificamente um modelo de embedding para codificar os dados de uma forma quando são armazenados para recuperação e de outra forma quando são usados como consultas.</p><h2>Embeddings multivetoriais</h2><p>Embeddings únicos funcionam bem para recuperação de informações porque se encaixam no modelo básico de um banco de dados indexado: armazenamos objetos para recuperação usando um único vetor de embedding como chave de recuperação. Quando usuários consultam o repositório de documentos, suas consultas são traduzidas em vetores de embedding, e os documentos cujas chaves estão mais próximas do embedding da consulta, no espaço de embeddings de alta dimensionalidade, são recuperados como candidatos.</p><p>Embeddings multivetoriais funcionam de forma um pouco diferente. Em vez de gerar um vetor de comprimento fixo para representar uma consulta e um objeto armazenado inteiro, eles produzem uma sequência de embeddings que representam partes menores desses elementos. Essas partes geralmente são tokens ou palavras no caso de textos, e blocos de imagem no caso de dados visuais. Esses embeddings refletem o significado de cada parte dentro de seu contexto.</p><p>Por exemplo, considere estas frases:</p><ul><li><p>Ela tinha um coração de ouro.</p></li><li><p>Ela fez das tripas coração.</p></li><li><p>Ela teve um ataque do coração.</p></li></ul><p>Superficialmente, essas frases parecem muito semelhantes, mas um modelo multivetorial provavelmente geraria embeddings bem diferentes para cada ocorrência de “coração”, representando como cada uma assume um significado distinto no contexto da frase como um todo.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt5c81f089771e6029/6a17db7b7f6f157601c099ec/a33e60c8d8ee3d312bca8375ca2a8b0a0cd40ba9-615x615.png" alt="" /><p>Comparar dois objetos por meio de seus embeddings multivetoriais geralmente envolve medir a distância de Chamfer: comparar cada parte de um embedding multivetorial com cada parte de outro e somar as menores distâncias entre elas. Outros sistemas, incluindo os reclassificadores Jina descritos abaixo, usam esses embeddings como entrada para um modelo de IA treinado especificamente para avaliar sua similaridade. Ambas as abordagens normalmente apresentam maior precisão do que a simples comparação de embeddings de vetor único, porque embeddings multivetoriais contêm informações muito mais detalhadas do que embeddings de vetor único.</p><p>No entanto, embeddings multivetoriais não são adequados para indexação. Eles costumam ser usados em tarefas de reclassificação, conforme descrito para o modelo <code>jina-colbert-v2</code> na próxima seção.</p><h2>Modelos de embedding Jina</h2><h3>Jina embeddings v4</h3><p><a href="https://jina.ai/news/jina-embeddings-v4-universal-embeddings-for-multimodal-multilingual-retrieval/"><strong>jina-embeddings-v4</strong></a> é um modelo de embedding multilíngue e multimodal, com 3,8 bilhões (3,8 × 10⁹) de parâmetros, que oferece suporte a imagens e textos em diversos idiomas amplamente utilizados. Ele utiliza uma arquitetura inédita para aproveitar conhecimento visual e conhecimento linguístico, melhorando o desempenho em ambas as tarefas e permitindo que o modelo se destaque na recuperação de imagens e, especialmente, na <a href="https://huggingface.co/tasks/visual-document-retrieval">recuperação de documentos visuais</a>. Isso significa que ele lida bem com imagens como gráficos, slides, mapas, capturas de tela, digitalizações de páginas e diagramas — tipos comuns de imagens que muitas vezes contêm texto incorporado importante e que ficam fora do escopo de modelos de visão computacional treinados apenas com imagens de cenas do mundo real.</p><p>Otimizamos esse modelo para diversas tarefas diferentes usando <a href="https://huggingface.co/docs/peft/en/package_reference/lora">adaptadores compactos de Low-Rank Adaptation (LoRA)</a>. Isso nos permite treinar um único modelo para se especializar em múltiplas tarefas, sem comprometer o desempenho em nenhuma delas, com um custo adicional mínimo de memória ou processamento.</p><p>Os principais recursos incluem:</p><ul><li><p>Desempenho de ponta na recuperação de documentos visuais, além de suporte a texto multilíngue e imagens comuns com resultados que superam significativamente modelos muito maiores.</p></li><li><p>Suporte a grandes tamanhos de contexto de entrada: 32.768 tokens equivalem aproximadamente a 80 páginas de texto em inglês com espaçamento duplo, e 20 megapixels equivalem a uma imagem de 4.500 × 4.500 pixels.</p></li><li><p>Tamanhos de embedding selecionáveis pelo usuário, de um máximo de 2.048 dimensões até 128 dimensões. Constatamos empiricamente que o desempenho se degrada de forma acentuada abaixo desse limite.</p></li><li><p>Suporte tanto a embeddings únicos quanto a embeddings multivetoriais. Para textos, a saída multivetorial consiste em um embedding de 128 dimensões para cada token de entrada. Para imagens, é gerado um embedding de 128 dimensões para cada bloco de 28 × 28 pixels necessário para cobrir a imagem.</p></li><li><p>Otimização para recuperação assimétrica por meio de um par de adaptadores LoRA treinados especificamente para esse propósito.</p></li><li><p>Um adaptador LoRA otimizado para cálculo de similaridade semântica.</p></li><li><p>Suporte especial a linguagens de programação e estruturas de TI, também por meio de um adaptador LoRA.</p></li></ul><p>Desenvolvemos <code>jina-embeddings-v4</code> para atuar como uma ferramenta geral e multifuncional para uma ampla gama de tarefas comuns de busca, compreensão de linguagem natural e análise com IA. Apesar de ser relativamente pequeno considerando suas capacidades, ainda exige recursos significativos para implantação e é mais adequado para uso por meio de uma API em nuvem ou em ambientes de alto volume.</p><h3>Jina embeddings v3</h3><p><a href="https://jina.ai/news/jina-embeddings-v3-a-frontier-multilingual-embedding-model/"><strong>jina-embeddings-V3</strong></a> é um modelo de embedding compacto, multilíngue, somente para texto, com alto desempenho e menos de 600 milhões de parâmetros. Ele oferece suporte a até 8.192 tokens de texto de entrada e gera embeddings de vetor único com tamanhos escolhidos pelo usuário, desde o padrão de 1.024 dimensões até 64.</p><p>Treinamos <code>jina-embeddings-v3</code> para uma variedade de tarefas de texto — não apenas recuperação de informações e similaridade semântica, mas também tarefas de classificação, como análise de sentimento e moderação de conteúdo, além de tarefas de clusterização, como agregação de notícias e recomendação. Assim como <code>jina-embeddings-v4</code>, esse modelo oferece adaptadores LoRA especializados para as seguintes categorias de uso:</p><ul><li><p>Recuperação assimétrica</p></li><li><p>Similaridade semântica</p></li><li><p>Classificação</p></li><li><p>Clustering</p></li></ul><p><code>jina-embeddings-v3</code> é um modelo muito menor do que <code>jina-embeddings-v4</code> com um tamanho de contexto de entrada significativamente reduzido, mas com custo operacional mais baixo. Ainda assim, apresenta desempenho bastante competitivo, embora apenas para textos, e é uma escolha melhor para muitos casos de uso.</p><h3>Incorporações de código Jina</h3><p>Os modelos especializados de embedding de código da Jina — <a href="https://jina.ai/models/jina-code-embeddings-1.5b"><strong>jina-code-embeddings (0.5b e 1.5b)</strong></a> — oferecem suporte a 15 esquemas de programação e estruturas, além de textos em inglês relacionados a computação e tecnologia da informação. São modelos compactos, com meio bilhão (0,5 × 10⁹) e um bilhão e meio (1,5 × 10⁹) de parâmetros, respectivamente. Ambos oferecem suporte a tamanhos de contexto de entrada de até 32.768 tokens e permitem que os usuários escolham os tamanhos dos embeddings de saída, de 896 a 64 dimensões no modelo menor e de 1.536 a 128 no modelo maior.</p><p>Esses modelos oferecem suporte a recuperação assimétrica para cinco especializações específicas de tarefa, usando <a href="https://arxiv.org/abs/2101.00190">ajuste de prefixo</a> em vez de adaptadores LoRA:</p><ul><li><p><strong>Código para código.</strong> Recuperar código semelhante entre diferentes linguagens de programação. Isso é usado para alinhamento de código, deduplicação de código e suporte a portabilidade e refatoração.</p></li><li><p><strong>Linguagem natural para código.</strong> Recuperar código que corresponda a consultas em linguagem natural, comentários, descrições e documentação.</p></li><li><p><strong>Código para linguagem natural. </strong>Associar código a documentação ou a outros textos em linguagem natural.</p></li><li><p><strong>Conclusão de código para código.</strong> Sugerir código relevante para completar ou aprimorar código existente.</p></li><li><p><strong>Perguntas e respostas técnicas.</strong> Identificar respostas em linguagem natural para perguntas sobre tecnologias da informação, sendo ideal para casos de uso de suporte técnico.</p></li></ul><p>Esses modelos oferecem performance superior em tarefas que envolvem documentação técnica e materiais de programação, com um custo computacional relativamente baixo. Eles são bem adequados para integração em ambientes de desenvolvimento e assistentes de código.</p><h3>Jina ColBERT v2</h3><p><a href="https://jina.ai/models/jina-colbert-v2"><strong>jina-colbert-v2</strong></a> é um modelo de embedding de texto multivetorial com 560 milhões de parâmetros. Ele é multilíngue, treinado com materiais em 89 idiomas, e oferece suporte a tamanhos variáveis de embedding e recuperação assimétrica.</p><p>Como observado anteriormente, embeddings multivetoriais não são adequados para indexação, mas são muito úteis para aumentar a precisão dos resultados de outras estratégias de busca. Com <code>jina-colbert-v2</code><strong>,</strong> é possível calcular embeddings multivetoriais antecipadamente e usá-los para reclassificar candidatos à recuperação no momento da consulta. Essa abordagem é menos precisa do que usar um dos modelos de reclassificação descritos na próxima seção, mas é muito mais eficiente, pois envolve apenas a comparação de embeddings multivetoriais armazenados, em vez de invocar todo o modelo de IA para cada consulta e cada correspondência candidata. Ela é especialmente adequada para casos de uso em que a latência e a sobrecarga computacional dos modelos de reclassificação são excessivas ou em que o número de candidatos a comparar é grande demais para esse tipo de modelo.</p><p>Esse modelo gera uma sequência de embeddings, um por token de entrada, e os usuários podem selecionar embeddings de tokens com 128, 96 ou 64 dimensões. As correspondências de texto candidatas são limitadas a 8.192 tokens. As consultas são codificadas de forma assimétrica, portanto é necessário especificar se um texto é uma consulta ou uma correspondência candidata, além de limitar consultas a 32 tokens.</p><h3>Jina CLIP v2</h3><p><a href="https://jina.ai/news/jina-clip-v2-multilingual-multimodal-embeddings-for-text-and-images/"><strong>jina-clip-v2</strong></a> é um modelo de embedding multimodal com 900 milhões de parâmetros, treinado para que textos e imagens gerem embeddings próximos entre si quando o texto descreve o conteúdo da imagem. Seu uso principal é a recuperação de imagens com base em consultas textuais, mas ele também é um modelo somente de texto com alto desempenho, reduzindo custos para os usuários, já que não é necessário manter modelos separados para recuperação de texto para texto e de texto para imagem.</p><p>Esse modelo oferece suporte a um contexto de entrada de texto de 8.192 tokens, e as imagens são redimensionadas para 512 × 512 pixels antes da geração dos embeddings.</p><p>Arquiteturas de pré-treinamento contrastivo de linguagem e imagem (CLIP) são fáceis de treinar e operar e podem gerar modelos muito compactos, mas apresentam algumas limitações fundamentais. Eles não conseguem usar conhecimento de um meio para melhorar seu desempenho em outro. Ou seja, não conseguem aproveitar informações de um meio para aprimorar o desempenho em outro. Assim, embora um modelo possa saber que as palavras “cão” e “gato” são mais próximas em significado entre si do que qualquer uma delas em relação a “carro”, ele não necessariamente saberá que a imagem de um cão e a imagem de um gato são mais relacionadas entre si do que qualquer uma delas em relação à imagem de um carro.</p><p>Esses modelos também sofrem do que se chama de <em>lacuna de modalidade</em>: um embedding de um texto sobre cães tende a ficar mais próximo de um embedding de um texto sobre gatos do que de um embedding de uma imagem de cães. Por causa dessa limitação, recomendamos usar CLIP como um modelo de recuperação de texto para imagem ou como um modelo somente de texto, mas não misturar os dois em uma única consulta.</p><h2>Modelos de reclassificação</h2><p>Modelos de reclassificação recebem como entrada uma consulta e uma ou mais correspondências candidatas e as comparam diretamente, produzindo correspondências com precisão muito maior.</p><p>Em princípio, seria possível usar um reclassificador diretamente para recuperação de informações, comparando cada consulta com cada documento armazenado, mas isso seria computacionalmente muito caro e impraticável para qualquer coleção que não seja muito pequena. Por isso, reclassificadores tendem a ser usados para avaliar listas relativamente curtas de correspondências candidatas encontradas por outros meios, como busca baseada em embeddings ou outros algoritmos de recuperação. Modelos de reclassificação são ideais para esquemas de busca híbrida e federada, nos quais executar uma busca pode significar enviar consultas a sistemas de busca separados, com conjuntos de dados distintos, cada um retornando resultados diferentes. Eles funcionam muito bem para combinar resultados diversos em um único resultado de alta qualidade.</p><p>A busca baseada em embeddings pode exigir um grande investimento, envolvendo a reindexação de todos os dados armazenados e a mudança das expectativas dos usuários em relação aos resultados. Adicionar um reclassificador a um esquema de busca existente pode trazer muitos dos benefícios da IA sem a necessidade de reestruturar toda a solução de busca.</p><h2>Modelos de reclassificação Jina</h2><h3>Jina Reranker m0</h3><p><a href="https://jina.ai/models/jina-reranker-m0/"><strong>jina-reranker-m0</strong></a> é um reclassificador multimodal com 2,4 bilhões (2,4 × 10⁹) de parâmetros, que oferece suporte a consultas textuais e a correspondências candidatas compostas por textos e/ou imagens. Ele é o principal modelo para recuperação de documentos visuais, o que o torna uma solução ideal para repositórios de PDFs, digitalizações de texto, capturas de tela e outras imagens geradas ou modificadas por computador que contêm texto ou outras informações semiestruturadas, bem como para dados mistos compostos por documentos de texto e imagens.</p><p>Esse modelo recebe uma única consulta e uma correspondência candidata e retorna uma pontuação. Quando a mesma consulta é usada com diferentes candidatos, as pontuações são comparáveis e podem ser usadas para ranqueá-los. Ele oferece suporte a um tamanho total de entrada de até 10.240 tokens, incluindo o texto da consulta e o texto ou imagem candidata. Cada bloco de 28 × 28 pixels necessário para cobrir uma imagem conta como um token no cálculo do tamanho de entrada.</p><h3>Jina Reranker v3</h3><p><a href="https://jina.ai/models/jina-reranker-v3/"><strong>jina-reranker-v3</strong></a> é um reclassificador de texto com 600 milhões de parâmetros, com desempenho de ponta entre modelos de tamanho comparável. Ao contrário de <code>jina-reranker-m0</code>, ele recebe uma única consulta e uma lista de até 64 correspondências candidatas e retorna a ordem de ranqueamento. Ele tem um contexto de entrada de 131.000 tokens, incluindo a consulta e todos os candidatos de texto.</p><h3>Jina Reranker v2</h3><p><a href="https://jina.ai/models/jina-reranker-v2"><strong>jina-reranker-v2-base-multilingual</strong></a> é um reclassificador multifuncional, de uso geral, muito compacto, com recursos adicionais projetados para oferecer suporte a chamadas de função e consultas SQL. Com menos de 300 milhões de parâmetros, ele fornece reclassificação de texto multilíngue rápida, eficiente e precisa, com suporte adicional para selecionar tabelas SQL e funções externas que correspondam a consultas de texto, o que o torna adequado para casos de uso com IA agêntica.</p><h2>Modelos de linguagem generativos de pequeno porte</h2><p>Modelos de linguagem generativos são modelos como o ChatGPT da OpenAI, o Google Gemini e o Claude, da Anthropic, que recebem entradas em texto ou multimídia e respondem com saídas em texto. Não existe um limite bem definido que separe modelos de linguagem <em>grandes</em> (LLMs) de modelos de linguagem <em>pequenos</em> (SLMs), mas os desafios práticos de desenvolver, operar e usar LLMs de ponta são bem conhecidos. Os modelos mais conhecidos não são distribuídos publicamente, portanto só é possível estimar seu tamanho, mas espera-se que ChatGPT, Gemini e Claude estejam na faixa de 1 a 3 trilhões (1–3 × 10¹²) de parâmetros.</p><p>Executar esses modelos, mesmo quando estão disponíveis publicamente, está muito além do alcance de hardware convencional, exigindo os chips mais avançados organizados em grandes arranjos paralelos. É possível acessar LLMs por meio de APIs pagas, mas isso envolve custos significativos, alta latência e dificuldades para atender a exigências de proteção de dados, soberania digital e repatriação de nuvem. Além disso, os custos relacionados ao treinamento e à personalização de modelos desse porte podem ser consideráveis.</p><p>Consequentemente, uma grande quantidade de pesquisa tem se concentrado no desenvolvimento de modelos menores que, embora não tenham todas as capacidades dos maiores LLMs, conseguem executar tipos específicos de tarefas com a mesma qualidade, a um custo reduzido. Empresas normalmente implantam software para resolver problemas específicos, e com software de IA não é diferente; por isso, soluções baseadas em SLMs costumam ser preferíveis às baseadas em LLMs. Elas geralmente podem ser executadas em hardware comum, são mais rápidas, consomem menos energia e são muito mais fáceis de personalizar.</p><p>As ofertas de SLM da Jina estão crescendo à medida que nos concentramos em como levar IA da melhor forma possível a soluções práticas de busca.</p><h2>Jina SLMs</h2><h3>ReaderLM v2</h3><p><a href="https://jina.ai/models/ReaderLM-v2"><strong>ReaderLM-v2</strong></a> é um modelo de linguagem generativo que converte HTML em Markdown ou em JSON, de acordo com esquemas JSON fornecidos pelo usuário e instruções em linguagem natural.</p><p>O pré-processamento e a normalização de dados são uma parte essencial do desenvolvimento de boas soluções de busca para dados digitais, mas dados do mundo real, especialmente informações derivadas da web, costumam ser caóticos, e estratégias simples de conversão frequentemente se mostram frágeis. Em vez disso, <code>ReaderLM-v2</code> oferece uma solução inteligente baseada em modelo de IA, capaz de entender o caos de um dump de árvore DOM de uma página da web e identificar, de forma robusta, elementos úteis.</p><p>Com 1,5 bilhão (1,5 × 10⁹) de parâmetros, esse modelo é três ordens de magnitude mais compacto do que LLMs de última geração, mas apresenta desempenho equivalente a eles nessa tarefa específica e bastante restrita.</p><h3>Jina VLM</h3><p><a href="https://jina.ai/models/jina-vlm"><strong>jina-VLC</strong></a> é um modelo de linguagem generativo com 2,4 bilhões (2,4 × 10⁹) de parâmetros, treinado para responder a perguntas em linguagem natural sobre imagens. Ele oferece suporte muito robusto a análise de documentos visuais, isto é, responder a perguntas sobre digitalizações, capturas de tela, slides, diagramas e dados de imagem semelhantes que não são naturais.</p><p>Por exemplo:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt124b9932e01dcd40/6a17db7d4202291eca29f4bc/adfa1420d079ca4fd5582eef4349b1265b378e76-950x500.png" alt="" /><p>Ele também é muito eficiente na leitura de texto em imagens:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt1a862a9c9a0e42ce/6a17db7fb1e1133a2979f15d/ea3956e7ad86f8e171841cab2c28c8b3498da1d4-1002x500.png" alt="" /><p>Mas é na compreensão do conteúdo de imagens informativas e produzidas pelo ser humano que <code>jina-vlm</code> realmente se destaca:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt761cf621ea32e4ae/6a17db8163baff7730741b26/f68606f9d2d99e2cd616d4ff81db3574dc4e26a5-1020x700.png" alt="" /><p>Ou:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt4df4d31e574df7e3/6a17db82e3179134e02d56e9/297e85e7e78f296388a02301e1e08fed70827423-1000x500.png" alt="" /><p><code>jina-vlm</code> é especialmente adequado para geração automática de legendas, descrições de produtos, texto alternativo de imagens e aplicações de acessibilidade para pessoas com deficiência visual. Além disso, cria novas possibilidades para sistemas de geração aumentada por recuperação (RAG) utilizarem informações visuais e para agentes de IA processarem imagens sem assistência humana.</p>]]></content:encoded>
    <link>https://www.elastic.co/search-labs/blog/jina-models-elasticsearch-guide</link>
    <guid isPermaLink="true">https://www.elastic.co/search-labs/blog/jina-models-elasticsearch-guide</guid>
    <category><![CDATA[Integrações]]></category>
    <category><![CDATA[Jina AI]]></category>
    <dc:creator><![CDATA[Scott Martens]]></dc:creator>
    <enclosure url="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blta03919124faf767a/6a17db84ec0f89b8fe5a64d8/407b4c862b51ebdfc7f26db4e25950a65caf1673-656x442.png" length="0" type="image/png"/>
    <pubDate>Thu, 01 Jan 2026 00:00:00 GMT</pubDate>
  </item>
  </channel>
</rss>