<?xml version="1.0" encoding="UTF-8"?>
<rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0">
  <channel>
    <title><![CDATA[Jina AI - Elasticsearch Labs]]></title>
    <description><![CDATA[Articles and tutorials from the Search team at Elastic]]></description>
    <copyright><![CDATA[© 2026. Elasticsearch B.V. All Rights Reserved]]></copyright>
    <image>
      <title><![CDATA[Jina AI - Elasticsearch Labs]]></title>
      <url>https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt1121c0bf0e8a6e65/6a88da6340a1841030ef456f/search-labs-thumbnail.png</url>
      <link>https://www.elastic.co/pt/search-labs/blog/category/jina-ai</link>
    </image>
    <link>https://www.elastic.co/pt/search-labs/blog/category/jina-ai</link>
    <atom:link href="https://www.elastic.co/pt/search-labs/rss/category/jina-ai.xml" rel="self" type="application/rss+xml"/>
    <language><![CDATA[pt]]></language>
    <lastBuildDate>Tue, 29 Sep 2026 07:37:34 GMT</lastBuildDate>
  <item>
    <title><![CDATA[No local em menos de 5 minutos: modelos de embedding Jina agora disponíveis para implantação no local]]></title>
    <description><![CDATA[Todos os 28 modelos do Jina AI, incluindo rerankers, como containers do Docker prontos para implantação, com zero telemetria e sem servidor de licença. Compatível diretamente com as APIs da OpenAI, Cohere, Voyage AI e Elastic Inference Service.]]></description>
    <content:encoded><![CDATA[<p>Todos os 28 modelos de embedding e reclassificação do Jina AI agora são enviados como containers do Docker totalmente offline para implantação no local, incluindo <a href="https://www.elastic.co/pt/search-labs/blog/jina-embeddings-v5-omni-all-media-one-index">jina-embeddings-v5-omni</a><a href="https://www.elastic.co/pt/search-labs/blog/jina-embeddings-v5-omni-all-media-one-index"> </a>e <a href="https://www.elastic.co/pt/search-labs/tutorials/jina-tutorial/jina-reranker-v3">jina-reranker-v3</a>. Baixe um, transfira-o para um sistema air-gapped ou com firewall no local, e a inferência local estará em execução em menos de cinco minutos. Os containers são totalmente autocontidos e não fazem conexões externas. Não há chamadas para a Hugging Face nem para nenhum registro de modelos. Também não há servidor de licença, telemetria nem endpoints de logging. Para setores regulamentados, requisitos de soberania de dados ou ambientes em que o acesso à internet é instável ou simplesmente indisponível, isso elimina a dependência de serviços de IA de terceiros. O Jina On-Prem é compatível com os esquemas de API do Elastic Inference Service (EIS), da OpenAI, da Cohere, da Voyage AI e do Gemini, para que as aplicações existentes funcionem sem alterações de código.</p><p>Os modelos de IA mais poderosos são executados em instalações remotas na nuvem com acesso por meio de uma API web, o que significa que você precisa confiar no seu provedor de serviços de IA para segurança, disponibilidade do serviço e preços estáveis. Você não consegue alinhar facilmente demandas razoáveis de confiabilidade, privacidade, custos gerenciáveis e boa governança de dados com o uso de IA cada vez mais poderoso, sofisticado e intensivo em recursos.</p><p>Regulamentações governamentais, decisões judiciais e considerações comerciais feitas no interesse de terceiros recentemente resultaram na restrição do acesso a serviços específicos. E mesmo que você possa alternar para outros serviços, os modelos de IA não são componentes que podem simplesmente ser trocados sempre que você quiser. Aplicações que usam embeddings semânticos dependem de ter acesso aos mesmos modelos no momento da consulta e no momento da ingestão de dados. Perder o acesso ao seu modelo de embedding significa que seu sistema de busca para completamente.</p><p>Os modelos de precificação de IA agravam esse risco. Divulgações financeiras recentes de grandes fornecedores de IA dão aos clientes bons motivos para se preocuparem com potenciais aumentos de preços. A dependência de produtos com custos imprevisíveis adiciona mais risco a investimentos em IA que exigem uso intensivo de capital e podem não produzir retornos claros.</p><p>O Jina On-Prem é a resposta da Elastic para esses desafios.</p><h2>Quem precisa de IA no local?</h2><p>A hospedagem local e o controle direto sobre seus modelos de IA são compatíveis com uma variedade de demandas técnicas, requisitos do setor e interesses de negócios.</p><p>A instalação local reduz o que você paga aos seus provedores de serviços de IA, mas transfere o custo de hardware e de acesso confiável para a sua organização. Dependendo do seu volume de uso, pode simplesmente ser mais barato. Mas há outras razões urgentes para considerar a execução da sua própria IA. Se algum dos problemas descritos abaixo afetar a sua empresa, considere uma solução de IA local como o Jina On-Prem. Esta lista não é exaustiva.</p><p>Caso de uso</p><p>Por que no local</p><p>Exemplo</p><p>Air-gapped / alta segurança</p><p>Sem transmissão de dados de saída; isolamento completo de rede</p><p>Defesa, inteligência, pesquisas classificadas</p><p>Conformidade regulatória</p><p>Soberania de dados; sem transmissão transfronteiriça ou exposição a terceiros</p><p>Saúde (Health Insurance Portability and Accountability Act [HIPAA]), finanças, empresas da UE (Regulamento Geral de Proteção de Dados [GDPR])</p><p>Crítico para a latência</p><p>Zero dependência de rede; nenhuma tolerância a falhas de conexão</p><p>Robótica, computação de borda, veículos, navios</p><p>Previsibilidade de custo</p><p>Custo fixo de infraestrutura vs. preço por token com taxas futuras incertas</p><p>Cargas de trabalho de inferência contínua de alto volume</p><p>Redução de passivos</p><p>Sem exposição de dados a terceiros; mantém o privilégio legal e o dever de cuidado</p><p>Escritórios de advocacia, agências governamentais</p><h3>Por que sistemas air-gapped e com firewall precisam de IA no local</h3><p>Sistemas air-gapped e com firewall não podem usar APIs de IA externas. O Jina On-Prem é executado inteiramente em sua infraestrutura, sem conexões de saída.</p><p>Para organizações que gerenciam dados especialmente sensíveis, as considerações de segurança e privacidade são fundamentais. Pouco adianta investir na proteção dos seus dados sensíveis se você os entrega prontamente a terceiros remotos que podem ter segurança insuficiente ou estar sujeitos às exigências de um governo estrangeiro.</p><p>Funcionários de organizações que lidam com dados sensíveis costumam receber algum treinamento sobre o tratamento seguro de dados, mas isso não é muito eficaz quando todos eles têm navegadores web que podem estar abertos em qualquer página da internet enquanto lidam com esses dados. O isolamento é a medida de segurança mais eficaz disponível, seja por meio de air-gapping ou de firewalls muito restritivos, mas isso dificulta o uso de serviços externos de qualquer tipo.</p><h3>IA no local para sistemas sensíveis à latência e de alta disponibilidade</h3><p>O software como serviço e a computação em nuvem representam um meio-termo entre o custo de oferecer serviços altamente acessíveis e confiáveis em seus próprios computadores e a terceirização do problema para outra pessoa. Mas eles vêm acompanhados de latência variável, interrupções e uma perda total de controle quando algo dá errado. Os serviços de IA não são exceção. Se o seu sistema de busca ficar offline quando você não puder acessar seu modelo de embedding, isso pode não parecer mais um bom meio-termo.</p><p>Além disso, confiar em IA externa sempre envolverá riscos que você não pode prever ou gerenciar facilmente. O acesso à internet e a latência da rede podem se deteriorar sem aviso prévio, como resultado de eventos políticos, mau tempo ou navios arrastando suas âncoras sobre cabos de fibra óptica submarinos. Os governos podem, e recentemente o fizeram, usar proibições de exportação para bloquear de repente o acesso a modelos de IA. Às vezes, os provedores de serviços de IA descontinuam modelos para induzir você a mudar para outros mais recentes. A flexibilidade e os custos gerenciados dos serviços externos precisam ser ponderados em relação aos riscos de dependência.</p><h3>IA no local para conformidade com o GDPR, a HIPAA e a soberania dos dados</h3><p>Organizações que coletam dados pessoais estão sujeitas a regulamentações cada vez mais rigorosas, que geralmente diferem entre as jurisdições e podem ter requisitos contraditórios. Notavelmente, as <a href="https://www.hhs.gov/hipaa/for-professionals/privacy/laws-regulations/index.html">regras da HIPAA</a> impõem proteções de dados muito rigorosas aos provedores de saúde norte-americanos, e leis gerais de proteção de dados fortes no <a href="https://laws-lois.justice.gc.ca/eng/acts/p-8.6/">Canadá</a>, na <a href="https://gdpr-info.eu/">União Europeia</a> e em <a href="https://www.japaneselawtranslation.go.jp/en/laws/view/4241">muitas jurisdições asiáticas</a> exigem que todas as empresas que lidam com informações pessoais o façam de forma segura e limitem a transmissão desses dados a outras partes ou outras jurisdições. Essas regras podem até impor obrigações a entidades estrangeiras se elas tiverem clientes nessas jurisdições. As instituições financeiras estão frequentemente sujeitas a regras ainda mais rigorosas e possuem a mesma responsabilidade direta pela segurança da informação que têm para se protegerem contra outras formas de atividade criminosa.</p><p>A conformidade regulatória pode ser incompatível com serviços de IA de terceiros, especialmente se usá-los envolver a transmissão transfronteiriça de dados.</p><p>Além disso, eventos recentes mostram que regras que restringem a localização física dos armazenamentos de dados podem não ser uma fonte confiável de proteção quando operadores internacionais de nuvem estão sujeitos à pressão de governos estrangeiros. Leis locais podem entrar em conflito entre jurisdições, exigindo o armazenamento e processamento local de dados e tornando impossível o uso de serviços de terceiros. Em alguns casos, a única solução é internalizar todas as partes dos seus processos, incluindo seus sistemas de IA.</p><h3>Riscos de responsabilidade por IA na transmissão de dados de terceiros</h3><p>Leis de proteção de dados e deveres de cuidado reconhecidos em relação a dados sensíveis rotineiramente têm implicações de responsabilidade, às vezes muito severas. Você pode ser responsabilizado pelo tratamento dos seus dados por provedores de serviços terceirizados. Embora os tribunais e procedimentos legais possam fornecer algumas proteções retrospectivas contra provedores de serviços inseguros, esses recursos não estão disponíveis nem são geralmente eficazes contra agentes de segurança nacional, autoridades policiais ou hackers criminosos.</p><p>Para os governos, já houve casos em que provedores de serviços em nuvem internacionais liberaram informações estatais sensíveis para agentes estrangeiros.</p><p>Mas mesmo que você não se preocupe com governos estrangeiros ou hackers, e mesmo que seus provedores de serviços de IA externos sejam seguros, o simples fato de serem externos pode criar responsabilidades.</p><p>Por exemplo, na maioria das jurisdições, as comunicações dos advogados com seus clientes contam com proteções jurídicas especiais, e os escritórios de advocacia têm responsabilidades rígidas ao gravar ou armazenar essas informações. Nos Estados Unidos, esse "sigilo advogado-cliente" é tão famoso que é central nos enredos de filmes e séries de TV. Mas uma das maneiras pelas quais esse privilégio pode ser perdido é ao comunicar informações a alguém que não seja protegido por ele, e desenvolvimentos recentes sugerem que provedores externos de serviços de IA podem se enquadrar nisso.</p><p>É possível, pelo menos nos Estados Unidos, que o simples uso de serviços de IA de terceiros por meio de uma API de internet, como modelos de incorporação que oferecem serviços de indexação, viole regras críticas de confidencialidade. Um escritório de advocacia pode ser processado, punido disciplinarmente ou ter o registro cassado só por usar software hospedado externamente, mesmo que nenhuma violação de segurança ocorra.</p><h3>IA no local para sistemas offline, de borda e fisicamente isolados</h3><p>Os sistemas de computador não são isolados apenas por motivos de segurança. Por exemplo, veículos em movimento não podem depender do acesso à internet para nenhuma função essencial. Navios e aeronaves têm sistemas de computador de bordo muito extensos que precisam funcionar sem conexões com a internet e, portanto, não podem usar serviços de IA externos. Plataformas offshore, instalações remotas em áreas selvagens, serviços de computador no Ártico, na Antártida e em pequenas ilhas sem conexões físicas adequadas com redes globais são todos exemplos de instalações que se beneficiam ao hospedar localmente todos os serviços de que precisam. À medida que o papel da IA na computação empresarial cresce, torna-se mais importante abordar essas limitações.</p><p>Aplicações emergentes de IA em sistemas físicos (robótica e outros casos de uso delimitados espacialmente ou focados no mundo externo, como sistemas de gestão de logística ou até mesmo caixas de supermercado) podem estar conectadas à internet global, mas não têm tolerância a falhas de conexão ou picos de latência. Se elas dependem de um sistema de IA para operar, esse sistema de IA precisa ser o mais local e confiável possível.</p><h2>Quem não precisa de IA em ambiente local?</h2><p>Serviços de software remotos e IA fora do local têm benefícios. Executar modelos de IA pode exigir processadores caros, de alto consumo de energia e com vida útil notoriamente curta. O acesso a hardware de alta qualidade é particularmente difícil no momento devido a fatores de mercado e choques econômicos externos. Diante das circunstâncias, pode fazer sentido pagar por token para usar uma API externa em vez de arcar com os altos custos de capital da IA local.</p><p>APIs externas fazem mais sentido para usuários intermitentes. Se você usa modelos de IA principalmente para processar dados em lote para análise, em vez de executar um sistema de busca que precise ficar online o tempo todo, faz pouco sentido investir em hardware de alto custo de capital e instalações locais.</p><p>Além disso, quando o seu processamento de dados já é baseado na nuvem, por exemplo, um website de e-commerce hospedado na nuvem por motivos de confiabilidade e acessibilidade, usar serviços de IA localizados na mesma infraestrutura de nuvem pode proporcionar um melhor custo-benefício do que introduzir a sua própria implantação de modelo de IA licenciado. Você já depende do seu provedor de serviços em nuvem, então depender dos serviços de IA dele não adiciona muito risco.</p><p>Se o seu caso de uso se encaixa nessa descrição, os modelos Jina AI estão disponíveis no <a href="https://www.elastic.co/docs/explore-analyze/elastic-inference/eis">EIS</a>, no <a href="https://aws.amazon.com/marketplace/seller-profile?id=seller-stch2ludm6vgy">AWS Marketplace</a> e no <a href="https://console.cloud.google.com/marketplace/browse?q=jina">Google Cloud Platform</a> especificamente para atender às suas necessidades.</p><p>A tabela abaixo resume os principais fatores. Sua resposta depende dos seus dados, da sua infraestrutura e do seu padrão de uso.</p><p>Fator</p><p>No local preferido</p><p>API da Nuvem Preferida</p><p>Padrão de uso</p><p>Inferência contínua ou de alto volume</p><p>Processamento intermitente ou em lote</p><p>Sensibilidade dos dados</p><p>Regulado, soberano ou confidencial</p><p>Sem restrições transfronteiriças ou de terceiros</p><p>Ambiente de rede</p><p>Air-gapped, com firewall ou instáveis</p><p>Internet estável, sempre ativa</p><p>Infraestrutura existente</p><p>Possuir ou poder adquirir hardware de GPU</p><p>Já hospedado na nuvem com IA colocalizada</p><p>Modelo de custo</p><p>Hardware fixo + licença; previsível em escala</p><p>Por token; menor custo inicial, variável a longo prazo</p><p>Tolerância a latência</p><p>Nenhum (robótica, edge, tempo real)</p><p>A variabilidade da rede é aceitável</p><p>Responsabilidade operacional</p><p>Sua equipe gerencia o hardware e a disponibilidade</p><p>O provedor gerencia o hardware e as atualizações; você gerencia a integração</p><p>Você precisa considerar os custos e benefícios à luz de suas circunstâncias específicas e casos de uso, levando em consideração os problemas destacados na seção anterior que se aplicam a você. A análise de custo-benefício sem dúvida mudará ao longo do tempo. Não podemos prever o futuro do setor de IA ou os preços de hardware, mesmo no curto prazo.</p><h2>Apresentando Jina no Local</h2><p>Para usuários que podem se beneficiar de serviços de IA locais, estamos apresentando o <a href="https://github.com/jina-ai/jina-on-prem/wiki/">Jina On-Prem</a>, um conjunto de instalação totalmente independente para os modelos de alto desempenho da Jina AI.</p><p>Os modelos do Jina AI correspondem à precisão de modelos de embedding <a href="https://mteb-leaderboard.hf.space/benchmark/MTEB(Multilingual%2C%20v2)">muitas vezes maiores que eles</a>, reduzindo custos computacionais, uso de memória e requisitos de hardware. Isso os torna uma escolha ideal para usuários que desejam ou precisam manter sua IA no local. Licenças comerciais estão disponíveis com solutions escaláveis e de preços proporcionais para casos de uso de todos os tamanhos.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt190865fb3ebde472/6a6a33d0065b162508701ff9/02559ceca556a26c53eb703ae87d421452b27251-1374x1400.png" alt="MMTEB Multilingual v2 leaderboard showing Jina AI embedding model rankings: jina-embeddings-v5-omni-small and jina-embeddings-v5-text-small ranked 13th, jina-embeddings-v5-omni-nano and jina-embeddings-v5-text-nano ranked 19th, competing against models from Microsoft, Google, Tencent, NVIDIA and Qwen" /><h3>A quais esquemas de API o Jina no local oferece suporte?</h3><ul><li><p>Disponível como uma coleção completa de dependências para instalação local ou como um <a href="https://www.docker.com/">container do Docker</a> que você pode instalar e executar em minutos.</p></li><li><p>Instalações Jina no local <em>não</em> fazem chamadas para sistemas externos.</p><ul><li><p>Nenhuma chamada ao Hugging Face Hub ou a qualquer registro de modelo (HF_HUB_OFFLINE=1 e TRANSFORMERS_OFFLINE=1 estão embutidos).</p></li><li><p>Não há servidor de licença.</p></li><li><p>Não há endpoints de telemetria ou logging.</p></li></ul></li><li><p>Oferece suporte a hardware de CPU e GPU, com detecção automática de GPU.</p></li><li><p>Todos os 28 modelos Jina AI disponíveis, incluindo os mais recentes modelos de embedding multimodal <a href="https://www.elastic.co/pt/search-labs/blog/jina-embeddings-v5-omni-all-media-one-index">jina-embeddings-v5-omni</a> e o <a href="https://www.elastic.co/pt/search-labs/tutorials/jina-tutorial/jina-reranker-v3">jina-reranker-v3</a>.</p></li><li><p>Acesso via esquemas padrão de API de IA: <a href="https://jina.ai/api-dashboard">Jina API</a>, OpenAI, Cohere, Voyage AI e Gemini. O Jina On-Prem é uma solução de substituição direta para aplicações construídas com base nesses esquemas.</p></li><li><p>Substituição direta para modelos servidos pelo <a href="https://www.elastic.co/docs/explore-analyze/elastic-inference/eis">EIS</a>. O Jina On-Prem se integra diretamente com <a href="https://www.elastic.co/pt/blog/deploy-elastic-air-gapped-disconnected-environments">implantações da Elastic em ambientes isolados</a>.</p></li></ul><h2>Requisitos de hardware para modelos Jina AI no local</h2><p>Os requisitos de hardware variam para diferentes modelos Jina. A tabela abaixo mostra as recomendações para os modelos mais recentes usando configurações de GPU. Você não precisa de nada mais potente do que uma GPU NVIDIA L4, embora uma A100 seja recomendada para os modelos de embedding v5. Nosso modelo de embedding mais recente exige atualmente no mínimo 8 GB de VRAM.</p><p>Modelo</p><p>VRAM mínima</p><p>GPU Recomendada</p><p>jina-embeddings-v5-text-nano</p><p>2 GB</p><p>T4 / L4</p><p>jina-embeddings-v5-text-small</p><p>3 GB</p><p>L4 / A10G</p><p>jina-embeddings-v5-omni-small</p><p>8 GB</p><p>L4 / A10G / A100</p><p>jina-reranker-v3</p><p>3 GB</p><p>L4</p><p>jina-clip-v2</p><p>4 GB</p><p>L4</p><p>jina-code-embeddings-1.5b</p><p>4 GB</p><p>L4</p><p>ReaderLM-v2</p><p>4 GB</p><p>L4</p><p>Se você usar mais de um modelo por vez, os requisitos de VRAM aumentarão. Consulte a <a href="https://github.com/jina-ai/jina-on-prem/wiki/Sizing-And-Hardware">página de dimensionamento e hardware</a> para obter mais informações.</p><h2>Como Instalar o Jina no Local com o Docker</h2><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt20265d09e2d8d0f4/6a6a33d1065b162105701ffd/ada9881af407168298b1940f8537ad71a5411c89-1999x1200.png" alt="" /><p>A maneira mais rápida de começar é <a href="https://www.docker.com/get-started/">instalar o Docker</a> (se você ainda não o fez) e seguir as instruções na página do <a href="https://github.com/jina-ai/jina-on-prem/wiki/QuickStart">Guia rápido do Jina no local</a>.</p><p>Há containers do Docker pré-compostos para todos os 28 modelos Jina. Baixe um e transfira-o para o seu destino de instalação, e você poderá ter os modelos Jina AI em execução em menos de cinco minutos.</p><p>Para compilações multimodais ou personalizadas, ou para baixar o conjunto completo de dependências para instalação fora de um container, siga as etapas descritas no <a href="https://github.com/jina-ai/jina-on-prem/wiki/Bundling-Guide">guia de empacotamento</a>.</p><p>Sua instalação Jina no local oferece suporte a todas as funcionalidades da Jina API e do EIS e à geração de embeddings por meio das APIs da OpenAI, Cohere, Voyage AI e Gemini, de modo que ela pode ser integrada a aplicativos preexistentes usando interfaces padrão. Consulte a <a href="https://github.com/jina-ai/jina-on-prem/wiki/API-Reference">documentação da API</a> para obter mais informações.</p><p>Os modelos Jina, incluindo os modelos instalados com o Jina no local, estão disponíveis sob vários termos de licenciamento, sendo que os modelos mais recentes são gratuitos para uso não comercial sob uma licença <a href="https://creativecommons.org/licenses/by-nc/4.0/deed.en">CC BY-NC 4.0</a>. Para licenciar o Jina no local para uso comercial, entre em contato com as <a href="https://www.elastic.co/pt/contact">vendas da Elastic</a>.</p>]]></content:encoded>
    <link>https://www.elastic.co/search-labs/blog/on-prem-ai-jina-embedding-models</link>
    <guid isPermaLink="true">https://www.elastic.co/search-labs/blog/on-prem-ai-jina-embedding-models</guid>
    <category><![CDATA[Jina AI]]></category>
    <category><![CDATA[Integrações]]></category>
    <dc:creator><![CDATA[Scott Martens]]></dc:creator>
    <enclosure url="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt17731ab0c6ec66f6/6a6a33d140a4941014ca5c9a/09bc6dac4e6a86c7877f8ed78d68f5d581aeffa9-1999x1200.png" length="0" type="image/png"/>
    <pubDate>Thu, 23 Jul 2026 00:00:00 GMT</pubDate>
  </item>
  <item>
    <title><![CDATA[Um índice, todas as mídias: Apresentando jina-embeddings-v5-omni]]></title>
    <description><![CDATA[O jina-embeddings-v5-omni permite incorporar texto, imagens, vídeos e áudio em um único índice do Elasticsearch e realizar consultas em todos eles simultaneamente.]]></description>
    <content:encoded><![CDATA[<p><code>jina-embeddings-v5-omni</code> reúne texto, imagens, vídeo e áudio em um único índice do Elasticsearch. Estendendo os modelos líderes da categoria <a href="https://www.elastic.co/search-labs/blog/jina-embeddings-v5-text"><code>jina-embeddings-v5-text</code></a>, suíte v5-omni adiciona codificação visual e de áudio por meio de uma arquitetura inovadora que mantém a estrutura principal de texto inalterado, oferecendo desempenho de ponta em um único modelo de embedding muito compacto.</p><p>Agora você pode criar embeddings semânticos de alto desempenho para <strong>texto</strong>, <strong>imagens</strong>, <strong>vídeos</strong> e <strong>gravações de áudio</strong>, abrangendo <strong>quase 100 idiomas</strong>, e utilizá-los para classificação, clustering, medição de similaridade semântica e indexação para recuperação de informações. Se seus dados estão em PDFs, gravações e vídeos junto com texto, você não precisa mais de pipelines separados para cada um.</p><p>A família <code>jina-embeddings-v5-omni</code> é o <strong>modelo de embedding mais compacto atualmente no mercado, com suporte para imagens, fala, documentos impressos e vídeo</strong>. Ela oferece:</p><ul><li><p><strong><code>jina-embeddings-v5-text</code></strong><strong>Embeddings de texto de última geração</strong> para aplicações de recuperação, análise e agentes de IA.</p></li><li><p><strong>Embeddings com o melhor desempenho da categoria em termos de tamanho</strong> <strong>para similaridade semântica visual, compreensão visual e recuperação de imagens.</strong> <code>jina-embeddings-v5-omni-small</code> tem o melhor desempenho em benchmarks de imagem de qualquer modelo nos parâmetros de 1 bilhão (10⁹) e é superior ao nosso próprio <a href="https://www.elastic.co/search-labs/blog/jina-models-elasticsearch-guide#jina-clip-v2"><code>jina-clip-v2</code></a> anterior. Apenas alguns modelos com três a trinta vezes mais parâmetros conseguem superá-lo.</p></li><li><p><strong>Embeddings de última geração para compreensão e recuperação visual multilíngue</strong>, superando modelos até 20 vezes maiores.</p></li><li><p><strong>Os melhores embeddings de áudio da categoria de tamanho</strong>, com apenas modelos que têm o dobro ou mais de parâmetros apresentando melhor desempenho em benchmarks padrão.</p></li><li><p><strong>Suporte a vídeo</strong>, especialmente para localizar objetos e eventos em vídeos.</p></li></ul><p>Isso tem aplicações em todas as áreas de recuperação de informações, processamento de documentos e análise de dados. O <code>jina-embeddings-v5-omni</code> abre o acesso a informações bloqueadas em diferentes silos de mídia e as torna acessíveis para recuperação, análise e uso por agentes de IA. As informações em gravações de áudio e vídeo, PDF, digitalizações de páginas impressas e infográficos estão em pé de igualdade com os textos digitalizados em seu ecossistema de dados.</p><p>Assim como <code>jina-embeddings-v5-text</code>, esses modelos vêm em dois tamanhos: <code>small</code> e <code>nano</code>. Ambos os modelos estendem suas versões em texto com módulos adicionais que suportam entrada de áudio e vídeo. Os usuários podem selecionar módulos no momento do carregamento. Além disso, extensões específicas de tarefa para similaridade semântica, classificação, agrupamento e recuperação de informações são implementadas como adaptadores compactos de baixo nível (LoRAs) e todas são carregadas, para que os usuários possam selecioná-las no momento da inferência.</p><p>Ambos os modelos são muito compactos. <code>jina-embeddings-v5-omni-small</code> pode ser executado em servidores convencionais com GPU, e <code>jina-embeddings-v5-omni-nano</code> é pequeno o suficiente para executar em hardware comum. Isso representa uma grande economia potencial nos custos de computação e possibilita a instalação local licenciada e o processamento na borda, reduzindo a latência e aumentando o controle de seus próprios dados.</p><p>A suíte v5-omni usa técnicas inovadoras de design de modelos e Machine Learning para compor novos modelos de embedding a partir de modelos previamente treinados, sem precisar treiná-los novamente. Usamos codificadores de modelos pré-treinados, alinhados linguisticamente e incorporados para mídia de áudio e vídeo como pré-processadores de entrada para nosso conjunto de modelos <code>jina-embeddings-v5-text</code> existente. Os modelos resultantes geram embeddings para imagens e gravações de som que são semanticamente compatíveis com as embeddings gerados para textos.</p><p>Os modelos v5-omni produzem embeddings de texto idênticas a <code>jina-embeddings-v5-text</code> (isto é, <code>jina-embeddings-v5-omni-small</code> com <code>jina-embeddings-v5-text-small</code>; e <code>jina-embeddings-v5-omni-nano</code> com <code>jina-embeddings-v5-text-nano</code>), para que você possa estender repositórios de recuperação de texto existentes para aplicativos multimídia sem reconstruir seus índices.</p><p>Os codificadores integrados são todos derivados de modelos de pesos abertos. Para imagens e vídeos, utilizamos codificadores dos modelos <a href="https://qwen.ai/blog?id=qwen3.5">Qwen3.5</a>:</p><ul><li><p>Para <code>jina-embeddings-v5-omni-nano</code>, o codificador <a href="https://huggingface.co/google/siglip2-base-patch16-224">SigLIP2 Base</a> ajustado de <a href="https://huggingface.co/Qwen/Qwen3.5-0.8B">Qwen3.5-0.8B</a>.</p></li><li><p>Para <code>jina-embeddings-v5-omni-small</code>, o codificador <a href="https://huggingface.co/google/siglip2-so400m-patch14-384">SigLIP2 So400m</a> ajustado de <a href="https://huggingface.co/Qwen/Qwen3.5-2B">Qwen3.5-2B</a>.</p></li><li><p>Para suporte de áudio, adicionamos o codificador do <a href="https://huggingface.co/openai/whisper-large-v3">Whisper-large-v3</a>, extraído do <a href="https://huggingface.co/Qwen/Qwen2.5-Omni-7B">Qwen2.5-Omni-7B</a>, às versões small e nano.</p></li></ul><p>Conectamos esses codificadores específicos de mídia ao backbone de processamento de texto com projetores multimodais treinados. Esses projetores traduzem suas saídas nativas para embeddings de entrada compatíveis com <code>jina-embeddings-v5-text</code>. As únicas partes recém-treinadas dos modelos <code>jina-embeddings-v5-omni</code> são os pesos nesses projetores.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt62dc05bfa3d054b6/6a17e86eb1e113340b79f29c/4cb834b7e5fd63cdd78600de313615feffabbb1f-1999x1000.jpg" alt="" /><p>Essa arquitetura significa que só precisamos treinar os projetores entre modelos, cerca de 5,5 milhões de parâmetros para <code>jina-embeddings-v5-omni-small</code> e menos de 3,5 milhões para <code>jina-embeddings-v5-omni-nano</code>, para cada um dos quatro adaptadores de Low-Rank Adaptation (LoRA). Essa abordagem minimiza o treinamento adicional necessário para conectar diferentes modelos de embedding, aproveitando o treinamento especializado de cada um para produzir um conjunto modular de embedding extremamente compacto e de alto desempenho.</p><h2>Propriedades selecionadas do modelo</h2><h3>Entrada/saída</h3><p>Nome do modelo</p><p>Tamanho da janela de contexto de entrada</p><p>Tamanho do embedding</p><p>jina-embeddings-v5-omni-small</p><p>32.768 tokens*</p><p>1024 dimensões (mínimo: 32)</p><p>jina-embeddings-v5-omni-nano</p><p>8.192 tokens*</p><p>768 dimensões (mínimo: 32)</p><p>* Consulte <strong>Usando jina-embeddings-v5-omni</strong> abaixo para obter mais informações sobre como mídias não textuais são tokenizadas.</p><h3>Tamanho</h3><p>Nome do modelo</p><p>Tamanho total</p><p>jina-embeddings-v5-omni-small (modelo base apenas texto + 4 adaptadores LoRA)</p><p>700M params</p><p>Suporte a imagens/vídeos (codificador SigLIP2 So400m extraído do Qwen3.5-2B)</p><p>1.006B params</p><p>suporte a áudio (encoder Whisper-large-v3 extraído do Qwen2.5-Omni-7B)</p><p>1.354B params</p><p>ambos</p><p>1.660B params</p><p>adaptadores LoRA (cada)</p><p>20M</p><p>jina-embeddings-v5-omni-nano (modelo base apenas texto + 4 adaptadores LoRA)</p><p>266M params</p><p>Suporte a imagens/vídeos (codificador base SigLIP2 extraído de Qwen3.5-0,8B)</p><p>354M params</p><p>suporte a áudio (encoder Whisper-large-v3 extraído do Qwen2.5-Omni-7B)</p><p>916M params</p><p>ambos</p><p>1.004B params</p><p>adaptadores LoRA (cada)</p><p>7M</p><p>* Consulte <strong>Usando jina-embeddings-v5-omni</strong> abaixo para obter mais informações sobre como mídias não textuais são tokenizadas.</p><h2>Treinamento específico para tarefas</h2><p>A família <code>jina-embeddings-v5-omni</code> dá suporte aos mesmos adaptadores LoRA específicos para tarefas que <code>jina-embeddings-v5-text</code>:</p><p>Tarefa</p><p>Exemplos de uso</p><p>Recuperação</p><p>Recuperação de informações, isoladamente ou em conjunto com outras técnicas de recuperação e avaliação de resultados. Com os modelos v5-omni, você pode recuperar áudio, vídeo e imagens em uma única consulta de um único índice.</p><p>Clustering</p><p>Descoberta de tópicos e organização automática de conteúdos em todas as mídias.</p><p>Classificação</p><p>Categorização, análise de sentimento e tipos de tarefas relacionadas.</p><p>Similaridade semântica</p><p>Deduplicação de dados em diferentes mídias, sistemas de recomendação, mídias relacionadas, encontrar textos para corresponder à fala, identificar traduções e tarefas similares.</p><p>Os embeddings de saída dependem da categoria de tarefa selecionada. Por exemplo, você não deve usar embeddings orientados à recuperação para agrupamento nem embeddings de similaridade semântica para classificação.</p><h2>Multimídia, multimodal, multilíngue, multifuncional</h2><p>Para mostrar o que <code>jina-embeddings-v5-omni</code> é capaz, vamos pegar as famosas passagens iniciais de dois romances e medir sua semelhança semântica:</p><p><em><strong>Um Conto de Duas Cidades</strong></em><strong> (Charles Dickens)</strong></p>It was the best of times, it was the worst of times, it was the
age of wisdom, it was the age of foolishness, 
it was the epoch of belief, it was the epoch of incredulity,
it was the season of Light, it was the season of Darkness,
it was the spring of hope, it was the winter of despair,
we had everything before us, we had nothing before us,
we were all going direct to Heaven, we were all going
direct the other way—in short, the period was so far like
the present period, that some of its noisiest authorities
insisted on its being received, for good or for evil, in 
the superlative degree of comparison only.<p><em><strong>Orgulho e Preconceito</strong></em><strong> (Jane Austen)</strong></p>It is a truth universally acknowledged, that a 
single man in possession of a good fortune must
be in want of a wife. However little known the
feelings or views of such a man may be on his first
entering a neighbourhood, this truth is so well
fixed in the minds of the surrounding families,
that he is considered as the rightful property of
some one or other of their daughters.<p>Usando <code>jina-embeddings-v5-omni-small</code>, com seu adaptador de similaridade semântica, esses textos têm uma similaridade de <strong>0,5329</strong>.</p><p>Esse número não significa muito sem algo para comparar, então vamos comparar esses dois textos com suas traduções francesas usando o mesmo modelo e adaptador:</p><p><strong>Pontuações de similaridade semântica para textos entre línguas</strong></p><p></p><p>Um Conto de Duas Cidades (inglês)</p><p>Orgulho e Preconceito (inglês)</p><p>Um Conto de Duas Cidades (francês)(Paris et Londres en 1783, trad. H. Loreau)</p><p>0,9095</p><p>0,5074</p><p>Orgulho e Preconceito (Francês) (Orgueil et Préjugés, tr. Leconte et Pressoir)</p><p>0,4826</p><p>0,8784</p><p>Os dois textos mostram muito mais similaridade com suas traduções do que com outros textos no mesmo idioma ou em outro idioma. Isso reflete os embeddings semânticos multilíngues de altíssimo desempenho de <code>jina-embeddings-v5-text-small</code>, incluídas inalteradas em <code>jina-embeddings-v5-omni-small</code>.</p><p>Adicionar suporte multimídia ao <code>jina-embeddings-v5-omni</code> significa que podemos estender este experimento para outros tipos de dados. Por exemplo, obtivemos digitalizações das primeiras páginas de ambos os romances em edições impressas antigas:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt95d451adb5680e20/6a17e871445de9e88a4d016c/e92d928a4813ccecc7d02639eea699e3a71c66e3-1999x1692.png" alt="Duas páginas envelhecidas de livros exibem as passagens iniciais de &quot;Um Conto de Duas Cidades&quot; e &quot;Orgulho e Preconceito&quot;, com a página da esquerda mostrando o início do primeiro capítulo de uma edição do século XIX sem data de &quot;Um Conto de Duas Cidades&quot; e a página da direita mostrando o início do primeiro capítulo da edição de 1903 da Macmillan de &quot;Orgulho e Preconceito&quot;." /><p><strong>Figura 2:</strong> <em>Um Conto de Duas Cidades</em>, edição do século XIX sem data, e <em>Orgulho e Preconceito</em>, edição Macmillan de 1903.</p><p>Vamos comparar os dois textos com as digitalizações, usando novamente o adaptador de similaridade semântica:</p><p><strong>Pontuações de similaridade semântica entre textos e imagens</strong></p><p></p><p>Um Conto de Duas Cidades (digitalização)</p><p>Orgulho e Preconceito (digitalização)</p><p>Um Conto de Duas Cidades (texto)</p><p>0,7336</p><p>0,4891</p><p>Orgulho e Preconceito (texto)</p><p>0,4804</p><p>0,7213</p><p>Você vê que as pontuações de similaridade semântica favorecem fortemente textos que correspondem ao conteúdo das imagens.</p><p>Podemos também comparar os textos com uma captura de tela de uma postagem nas redes sociais e um meme que fazem referência a esses textos, usando a mesma estrutura:</p><p><strong>Figura 3:</strong> Um tuíte de Elon Musk que faz referência a <em>A Tale of Two Cities (Um Conto de Duas Cidades)</em> e um meme que faz referência à famosa abertura de <em>Pride and Prejudice (Orgulho e Preconceito)</em>.</p><p><strong>Pontuações de similaridade semântica entre textos e imagens</strong></p><p></p><p>Um Conto de Duas Cidades</p><p>Orgulho e Preconceito</p><p>Tweet de Musk (imagem)</p><p>0,7156</p><p>0,4912</p><p>Meme Keep Calm (imagem)</p><p>0,4555</p><p>0,6244</p><p>Podemos fazer o mesmo para a fala. Obtivemos gravações da leitura de ambos os textos, em inglês e francês:</p><ul><li><p><a href="https://drive.google.com/file/d/1IK_bR6L47TSrnESdXLEpHCX6o-FzPmOx/view?usp=sharing"><em>A Tale of Two Cities</em></a><a href="https://drive.google.com/file/d/1IK_bR6L47TSrnESdXLEpHCX6o-FzPmOx/view?usp=sharing"> (áudio em inglês da Librivox)</a>.</p></li><li><p><a href="https://drive.google.com/file/d/1KurbhD6INc6oZlq_SJcWq7MBVfJQ3pof/view?usp=sharing"><em>Um Conto de Duas Cidades</em></a><a href="https://drive.google.com/file/d/1KurbhD6INc6oZlq_SJcWq7MBVfJQ3pof/view?usp=sharing"> (áudio em francês gerado pela OmniVoice AI).</a></p></li><li><p><a href="https://drive.google.com/file/d/1D_G2FOCb7ct-FBVY1fyivXlY2e_yGZw1/view?usp=sharing"><em>Orgulho e Preconceito</em></a><a href="https://drive.google.com/file/d/1D_G2FOCb7ct-FBVY1fyivXlY2e_yGZw1/view?usp=sharing"> (áudio em inglês da Librivox).</a></p></li><li><p><a href="https://drive.google.com/file/d/1jutY61YSFGBIyE8m-ltEJx-8dEXNJJ5N/view?usp=sharing"><em>Orgulho e Preconceito</em></a><a href="https://drive.google.com/file/d/1jutY61YSFGBIyE8m-ltEJx-8dEXNJJ5N/view?usp=sharing"> (áudio em francês gerado pela OmniVoice AI).</a></p></li></ul><p><strong>Pontuações de similaridade semântica entre textos e áudios entre línguas</strong></p><p></p><p>Um Conto de Duas Cidades (áudio em inglês)</p><p>Um Conto de Duas Cidades (áudio em francês)</p><p>Orgulho e Preconceito (áudio em inglês)</p><p>Orgulho e Preconceito (áudio em francês)</p><p>Um Conto de Duas Cidades (texto em inglês)</p><p>0,3816</p><p>0,3106</p><p>0,1607</p><p>0,1774</p><p>Um Conto de Duas Cidades (texto em francês)</p><p>0,3528</p><p>0,3253</p><p>0,1598</p><p>0,1721</p><p>Orgulho e Preconceito (texto em inglês)</p><p>0,1910</p><p>0,1682</p><p>0,3511</p><p>0,3398</p><p>Orgulho e Preconceito (texto em francês)</p><p>0,1667</p><p>0,1474</p><p>0,3018</p><p>0,3702</p><p>Essa capacidade multilíngue e multimídia se estende à recuperação de informações.</p><p>Os adaptadores de recuperação para os modelos <code>jina-embeddings-v5-omni</code> implementam recuperação assimétrica. Isso significa que eles codificam consultas de maneira diferente da forma como incorporam documentos-alvo de recuperação, então as consultas multimodais estão sempre em alguma direção, com consultas em uma mídia e documentos em outra, dando pontuações diferentes de quando são invertidas.</p><p>As tabelas abaixo mostram as pontuações de recuperação para texto, áudio e imagens de digitalização de páginas de <em>Um Conto de Duas Cidades</em> e <em>Orgulho e Preconceito</em>, quando o texto de <em>Um Conto de Duas Cidades</em> (em inglês) é codificado como a consulta:</p><p><strong>Texto para texto</strong></p><p>Documento</p><p>Pontuação de recuperação</p><p>Um Conto de Duas Cidades (trecho de texto em francês)</p><p>0,7597</p><p>Orgulho e Preconceito (trecho do texto em inglês)</p><p>0,1482</p><p>Orgulho e Preconceito (trecho de texto em francês)</p><p>0,0523</p><p><strong>Texto para imagem</strong></p><p>Documento</p><p>Pontuação de recuperação</p><p>Um Conto de Duas Cidades (digitalização da página em inglês)</p><p>0,5517</p><p>Um Conto de Duas Cidades (digitalização da página em francês)</p><p>0,3576</p><p>Orgulho e Preconceito (digitalização da página em inglês)</p><p>0,1917</p><p><strong>Texto para áudio</strong></p><p>Documento</p><p>Pontuação de recuperação</p><p>Um Conto de Duas Cidades (áudio em inglês)</p><p>0,3277</p><p>Um Conto de Duas Cidades (áudio em francês)</p><p>0,1980</p><p>Orgulho e Preconceito (áudio em inglês)</p><p>0,1419</p><p>Orgulho e Preconceito (áudio em francês)</p><p>0,1759</p><p>Os usuários também podem executar a consulta no sentido oposto, realizando recuperação de áudio-texto e imagem-texto.</p><p>Abaixo estão as pontuações usando o áudio em inglês de <em>Um Conto de Duas Cidades</em> como consulta e vários textos como documentos:</p><p><strong>Imagem para texto</strong></p><p>Documento</p><p>Pontuação de recuperação</p><p>Um Conto de Duas Cidades (trecho do texto em inglês)</p><p>0,3352</p><p>Um Conto de Duas Cidades (trecho de texto em francês)</p><p>0,2650</p><p>Orgulho e Preconceito (trecho do texto em inglês)</p><p>0,1626</p><p>Orgulho e Preconceito (trecho de texto em francês)</p><p>0,1385</p><p>E as pontuações usando uma digitalização da primeira página de <em>Um Conto de Duas Cidades</em> (em inglês) como consulta:</p><p><strong>Áudio para texto</strong></p><p>Documento</p><p>Pontuação de recuperação</p><p>Um Conto de Duas Cidades (trecho do texto em inglês)</p><p>0,5304</p><p>Um Conto de Duas Cidades (trecho de texto em francês)</p><p>0,4845</p><p>Orgulho e Preconceito (trecho do texto em inglês)</p><p>0,1467</p><p>Orgulho e Preconceito (trecho de texto em francês)</p><p>0,0761</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt501b2c594f45f2e3/6a17e877a292992e3ad02c9a/673f5116c1d7a5a6f9adfbb2f48b9e6920e3229b-668x130.png" alt="Uma caixa de notificação retangular com fundo azul claro exibe um ícone amarelo de triângulo de advertência ao lado do texto, explicando que jina-embeddings-v5-omni é treinado para encontrar áudio, vídeo e imagens de consultas de texto e que consultas sem texto podem ser menos eficazes." /><h2>Busca de vídeo</h2><p>As capacidades do <code>jina-embeddings-v5-omni</code> para indexação de vídeo e busca trazem novas capacidades aos bancos de dados Elasticsearch, mas estão sujeitas a muitos dos mesmos avisos que se aplicam aos textos. Gerar um único embedding para um filme longo é como incorporar um romance muito longo: informações detalhadas serão diluídas, e o embedding resultante será uma boa correspondência para muitas consultas muito espúrias.</p><p>Se você incorporar o texto completo de <em>O Senhor dos Anéis</em> (aproximadamente 500.000 palavras), é provável que ele corresponda à maioria das consultas, independentemente do que você esteja procurando. Da mesma forma, se você indexar um filme de Hollywood de duas horas, obterá muitas correspondências espúrias e detalhes totalmente perdidos. <code>jina-embeddings-v5-omni</code> é ideal com clipes curtos.</p><p>Para este exemplo, baixamos o trailer do filme <em>Bonequinha de Luxo</em>, de 1961, que tem apenas 158 segundos de duração e está em domínio público. Você pode assistir ao trailer <a href="https://archive.org/details/turner_video_311/311.mp4">no Internet Archive</a>.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt06633fdd1c8334dd/6a17e8790b0bed7d9add35b2/1948f585027d1342528c0dd93fe99e3ec7ba17f9-800x1200.png" alt="Um pôster vintage do filme Bonequinha de Luxo apresenta uma imagem ilustrada de corpo inteiro de Audrey Hepburn usando um vestido preto longo, luvas pretas, um colar de pérolas e um porta-cigarros, com um gato no ombro. Uma ilustração de fundo menor mostra um casal se abraçando perto de uma paisagem urbana, e o pôster inclui bordas coloridas junto com os créditos do elenco e da produção." /><p><strong>Figura 4: </strong>O pôster teatral de <em>Bonequinha de Luxo</em>.</p><p>Nós usamos <a href="https://www.scenedetect.com/">PySceneDetect </a>para dividir o trailer em 28 cenas individuais, com durações variando de 1,877 segundos (45 quadros) a 18,393 segundos (441 quadros). A detecção de cena é imperfeita, mas fornece um mecanismo adequado para dividir o vídeo em trechos menores para recuperação. Então, geramos embeddings de documentos para cada um dos 28 segmentos, usando <code>jina-embeddings-v5-omni-small</code>, para que pudéssemos testar a eficácia das consultas de texto na localização de elementos específicos no vídeo.</p><p>Por exemplo, a consulta por “cat” retornou os seguintes trechos como os três principais resultados. A única cena com um gato está no topo, com uma pontuação de <strong>0,1634</strong>:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt6dca953a4afd5c1b/6a17e87baf47b65bf6cddfbc/82bd1759ebb65202f01a1e290447619af39f9a3d-735x426.png" alt=" Uma miniatura de vídeo mostra uma pessoa ajoelhada no chão da cozinha estendendo a mão em direção a uma geladeira aberta enquanto um gato está por perto (pontuação 0,1634)." /><p><a href="https://drive.google.com/file/d/1O3r-97rQJE7HAlUHsLygmFLwlZihRF26/view?usp=drive_link">Assista ao primeiro vídeo</a>.</p><p>A próxima melhor correspondência, com uma pontuação de <strong>0,1237</strong>, é muito menor:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltcc2cc1ef9ff9ce4b/6a17e87d7c026e725cf146b3/de4eb704ef751cc4df2bead7faa177decd20b1b3-735x426.png" alt="Uma miniatura de vídeo mostra uma pessoa segurando uma máscara colorida perto do rosto com o nome “GEORGE PEPPARD” sobreposto na imagem (pontuação 0,1237)." /><p><a href="https://drive.google.com/file/d/1DEK2H4bCpLVzyipJri9NSqE2jkeZ5jLm/view?usp=drive_link">Assista ao clipe 2</a>.</p><p>Você também pode buscar ações. Se você pesquisar por "beijo", as quatro melhores correspondências mostram beijos:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt85bf55536faf5156/6a17e87f25daab4bb608a269/18efdcbbb31954dfab8eafe5055773b6b8e3de72-735x426.png" alt="Uma miniatura de vídeo mostra três pessoas em um ambiente interno, com uma pessoa de pé à esquerda de costas para a câmera e duas pessoas à direita parecendo se abraçar perto de uma cortina e uma porta (pontuação: 0,2864)." /><p><a href="https://drive.google.com/file/d/1Pmr_D4wKjUCCiq_Dzy5PQeWldJLjZ8kI/view?usp=drive_link">Assista ao clipe 3.</a> Sua pontuação é 0,2864.</p><p>Pontuações: Para a <a href="https://drive.google.com/file/d/1sS_4qTnmHU2uOwbN1fmdXeS3IvZAI_IN/view?usp=drive_link">segunda correspondência</a> (0,2494), <a href="https://drive.google.com/file/d/1ofsrZHTUb3huwQ0JB6Hs5dOw4myTj-sk/view?usp=drive_link">terceira correspondência</a> (0,2099) e <a href="https://drive.google.com/file/d/1qaS4eueUCcQWdHLEjfEfneXsaWsx6P_5/view?usp=drive_link">quarta correspondência</a> (0,2068), respectivamente.</p><p>E você pode buscar textos exibidos em vídeos, como "Buddy Ebsen", que só aparece uma vez. <code>jina-embeddings-v5-omni-small</code> identifica-o prontamente como o melhor resultado com uma pontuação de <strong>0,3885</strong>, consideravelmente maior do que o próximo melhor resultado:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt4c3fd86052f17ce8/6a17e886e9ea8795d8a9c601/dabcae9f44b9d4a671f88717aa21a2c6cf685f6b-735x426.png" alt="Uma miniatura de vídeo mostrando um homem de terno ao lado de uma escada com balaústres brancos e um corrimão escuro, com o texto sobreposto “Buddy Ebsen&quot; (pontuação 0,3885)." /><p><a href="https://drive.google.com/file/d/1rdQ1OqtPBD-3iGG8A900jU5DpC-muye4/view?usp=sharing">Clipe do Buddy Ebsen</a>.</p><h2>Recuperação visual de documentos</h2><p>Os modelos multimodais de embedding da Jina AI estão entre os melhores em processamento de documentos visuais e são de última geração em processamento visual multilíngue de documentos. Isso significa lidar com dados de imagens que contenham texto, figuras e informações estruturadas. Os dados importantes geralmente estão na forma de digitalizações impressas, arquivos PDF, diagramas, desenhos técnicos, capturas de tela, imagens, infográficos e similares. Esses tipos de imagens geralmente são compostos mecanicamente ou gerados por computador. Eles geralmente não podem ser reduzidos a texto sem perda de significado e são pouco adequados para modelos de visão computacional projetados para fotografar cenas naturais.</p><p><code>jina-embeddings-v5-omni</code>Os embeddings abrangem informações sobre os objetos na imagem, o texto impresso neles e as relações entre eles. A recuperação visual de documentos possibilita indexar imagens ricas em informações que contêm tanto elementos quanto texto relevante, inclusive em diferentes idiomas.</p><p>Como exemplo, vamos usar quatro imagens de produtos de vários sites de comércio eletrônico:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt620568521e2a3057/6a17e888f7018418c89a68a8/639481349aed78d4139f0d388d44f79b6ba29f88-1297x650.png" alt="" /><p>Agora, vamos ver como <code>jina-embeddings-v5-omni-small</code> avalia essas quatro imagens para a consulta "miocarrão ramen":</p><p>Campbell’s Frango com Macarrão Grosso (embalagem canadense)</p><p>Kraft Dinner (embalagem canadense)</p><p>Ramen fresco sabor Maruchan Miso (embalagem japonesa)</p><p>Birkel Spaghetti (embalagem alemã)</p><p>0,0872</p><p>0,0711</p><p>0,1123</p><p>0,0886</p><p>Ele encontra facilmente a correspondência japonesa.</p><p>Agora, vamos tentar uma consulta para "マカロニチーズ" (japonês para <em>macarrão com queijo</em>):</p><p>Campbell’s Frango com Macarrão Grosso (embalagem canadense)</p><p>Kraft Dinner (embalagem canadense)</p><p>Ramen fresco sabor Maruchan Miso (embalagem japonesa)</p><p>Birkel Spaghetti (embalagem alemã)</p><p>0,2207</p><p>0,3487</p><p>0,2760</p><p>0,2674</p><p>Ele encontra a correspondência correta com a mesma facilidade que uma consulta em inglês.</p><p><code>jina-embeddings-v5-omni</code> também se destaca na interpretação de imagens ricas em informações, como gráficos. Para ver isso em ação, veja estes dois gráficos de barras:</p><p>Dois gráficos, <strong>Gráfico 1</strong> à esquerda, sobre a carga global de doenças, e <strong>Gráfico 2</strong> à direita, sobre a longevidade das raças de cães.</p><p>Vamos ver como eles correspondem a duas questões de texto potenciais, cada uma relevante para um, mas não para ambos os gráficos, usando <code>jina-embeddings-v5-omni-small</code> para recuperação:</p><p>Pergunta de texto</p><p>Gráfico 1</p><p>Gráfico 2</p><p>“Quais são alguns problemas médicos comuns para idosos?”</p><p>0,2787</p><p>0,1099</p><p>"Quanto tempo os cachorros vivem?"</p><p>0,1350</p><p>0,3564</p><p>Você também pode reverter a busca, usando imagens como consultas para encontrar textos. A tabela abaixo mostra documentos-alvo extraídos dos resumos de artigos científicos relacionados ao tópico e suas pontuações de recuperação, usando as imagens do gráfico como consultas:</p><p></p><p>Texto 1</p><p>Texto 2</p><p></p><p>A saúde das populações que vivem em extrema pobreza tem sido um foco de longa data dos esforços de desenvolvimento global e continua sendo uma prioridade durante a era dos Objetivos de Desenvolvimento Sustentável. No entanto, não houve uma tentativa sistemática de quantificar a magnitude e as causas da carga nessa população específica por quase duas décadas. Estimamos as taxas de doenças por causa para o bilhão mais pobre do mundo e comparamos essas taxas com as de populações de alta renda.</p><p>O cão de companhia é uma das espécies mais fenotipicamente diversas. A variabilidade entre raças se estende não apenas à morfologia e aspectos do comportamento, mas também à longevidade. Apesar desse fato, poucas pesquisas têm sido dedicadas à avaliação da variação na expectativa de vida entre raças ou à avaliação do potencial para caracterização filogenética da longevidade.</p><p>Gráfico 1</p><p>0,2377</p><p>0,1357</p><p>Gráfico 2</p><p>0,0673</p><p>0,3576</p><h2>Recursos</h2><h3>Embeddings truncáveis</h3><p>Treinamos os modelos de base <code>jina-embeddings-v5-text</code> que sustentam <code>jina-embeddings-v5-omni</code> com <a href="https://arxiv.org/abs/2205.13147">Aprendizado de Representação Matryoshka</a>, para que você possa truncar embeddings de texto e multimídia desses modelos.</p><p>Por padrão, <code>jina-embeddings-v5-omni-small</code> gera embeddings com 1.024 dimensões, consumindo 2KB para armazenar com precisão de 16 bits. Os embeddings do <code>jina-embeddings-v5-omni-nano</code> têm 768 dimensões, ocupando cerca de 1,5KB. Você pode reduzir o tamanho desses embeddings para 32 dimensões (64 bytes) a algum custo para a precisão, mas com grande ganho na velocidade de processamento e redução dos custos de recursos. Em geral, reduzir o tamanho dos embeddings pela metade diminui a precisão em cerca de 2%, até 128 dimensões, abaixo das quais a precisão cai muito mais rápido.</p><p>Embeddings truncáveis permitem que os usuários decidam o melhor compromisso entre precisão, velocidade e custo, de acordo com seus casos de uso.</p><h3>Quantização</h3><p>A família <code>jina-embeddings-v5-omni</code> também herda desempenho robusto com quantização de sua estrutura principal <code>jina-embeddings-v5-text</code>. Isso aumenta ainda mais a velocidade e reduz os custos de computação e armazenamento ao armazenar números menos precisos. Nós os treinamos para funcionar com <a href="https://elastic.co/elasticsearch">Elasticsearch</a>e sua <a href="https://www.elastic.co/docs/reference/elasticsearch/mapping-reference/bbq">Quantização Binária Aprimorada</a> (BBQ), para fornecer desempenho quase idêntico ao de embeddings não quantizados. No conjunto de benchmarks de recuperação Massive Text Embedding Benchmark (MTEB), a binarização reduz o desempenho em menos de 3% em comparação com valores completos de 16 bits, enquanto economiza 93% do espaço e aumenta drasticamente as velocidades de processamento e recuperação.</p><h3>Desempenho multilíngue</h3><p><code>jina-embeddings-v5-text</code>O extenso treinamento multilíngue também está presente em <code>jina-embeddings-v5-omni</code>, com quase 100 idiomas na pré-formação de <code>jina-embeddings-v5-text-small</code> e 15 principais línguas globais em <code>jina-embeddings-v5-text-nano</code>. Para mídia de áudio, o modelo <code>Whisper-large-v3</code> possui aproximadamente 100 idiomas em seu treinamento, e os modelos de visão SigLip2 modificados por Qwen, integrados em <code>jina-embeddings-v5-omni-small</code> e <code>-nano</code>, foram treinados com dados de 201 idiomas e dialetos distintos.</p><h2>Desempenho em benchmarks</h2><h3>Texto</h3><p><code>jina-embeddings-v5-omni</code> Os modelos são idênticos aos modelos <code>jina-embeddings-v5-text</code> quando usados apenas para texto. São os modelos com melhor desempenho no conjunto <a href="https://huggingface.co/spaces/mteb/leaderboard">de benchmarks MMTEB</a> em suas respectivas categorias de tamanho para embeddings semânticos de texto.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt14d87596ca463c88/6a17e88dec0f89dfb65a664f/8687106cf82e6ec2b3f79f893cfe011e4a5b4a21-1095x1095.png" alt="Um gráfico de barras e linhas compara as pontuações MMTEB e os tamanhos dos parâmetros para nove modelos de embedding, com jina-v3-omni-small alcançando a maior pontuação e snowflake-arctic-embed-l-v2 tendo o menor tamanho." /><p><strong>Figura 5</strong>: Tamanho e desempenho de <code>jina-embeddings-v5-omni</code>em benchmarks de texto, em comparação com modelos concorrentes. O tamanho citado é sem carregar extensões para outras mídias.</p><h3>Similaridade semântica visual</h3><p>Nos benchmarks padrão de similaridade semântica visual, <code>jina-embeddings-v5-omni</code> apresenta as melhores pontuações de qualquer modelo próximo ao seu tamanho. <code>jina-embeddings-v5-omni</code> modelos apresentam, de longe, o melhor desempenho entre os modelos públicos de pesos abertos de tamanho comparável. <code>jina-embeddings-v5-omni-small</code> só é superado por um modelo três vezes maior em tarefas de similaridade semântica visual, e <code>jina-embeddings-v5-omni-nano</code> é superado apenas por <code>jina-embeddings-v5-omni-small</code> e por modelos 10 a 25 vezes maiores.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt16ad3463d2aeefc5/6a17e88efaa9139b1493c8a9/f2ae56764865953bdf8c54747276189efd6d45e1-1496x877.png" alt="Um gráfico de barras e linhas compara as pontuações visuais de similaridade semântica e os tamanhos dos parâmetros para sete modelos de embedding, com jina-embeddings-v5-omni-small alcançando a maior pontuação de similaridade e laion/CLIP-ViT-bigG-14 apresentando o maior tamanho de modelo." /><p><strong>Figura 6</strong>: Benchmark de pontuação média de similaridade semântica visual para os modelos <code>jina-embeddings-v5-omni-small</code>, <code>jina-embeddings-v5-omni-nano</code> e comparáveis, além de seus tamanhos, incluindo extensões de visão.</p><h3>Recuperação visual de documentos</h3><p><code>jina-embeddings-v5-omni-small</code> é competitivo com modelos de três e sete bilhões de parâmetros, permanecendo abaixo de um bilhão de parâmetros. <code>jina-embeddings-v5-omni-nano</code> também se destaca pelo tamanho, superando modelos de dez a sessenta vezes maiores.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltcbabd1477ec3459c/6a17e890e317912a242d5806/cde672f18de8f4a30dd81938b08bb06e08444be0-1223x905.png" alt="Um gráfico de barras e linhas compara pontuações ViDoRe selecionadas e tamanhos de parâmetros para múltiplos modelos de embedding, com LCO‑Embedding‑Omni‑7B alcançando a maior pontuação e laion/CLIP‑ViT‑bigG‑14 com o maior tamanho de modelo. O foco está em dois modelos de jina-embeddings." /><p><strong>Figura 7</strong>: Pontuações médias <a href="https://huggingface.co/spaces/vidore/vidore-leaderboard">de recuperação visual de documentos do ViDoRe</a> em seis benchmarks: <em>DocVQA</em>, <em>InfoVQA</em>, <em>ShiftProj</em>, <em>SynAI</em>, <em>Tabfquad</em> e <em>TatDQA</em>.</p><h3>Recuperação de áudio</h3><p>Nos benchmarks padrão de recuperação de áudio MAEB (Massive Audio Embedding Benchmark), tanto <code>jina-embeddings-v5-omni-small</code> quanto <code>jina-embeddings-v5-omni-nano</code> estão entre os melhores desempenhos. Apenas modelos muito grandes — mais de três vezes maiores que <code>jina-embeddings-v5-omni-small</code> — superam sua pontuação.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt80f517c1c0230031/6a17e892dbb4ff8498fb56ee/a8c896bbbd710026c7b053e38af460194e7730a6-1650x912.png" alt="Um gráfico de barras e linhas compara modelos de incorporação e de áudio ao longo do eixo x, mostrando barras azuis para o MAEB Score no eixo y esquerdo e uma linha vermelha para o tamanho do modelo em bilhões de parâmetros no eixo y direito. As barras variam de aproximadamente 20 a 55, e a linha varia de 0 a 10." /><p><strong>Figura 8</strong>: Pontuação média para vários modelos nos benchmarks de recuperação de áudio MAEB.</p><p>Embora o modelo <code>larger_clap_general</code> da LAION melhore a pontuação do jina-embeddings-v5-omni-nano ao ter menos parâmetros, é um modelo apenas de áudio, sem nenhum dos recursos multimodais adicionais do conjunto v5-omni.</p><h3>Vídeo</h3><p>No vídeo, <code>jina-embeddings-v5-omni-small</code> se destaca em encontrar o lugar em um vídeo que corresponde a uma consulta de texto. Os testes Charades-STA e MomentSeeker são os benchmarks padrão para essa tarefa, e você pode ver nos gráficos abaixo que <code>jina-embeddings-v5-omni-small</code> é o modelo com melhor pontuação entre modelos de pesos abertos comparáveis, apesar de seu tamanho muito menor.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltc8d7e7570b64d45a/6a17e8944b055d34e643221b/a2d7744d39fefb6b8b1f66e5b3f227828ef4ad4e-1350x672.png" alt="Um gráfico de barras e linhas mostra as pontuações do Charades-STA e os tamanhos do modelo para seis modelos de embedding. O eixo X lista os modelos, o eixo Y esquerdo mostra as pontuações do Charades-STA de 20 a 60 e o eixo Y direito mostra o tamanho do modelo (em bilhões de parâmetros) de 0 a 10. As barras azuis representam as pontuações, e uma linha vermelha com marcadores representa os tamanhos dos modelos." /><p><strong>Figura 9</strong>: Pontuações Charades-STA para vários modelos, junto com seus tamanhos.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltfbce6716a3a33ca5/6a17e89525daab2e8a08a26d/cf7578863fd509edb62c15878816d39657abc715-1550x845.png" alt="Um gráfico de barras e linhas compara seis modelos de embedding usando as pontuações do MomentSeeker e o tamanho do modelo. O eixo X lista os modelos, o eixo Y esquerdo mostra as pontuações do MomentSeeker de aproximadamente 44 a 60, e o eixo Y direito mostra o tamanho do modelo em bilhões de parâmetros de 0 a 10. As barras azuis representam as pontuações, e uma linha vermelha com marcadores representa os tamanhos dos modelos." /><p><strong>Figura 10</strong>: Pontuações do MomentSeeker para vários modelos, junto com seus tamanhos.</p><p>Também comparamos <code>jina-embeddings-v5-omni-small</code> com o <a href="https://seed.bytedance.com/en/blog/built-on-seed1-6-flash-seed-1-6-embedding-launched">Seed 1.6</a> da ByteDance, um modelo de peso fechado com contagem de parâmetros não divulgada. Nosso modelo supera o Seed 1.6 por uma grande margem no benchmark Charades-STA e quase iguala no MomentSeeker.</p><p>Modelo</p><p>Pontuação Charades-STA</p><p>Pontuação do MomentSeeker</p><p>seed-1.6-embedding</p><p>29,30</p><p>59,30</p><p>jina-embeddings-v5-omni-small</p><p>55,57</p><p>58,93</p><h2>Pontos fortes e limitações</h2><p><code>jina-embeddings-v5-omni</code> Os modelos ampliam a capacidade dos usuários de indexar, buscar e analisar informações digitalizadas de várias maneiras, particularmente:</p><ul><li><p>Recuperação de fala multilíngue a partir de consultas de texto.</p></li><li><p>PDF, digitalizações e busca visual de documentos.</p></li><li><p>Localização temporal em vídeos, ou seja, identificar trechos dos vídeos que correspondem a descrições em linguagem natural.</p></li><li><p>Classificação de gêneros de áudio, incluindo gêneros musicais.</p></li><li><p>Classificação de imagem baseada em informações da cena e identificação de objetos.</p></li></ul><p>O desempenho é mais limitado em outras áreas. Pode ser possível usar <code>jina-embeddings-v5-omni</code> para realizar essas tarefas, mas não treinamos para elas e os resultados podem ser ruins.</p><p>Estamos trabalhando ativamente para aprimorar nossa tecnologia nestas áreas:</p><ul><li><p>Encontrar vídeos específicos a partir de descrições em linguagem natural.</p></li><li><p>Similaridade semântica e recuperação de imagens (imagem para imagem).</p></li><li><p>Classificação de intenção na fala, como reconhecer comandos verbais.</p></li><li><p>Processamento de entradas multimídia, ou seja, imagens e textos acompanhantes, ou áudio, imagens e textos combinados.</p></li></ul><h2>Usando <strong>jina-embeddings-v5-omni</strong></h2><p>Este conjunto de modelos permite entrada por meio de três pontos de entrada: texto, áudio, imagens e vídeo juntos. <code>jina-embeddings-v5-omni</code> é executado em um framework que converte uma ampla variedade de formatos padronizados e realiza outros pré-processamentos.</p><p>Processamos as imagens usando a mesma <a href="https://arxiv.org/abs/2502.14786">abordagem NaFlex</a> fornecida na versão inicial do SigLip2: se a entrada for menor que 262.144 pixels (equivalente a 512x512), ela é ampliada até ficar maior que esse mínimo; e se for maior que 3.072.000 pixels, ela é reduzida até ficar menor que esse máximo. O processo de conversão garante que a altura e a largura da imagem sejam múltiplas de 14 pixels, com a menor distorção possível na proporção para atingir esse objetivo. O resultado é dividido em patches de 28x28 pixels, então o número total de patches é quantos quadrados de 28x28 forem necessários para cobrir a imagem. Cada patch é tratado como um único token no momento da inferência, e cada entrada de imagem é acompanhada por tokens especiais de início e fim para delimitar uma única imagem.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltf192cdba41155257/6a17e897abe0f2faaedfea2a/5ab7a8951780afdfe6eda9dca14add0375ae36bd-668x130.png" alt="Uma caixa de notificação retangular com fundo azul claro exibe um ícone amarelo de triângulo de advertência ao lado do texto, explicando que jina-embeddings-v5-omni é treinado para encontrar áudio, vídeo e imagens de consultas de texto e que consultas sem texto podem ser menos eficazes." /><p>Os modelos <code>jina-embeddings-v5-omni</code> modificam a resolução do vídeo da mesma forma que as imagens são modificadas (veja acima), e extraímos até 32 quadros do vídeo. Se o vídeo tiver mais de 32 quadros (o que é provável, já que os formatos padrão geralmente têm pelo menos 24 quadros por segundo), espaçaremos uniformemente os quadros que extraímos. Então, para cada dois quadros, o pré-processador de vídeo gera um conjunto de tokens igual ao número de quadrados 28x28 necessários para cobrir o vídeo.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt0acd4ddd95a66a53/6a17e898445de966214d0176/a38491c1cc47cfc65344c786e8ab57b9abf67e0b-1999x851.png" alt="Uma colagem de quadros de vídeo sequenciais é organizada com setas mostrando a progressão, representando uma série de cenas com Audrey Hepburn em diferentes momentos, terminando com um quadro exibindo o título &quot;Bonequinha de Luxo&quot;. O layout mostra que o modelo extrai 64 quadros igualmente espaçados de um vídeo, o que pode causar perda significativa de informações quando o vídeo é longo." /><p><strong>Figura 11:</strong> <code>jina-embeddings-v5-omni</code> extrai 32 quadros igualmente espaçados do vídeo. Se você tiver um vídeo longo, isso significa que muita coisa será perdida.</p><p>Para mais detalhes sobre pré-processamento de vídeo, veja a <a href="https://arxiv.org/abs/2502.14786">documentação técnica do SigLip2</a>.</p><p>A tokenização de áudio segue a abordagem incorporada ao Qwen-2.5-Omni: Os arquivos de som são cortados em segmentos de 30 segundos; se tiverem mais de 30 segundos, serão reamostrados para 16 kHz e transformados em um mel espectrograma de 128 canais Cada 40 ms é tratado como um único token, portanto, cada segmento de 30 segundos é tratado como 750 tokens, um token por 40 ms de áudio, além de tokens especiais de início e fim para delimitar uma única amostra.</p><p>Para mais detalhes sobre pré-processamento de áudio, veja o <a href="https://arxiv.org/abs/2503.20215">Relatório Técnico Qwen-2.5-Omni</a>.</p><h2>Disponibilidade</h2><p>Tanto <code>jina-embeddings-v5-omni-small</code> quanto <code>jina-embeddings-v5-omni-nano</code> estão disponíveis no <a href="https://www.elastic.co/docs/explore-analyze/elastic-inference/eis">Elastic Inference Service</a> (EIS), por meio da <a href="https://jina.ai/embeddings">API Jina</a>, e para instalação local por download (<a href="https://huggingface.co/jinaai/jina-embeddings-v5-omni-small"><code>small</code></a> e <a href="https://huggingface.co/jinaai/jina-embeddings-v5-omni-nano"><code>nano</code></a>). Os pesos dos modelos são distribuídos gratuitamente para teste em uma licença não comercial. Entre em contato com <a href="https://www.elastic.co/contact?pg=global&amp;plcmt=nav&amp;cta=205352">as vendas da Elastic</a> para uso comercial.</p><h2>Para começar</h2><p>Para usar <code>jina-embeddings-v5-omni</code> para texto, você pode integrar usando o campo <code>semantic_text</code> assim como com <code>jina-embeddings-v5-text</code>. Basta definir o <code>inference_id</code> para <code>.jina-embeddings-v5-omni-small</code> ou <code>.jina-embeddings-v5-omni-nano</code>. Consulte o <a href="https://www.elastic.co/docs/reference/elasticsearch/mapping-reference/semantic-text-how-tos">Guia de Referência</a> para obter instruções.</p><p>Para incorporar outras mídias com <code>jina-embeddings-v5-omni</code>, você precisa <a href="https://www.elastic.co/docs/api/doc/elasticsearch/operation/operation-inference-embedding">usar a API de inferência</a>. Por exemplo:</p>POST _inference/embedding/.jina-embeddings-v5-omni-small
{
  "input": [
    {
      "content": { 
        "type": "image", 
        "format": "base64", 
        "value": "data:image/jpeg;base64,..." 
      } 
    }, 
    { 
      "content": { 
        "type": "text", 
        "value": "Some text to create an embedding" 
      } 
    } 
  ] 
}<p>Para <code>jina-embeddings-v5-omni-nano</code>, mude o URI <code>POST</code> para <code>_inference/embedding/.jina-embeddings-v5-omni-nano</code>.</p><p>Para codificar documentos em outras mídias ou gerar embeddings para classificação ou clustering, você precisa <a href="https://www.elastic.co/docs/api/doc/elasticsearch-serverless/operation/operation-inference-put-jinaai"><u>criar um endpoint de inferência com o </u></a><a href="https://www.elastic.co/docs/api/doc/elasticsearch-serverless/operation/operation-inference-put-jinaai"><u>serviço</u></a> <u><code>jinaai</code></u>.</p><p>Para consultas, use o construtor de consultas como no exemplo abaixo. Troque o valor <code>inference_id</code> por <code>.jina-embeddings-v5-omni-nano</code> para usar o modelo <code>nano</code> em vez de <code>small</code>.</p>POST my-index/_search
{
  "knn": {
    "field": "dense-vector-field",
    "k": 10,
    "num_candidates": 100,
    "query_vector_builder": {
      "embedding": {
        "inference_id": ".jina-embeddings-v5-omni-small",
        "input": {
          "type": "image",
          "format": "base64",
          "value": "data:image/jpeg;base64,..."
        }
      }
    }
  }
}<p>Saiba mais na <a href="https://www.elastic.co/docs/reference/query-languages/query-dsl/query-dsl-knn-query#knn-query-builder-embedding">documentação do construtor de consultas</a>.</p><p>Para usar BBQ com <code>jina-embeddings-v5-omni</code>, siga<a href="https://www.elastic.co/docs/reference/elasticsearch/mapping-reference/bbq"> as instruções para indexação BBQ</a>.</p><h2>Mais informações</h2><p>Para mais informações sobre <code>jina-embeddings-v5-omni</code>, consulte o <a href="https://arxiv.org/html/2605.08384v2">relatório técnico</a> e a página do modelo no <a href="https://jina.ai/models/">website da Jina AI</a>. A <a href="https://huggingface.co/collections/jinaai/jina-embeddings-v5-omni">página da coleção jina-embeddings-v5-omni no Hugging Face</a> também contém informações técnicas e instruções para baixar e executar esses modelos localmente. Os modelos <code>jina-embeddings-v5-omni</code> podem ser baixados sob uma licença <a href="https://creativecommons.org/licenses/by-nc/4.0/deed.en">CC-BY-NC-4.0</a>, portanto, você pode experimentá-los livremente, mas para uso comercial, por favor, entre em contato com a equipe de vendas da Elastic.</p>]]></content:encoded>
    <link>https://www.elastic.co/search-labs/blog/jina-embeddings-v5-omni-all-media-one-index</link>
    <guid isPermaLink="true">https://www.elastic.co/search-labs/blog/jina-embeddings-v5-omni-all-media-one-index</guid>
    <category><![CDATA[Jina AI]]></category>
    <dc:creator><![CDATA[Scott Martens]]></dc:creator>
    <enclosure url="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt61bf5ce9de247ac5/6a17e89a7b54f9f4108b390f/b51e488ba5b90bec77f75af0b9cb4f0e25e20b91-1130x635.png" length="0" type="image/png"/>
    <pubDate>Mon, 11 May 2026 00:00:00 GMT</pubDate>
  </item>
  <item>
    <title><![CDATA[Jina embeddings v3 agora disponível no Gemini Enterprise Agent Platform Model Garden]]></title>
    <description><![CDATA[O modelo de busca Jina, jina-embeddings-v3, agora é autoimplantável na plataforma Gemini Enterprise Agent Platform Model Garden, com mais novidades por vir. Execute jina-embeddings-v3 em uma única GPU L4 dentro da sua própria VPC.]]></description>
    <content:encoded><![CDATA[<p>Hoje estamos lançando o <code>jina-embeddings-v3</code>, o primeiro modelo de base de busca Jina disponível no <a href="https://console.cloud.google.com/vertex-ai/publishers/jinaai/model-garden/jina-embeddings-v3">Gemini Enterprise Agent Platform Model</a><a href="https://console.cloud.google.com/vertex-ai/publishers/jinaai/model-garden/jina-embeddings-v3"> Garden</a> como um modelo de parceiro autoimplantável. <em>A autoimplantação</em> significa que o modelo é executado em instâncias de GPU dentro do seu projeto do Google Cloud e da sua Virtual Private Cloud (VPC). Sem chamadas de API externas, sem medição por token, sem limites de taxa.</p><p>Com essa integração, os usuários do Elasticsearch ganham uma nova opção de implantação que mantém os dados dentro do perímetro de segurança, entrega custos de infraestrutura previsíveis e roda de forma nativa no Google Cloud. Ao mesmo tempo, o ecossistema mais amplo do Google Cloud ganha acesso aos modelos de busca e recuperação de última geração desenvolvidos especificamente pelo Jina.</p><p>Esta é a primeira etapa de uma implementação mais ampla. Junto com os modelos que virão a seguir, a linha formará uma pilha completa de recuperação: incorpore seus dados, incorpore consultas, recupere e reclassifique candidatos, e estenda a busca para imagens com embeddings multimodais, tudo na infraestrutura que você controla. Você pode começar hoje com <code>jina-embeddings-v3</code>, o modelo que já alimenta pipelines de busca em produção em todo o ecossistema Elasticsearch via Elastic Inference Service (EIS).</p><p>Modelo</p><p>Tipo</p><p>Parâmetros</p><p>Principal recurso</p><p>Status do Model Garden</p><p>`jina-embeddings-v3`</p><p>Embedding de texto</p><p>572 milhões</p><p>Ferramenta multilíngue comprovada, contexto 8K, saída de 1024 dimensões, truncável para 32</p><p>Disponível agora</p><p>`jina-embeddings-v5-text-small`</p><p>Embedding de texto</p><p>677M</p><p>Multilíngue sub-1B de última geração, contexto de 32K, saída de 1024 dimensões, truncável para 32</p><p>Em breve</p><p>`jina-embeddings-v5-text-nano`</p><p>Embedding de texto</p><p>239 milhões</p><p>O melhor da categoria com menos de 500 milhões de parâmetros, contexto de 8K, saída de 768 dimensões, truncável até 32</p><p>Em breve</p><p>`jina-reranker-v3`</p><p>Reclassificador</p><p>600 milhões</p><p>Reclassificador listwise, contexto de 131 mil, até 64 documentos</p><p>Em breve</p><p>`jina-clip-v2`</p><p>Embedding multimodal</p><p>900M</p><p>Texto e imagem em espaço compartilhado, 89 idiomas e contexto de texto de 8K, imagens 512 × 512</p><p>Em breve</p><p>Cada modelo roda em uma única placa NVIDIA L4 (24 GB), a camada de GPU mais econômica do Google Cloud. A maioria dos outros modelos de incorporação no Google Cloud Model Garden exige um A100 de 80 GB ou H100, aproximadamente três vezes o custo da instância por hora antes mesmo de você começar a contar os tokens.</p><p>Não é necessária licença comercial adicional quando implantada via Vertex AI.</p><h2><strong>Por que o Model Garden?</strong></h2><p>Por que implantar pelo Model Garden em vez de usar uma API? Tudo se resume a três coisas: controle, custo e contexto.</p><h3>Seus dados nunca saem do ambiente seguro</h3><p>O principal atrativo para a maioria dos desenvolvedores é a arquitetura de autoimplantação. Quando você implanta um modelo Jina pelo Model Garden, os pesos são executados em instâncias de GPU dentro do seu próprio projeto Google Cloud e da sua própria VPC. Isso é um divisor de águas para qualquer pessoa que trabalhe em setores com preocupações com segurança de dados, como finanças ou saúde. Como não há chamadas externas de API, seus dados sensíveis permanecem dentro do seu perímetro de segurança.</p><h3>Redimensionamento com previsão</h3><p>Em vez de pagar toda vez que você incorpora uma frase ou reclassifica um documento, você paga um custo fixo por hora de instância. E como todo modelo Jina pode rodar em uma única NVIDIA L4, a camada de GPU mais acessível do Google Cloud, a barreira de entrada é baixa. Seja processando mil solicitações ou um bilhão, sua conta de infraestrutura permanece previsível. Essa é uma configuração que realmente recompensa você por aumentar seu tráfego, em vez de te taxar por isso.</p><h3>Tudo sob o mesmo teto</h3><p>Se seus dados já estão no Elasticsearch na Google Cloud, BigQuery ou Cloud Storage, faz sentido manter seus mecanismos de inferência próximos. Ao serem implementados por meio do Model Garden, os modelos da base de pesquisa Jina herdam todos os recursos corporativos que você já utiliza: gerenciamento de identidade e acesso (IAM) para controle de acesso, faturamento unificado na fatura existente do Google Cloud e a capacidade de integração com o Vertex AI Pipelines para fluxos de trabalho de operações de aprendizado de máquina (MLOps).</p><p>Embora a API Jina AI Cloud e o Elastic Cloud ofereçam o caminho mais rápido para picos de tráfego ou fluxos de trabalho de busca existentes, o Model Garden é ideal para aplicações corporativas que exigem segurança de dados rigorosa e custos previsíveis em grande escala. A Elastic quer encontrar você onde você estiver.</p><h2><strong>Modelos Jina AI</strong></h2><h3><strong>jina-embeddings-v3</strong></h3><p>Nosso modelo comprovado de embedding multilíngue com 572 milhões de parâmetros e contexto de token 8K. Pontuação 65,5 no Massive Text Embedding Benchmark (MTEB) em inglês. Compatível com cinco adaptadores LoRA (Low-Rank Adaptation) específicos para tarefas (consulta/passagem de recuperação, correspondência de texto, classificação, agrupamento) e truncamento Matryoshka de 1024 para 64 dimensões. Já amplamente adotado em todo o ecossistema Elasticsearch via EIS.</p><p>Estamos priorizando a v3 porque muitos sistemas de produção já dependem dela. Se você está migrando um pipeline baseado em v3 para o Google Cloud, agora pode executar o mesmo modelo de forma nativa sem alterar as dimensões de embedding nem reindexar.</p><h3><strong>jina-embeddings-v5-text (pequeno e nano)</strong></h3><p>Nossos modelos de incorporação de texto de quinta geração, lançados em fevereiro de 2026, alcançam desempenho de alto nível, competindo com modelos muitas vezes maiores.</p><p><code>v5-text-small</code> (677 milhões) pontua 67,0 no conjunto de benchmarks Multilingual MTEB (MMTEB), abrangendo 131 tarefas de nove tipos, e 71,7 no benchmark MTEB em inglês. É o modelo de incorporação multilíngue sub-1B mais forte no MTEB Leaderboard.</p><p><code>v5-text-nano</code> (239 milhões) tem 65,5 pontos no MMTEB. Nenhum outro modelo com menos de 500 milhões de parâmetros atinge esse nível. Com menos da metade do tamanho da maioria dos modelos comparáveis, é a escolha natural para implantações sensíveis à latência.</p><p>Ambos os modelos oferecem suporte:</p><ul><li><p><strong>Quatro adaptadores LoRA específicos para tarefas:</strong> recuperação, correspondência de texto, classificação e clustering. Selecionar um adaptador apropriado por meio do parâmetro <code>task</code> no momento da inferência.</p></li><li><p><strong>Truncamento da dimensão matrioshka:</strong> reduza as dimensões de embedding de 1024 (ou 768 para nano) para 32. A perda de qualidade é mínima em truncamento moderado (por exemplo, 256 dimensões). Ao reduzir as dimensões pela metade, você reduz o armazenamento pela metade.</p></li><li><p><strong>Quantização binária:</strong> comprima embeddings de 1024 dimensões de 2KB para 128 bytes com binarização. O treinamento especial faz com que esta compressão tenha perdas mínimas.</p></li><li><p><strong>Multilíngue: </strong>119 idiomas (pequeno) e 93 (nano).</p></li></ul><h3><strong>jina-reranker-v3</strong></h3><p>Um reclassificador de listas multilíngue com 0,6 bilhões de parâmetros, construído usando uma arquitetura <em>de interação última, mas não tardia</em>. A consulta e até 64 correspondências de candidatos são inseridas em uma única janela de contexto de 131 mil tokens, e o modelo realiza uma comparação cruzada de documentos antes da pontuação. O Jina Reranker v3 alcança 61,94 nDCG@10 no BEIR, superando o modelo por ser 6× menor em tamanho. Isso é fundamentalmente diferente dos reclassificadores pontuais, que pontuam cada documento isoladamente, produzindo melhores resultados, especialmente para recuperação de trechos a partir de documentos isolados.</p><h3><strong>jina-clip-v2</strong></h3><p>Um modelo de incorporação multimodal e multilíngue de 0,9B que mapeia texto e imagens em um espaço compartilhado de 1024 dimensões. Ele é compatível com:</p><ul><li><p><strong>89 idiomas</strong> para recuperação de texto-imagem.</p></li><li><p><strong>Resolução de imagem 512×512.</strong></p></li><li><p><strong>Entrada de texto com token de 8 mil.</strong></p></li><li><p><strong>Truncamento de Matryoshka</strong> de 1024 para 64 dimensões para ambas as modalidades.</p></li></ul><p>Altamente competitivo em benchmarks de imagem para texto, incluindo tarefas multilíngues.</p><h2><strong>Para começar</strong></h2><p>Jina Embeddings v3 está disponível no Model Garden hoje. Veja como fazê-lo funcionar.</p><p>Você precisa de um projeto do Google Cloud com a API Vertex AI habilitada e cota de GPU suficiente para pelo menos uma instância g2-standard-8 (NVIDIA L4). Se você é novo no Google Cloud, <a href="https://cloud.google.com/vertex-ai/docs/start/cloud-environment">comece pelo guia de configuração.</a></p><p><a href="https://console.cloud.google.com/vertex-ai/publishers/jinaai/model-garden/jina-embeddings-v3">A página Model Garden para Jina Embeddings v3</a> guia você pelo fluxo completo: faça upload do modelo, crie um endpoint, escolha o tipo de máquina e implante. Abra-o em seu próprio projeto e siga as etapas guiadas. Máquinas A100 e H100 também estão disponíveis onde a região e a cota permitem, mas L4 é tudo que você precisa para começar.</p><p>Desde o clique até a primeira incorporação, todo o processo leva alguns minutos.</p><h2><strong>O que vem depois</strong></h2><p>Jina Embeddings v3 é o ponto de partida. Nas próximas semanas, traremos o restante do stack de recuperação Jina para o Model Garden: embeddings de texto v5 (pequeno e nano), jina-reranker-v3 e jina-clip-v2 para busca multimodal. Tudo será executado em uma única GPU L4 com o mesmo modelo de autoimplantação.</p>]]></content:encoded>
    <link>https://www.elastic.co/search-labs/blog/jina-embeddings-v3-gemini-enterprise-model-garden</link>
    <guid isPermaLink="true">https://www.elastic.co/search-labs/blog/jina-embeddings-v3-gemini-enterprise-model-garden</guid>
    <category><![CDATA[Jina AI]]></category>
    <dc:creator><![CDATA[Sa Zhang]]></dc:creator>
    <enclosure url="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt1d9669e8c7a62bf6/6a170ee7a929cf0371ae0a87/42f72633f1e5453dbfd47730b5f776429f9f633e-721x420.png" length="0" type="image/png"/>
    <pubDate>Wed, 22 Apr 2026 00:00:00 GMT</pubDate>
  </item>
  <item>
    <title><![CDATA[Clustering não supervisionado de documentos com Elasticsearch + embeddings Jina]]></title>
    <description><![CDATA[Uma abordagem prática e reproduzível para clustering não supervisionado de documentos com Elasticsearch e embeddings Jina.]]></description>
    <content:encoded><![CDATA[<p>A busca vetorial começa com uma consulta, mas e se você não tiver o que consultar?</p><p>As organizações acumulam grandes coleções de documentos, como chamados de suporte, processos judiciais, notícias, artigos de pesquisa, e precisam entender o que eles contêm antes de poderem fazer as perguntas certas. Sem rótulos nem dados de treinamento, revisar manualmente milhares de documentos é impraticável. A busca tradicional não ajuda quando você não sabe o que procurar.</p><p>Esta publicação tem uma abordagem nativa do Elasticsearch para clustering de documentos não supervisionados e rastreamento de histórias temporais que lida com esse problema de descoberta. Ao final, você poderá acompanhar arcos narrativos como este ao longo de vários dias:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blta8c243e0c5773440/6a17093fa6c2b98c86e7968c/100a60a7fb85da8ab3813fd071a82c93f2c3f318-1300x650.png" alt="Cadeias temporais de histórias que fluem ao longo de fevereiro de 2025, cada caminho colorido representa uma história que persiste ao longo dos dias, com a largura do link indicando a força de sobreposição do kNN" /><p><strong>O que você vai descobrir:</strong></p><ul><li><p>Por que <strong>embeddings de clustering</strong> (e não embeddings de recuperação) são importantes quando se deseja descobrir tópicos sem uma consulta?</p></li><li><p>Como a classificação de centroides sondada por densidade agrupa documentos por tópico usando Elasticsearch k-nearest neighbor (kNN) e processamento em lote <code>msearch</code>.</p></li><li><p>Como <a href="https://www.elastic.co/docs/reference/aggregations/search-aggregations-bucket-significanttext-aggregation"><code>significant_text</code></a> pode automaticamente rotular clusters para que os temas sejam legíveis sem precisar treinar um modelo?</p></li><li><p>Como as cadeias temporais de histórias conectam clusters diários para mostrar como os temas evoluem dia após dia.</p></li></ul><p>O pipeline utiliza ~8.500 artigos de fevereiro de 2025 da BBC News e do The Guardian como um corpus de teste. As notícias são convenientes porque apresentam um comportamento temporal claro, mas esse padrão se aplica a qualquer situação em que a descoberta de documentos seja importante: revisão jurídica, monitoramento de conformidade, síntese de pesquisas, triagem de suporte ao cliente.</p><p><strong>Stack:</strong></p><ul><li><p><a href="https://www.elastic.co/search-labs/blog/jina-embeddings-v5-text"><strong>Jina v5</strong></a> <strong>clustering embeddings:</strong> adaptadores LoRA (Low-Rank Adaptation) específicos para tarefas no agrupamento de tópicos. <a href="https://www.elastic.co/blog/elastic-jina-ai">Jina ingressou na Elastic</a> e os modelos estão disponíveis nativamente por meio do <a href="https://www.elastic.co/docs/explore-analyze/elastic-inference/eis">Elastic Inference Service (EIS).</a></p></li><li><p><strong>Elasticsearch:</strong> <a href="https://www.elastic.co/docs/solutions/search/vector/knn">kNN</a> escalável, rotulagem <code>significant_text</code> e armazenamento de vetores.</p></li><li><p><a href="https://www.elastic.co/search-labs/blog/diskbbq-elasticsearch-introduction"><strong>DiskBBQ:</strong></a> um formato de índice vetorial baseado em disco que combina <a href="https://www.elastic.co/docs/reference/elasticsearch/index-settings/bbq">quantização binária aprimorada (BBQ)</a> com particionamento hierárquico k-means para aceleração aproximada de vizinhos mais próximos (ANN). Essa partição de índice é interna à busca vetorial e separada do algoritmo de clustering baseado em densidade usado nesta postagem. <code>bbq_disk</code> armazena vetores quantizados em disco e mantém apenas metadados de partição no heap, reduzindo os requisitos de recursos, em comparação com <code>bbq_hnsw</code>, mantendo alta recuperação.</p></li><li><p><strong>Clustering global + vinculação temporal diária:</strong> descoberta e evolução da narrativa.</p></li></ul><p><strong>O que você precisará:</strong></p><ul><li><p>Uma implementação do Elasticsearch (Elastic Cloud, Elasticsearch Serverless ou Elastic Self-Managed 8.18+/9.0+): <code>bbq_disk</code> requer a versão 8.18 ou posterior. A seção opcional do diversificador retriever exige 9.3+ ou serverless.</p></li><li><p>Uma <a href="https://jina.ai/embeddings/">chave de API Jina</a>: o nível gratuito inclui 10 milhões de tokens, o que cobre o pipeline principal de clusterização (aproximadamente 4,25 milhões de tokens). A comparação opcional entre recuperação e clustering usa uma segunda passagem de incorporação.</p></li><li><p>Uma <a href="https://bonobo.capi.gutools.co.uk/register/developer">chave de API do Guardian</a> (gratuita).</p></li></ul><h2>Configuração</h2><p>Instale os pacotes necessários:</p>pip install elasticsearch pandas numpy plotly umap-learn python-dotenv pydantic-settings datasets requests<p>Opcional (somente se você executar ferramentas de scraping deste repositório):</p>pip install beautifulsoup4<p>Depois, configure chaves de API em um arquivo <code>.env</code> na raiz do projeto:</p>ELASTIC_CLOUD_ID=your-cloud-id        # or ELASTIC_HOST=https://...
ELASTIC_API_KEY=your-api-key
JINA_API_KEY=your-jina-key
GUARDIAN_API_KEY=your-guardian-key<p>Este notebook chama <code>load_dotenv(override=True)</code>, portanto os valores locais <code>.env</code> têm precedência.</p>Connected to Elasticsearch<h2>Parte 1: clustering de descoberta – Por que fazer clustering de embeddings?</h2><p>A maioria das buscas vetoriais utiliza <strong>embeddings de recuperação</strong> treinados para associar uma <em>consulta</em> a <em>documentos</em> relevantes. Isso é perfeito para buscas, mas não para descobertas. Quando você quer descobrir quais tópicos existem em um corpus sem qualquer consulta, precisa de embeddings que agrupem documentos semelhantes.</p><p>O Jina v5 resolve isso com <strong>adaptadores Low-Rank Adaptation (LoRA) específicos para cada tarefa</strong>. O LoRa adiciona pequenas atualizações de baixa classificação às camadas internas específicas, mantendo a maioria dos pesos do modelo base congelados, de modo que o comportamento do modelo se adapta a uma tarefa específica sem a necessidade de um novo treinamento completo. O mesmo modelo base produz embeddings diferentes dependendo do parâmetro <code>task</code>:</p><p>Tarefa</p><p>Preparado para</p><p>Caso de uso</p><p>retrieval.passage</p><p>Correspondência entre consulta e documento</p><p>Busca, retrieval augmented generation (RAG)</p><p>clustering</p><p>Agrupamento de tópicos (otimizado para clusters compactos)</p><p>Descoberta, categorização</p><p>O adaptador de clustering é treinado para <em>aproximar</em> documentos sobre o mesmo tópico no espaço de incorporação e <em>distanciar</em> documentos sobre tópicos diferentes. A comparação visual abaixo torna a diferença concreta.</p><h3>Recuperação vs. clustering: uma comparação visual</h3><p>Para ver a diferença, uma amostra de documentos recebe embedding de ambos os tipos de tarefa. O clustering é realizado no espaço de incorporação original de 1024 dimensões; a aproximação e projeção uniforme de variedades (UMAP) é usada apenas para projetar essas incorporações em 2D para visualização. A UMAP preserva a estrutura local de vizinhança, tornando-a útil para comparar a separação de clusters.</p><p>Abaixo, o mesmo exemplo de 480 documentos é incorporado com ambos os tipos de tarefas e projetado para 2D com UMAP. Procure grupos de cores mais fechados e separados no painel de clustering.</p>    Full dataset: 8,495 articles
    Sources: guardian: 5749, bbc: 2746
    Date range: 2025-02-01 to 2025-02-28


    Sample: 480 docs across 8 sections
    section
    Film              60
    World news        60
    Australia news    60
    Opinion           60
    Football          60
    US news           60
    Sport             60
    Business          60


    Clustering embeddings: 480
    Retrieval embeddings:  480


    UMAP projection complete<img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt4b3733dccad212b6/6a1709407d8d67aaeb70e6a4/9bcf7a744900560c1c6c63a2dc3af2f9bfd33e11-1100x500.png" alt="Comparação da UMAP entre embeddings de recuperação e clustering" /><p><em>Os embeddings de recuperação (à esquerda) espalham amplamente os tópicos; os embeddings de clustering (à direita) produzem grupos mais coesos e separados a partir dos mesmos documentos.</em></p><p>Os embeddings de clustering produzem grupos mais compactos e visualmente distintos. Os embeddings de recuperação distribuem os tópicos de maneira mais uniforme, ideais para busca (similaridade refinada); mas, para descoberta, o que importa são os clusters temáticos compactos.</p><p>É por isso que o <code>task="clustering"</code> é usado no restante deste guia.</p><h3>Carregando o conjunto de dados</h3><p>O corpus combina duas fontes de notícias para fevereiro de 2025:</p><ul><li><p><strong>BBC News</strong> através do conjunto de dados <a href="https://huggingface.co/datasets/RealTimeData/bbc_news_alltime">RealTimeData/bbc_news_alltime</a> HuggingFace.</p></li><li><p><strong>The Guardian</strong> através da <a href="https://open-platform.theguardian.com/">API da Guardian Open Platform</a>.</p></li></ul><p>Ter múltiplas fontes ajuda a validar se o clustering encontra <em>tópicos</em> em vez de <em>estilos específicos de cada fonte</em>.</p>    Total articles:  8,495
    
    Source breakdown:
    source
    guardian    5749
    bbc         2746
    
    Date range: 2025-02-01 → 2025-02-28
    Days covered: 28
    
    Sample article:
      Source:  guardian
      Title:   Carbon monoxide poisoning ruled out in death of Gene Hackman and wife, police sa
      Section: Film
      Text:    Authorities have ruled out that Gene Hackman and his wife, Betsy Arakawa, died from carbon monoxide poisoning earlier this week in their home in Santa Fe, New Mexico. The Santa Fe county sheriff, Adan...<h3>Embedding com a tarefa de clustering</h3><p>A API Jina v5 é chamada com <code>task="clustering"</code> para todos os documentos. Os embeddings são armazenados em cache no disco, portanto, as execuções subsequentes ignoram a API completamente.</p><p>A chamada da API é direta. O parâmetro <code>task</code> é a principal diferença em relação ao uso típico de embeddings:</p>payload = {
    "model": "jina-embeddings-v5-text-small",
    "input": texts,
    "task": "clustering",  # ← This selects the clustering LoRA adapter
}<p>O tempo abaixo reflete uma taxa de acerto do cache. A primeira execução contra a API demora mais, dependendo do tamanho do corpus.</p>    Embeddings ready: 8,495 vectors of dimension 1024
    Time: 0.6s<h3>Indexação em um único índice do Elasticsearch</h3><p>Para clustering de descoberta, o mês inteiro é dedicado a um índice (<code>docs-clustering-all</code>). A partição diária vem depois para a ligação temporal da história.</p><p>O mapeamento do índice usa <a href="https://www.elastic.co/docs/reference/elasticsearch/index-settings/bbq"><code>bbq_disk</code></a> para o campo vetorial:</p>{
  "embedding": {
    "type": "dense_vector",
    "dims": 1024,
    "index": true,
    "similarity": "cosine",
    "index_options": {
      "type": "bbq_disk"        // hierarchical k-means partitioning for ANN index lookup; separate from this post's clustering algorithm
    }
  }
}<p>Um vetor float32 de dimensão 1024 tem 4 KB. <a href="https://www.elastic.co/search-labs/blog/diskbbq-elasticsearch-introduction"><code>bbq_disk</code></a> utiliza k-means hierárquicos para particionar vetores em pequenos clusters, quantificá-los de forma binária e armazenar os vetores de precisão total no disco para repontuação. Apenas os metadados de partição permanecem no heap, então os requisitos de memória permanecem baixos mesmo para corpora grandes. Para cargas de trabalho que podem suportar mais heap, <a href="https://www.elastic.co/docs/reference/elasticsearch/index-settings/bbq"><code>bbq_hnsw</code></a> constrói um gráfico Hierarchical Navigable Small World (HNSW) para consultas mais rápidas com mais custo de recursos.</p><p>O tipo de campo <a href="https://www.elastic.co/docs/reference/elasticsearch/mapping-reference/dense-vector"><code>dense_vector</code></a> suporta múltiplas estratégias de quantização: <code>bbq_disk</code> e <code>bbq_hnsw</code> são os melhores ajustes para embeddings de alta dimensão como os vetores de dimensão 1024 usados aqui.</p>    Indexed 8,495 documents into docs-clustering-all
    Time: 57.5s<h3>Clusteringo: classificação de centroides baseada em densidade</h3><p>Algoritmos de clustering tradicionais, como o HDBSCAN, pressupõem que você possa manter a matriz vetorial completa de N×d na memória e executar atualizações de passagem completa repetidas. Para 8.495 documentos em 1024 dimensões, isso é administrável (aproximadamente 35 MB), mas a abordagem não é escalável para milhões de documentos sem infraestrutura adicional.</p><p>Este algoritmo é conceitualmente semelhante à inicialização do KMeans++ com atribuição de Voronoi e um nível de ruído, mas utiliza a <a href="https://www.elastic.co/docs/solutions/search/vector/knn">busca kNN</a> do Elasticsearch como primitiva de computação, mantendo quase todo o trabalho no lado do servidor:</p><ol><li><p><strong>Amostra de 5% de documentos</strong> como sondas de densidade (amostra aleatória, mínimo de 50).</p></li><li><p><strong>Densidade da sonda por meio de lote</strong> <a href="https://www.elastic.co/docs/api/doc/elasticsearch/operation/operation-msearch"><strong><code>msearch</code></strong></a> <strong>kNN</strong>. Cada sonda dispara uma consulta kNN e registra a semelhança média dos vizinhos. Alta similaridade média = região densa do espaço de embedding. <a href="https://www.elastic.co/docs/api/doc/elasticsearch/operation/operation-msearch"><code>msearch</code></a> envia várias solicitações de pesquisa em uma única chamada HTTP, o que é fundamental aqui: a sondagem de densidade gera centenas de consultas kNN e processá-las em lote evita a sobrecarga por solicitação.</p></li><li><p><strong>Selecione sementes de alta densidade com diversificação</strong>: os candidatos acima da densidade média são classificados por densidade decrescente e aceitos avidamente somente quando a semelhança de cosseno com cada semente existente estiver abaixo de um limite de separação. Este é o único processamento do lado do cliente (~0,01s para 8k documentos).</p></li><li><p><strong>Classificar todos os documentos em relação aos centroides via</strong> <strong><code>msearch</code></strong> <strong>kNN</strong>: cada semente atua como um centroide; uma pesquisa kNN recupera documentos próximos acima de um limite de similaridade. Cada documento é atribuído ao centroide que o retornou com a maior pontuação. Pequenos clusters são dissolvidos em ruído.</p></li></ol><p>O Elasticsearch cuida do trabalho pesado: <code>msearch</code> para sondas de densidade, <code>msearch</code> para classificação e <code>significant_text</code> para rotulagem. Para esse corpus (8.495 documentos), a amostra de sonda de densidade de 5% executa consultas de sonda de 425 kNN, que <code>msearch</code> agrupam lotes em nove chamadas HTTP (no tamanho de lote 50), evitando a sobrecarga de uma solicitação por sonda. Combinado com <code>bbq_disk</code> busca ANN, isso mantém a etapa de clustering rápida e escalável. As consultas kNN usam um valor mínimo de <a href="https://www.elastic.co/docs/deploy-manage/production-guidance/optimize-performance/approximate-knn-search"><code>num_candidates</code></a> para velocidade durante a passagem de clustering; consultas de busca em produção devem usar valores de <code>num_candidates</code> mais altos para melhorar a recordação, mas isso custa latência.</p><p>Clusters têm tamanhos naturais determinados pela densidade do espaço de embedding ao redor de cada centroide, não por um limite de <code>k</code> rígido. Regiões temáticas densas produzem clusters maiores; tópicos de nicho produzem agrupamentos menores.</p><h4>Por que escolher KMeans ou HDBSCAN?</h4><p>O algoritmo KMeans pressupõe clusters esféricos e requer a matriz completa N×d na memória. Para corpora que cabem na memória, <a href="https://scikit-learn.org/stable/modules/generated/sklearn.cluster.HDBSCAN.html">HDBSCAN</a> é uma excelente alternativa. Ele lida com formatos de cluster arbitrários e possui semântica de densidade bem compreendida.</p><p>A abordagem de centroide sondado por densidade mira em um nicho diferente: corpora onde você quer armazenamento, recuperação e clustering em um único sistema, ou onde a escala torna as operações matriciais do lado do cliente impraticáveis. Ele usa o Elasticsearch kNN como primitiva de computação, lida com tamanhos arbitrários de cluster e mantém quase toda a computação no lado do servidor.</p>    Clustered global index in 31.6s
      Total clusters: 82
      Total noise:    2420 (28.5%)
      Density probes: 425 kNN queries via 9 _msearch HTTP calls<h4>Entendendo a taxa de ruído</h4><p>A taxa de ruído de ~28% é intencional, não uma falha. Documentos que não cabem em nenhum cluster denso na <code>similarity_threshold</code> configurada ficam sem atribuição, em vez de serem forçados a uma correspondência ruim. Isso funciona como um filtro de qualidade: colunas de opinião, artigos curtos e reportagens isoladas naturalmente resistem ao clustering porque falta a densidade temática que define um grupo coerente.</p><p>O limiar é ajustável: reduzir <code>similarity_threshold</code> produz clusters mais abrangentes (mais documentos atribuídos, mas clusters menos coesos), enquanto aumentá-lo torna os clusters mais compactos e aumenta a fração de ruído. Para este corpus de conteúdo de notícias misto, ~30% de ruído é um ponto de operação razoável. Implantações em produção devem ajustar o limiar com base em critérios de qualidade específicos do domínio.</p><h3>Rótulos automáticos com significant_text</h3><p>Agora, cada cluster precisa de um rótulo de fácil compreensão. A agregação <code>significant_text</code> do Elasticsearch encontra termos que aparecem com frequência incomum em um conjunto em primeiro plano (o cluster) em comparação com um conjunto em segundo plano (o corpus completo).</p><p>Nos bastidores, ele usa uma heurística estatística (pontuação JLH por padrão) que equilibra mudanças de frequência absolutas e relativas, sem machine learning, sem chamadas de grandes modelo de linguagem (LLM). Um cluster sobre política do Reino Unido pode apresentar termos como <code>starmer</code>, <code>labour</code>, <code>downing</code> porque esses termos são desproporcionalmente comuns nesse cluster em comparação ao conjunto geral de notícias.</p><p>Para essa passagem global, os rótulos são calculados diretamente contra <code>docs-clustering-all</code>, então tanto o plano de frente quanto o plano de fundo são extraídos do mês inteiro. Na parte 2, a rotulagem utiliza o padrão de indexação diário (<code>docs-clustering-*</code>), um caractere curinga que permite que consultas abranjam todos os índices correspondentes simultaneamente, para dar <code>significant_text</code> um plano de fundo mais amplo e melhor contraste.</p><p>Um formato de consulta mínimo tem a seguinte aparência:</p>{
  "size": 0,
  "query": { "term": { "cluster_id": "72" } },
  "aggs": {
    "label_terms": {
      "significant_text": {
        "field": "text",
        "size": 5,
        "filter_duplicate_text": true
      }
    }
  }
}<p><code>significant_text</code> serve também como um filtro de qualidade: clusters que não produzem termos significativos não possuem vocabulário distintivo. São agrupamentos incoerentes que devem ser dissolvidos e reduzidos a ruído, em vez de receberem um rótulo enganoso.</p><p>Uma etapa de limpeza determinística e leve remove termos de rótulos irrelevantes (tokens numéricos, palavras genéricas) e recorre a um título representativo quando necessário. Isso mantém os rótulos nativos do Elasticsearch enquanto melhora a legibilidade.</p>    Sample cluster labels:
      cluster   3  (200 docs)  arsenal | mikel | villa
      cluster   1  (198 docs)  volodymyr | ukrainian | kyiv
      cluster   0  (196 docs)  hostages | hamas | israeli
      cluster   4  (187 docs)  scrum | rugby | borthwick
      cluster  52  (185 docs)  fossil | renewable | renewables
      cluster  10  (156 docs)  labour | gwynne | mps
      cluster  40  (151 docs)  novel | novels | literary
      cluster  11  (149 docs)  mewis | sarina | wiegman
      cluster  44  (143 docs)  flooding | rainfall | rain
      cluster  13  (131 docs)  doge | musk | elon
      cluster  12  (128 docs)  murder | insp | knockholt
      cluster   5  (124 docs)  putin | backstop | starmer


    Reassigned 35 docs from incoherent clusters to noise
    Total docs: 8,495
    Clustered:  6,040 (71.1%)
    Noise:      2,455 (28.9%)<h3>Visualizando os clusters</h3><p>As visualizações abaixo mostram o que a análise de clustering global descobriu: uma análise por data de documentos agrupados versus documentos de ruído, uma projeção UMAP para o mês inteiro e um gráfico de composição de fontes confirmando que os agrupamentos refletem tópicos em vez de fontes.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt4ed087d8b6dac2a0/6a17094260084b44543c4501/99099f5adaa945ae4097c50b0d7151c7dd28872e-1000x400.png" alt="Distribuição diária de documentos agrupados versus documentos com ruído" /><p>Distribuição diária de documentos agrupados versus ruídos ao longo de fevereiro de 2025.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltf5ca320bc91131ab/6a17094366c4f95828f8bfbf/477c6c7177942955a942f85f5c881da50e517915-1100x700.png" alt="Projeção UMAP para o mês inteiro com todos os documentos" /><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt5f554a6bc2bc367b/6a170945a929cfa7a1ae0947/4f4302556c8974c416842452cf33bca06e90b966-1100x700.png" alt="Projeção UMAP mostrando apenas documentos agrupados" /><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt8e40c26f89ce5523/6a17094747d49c147d2d8974/327f96a79e382ef30614cb0570aa7fccd822b8f8-1100x700.png" alt="[Projeção UMAP destacando um único cluster]" /><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltf1dd2c19ae628f1d/6a1709481949f7a630e7a9a3/acfb1524a10e24d6ff2412e7c3ec0f2b3ac75193-900x600.png" alt="Mistura de fontes por cluster mostrando agrupamento baseado em tópicos" /><p>Cada ilha colorida no UMAP representa um cluster: um grupo de artigos sobre o mesmo tema descobertos puramente por similaridade de incorporação. Os pontos de ruído cinza são artigos que não se encaixavam perfeitamente em nenhum cluster (artigos curtos, artigos de opinião ou histórias isoladas).</p><p>O gráfico de detalhamento da fonte confirma que os clusters contêm artigos de <strong>ambos</strong> BBC News e The Guardian. O clustering está encontrando <em>tópicos</em>, não <em>fontes</em>, exatamente o que a descoberta não supervisionada deve produzir.</p><h3>Explorando a amplitude do cluster com o diversificador</h3><p>O algoritmo kNN simples retorna os documentos mais semelhantes ao centroide de um cluster (o núcleo denso). Mas clusters reais abrangem subtópicos. O <a href="https://www.elastic.co/docs/reference/elasticsearch/rest-apis/retrievers/diversify-retriever"><strong>recuperador de diversificação</strong></a> usa a relevância marginal máxima (MMR) para destacar documentos que são relevantes para o centroide, mas também <em>diferentes entre si</em>.</p><p>O parâmetro chave é <strong>λ (lambda):</strong></p><ul><li><p>λ = 1,0 → relevância pura (o mesmo que kNN simples).</p></li><li><p>λ = 0,0 → diversidade pura (resultados de distribuição máxima).</p></li><li><p>λ = 0,5 → equilibrado: relevante para o tópico, mas abordando diferentes perspectivas.</p></li></ul><p>Uma forma mínima de solicitação de recuperador é assim:</p>{
  "size": 8,
  "retriever": {
    "diversify": {
      "type": "mmr",
      "field": "embedding",
      "lambda": 0.5,
      "query_vector": "&lt;cluster-centroid-vector&gt;",
      "retriever": {
        "knn": {
          "field": "embedding",
          "query_vector": "&lt;cluster-centroid-vector&gt;",
          "k": 50,
          "num_candidates": 100
        }
      }
    }
  }
}<p>Os parâmetros <code>type</code>, <code>field</code>, e <code>query_vector</code> são necessários no nível de diversificação: <code>field</code> informa à MMR qual campo dense_vector usar para similaridade entre resultados, e <code>query_vector</code> fornece o ponto de referência para a pontuação de relevância.</p><p>Isso permite que você responda: "O que esse cluster cobre de fato?" em vez de apenas "Qual é o ponto central?"</p>    Exploring cluster 52 (185 docs)
    Label: fossil | renewable | renewables
    Centroid computed (dim=1024)


    ========================================================================
    Plain kNN (closest to centroid)
    ========================================================================
      1. [0.9738] Green campaigners fear ministers are poised to award billions of pounds in fresh subsidies to Drax power station, despite strong concerns...
      2. [0.9710] Thirteen more oil and gas licences could be cancelled as ministers decide new guidance for fossil fuel extraction after a landmark court...
      3. [0.9699] Experts have accused the fossil fuel industry of seeking special treatment after lobbyists argued greenhouse gas emissions from oilfields...
      4. [0.9681] Burning wood is a terrible way of producing electricity . Chopping down trees destroys habitats for wildlife, and growing new trees cannot...
      5. [0.9649] Keir Starmer will do huge damage to the global fight against climate change if he gives in to political pressure and allows the development...
      6. [0.9641] Labour will next week be confronted with stark policy choices that threaten to expose the fault lines between the Treasury and the...
      7. [0.9638] The Drax power station near Selby in north Yorkshire burns imported wood pellets  The government has agreed a new funding arrangement with...
      8. [0.9581] If you care about the world we are handing on to future generations, the news on Thursday morning was dramatic. This January was the...
    
    ========================================================================
    Diversify retriever (MMR, lambda=0.5)
    ========================================================================
      1. [0.9738] Green campaigners fear ministers are poised to award billions of pounds in fresh subsidies to Drax power station, despite strong concerns...
      2. [0.9434] Oil and gas interests have waged a coordinated campaign to kill pro-electrification policies that ban gas connections in new buildings ,...
      3. [0.9303] It was interesting to read that new licences for oil and gas production in the North Sea are being delayed by legal action ( Thirteen more...
      4. [0.9139] The US energy secretary, Chris Wright, has said he “would love to see Australia get in the game of supplying uranium and maybe going down...
      5. [0.9077] Rachel Reeves was facing criticism on Saturday night as it was confirmed that a report she cited as evidence that a third ­runway at...
      6. [0.8996] When Margaret Thatcher opened the Hadley Centre for Climate Change in 1990 journalists suggested she was attempting to appear to be doing...
      7. [0.8993] The vast majority of governments are likely to miss a looming deadline to file vital plans that will determine whether or not the world has...
      8. [0.8987] European imports of seaborne gas shipments fell by a fifth last year to their lowest level since the pandemic, according to a new report,...
    
    Overlap: 1/8 documents appear in both result sets
    
    Avg pairwise similarity (lower = more diverse):
      Plain kNN:          0.9057
      Diversify retriever: 0.6965<p>Os resultados simples kNN se agrupam em torno de um ângulo do tema: os documentos mais semelhantes ao centroide e entre si. O recurso de recuperação de diversidade revela diferentes facetas do mesmo cluster: subtópicos, fontes diversas e perspectivas variadas.</p><p>A métrica de diversidade confirma isso quantitativamente: a similaridade média entre pares é menor para os resultados do recuperador diversificado, o que significa que os documentos retornados abrangem um espectro mais amplo.</p><p>Isso é útil para você:</p><ul><li><p><strong>Entender o que um cluster cobre</strong>, não apenas o centro, mas também as bordas.</p></li><li><p><strong>Geração de resumos</strong>. Documentos representativos diversos oferecem um material melhor para um LLM.</p></li><li><p><strong>Encontrar exemplos representativos</strong> para análise humana ou rotulagem posterior.</p></li><li><p><strong>Verificações de qualidade</strong>. Se os resultados diversos parecerem incoerentes, o cluster pode precisar ser dividido.</p></li></ul><h2>Parte 2: Cadeias de histórias temporais</h2><h3>Acompanhando histórias ao longo dos dias</h3><p>A parte 1 fez o clustering de todo o mês global para descoberta de tópicos. Para o fluxo temporal, a mesma classificação de centroides sondados por densidade é executada independentemente por dia em <strong>índices diários</strong>, e depois os clusters são vinculados ao longo de dias consecutivos. Observe que os clusters diários são independentes dos clusters globais da parte 1; cada dia produz as próprias atribuições de agrupamento e rótulos ajustados ao conteúdo daquele dia.</p><h4><strong>A abordagem de vinculação: amostragem e consulta</strong></h4><p>Para cada cluster no dia A:</p><ol><li><p>Você pode ver uma amostra de alguns documentos representativos.</p></li><li><p>Executar kNN contra o índice do dia B.</p></li><li><p>Conte quantos acessos caem em cada cluster B do dia.</p></li><li><p>Se a fração de acerto ultrapassar um limite (fração de kNN ≥ 0,4), registre um link.</p></li></ol><p>Isso é rápido (apenas alguns documentos por cluster são consultados, nem todos) e usa o kNN nativo do Elasticsearch, sem necessidade de ferramentas externas.</p>Preparing daily indices for temporal linkage...


Indexed 8,495 docs into 28 daily indices


Temporal links found: 808 in 145.4s

Strongest links:
  2025.02.01 'league | arsenal | premier' -&gt; 2025.02.02 'league | season | striker'  (100%)
  2025.02.03 'league | striker | loan' -&gt; 2025.02.04 'league | striker | season'  (100%)
  2025.02.03 'score | operator | gedling' -&gt; 2025.02.04 'league | striker | season'  (100%)
  2025.02.12 'playoff | leg | bayern' -&gt; 2025.02.13 'league | players | injury'  (100%)
  2025.02.14 'league | injury | football' -&gt; 2025.02.15 'league | premier | football'  (100%)
  2025.02.18 'russia | ukraine | talks' -&gt; 2025.02.19 'saudi | russia | arabia'  (100%)
  2025.02.18 'football | league | bayern' -&gt; 2025.02.19 'league | manchester | players'  (100%)
  2025.02.21 'league | premier | manchester' -&gt; 2025.02.22 'game | players | defeat'  (100%)
  2025.02.21 'rugby | calcutta | brilliant' -&gt; 2025.02.22 'game | players | defeat'  (100%)
  2025.02.26 'metals | kyiv | ukrainian' -&gt; 2025.02.27 'ukraine | russia | talks'  (100%)<p>Uma fração de kNN de 100% significa que todos os documentos mostrados do cluster de origem foram atribuídos ao mesmo cluster de destino, o vínculo mais forte possível entre os dias. A maioria dos links acima está relacionada ao futebol, o que faz sentido: a cobertura da Premier League é feita diariamente com alta consistência de tópicos.</p><p>O link <code>score | operator | gedling</code> → <code>league | striker | season</code> é um exemplo de um cluster de futebol local de nicho (Gedling é um clube fora da liga) sendo absorvido pelo cluster mais amplo da Premier League no dia seguinte, um efeito natural do clustering diário em diferentes granularidades.</p><h3>Criar cadeias de histórias</h3><p>Uma cadeia de histórias é uma sequência de clusters ligados ao longo de dias consecutivos.</p><p>Ligações pareadas individuais indicam que o cluster "política do Reino Unido" de segunda-feira está conectado ao de terça-feira. As cadeias revelam o arco completo: uma história que começa na segunda-feira, evolui durante a semana e encerra na sexta-feira.</p><p>As cadeias são construídas de forma ávida a partir de links com uma fração kNN ≥ 0,4, o que significa que pelo menos 40% dos documentos mostrados do cluster de origem chegaram a um único cluster de destino. A partir do cluster mais antigo, o algoritmo sempre segue o link de saída mais forte.
</p>    Strong links (kNN fraction &gt;= 0.4): 244
    Story chains spanning 3+ days: 18
      Chain 1: 'ukrainian | kyiv | eastern' (19 days: Feb 3 → Feb 21)
      Chain 2: 'playing | opposition' (19 days: Feb 10 → Feb 28)
      Chain 3: 'tadhg | maro | cadan' (10 days: Feb 1 → Feb 10)
      Chain 4: 'invade | china | putin' (8 days: Feb 21 → Feb 28)
      Chain 5: 'elected | labour | leader' (7 days: Feb 12 → Feb 18)
      Chain 6: 'film | swift | awards' (6 days: Feb 2 → Feb 7)
      Chain 7: 'amendment | termination | reporting' (6 days: Feb 12 → Feb 17)
      Chain 8: 'officers | scene | police' (5 days: Feb 1 → Feb 5)<p>A rede mais longa acompanha a cobertura Ucrânia–Rússia por 19 dias consecutivos, o que não surpreende dada a intensidade geopolítica em fevereiro de 2025. O segundo mais longo acompanha o futebol da Premier League ao longo de 19 dias do mês. Cadeias mais curtas captam a temporada de premiações (filme/prêmios, seis dias), o rúgbi Six Nations (10 dias) e a cobertura da liderança política do Reino Unido (sete dias). Cada cadeia representa um arco narrativo que o algoritmo descobriu ao incorporar similaridade entre índices diários.</p><h3>Sankey: Visualizando o fluxo da história</h3><p>Um diagrama de Sankey é uma visualização de fluxo onde a largura da ligação representa a força da conexão. Aqui, cada faixa vertical representa um dia, cada nó é um cluster diário (dimensionado pela contagem de documentos), e cada caminho colorido traça uma cadeia de histórias ao longo do tempo. A largura do link codifica a força de sobreposição kNN: links mais espessos indicam que mais documentos mostrados caíram no cluster alvo. As cores são consistentes por cadeia, então um único caminho colorido da esquerda para a direita representa o progresso de uma história.</p><p>Por exemplo, a cadeia Ucrânia-Rússia (visível como um dos caminhos mais longos) flui continuamente desde o início de fevereiro até a terceira semana, com elos consistentemente espessos indicando forte continuidade temática ao longo dos dias.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blta8c243e0c5773440/6a17093fa6c2b98c86e7968c/100a60a7fb85da8ab3813fd071a82c93f2c3f318-1300x650.png" alt="Sequências temporais de histórias ao longo do mês de fevereiro de 2025" /><p><em>Cadeias temporais de histórias que fluem ao longo de fevereiro de 2025. Cada caminho colorido representa uma história que persiste ao longo dos dias; com a largura indicando a força de sobreposição do kNN.</em></p><h2>O que essa abordagem oferece</h2><p>Esta análise abordou um pipeline completo de clustering de documentos não supervisionado construído no Elasticsearch:</p><ol><li><p><strong>Embeddings de clustering</strong>: os adaptadores específicos de tarefa do Jina v5 produzem embeddings otimizadas para agrupamento de tópicos, e não apenas para correspondência de consulta-documento.</p></li><li><p><strong>Clustering de descoberta global</strong>: clustering o mês inteiro em um único índice maximiza a descoberta de tópicos ao longo dos dias.</p></li><li><p><strong>Classificação de centroides com base na densidade</strong>: amostra 5%, sondar a densidade via <code>msearch</code> kNN, selecionar sementes diversas de alta densidade, classificar todos os documentos em relação aos centroides. O Elasticsearch cuida do processamento pesado; apenas a seleção de sementes executa do lado do cliente (~0,01s).</p></li><li><p><a href="https://www.elastic.co/docs/reference/aggregations/search-aggregations-bucket-significanttext-aggregation"><strong><code>significant_text</code></strong></a> <strong>rotulagem</strong>: o teste de significância produz rótulos de cluster significativos sem qualquer modelo de ML ou anotação manual. Clusters que não produzem termos significativos são incoerentes e são rebaixados a ruído, uma porta de qualidade integrada.</p></li><li><p><strong>Vinculação temporal de histórias</strong>: índices diários e kNN de índice cruzado entre amostra e consulta rastreiam como as histórias evoluem ao longo do tempo.</p></li></ol><p><strong>Principais conclusões:</strong></p><ul><li><p>O tipo de tarefa de incorporação importa: embeddings de clustering produzem grupos tópicos mensuravelmente mais compactos.</p></li><li><p>O Elasticsearch pode atuar tanto como camada de armazenamento <em>quanto</em> como motor de clustering por meio da <a href="https://www.elastic.co/docs/solutions/search/vector/knn">busca kNN</a>.</p></li><li><p>A classificação de centroides baseada em densidade mantém quase toda a computação no lado do servidor e produz clusters com tamanhos naturais determinados pela densidade do espaço de incorporação.</p></li><li><p><code>significant_text</code> é rápido, compreensível e eficaz tanto para autorrotulagem quanto para controle de qualidade.</p></li></ul><p><strong>Quando essa abordagem é útil:</strong></p><ul><li><p>Você tem texto com carimbo de data e hora e quer descobrir tópicos sem dados de treinamento rotulados.</p></li><li><p>Você precisa de uma plataforma para armazenamento, busca vetorial, rotulagem e ligação temporal.</p></li></ul><p><strong>Extensões para explorar:</strong></p><ul><li><p>Clustering por múltiplos períodos (semanal, pacotes mensais).</p></li><li><p>Ingestão em tempo real com atribuição incremental de cluster.</p></li><li><p>Resumos de cluster gerados pelo LLM usando os termos significant_text como sementes.</p></li><li><p>Em escala maior, centroides KMeans mostrados podem servir como sementes de aquecimento para clustering baseado em densidade, reduzindo o custo da fase da sonda.</p></li></ul><h2>Experimente você mesmo</h2><p>Troque seu próprio corpus de documentos com carimbo de data; qualquer coleção de texto com datas funciona com esse pipeline. O notebook completo e o código de suporte estão disponíveis no <a href="https://github.com/elastic/elasticsearch-labs/tree/main/supporting-blog-content/unsupervised-document-clustering-elasticsearch-jina-embeddings">repositório complementar</a>.</p><ul><li><p><a href="https://cloud.elastic.co/registration?onboarding_token=vectorsearch&amp;cta=cloud-registration&amp;tech=trial&amp;plcmt=article%20content&amp;pg=search-labs"><strong>Inicie uma avaliação gratuita do Elastic Cloud</strong></a>: instale um cluster gerenciado com suporte <code>bbq_disk</code> em questão de minutos.</p></li><li><p><a href="https://www.elastic.co/elasticsearch/serverless"><strong>Experimente o Elasticsearch Serverless</strong></a>: sem gerenciamento de cluster, escala automática e com suporte.</p></li></ul>]]></content:encoded>
    <link>https://www.elastic.co/search-labs/blog/unsupervised-document-clustering-elasticsearch-jina-embeddings</link>
    <guid isPermaLink="true">https://www.elastic.co/search-labs/blog/unsupervised-document-clustering-elasticsearch-jina-embeddings</guid>
    <category><![CDATA[Banco de dados vetorial]]></category>
    <category><![CDATA[Pesquisa de aprendizado de máquina]]></category>
    <category><![CDATA[Jina AI]]></category>
    <dc:creator><![CDATA[Matthew Adams]]></dc:creator>
    <enclosure url="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt4bd7dd10a7cd6dc8/6a17094a14b270581de3c5b6/662c00694c3e0c2fb2128098bdb6813df9e86a72-1280x720.png" length="0" type="image/png"/>
    <pubDate>Fri, 10 Apr 2026 00:00:00 GMT</pubDate>
  </item>
  <item>
    <title><![CDATA[jina-embeddings-v5-text: Incorporações de texto compactas e de última geração para busca e aplicações inteligentes]]></title>
    <description><![CDATA[Apresentação dos modelos jina-embeddings-v5-text models, including jina-embeddings-v5-text-small e jina-embeddings-v5-text-nano explicando como usar esses modelos de incorporação multilíngue por meio do Elastic Inference Service (EIS).]]></description>
    <content:encoded><![CDATA[<p>A Jina AI e a Elastic estão lançando <code>jina-embeddings-v5-text</code>, uma família de novos modelos compactos de incorporação de texto de alto desempenho, com desempenho de última geração para modelos de tamanho comparável em todos os principais tipos de tarefas.</p><p>A família inclui dois modelos:</p><ul><li><p><code>jina-embeddings-v5-text-small</code></p></li><li><p><code>jina-embeddings-v5-text-nano</code></p></li></ul><p>Esses modelos são o resultado bem-sucedido de uma nova receita inovadora de treinamento para incorporação de modelos. Ambos superam modelos muitas vezes maiores que eles, gerando economia de memória e recursos computacionais e respondendo mais rápido a solicitações.</p><p>O modelo <code>jina-embeddings-v5-text-small</code> possui 677 milhões de parâmetros, é compatível com uma janela de contexto de entrada de 32.768 tokens e gera embeddings de 1.024 dimensões por padrão.</p><p><code>jina-embeddings-v5-text-nano</code> Pesa cerca de um terço do tamanho da nova versão, com 239 milhões de parâmetros e uma janela de contexto de entrada de 8.192 tokens, resultando em embeddings de dimensão 768 compactos.</p><p>Nome do modelo</p><p>Tamanho total</p><p>Tamanho da janela de contexto de entrada</p><p>Tamanho do embedding</p><p>jina-v5-text-small</p><p>677M params</p><p>32.768 tokens</p><p>1.024 dims</p><p>jina-v5-text-nano</p><p>239M params</p><p>8.192 tokens</p><p>768 dimensões</p><p>Esses dois modelos são os melhores da categoria para o desempenho geral do benchmark MMTEB (<a href="https://huggingface.co/spaces/mteb/leaderboard">Multilingual MTEB</a>). Entre os modelos com menos de 500M, <code>jina-embeddings-v5-text-nano</code> é o de melhor desempenho, apesar de ter menos de 250M, e o modelo <code>jina-embeddings-v5-text-small</code> é o líder entre os modelos de embedding multilíngue com menos de 750M.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltb2f2be8618f5e240/6a17dbb83e9e45b7f3ba1344/d97126285fa196c3045b1913b7754e4b186c1e4c-1300x1100.png" alt="jina-embeddings-v5-text pontuações MMTEB" /><p>Esses modelos estão disponíveis por meio do Elastic Inference Service (EIS), de uma API online e para hospedagem local. Para instruções sobre como acessar os modelos <code>jina-embeddings-v5-text</code>, veja a seção "<strong>Começar</strong>" abaixo.</p><p>Modelos de incorporação e indexação semântica aumentam muito a precisão dos algoritmos de busca, mas também têm uma variedade de outros usos para tarefas envolvendo similaridade semântica e extração de significado, por exemplo:</p><ul><li><p>Encontrando textos duplicados.</p></li><li><p>Reconhecendo paráfrases e traduções.</p></li><li><p>Descoberta de tópicos.</p></li><li><p>Mecanismos de recomendação.</p></li><li><p>Análise de sentimentos e intenções.</p></li><li><p>Filtragem de spam.</p></li><li><p>E muitos outros.</p></li></ul><h2><strong>Recursos</strong></h2><p>Essa nova família de modelos possui uma série de recursos projetados para aumentar a relevância e reduzir custos.</p><h3>Otimização de tarefas</h3><p>Otimizamos os modelos <code>jina-embeddings-v5-text</code> para quatro tipos amplos de tarefas:</p><p>Tarefa</p><p>Exemplos de casos de uso</p><p>Recuperação</p><p>Busca com consultas em linguagem natural e recuperação das correspondências mais relevantes em um conjunto de documentos.</p><p>Correspondência de texto</p><p>Similaridade semântica, desduplicação, alinhamento de paráfrases e traduções, e muito mais.</p><p>Clustering</p><p>Descoberta de tópicos, organização automática de coleções de documentos.</p><p>Classificação</p><p>Categorização de documentos, detecção de sentimentos e intenções, tarefas similares.</p><p>Otimizar para uma tarefa geralmente significa ter que ceder em outra, então a maioria dos modelos de embedding só tem desempenho competitivo para um tipo de tarefa. Mas os modelos <code>jina-embeddings-v5-text</code> são capazes de se especializar em todas as quatro áreas sem comprometer o desempenho, treinando <a href="https://arxiv.org/abs/2106.09685">adaptadores compactos de Low-Rank Adaptation (LoRA)</a> específicos para cada tarefa.</p><p>Adaptadores LoRA são uma espécie de plugin para um modelo de IA que muda o comportamento, aumentando ligeiramente o tamanho total. Em vez de ter um modelo inteiro para cada tarefa, cada um com centenas de milhões de parâmetros, a família de modelos <code>jina-embeddings-v5-text</code> permite que você use um modelo com um adaptador compacto LoRA para cada tarefa. Isso economiza memória, espaço de armazenamento e custos de inferência.</p><h3>Truncando embeddings</h3><p>Treinamos os modelos <code>jina-embeddings-v5-text</code> usando o <a href="https://arxiv.org/abs/2205.13147">Aprendizado de representação Matryoshka</a>, que permite reduzir seus embeddings para tamanhos menores com um custo mínimo para a qualidade deles.</p><p>Por padrão, <code>jina-embeddings-v5-text-small</code> gera vetores de embedding de 1024 dimensões, cada um representado por um número de 16 bits, fazendo com que cada embedding tenha 2KB de tamanho. Para um grande conjunto de documentos, isso pode representar uma grande quantidade de dados para armazenar, e a busca em um banco de dados vetorial repleto de embeddings é proporcional tanto ao tamanho do banco de dados quanto ao número de dimensões que cada vetor armazenado possui.</p><p>Mas você pode reduzir pela metade o tamanho dos embeddings (descartar 512 das 1024 dimensões) e ocupar metade do espaço enquanto dobra a velocidade das buscas. Isso tem um impacto no desempenho. Descartar informações reduz a precisão. Mas, como mostra o gráfico abaixo, mesmo ao eliminar metade do embedding, a redução de desempenho é mínima:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt8deea6ee69a6b77d/6a17dbba0b0bed2217dd347e/f11969682c81bcf22b5b29a6204ba6ec40471b3d-900x700.png" alt="tamanho de embedding jina-embeddings-v5-text-small &amp; jina-embeddings-v5-text-nano" /><p>Desde que suas embeddings tenham pelo menos 256 dimensões, a perda de precisão deve permanecer relativamente pequena. Abaixo desse nível, porém, a relevância e a precisão se deterioram rapidamente.</p><p>Truncar embeddings como esse permite aos usuários gerenciar as próprias trocas entre precisão e custos computacionais. Ela oferece ferramentas para ter grandes ganhos de eficiência e grandes economias de custos com a IA de busca.</p><h3>Quantização robusta</h3><p><em>Quantização </em>é outra forma de reduzir o tamanho das embeddings. Em vez de descartar parte de cada incorporação, a quantização reduz a precisão dos números na embedding. Os modelos <code>jina-embeddings-v5-text</code> geram embeddings com números de 16 bits, mas podemos arredondar esses números, reduzindo a precisão e o número de bits necessários para armazená-los. No caso mais extremo, podemos reduzir cada número a um bit (0 ou 1), comprimindo as embeddings padrão de 1024 dimensões de <code>jina-embeddings-v5-text</code>de 2 kilobytes para 128 bytes, uma redução de 94% apenas com a quantização binária. Assim como para a truncagem, isso produz grandes economias em memória e custos computacionais. No entanto, assim como a truncagem, a quantização torna as embeddings menos precisas.</p><p>Treinamos os modelos <code>jina-embeddings-v5-text</code> para funcionar com a <a href="https://www.elastic.co/docs/reference/elasticsearch/mapping-reference/bbq">Better Binary Quantization (BBQ)</a> do <a href="https://www.elastic.co/pt/elasticsearch">Elasticsearch</a>, minimizando a perda de precisão. Os testes de benchmark de embeddings binarizados desses modelos mostram desempenho quase igual aos equivalentes não binarizados. Consulte <a href="https://arxiv.org/abs/2602.15547">o relatório técnico</a> para estudos detalhados de ablação sobre o desempenho da binarização.</p><h3>Desempenho multilíngue</h3><p>Muitos modelos de embedding são multilíngues porque foram treinados com materiais que incluem um grande número de linguagens. Mas isso não significa que todos tenham o mesmo desempenho em todas as linguagens disponíveis.</p><p>Identificamos 211 linguagens no benchmark multilíngue MMTEB e os separamos para que pudéssemos comparar nossos modelos com modelos semelhantes linguagem por linguagem. A imagem abaixo resume nossos resultados como um mapa de calor. Cada patch é uma linguagem (identificada pelo código ISO-639), e quanto mais verde ela é, melhor o modelo teve desempenho em comparação com a média de modelos similares:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltee08033102f46c4f/6a17dbbc420229503229f4c8/852ac5d0f1977bb0c1124d87f8863a9bb94eb7da-1600x765.png" alt="As linguagens ina-embeddings-v5-text-nano e jina-embeddings-v5-text-small no benchmark multilíngue MMTEB" /><p>Embora a precisão varie entre as linguagens, os modelos <code>jina-embeddings-v5-text</code> são de ponta ou quase isso na maioria das linguagens do mundo.</p><p>Para saber detalhes sobre o desempenho multilíngue, consulte o <a href="https://arxiv.org/abs/2602.15547"><code>jina-embeddings-v5-text</code></a><a href="https://arxiv.org/abs/2602.15547"> relatório técnico</a>.</p><h2><strong>Jina no Elastic: IA nativa de última geração para busca</strong></h2><p>Com <code>jina-embeddings-v5-text</code> modelos no EIS, você pode executar modelos de embedding multilíngue de alto desempenho de forma nativa no <a href="https://www.elastic.co/pt/elasticsearch">Elasticsearch</a>, com inferência totalmente gerenciada e acelerada por GPU, sem infraestrutura para provisão ou redimensionamento. <code>jina-embeddings-v5-text</code> modelos ampliam o catálogo cada vez maior de modelos EIS com modelos compactos e multilíngues, impulsionados pelos mais recentes avanços em IA. Esses modelos têm desempenho de ponta em recuperação de informações e benchmarks padrão de análise de dados, além de oferecer suporte multilíngue incomparável e global.</p><p>Com dois modelos de tamanhos muito diferentes, os usuários podem definir qual é o mais adequado para as aplicações e orçamentos. Além disso, com embeddings robustas que mantêm o desempenho quando truncadas para tamanhos menores ou quantizadas com menor precisão, <code>jina-embeddings-v5-text </code>modelos oferecem oportunidades para economias concretas adicionais em custos de armazenamento e computação, bem como na latência de processamento.</p><p>Com a família <code>jina-embeddings-v5-text</code> , Jina Reranker e a busca vetorial rápida e BM25 da Elastic, os usuários agora têm acesso à <a href="https://www.elastic.co/docs/solutions/search/hybrid-search">busca híbrida</a> de ponta a ponta e de última geração da Elastic. Quando você precisa dos resultados mais relevantes, seja para pipelines de Retrieval-Augmented Generation (RAG), aplicações de busca ou análise de dados, a Elastic com modelos de IA de busca Jina oferece qualidade sólida e econômica.</p><h2><strong>Para começar</strong></h2><p>Os modelos <code>jina-embeddings-v5-text</code> estão totalmente integrados ao <a href="https://www.elastic.co/docs/explore-analyze/elastic-inference/eis">EIS</a> e você pode usá-los definindo o <strong><code>type</code></strong>campo para<strong><code>semantic_text</code></strong> ao criar seu índice e especificar o modelo (<code>jina-embeddings-v5-text-small</code> ou <code>jina-embeddings-v5-text-nano</code>) no <code>inference_id</code>campo, como neste exemplo:</p>PUT multilingual-semantic-index
{
  "mappings": {
    "properties": {
      "content": {
        "type": "semantic_text",
        "inference_id": ".jina-embeddings-v5-text-small"
      }
    }
  }
}

# Ingest data about France
POST multilingual-semantic-index/_doc
{
  "content": "The capital of France is Paris"}

GET multilingual-semantic-index/_search
{
  "query": {
    "semantic": {
      "field": "content",
      "query": "What is the French capital?"
    }
  }
}<p>O <a href="https://www.elastic.co/pt/elasticsearch">Elasticsearch</a> seleciona automaticamente o adaptador LoRA apropriado durante a indexação e a recuperação. As dimensões de embedding (veja a seção "<strong>Truncando embeddings</strong> ", acima) podem ser definidas ao <a href="https://www.elastic.co/docs/api/doc/elasticsearch/operation/operation-inference-put">criar um endpoint de inferência personalizado</a>.</p><p>Consulte a <a href="https://www.elastic.co/docs/reference/elasticsearch/mapping-reference/dense-vector">documentação do Elasticsearch</a> para saber mais informações sobre como usar os modelos <strong><code>jina-embeddings-v5-text</code></strong> .</p><h2><strong>Mais informações</strong></h2><p>Para saber mais sobre os modelos <code>jina-embeddings-v5-text</code> , leia as <a href="https://jina.ai/news/jina-embeddings-v5-text-distilling-4b-quality-into-sub-1b-multilingual-embeddings/">notas de lançamento no blog da Jina AI</a> e o <a href="https://arxiv.org/abs/2602.15547">relatório técnico</a>, que contém informações técnicas mais detalhadas sobre o desempenho e o novo procedimento de treinamento inovador da Jina AI. Para saber informações sobre como fazer download e executar esses modelos de forma local, acesse a<a href="https://huggingface.co/collections/jinaai/jina-embeddings-v5-text"> página da coleção</a> <a href="https://huggingface.co/collections/jinaai/jina-embeddings-v5-text"><code>jina-embeddings-v5-text</code></a>na Hugging Face.</p><p>Os modelos de Jina AI estão disponíveis sob a <a href="https://spdx.org/licenses/CC-BY-NC-4.0">licença CC-BY-NC-4.0</a>, portanto, você pode baixá-los e experimentá-los de forma livre, mas para uso comercial, entre em contato com a <a href="https://www.elastic.co/contact?pg=global&amp;plcmt=nav&amp;cta=205352">equipe de vendas da Elastic</a>.</p>]]></content:encoded>
    <link>https://www.elastic.co/search-labs/blog/jina-embeddings-v5-text</link>
    <guid isPermaLink="true">https://www.elastic.co/search-labs/blog/jina-embeddings-v5-text</guid>
    <category><![CDATA[Jina AI]]></category>
    <dc:creator><![CDATA[Scott Martens,Sofia Vasileva]]></dc:creator>
    <enclosure url="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltfd81be89ffe5b036/6a17dbbd445de9b55e4cffd1/e98dd30ab925b4bb32830228d71a1a51d02a0917-1600x840.png" length="0" type="image/png"/>
    <pubDate>Mon, 23 Feb 2026 00:00:00 GMT</pubDate>
  </item>
  <item>
    <title><![CDATA[Uma introdução aos modelos Jina, sua funcionalidade e seus usos no Elasticsearch]]></title>
    <description><![CDATA[Confira os embeddings multimodais Jina, o Reranker v3 e os modelos semânticos de embedding, além de como usá-los nativamente no Elasticsearch.]]></description>
    <content:encoded><![CDATA[<p>O Jina by Elastic fornece modelos de base para busca voltados a aplicações e automação de processos de negócio. Esses modelos oferecem funcionalidades essenciais para levar IA a aplicações no Elasticsearch e a projetos inovadores baseados em IA.</p><p>Os modelos Jina se enquadram em três grandes categorias, projetadas para dar suporte ao processamento, à organização e à recuperação de informações:</p><ul><li><p>Modelos de embedding semântico</p></li><li><p>Modelos de reclassificação</p></li><li><p>Modelos de linguagem generativos de pequeno porte</p></li></ul><h2>Modelos de embedding semântico</h2><p>A ideia por trás dos embeddings semânticos é que um modelo de IA pode aprender a representar aspectos do significado de suas entradas em termos da geometria de espaços de alta dimensionalidade.</p><p>É possível pensar em um embedding semântico como um ponto (tecnicamente, um <em>vetor</em>) em um espaço de alta dimensionalidade. Um modelo de embedding é uma rede neural que recebe algum tipo de dado digital como entrada, potencialmente qualquer tipo, mas mais comumente texto ou imagem, e produz a localização de um ponto correspondente em um espaço de alta dimensionalidade, representada por um conjunto de coordenadas numéricas. Quando o modelo executa bem sua função, a distância entre dois embeddings semânticos é proporcional ao quanto os objetos digitais correspondentes compartilham o mesmo significado.</p><p>Para entender por que isso é importante para aplicações de busca, imagine um embedding para a palavra “cão” e outro para a palavra “gato” como pontos em um espaço.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltbad74e5d8292a60e/6a17db73abe0f2114edfe8d2/802cf9bbcb82180d3fc91009f9f62027eee8f031-615x615.png" alt="" /><p>Um bom modelo de embedding deve gerar um embedding para a palavra “felino” muito mais próximo de “gato” do que de “cão”, e “canino” deve ter um embedding muito mais próximo de “cão” do que de “gato”, porque essas palavras têm praticamente o mesmo significado.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltdb2b25691801a881/6a17db747b54f946d28b37a5/bce49daf9a31b8fb7ce1c6ef7ae4e8117a4e8b33-615x615.png" alt="" /><p>Se um modelo for multilíngue, espera-se o mesmo comportamento para traduções de “gato” e “cão” em outros idiomas.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt976ba40be7776449/6a17db75be6086c2bd0045f2/ce4d030385324526cbd7539140e0e634d939371c-615x615.png" alt="" /><p>Modelos de embedding traduzem similaridade ou dissimilaridade de significado entre elementos em relações espaciais entre embeddings. As imagens acima têm apenas duas dimensões para que seja possível visualizá-las na tela, mas modelos de embedding produzem vetores com dezenas a milhares de dimensões. Isso permite codificar sutilezas de significado para textos inteiros, atribuindo um ponto em um espaço com centenas ou milhares de dimensões a documentos com milhares de palavras ou mais.</p><h2>Embeddings multimodais</h2><p>Modelos multimodais estendem o conceito de embeddings semânticos para além de textos, especialmente para imagens. Espera-se que o embedding de uma imagem fique próximo ao embedding de uma descrição fiel dessa imagem.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt66dc8895485734ec/6a17db77b1e11318d279f155/1ac6aef5b1423e5fe4853e8a547a74e66b0885c2-615x615.png" alt="" /><p>Embeddings semânticos têm muitos usos. Entre outras aplicações, é possível usá-los para criar classificadores eficientes, realizar clustering de dados e executar diversas tarefas, como deduplicação de dados e investigação da diversidade dos dados, ambas importantes para aplicações de big data que lidam com volumes de informação grandes demais para serem gerenciados manualmente.</p><p>O principal uso direto de embeddings está na recuperação de informações. O Elasticsearch pode armazenar objetos de recuperação com embeddings como chaves. As consultas são convertidas em vetores de embedding, e a busca retorna os objetos armazenados cujas chaves estão mais próximas do embedding da consulta.</p><p>Enquanto <em>a recuperação tradicional baseada em vetores</em> (às vezes chamada de <em>recuperação por vetores esparsos</em>) usa vetores baseados em palavras ou metadados presentes em documentos e consultas, a <em>recuperação baseada em embeddings</em> (também conhecida como <em>recuperação por vetores densos</em>) usa significados avaliados por IA em vez de palavras. Isso a torna, em geral, muito mais flexível e mais precisa do que métodos tradicionais de busca.</p><h2>Aprendizado de representação Matryoshka</h2><p>O número de dimensões de um embedding, assim como a precisão dos valores numéricos que o compõem, tem impactos significativos na performance. Espaços de dimensionalidade muito alta e números de precisão extremamente elevada podem representar informações altamente detalhadas e complexas, mas exigem modelos de IA maiores, mais caros para treinar e para executar. Os vetores que esses modelos geram requerem mais espaço de armazenamento, e são necessários mais ciclos de computação para calcular as distâncias entre eles. Usar modelos de embedding semântico envolve fazer concessões importantes entre precisão e consumo de recursos.</p><p>Para maximizar a flexibilidade para os usuários, os modelos Jina são treinados com uma técnica chamada <a href="https://arxiv.org/abs/2205.13147">Aprendizado de Representação Matryoshka</a>. Essa abordagem faz com que os modelos concentrem as distinções semânticas mais importantes nas primeiras dimensões do vetor de embedding, de modo que seja possível descartar as dimensões mais altas e ainda assim obter bom desempenho.</p><p>Na prática, isso significa que usuários dos modelos Jina podem escolher quantas dimensões desejam que seus embeddings tenham. Escolher menos dimensões reduz a precisão, mas a degradação de performance é pequena. Na maioria das tarefas, as métricas de performance dos modelos Jina caem entre 1% e 2% sempre que o tamanho do embedding é reduzido em 50%, até uma redução total de cerca de 95% no tamanho.</p><h2>Recuperação assimétrica</h2><p>A similaridade semântica geralmente é medida de forma simétrica. O valor obtido ao comparar “gato” com “cão” é o mesmo que ao comparar “cão” com “gato”. No entanto, quando embeddings são usados para recuperação de informações, o desempenho melhora quando essa simetria é quebrada e as consultas são codificadas de forma diferente dos objetos de recuperação.</p><p>Isso ocorre por causa da forma como treinamos modelos de embedding. Os dados de treinamento contêm ocorrências dos mesmos elementos, como palavras, em muitos contextos diferentes, e os modelos aprendem semântica comparando similaridades e diferenças contextuais entre esses elementos.</p><p>Assim, por exemplo, pode acontecer de a palavra “animal” não aparecer em muitos dos mesmos contextos que “gato” ou “cão”, e, portanto, o embedding de “animal” não ficar particularmente próximo de “gato” ou “cão”.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltf219074e18a6290a/6a17db78be6086cf060045f6/9a33163405af6c71ee7f4ba8ebc86af39e295a69-615x615.png" alt="" /><p>Isso torna menos provável que uma consulta por “animal” recupere documentos sobre gatos e cães — justamente o oposto do nosso objetivo. Por isso, em vez disso, codificamos “animal” de forma diferente quando ele aparece como consulta do que quando é um alvo de recuperação.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt33438b4964001467/6a17db79b1e113101c79f159/363992d4f0affba7937c0c8a9f82c9a531fcd3ba-615x615.png" alt="" /><p><em>Recuperação assimétrica</em> significa usar um modelo diferente para consultas ou treinar especificamente um modelo de embedding para codificar os dados de uma forma quando são armazenados para recuperação e de outra forma quando são usados como consultas.</p><h2>Embeddings multivetoriais</h2><p>Embeddings únicos funcionam bem para recuperação de informações porque se encaixam no modelo básico de um banco de dados indexado: armazenamos objetos para recuperação usando um único vetor de embedding como chave de recuperação. Quando usuários consultam o repositório de documentos, suas consultas são traduzidas em vetores de embedding, e os documentos cujas chaves estão mais próximas do embedding da consulta, no espaço de embeddings de alta dimensionalidade, são recuperados como candidatos.</p><p>Embeddings multivetoriais funcionam de forma um pouco diferente. Em vez de gerar um vetor de comprimento fixo para representar uma consulta e um objeto armazenado inteiro, eles produzem uma sequência de embeddings que representam partes menores desses elementos. Essas partes geralmente são tokens ou palavras no caso de textos, e blocos de imagem no caso de dados visuais. Esses embeddings refletem o significado de cada parte dentro de seu contexto.</p><p>Por exemplo, considere estas frases:</p><ul><li><p>Ela tinha um coração de ouro.</p></li><li><p>Ela fez das tripas coração.</p></li><li><p>Ela teve um ataque do coração.</p></li></ul><p>Superficialmente, essas frases parecem muito semelhantes, mas um modelo multivetorial provavelmente geraria embeddings bem diferentes para cada ocorrência de “coração”, representando como cada uma assume um significado distinto no contexto da frase como um todo.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt5c81f089771e6029/6a17db7b7f6f157601c099ec/a33e60c8d8ee3d312bca8375ca2a8b0a0cd40ba9-615x615.png" alt="" /><p>Comparar dois objetos por meio de seus embeddings multivetoriais geralmente envolve medir a distância de Chamfer: comparar cada parte de um embedding multivetorial com cada parte de outro e somar as menores distâncias entre elas. Outros sistemas, incluindo os reclassificadores Jina descritos abaixo, usam esses embeddings como entrada para um modelo de IA treinado especificamente para avaliar sua similaridade. Ambas as abordagens normalmente apresentam maior precisão do que a simples comparação de embeddings de vetor único, porque embeddings multivetoriais contêm informações muito mais detalhadas do que embeddings de vetor único.</p><p>No entanto, embeddings multivetoriais não são adequados para indexação. Eles costumam ser usados em tarefas de reclassificação, conforme descrito para o modelo <code>jina-colbert-v2</code> na próxima seção.</p><h2>Modelos de embedding Jina</h2><h3>Jina embeddings v4</h3><p><a href="https://jina.ai/news/jina-embeddings-v4-universal-embeddings-for-multimodal-multilingual-retrieval/"><strong>jina-embeddings-v4</strong></a> é um modelo de embedding multilíngue e multimodal, com 3,8 bilhões (3,8 × 10⁹) de parâmetros, que oferece suporte a imagens e textos em diversos idiomas amplamente utilizados. Ele utiliza uma arquitetura inédita para aproveitar conhecimento visual e conhecimento linguístico, melhorando o desempenho em ambas as tarefas e permitindo que o modelo se destaque na recuperação de imagens e, especialmente, na <a href="https://huggingface.co/tasks/visual-document-retrieval">recuperação de documentos visuais</a>. Isso significa que ele lida bem com imagens como gráficos, slides, mapas, capturas de tela, digitalizações de páginas e diagramas — tipos comuns de imagens que muitas vezes contêm texto incorporado importante e que ficam fora do escopo de modelos de visão computacional treinados apenas com imagens de cenas do mundo real.</p><p>Otimizamos esse modelo para diversas tarefas diferentes usando <a href="https://huggingface.co/docs/peft/en/package_reference/lora">adaptadores compactos de Low-Rank Adaptation (LoRA)</a>. Isso nos permite treinar um único modelo para se especializar em múltiplas tarefas, sem comprometer o desempenho em nenhuma delas, com um custo adicional mínimo de memória ou processamento.</p><p>Os principais recursos incluem:</p><ul><li><p>Desempenho de ponta na recuperação de documentos visuais, além de suporte a texto multilíngue e imagens comuns com resultados que superam significativamente modelos muito maiores.</p></li><li><p>Suporte a grandes tamanhos de contexto de entrada: 32.768 tokens equivalem aproximadamente a 80 páginas de texto em inglês com espaçamento duplo, e 20 megapixels equivalem a uma imagem de 4.500 × 4.500 pixels.</p></li><li><p>Tamanhos de embedding selecionáveis pelo usuário, de um máximo de 2.048 dimensões até 128 dimensões. Constatamos empiricamente que o desempenho se degrada de forma acentuada abaixo desse limite.</p></li><li><p>Suporte tanto a embeddings únicos quanto a embeddings multivetoriais. Para textos, a saída multivetorial consiste em um embedding de 128 dimensões para cada token de entrada. Para imagens, é gerado um embedding de 128 dimensões para cada bloco de 28 × 28 pixels necessário para cobrir a imagem.</p></li><li><p>Otimização para recuperação assimétrica por meio de um par de adaptadores LoRA treinados especificamente para esse propósito.</p></li><li><p>Um adaptador LoRA otimizado para cálculo de similaridade semântica.</p></li><li><p>Suporte especial a linguagens de programação e estruturas de TI, também por meio de um adaptador LoRA.</p></li></ul><p>Desenvolvemos <code>jina-embeddings-v4</code> para atuar como uma ferramenta geral e multifuncional para uma ampla gama de tarefas comuns de busca, compreensão de linguagem natural e análise com IA. Apesar de ser relativamente pequeno considerando suas capacidades, ainda exige recursos significativos para implantação e é mais adequado para uso por meio de uma API em nuvem ou em ambientes de alto volume.</p><h3>Jina embeddings v3</h3><p><a href="https://jina.ai/news/jina-embeddings-v3-a-frontier-multilingual-embedding-model/"><strong>jina-embeddings-V3</strong></a> é um modelo de embedding compacto, multilíngue, somente para texto, com alto desempenho e menos de 600 milhões de parâmetros. Ele oferece suporte a até 8.192 tokens de texto de entrada e gera embeddings de vetor único com tamanhos escolhidos pelo usuário, desde o padrão de 1.024 dimensões até 64.</p><p>Treinamos <code>jina-embeddings-v3</code> para uma variedade de tarefas de texto — não apenas recuperação de informações e similaridade semântica, mas também tarefas de classificação, como análise de sentimento e moderação de conteúdo, além de tarefas de clusterização, como agregação de notícias e recomendação. Assim como <code>jina-embeddings-v4</code>, esse modelo oferece adaptadores LoRA especializados para as seguintes categorias de uso:</p><ul><li><p>Recuperação assimétrica</p></li><li><p>Similaridade semântica</p></li><li><p>Classificação</p></li><li><p>Clustering</p></li></ul><p><code>jina-embeddings-v3</code> é um modelo muito menor do que <code>jina-embeddings-v4</code> com um tamanho de contexto de entrada significativamente reduzido, mas com custo operacional mais baixo. Ainda assim, apresenta desempenho bastante competitivo, embora apenas para textos, e é uma escolha melhor para muitos casos de uso.</p><h3>Incorporações de código Jina</h3><p>Os modelos especializados de embedding de código da Jina — <a href="https://jina.ai/models/jina-code-embeddings-1.5b"><strong>jina-code-embeddings (0.5b e 1.5b)</strong></a> — oferecem suporte a 15 esquemas de programação e estruturas, além de textos em inglês relacionados a computação e tecnologia da informação. São modelos compactos, com meio bilhão (0,5 × 10⁹) e um bilhão e meio (1,5 × 10⁹) de parâmetros, respectivamente. Ambos oferecem suporte a tamanhos de contexto de entrada de até 32.768 tokens e permitem que os usuários escolham os tamanhos dos embeddings de saída, de 896 a 64 dimensões no modelo menor e de 1.536 a 128 no modelo maior.</p><p>Esses modelos oferecem suporte a recuperação assimétrica para cinco especializações específicas de tarefa, usando <a href="https://arxiv.org/abs/2101.00190">ajuste de prefixo</a> em vez de adaptadores LoRA:</p><ul><li><p><strong>Código para código.</strong> Recuperar código semelhante entre diferentes linguagens de programação. Isso é usado para alinhamento de código, deduplicação de código e suporte a portabilidade e refatoração.</p></li><li><p><strong>Linguagem natural para código.</strong> Recuperar código que corresponda a consultas em linguagem natural, comentários, descrições e documentação.</p></li><li><p><strong>Código para linguagem natural. </strong>Associar código a documentação ou a outros textos em linguagem natural.</p></li><li><p><strong>Conclusão de código para código.</strong> Sugerir código relevante para completar ou aprimorar código existente.</p></li><li><p><strong>Perguntas e respostas técnicas.</strong> Identificar respostas em linguagem natural para perguntas sobre tecnologias da informação, sendo ideal para casos de uso de suporte técnico.</p></li></ul><p>Esses modelos oferecem performance superior em tarefas que envolvem documentação técnica e materiais de programação, com um custo computacional relativamente baixo. Eles são bem adequados para integração em ambientes de desenvolvimento e assistentes de código.</p><h3>Jina ColBERT v2</h3><p><a href="https://jina.ai/models/jina-colbert-v2"><strong>jina-colbert-v2</strong></a> é um modelo de embedding de texto multivetorial com 560 milhões de parâmetros. Ele é multilíngue, treinado com materiais em 89 idiomas, e oferece suporte a tamanhos variáveis de embedding e recuperação assimétrica.</p><p>Como observado anteriormente, embeddings multivetoriais não são adequados para indexação, mas são muito úteis para aumentar a precisão dos resultados de outras estratégias de busca. Com <code>jina-colbert-v2</code><strong>,</strong> é possível calcular embeddings multivetoriais antecipadamente e usá-los para reclassificar candidatos à recuperação no momento da consulta. Essa abordagem é menos precisa do que usar um dos modelos de reclassificação descritos na próxima seção, mas é muito mais eficiente, pois envolve apenas a comparação de embeddings multivetoriais armazenados, em vez de invocar todo o modelo de IA para cada consulta e cada correspondência candidata. Ela é especialmente adequada para casos de uso em que a latência e a sobrecarga computacional dos modelos de reclassificação são excessivas ou em que o número de candidatos a comparar é grande demais para esse tipo de modelo.</p><p>Esse modelo gera uma sequência de embeddings, um por token de entrada, e os usuários podem selecionar embeddings de tokens com 128, 96 ou 64 dimensões. As correspondências de texto candidatas são limitadas a 8.192 tokens. As consultas são codificadas de forma assimétrica, portanto é necessário especificar se um texto é uma consulta ou uma correspondência candidata, além de limitar consultas a 32 tokens.</p><h3>Jina CLIP v2</h3><p><a href="https://jina.ai/news/jina-clip-v2-multilingual-multimodal-embeddings-for-text-and-images/"><strong>jina-clip-v2</strong></a> é um modelo de embedding multimodal com 900 milhões de parâmetros, treinado para que textos e imagens gerem embeddings próximos entre si quando o texto descreve o conteúdo da imagem. Seu uso principal é a recuperação de imagens com base em consultas textuais, mas ele também é um modelo somente de texto com alto desempenho, reduzindo custos para os usuários, já que não é necessário manter modelos separados para recuperação de texto para texto e de texto para imagem.</p><p>Esse modelo oferece suporte a um contexto de entrada de texto de 8.192 tokens, e as imagens são redimensionadas para 512 × 512 pixels antes da geração dos embeddings.</p><p>Arquiteturas de pré-treinamento contrastivo de linguagem e imagem (CLIP) são fáceis de treinar e operar e podem gerar modelos muito compactos, mas apresentam algumas limitações fundamentais. Eles não conseguem usar conhecimento de um meio para melhorar seu desempenho em outro. Ou seja, não conseguem aproveitar informações de um meio para aprimorar o desempenho em outro. Assim, embora um modelo possa saber que as palavras “cão” e “gato” são mais próximas em significado entre si do que qualquer uma delas em relação a “carro”, ele não necessariamente saberá que a imagem de um cão e a imagem de um gato são mais relacionadas entre si do que qualquer uma delas em relação à imagem de um carro.</p><p>Esses modelos também sofrem do que se chama de <em>lacuna de modalidade</em>: um embedding de um texto sobre cães tende a ficar mais próximo de um embedding de um texto sobre gatos do que de um embedding de uma imagem de cães. Por causa dessa limitação, recomendamos usar CLIP como um modelo de recuperação de texto para imagem ou como um modelo somente de texto, mas não misturar os dois em uma única consulta.</p><h2>Modelos de reclassificação</h2><p>Modelos de reclassificação recebem como entrada uma consulta e uma ou mais correspondências candidatas e as comparam diretamente, produzindo correspondências com precisão muito maior.</p><p>Em princípio, seria possível usar um reclassificador diretamente para recuperação de informações, comparando cada consulta com cada documento armazenado, mas isso seria computacionalmente muito caro e impraticável para qualquer coleção que não seja muito pequena. Por isso, reclassificadores tendem a ser usados para avaliar listas relativamente curtas de correspondências candidatas encontradas por outros meios, como busca baseada em embeddings ou outros algoritmos de recuperação. Modelos de reclassificação são ideais para esquemas de busca híbrida e federada, nos quais executar uma busca pode significar enviar consultas a sistemas de busca separados, com conjuntos de dados distintos, cada um retornando resultados diferentes. Eles funcionam muito bem para combinar resultados diversos em um único resultado de alta qualidade.</p><p>A busca baseada em embeddings pode exigir um grande investimento, envolvendo a reindexação de todos os dados armazenados e a mudança das expectativas dos usuários em relação aos resultados. Adicionar um reclassificador a um esquema de busca existente pode trazer muitos dos benefícios da IA sem a necessidade de reestruturar toda a solução de busca.</p><h2>Modelos de reclassificação Jina</h2><h3>Jina Reranker m0</h3><p><a href="https://jina.ai/models/jina-reranker-m0/"><strong>jina-reranker-m0</strong></a> é um reclassificador multimodal com 2,4 bilhões (2,4 × 10⁹) de parâmetros, que oferece suporte a consultas textuais e a correspondências candidatas compostas por textos e/ou imagens. Ele é o principal modelo para recuperação de documentos visuais, o que o torna uma solução ideal para repositórios de PDFs, digitalizações de texto, capturas de tela e outras imagens geradas ou modificadas por computador que contêm texto ou outras informações semiestruturadas, bem como para dados mistos compostos por documentos de texto e imagens.</p><p>Esse modelo recebe uma única consulta e uma correspondência candidata e retorna uma pontuação. Quando a mesma consulta é usada com diferentes candidatos, as pontuações são comparáveis e podem ser usadas para ranqueá-los. Ele oferece suporte a um tamanho total de entrada de até 10.240 tokens, incluindo o texto da consulta e o texto ou imagem candidata. Cada bloco de 28 × 28 pixels necessário para cobrir uma imagem conta como um token no cálculo do tamanho de entrada.</p><h3>Jina Reranker v3</h3><p><a href="https://jina.ai/models/jina-reranker-v3/"><strong>jina-reranker-v3</strong></a> é um reclassificador de texto com 600 milhões de parâmetros, com desempenho de ponta entre modelos de tamanho comparável. Ao contrário de <code>jina-reranker-m0</code>, ele recebe uma única consulta e uma lista de até 64 correspondências candidatas e retorna a ordem de ranqueamento. Ele tem um contexto de entrada de 131.000 tokens, incluindo a consulta e todos os candidatos de texto.</p><h3>Jina Reranker v2</h3><p><a href="https://jina.ai/models/jina-reranker-v2"><strong>jina-reranker-v2-base-multilingual</strong></a> é um reclassificador multifuncional, de uso geral, muito compacto, com recursos adicionais projetados para oferecer suporte a chamadas de função e consultas SQL. Com menos de 300 milhões de parâmetros, ele fornece reclassificação de texto multilíngue rápida, eficiente e precisa, com suporte adicional para selecionar tabelas SQL e funções externas que correspondam a consultas de texto, o que o torna adequado para casos de uso com IA agêntica.</p><h2>Modelos de linguagem generativos de pequeno porte</h2><p>Modelos de linguagem generativos são modelos como o ChatGPT da OpenAI, o Google Gemini e o Claude, da Anthropic, que recebem entradas em texto ou multimídia e respondem com saídas em texto. Não existe um limite bem definido que separe modelos de linguagem <em>grandes</em> (LLMs) de modelos de linguagem <em>pequenos</em> (SLMs), mas os desafios práticos de desenvolver, operar e usar LLMs de ponta são bem conhecidos. Os modelos mais conhecidos não são distribuídos publicamente, portanto só é possível estimar seu tamanho, mas espera-se que ChatGPT, Gemini e Claude estejam na faixa de 1 a 3 trilhões (1–3 × 10¹²) de parâmetros.</p><p>Executar esses modelos, mesmo quando estão disponíveis publicamente, está muito além do alcance de hardware convencional, exigindo os chips mais avançados organizados em grandes arranjos paralelos. É possível acessar LLMs por meio de APIs pagas, mas isso envolve custos significativos, alta latência e dificuldades para atender a exigências de proteção de dados, soberania digital e repatriação de nuvem. Além disso, os custos relacionados ao treinamento e à personalização de modelos desse porte podem ser consideráveis.</p><p>Consequentemente, uma grande quantidade de pesquisa tem se concentrado no desenvolvimento de modelos menores que, embora não tenham todas as capacidades dos maiores LLMs, conseguem executar tipos específicos de tarefas com a mesma qualidade, a um custo reduzido. Empresas normalmente implantam software para resolver problemas específicos, e com software de IA não é diferente; por isso, soluções baseadas em SLMs costumam ser preferíveis às baseadas em LLMs. Elas geralmente podem ser executadas em hardware comum, são mais rápidas, consomem menos energia e são muito mais fáceis de personalizar.</p><p>As ofertas de SLM da Jina estão crescendo à medida que nos concentramos em como levar IA da melhor forma possível a soluções práticas de busca.</p><h2>Jina SLMs</h2><h3>ReaderLM v2</h3><p><a href="https://jina.ai/models/ReaderLM-v2"><strong>ReaderLM-v2</strong></a> é um modelo de linguagem generativo que converte HTML em Markdown ou em JSON, de acordo com esquemas JSON fornecidos pelo usuário e instruções em linguagem natural.</p><p>O pré-processamento e a normalização de dados são uma parte essencial do desenvolvimento de boas soluções de busca para dados digitais, mas dados do mundo real, especialmente informações derivadas da web, costumam ser caóticos, e estratégias simples de conversão frequentemente se mostram frágeis. Em vez disso, <code>ReaderLM-v2</code> oferece uma solução inteligente baseada em modelo de IA, capaz de entender o caos de um dump de árvore DOM de uma página da web e identificar, de forma robusta, elementos úteis.</p><p>Com 1,5 bilhão (1,5 × 10⁹) de parâmetros, esse modelo é três ordens de magnitude mais compacto do que LLMs de última geração, mas apresenta desempenho equivalente a eles nessa tarefa específica e bastante restrita.</p><h3>Jina VLM</h3><p><a href="https://jina.ai/models/jina-vlm"><strong>jina-VLC</strong></a> é um modelo de linguagem generativo com 2,4 bilhões (2,4 × 10⁹) de parâmetros, treinado para responder a perguntas em linguagem natural sobre imagens. Ele oferece suporte muito robusto a análise de documentos visuais, isto é, responder a perguntas sobre digitalizações, capturas de tela, slides, diagramas e dados de imagem semelhantes que não são naturais.</p><p>Por exemplo:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt124b9932e01dcd40/6a17db7d4202291eca29f4bc/adfa1420d079ca4fd5582eef4349b1265b378e76-950x500.png" alt="" /><p>Ele também é muito eficiente na leitura de texto em imagens:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt1a862a9c9a0e42ce/6a17db7fb1e1133a2979f15d/ea3956e7ad86f8e171841cab2c28c8b3498da1d4-1002x500.png" alt="" /><p>Mas é na compreensão do conteúdo de imagens informativas e produzidas pelo ser humano que <code>jina-vlm</code> realmente se destaca:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt761cf621ea32e4ae/6a17db8163baff7730741b26/f68606f9d2d99e2cd616d4ff81db3574dc4e26a5-1020x700.png" alt="" /><p>Ou:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt4df4d31e574df7e3/6a17db82e3179134e02d56e9/297e85e7e78f296388a02301e1e08fed70827423-1000x500.png" alt="" /><p><code>jina-vlm</code> é especialmente adequado para geração automática de legendas, descrições de produtos, texto alternativo de imagens e aplicações de acessibilidade para pessoas com deficiência visual. Além disso, cria novas possibilidades para sistemas de geração aumentada por recuperação (RAG) utilizarem informações visuais e para agentes de IA processarem imagens sem assistência humana.</p>]]></content:encoded>
    <link>https://www.elastic.co/search-labs/blog/jina-models-elasticsearch-guide</link>
    <guid isPermaLink="true">https://www.elastic.co/search-labs/blog/jina-models-elasticsearch-guide</guid>
    <category><![CDATA[Integrações]]></category>
    <category><![CDATA[Jina AI]]></category>
    <dc:creator><![CDATA[Scott Martens]]></dc:creator>
    <enclosure url="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blta03919124faf767a/6a17db84ec0f89b8fe5a64d8/407b4c862b51ebdfc7f26db4e25950a65caf1673-656x442.png" length="0" type="image/png"/>
    <pubDate>Thu, 01 Jan 2026 00:00:00 GMT</pubDate>
  </item>
  </channel>
</rss>