<?xml version="1.0" encoding="UTF-8"?>
<rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0">
  <channel>
    <title><![CDATA[Scott Martens - Elasticsearch Labs]]></title>
    <description><![CDATA[Articles and tutorials from the Search team at Elastic]]></description>
    <copyright><![CDATA[© 2026. Elasticsearch B.V. All Rights Reserved]]></copyright>
    <image>
      <title><![CDATA[Scott Martens - Elasticsearch Labs]]></title>
      <url>https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt1121c0bf0e8a6e65/6a88da6340a1841030ef456f/search-labs-thumbnail.png</url>
      <link>https://www.elastic.co/es/search-labs/author/scott-martens</link>
    </image>
    <link>https://www.elastic.co/es/search-labs/author/scott-martens</link>
    <atom:link href="https://www.elastic.co/es/search-labs/rss/author/scott-martens.xml" rel="self" type="application/rss+xml"/>
    <language><![CDATA[es]]></language>
    <lastBuildDate>Mon, 28 Sep 2026 06:01:00 GMT</lastBuildDate>
  <item>
    <title><![CDATA[Local en menos de 5 minutos: modelos de incrustación de Jina ya disponibles para el despliegue local]]></title>
    <description><![CDATA[Los 28 modelos de Jina AI, incluidos los reclasificadores, como contenedores docker listos para desplegar, con cero telemetría y sin servidor de licencias. Compatible de forma directa con las API de OpenAI, Cohere, Voyage AI y Elastic Inference Service.]]></description>
    <content:encoded><![CDATA[<p>Los 28 modelos de incrustación y reclasificación de Jina AI ahora se envían como contenedores docker completamente fuera de línea para despliegues locales, incluidos <a href="https://www.elastic.co/es/search-labs/blog/jina-embeddings-v5-omni-all-media-one-index">jina-embeddings-v5-omni</a><a href="https://www.elastic.co/es/search-labs/blog/jina-embeddings-v5-omni-all-media-one-index"> </a>y <a href="https://www.elastic.co/es/search-labs/tutorials/jina-tutorial/jina-reranker-v3">jina-reranker-v3</a>. Descarga uno, transfiérelo a un sistema local aislado o protegido por firewall, y la inferencia local estará funcionando en menos de cinco minutos. Los contenedores son completamente independientes y no hacen conexiones externas. No hay llamadas a Hugging Face ni a ningún registro de modelos. Tampoco hay un servidor de licencias ni endpoints de telemetría o logging. Para las industrias reguladas, los requisitos de soberanía de datos o los entornos donde el acceso a internet no es confiable o simplemente no está disponible, esto elimina la dependencia de los servicios de IA de terceros. Jina local brinda soporte para los esquemas de API de Elastic Inference Service (EIS), OpenAI, Cohere, Voyage AI y Gemini, por lo que las aplicaciones existentes funcionan sin cambios de código.</p><p>Los modelos de IA más potentes se ejecutan en instalaciones cloud remotas con acceso a través de una API web, lo que significa que tienes que confiar en tu proveedor de servicios de IA para la seguridad, la disponibilidad del servicio y los precios estables. No puedes alinear fácilmente las exigencias razonables de confiabilidad, privacidad, costos manejables y una buena gobernanza de datos con un uso de la IA cada vez más potente, sofisticado e intensivo en recursos.</p><p>Las regulaciones gubernamentales, los fallos judiciales y las consideraciones comerciales efectuadas en interés de terceros han dado como recientemente derivaron en la restricción del acceso a servicios específicos. Y, aunque puedas cambiar a otros servicios, los modelos de IA no son componentes que se puedan intercambiar simplemente cuando quieras. Las aplicaciones que usan incrustaciones semánticas dependen de tener acceso a los mismos modelos al momento de la búsqueda que al momento de la ingesta de datos. Perder el acceso a tu modelo de incrustación significa que tu sistema de búsqueda se detiene.</p><p>Los modelos de precios de AI agravan ese riesgo. Las declaraciones financieras recientes de los principales proveedores de IA dan a los clientes buenas razones para preocuparse por los posibles aumentos de precios. La dependencia de productos con costos impredecibles suma más riesgo a las inversiones en IA intensivas en capital que tal vez no generen retornos claros.</p><p>Jina On-Prem es la respuesta de Elastic a estos desafíos.</p><h2>¿Quién necesita IA local?</h2><p>El alojamiento local y el control directo sobre tus modelos de IA brindan soporte a una variedad de demandas técnicas, requisitos de la industria e intereses comerciales.</p><p>La instalación local reduce lo que pagas a tus proveedores de servicios de IA, pero traslada el costo del hardware y del acceso confiable a tu organización. Dependiendo de tu volumen de uso, simplemente puede ser más económico. Pero hay razones adicionales y apremiantes para considerar ejecutar tu propia IA. Si alguno de los problemas descritos a continuación afecta a tu empresa, considera una solución de IA local como Jina On-Prem. Esta lista no es exhaustiva.</p><p>Caso de uso</p><p>¿Por qué local?</p><p>Ejemplo</p><p>Aislado/alta seguridad</p><p>Sin transmisión de datos salientes; aislamiento completo de la red</p><p>Defensa, inteligencia, investigación clasificada</p><p>Cumplimiento normativo</p><p>Soberanía de datos; sin transmisión transfronteriza ni exposición a terceros</p><p>Atención médica (Ley de Portabilidad y Responsabilidad de los Seguros Médicos [HIPAA]), finanzas, empresas de la UE (Reglamento General de Protección de Datos [RGPD])</p><p>Crítico para la latencia</p><p>Cero dependencia de red; ninguna tolerancia a las fallas de conexión</p><p>Robótica, computación perimetral, vehículos, buques</p><p>Previsibilidad de costos</p><p>Costo fijo de infraestructura frente a precios por token con tarifas futuras inciertas</p><p>Cargas de trabajo de inferencia continua de alto volumen</p><p>Reducción de responsabilidad</p><p>Sin exposición de datos a terceros; mantiene el privilegio legal y el deber de cuidado</p><p>Firmas de abogados, agencias gubernamentales</p><h3>Por qué los sistemas aislados y protegidos por firewall necesitan IA local</h3><p>Los sistemas aislados de la red y protegidos por firewall no pueden usar API de IA externas. Jina On-Prem se ejecuta por completo dentro de tu infraestructura sin conexiones salientes.</p><p>Para las organizaciones que gestionan datos especialmente confidenciales, las consideraciones de seguridad y privacidad son primordiales. De poco sirve invertir en proteger tus datos confidenciales si inmediatamente se los entregas a un tercero remoto que puede tener una seguridad insuficiente o que podría estar sujeto a las exigencias de un gobierno extranjero.</p><p>Los empleados de organizaciones que manejan datos confidenciales suelen recibir cierta capacitación sobre el manejo seguro de datos, pero esto no es muy efectivo cuando todos tienen navegadores web que pueden estar abiertos en cualquier página de Internet mientras manejan esos datos. El aislamiento es la medida de seguridad más efectiva disponible, ya sea mediante aislamiento de red o firewalls muy restrictivos, pero eso dificulta el uso de servicios externos de cualquier tipo.</p><h3>IA local para sistemas sensibles a la latencia y de alta disponibilidad</h3><p>El software como servicio y la computación en la nube representan una solución intermedia entre el costo de ofrecer servicios muy accesibles y confiables en tus propias computadoras y delegar el problema a un tercero. Pero vienen con latencia variable, interrupciones y una pérdida total de control cuando las cosas salen mal. Los servicios de IA no son la excepción. Si tu sistema de búsqueda queda fuera de línea cuando no puedes acceder a tu modelo de embedding, es posible que ya no parezca una buena solución intermedia.</p><p>Además, confiar en la IA externa siempre implica riesgos que no puedes prever ni gestionar fácilmente. El acceso a internet y la latencia de red pueden degradarse sin previo aviso como resultado de acontecimientos políticos, mal tiempo o barcos que arrastran sus anclas sobre cables de fibra óptica submarinos. Los gobiernos pueden usar prohibiciones de exportación para bloquear repentinamente el acceso a los modelos de IA, y recientemente lo han hecho. Los proveedores de servicios de IA a veces retiran modelos para inducirte a cambiar a otros más nuevos. La flexibilidad y los costos gestionados de los servicios externos deben equilibrarse con los riesgos de la dependencia.</p><h3>IA local para el cumplimiento del RGPD, la HIPAA y la soberanía de datos</h3><p>Las organizaciones que recopilan datos están sujetas a normativas cada vez más estrictas que a menudo difieren entre jurisdicciones y pueden imponer requisitos contradictorios. En particular, <a href="https://www.hhs.gov/hipaa/for-professionals/privacy/laws-regulations/index.html">las reglas de la HIPAA</a> imponen protecciones de datos muy estrictas a los proveedores de salud estadounidenses, y las sólidas leyes generales de protección de datos en <a href="https://laws-lois.justice.gc.ca/eng/acts/p-8.6/">Canadá</a>, la <a href="https://gdpr-info.eu/">Unión Europea</a> y <a href="https://www.japaneselawtranslation.go.jp/en/laws/view/4241">muchas jurisdicciones asiáticas</a> exigen que todas las empresas que manejan información personal lo hagan de manera segura y limiten la transmisión de dichos datos a otras partes u otras jurisdicciones. Estas reglas pueden incluso imponer obligaciones a entidades extranjeras si tienen algún cliente en esas jurisdicciones. Las instituciones financieras suelen estar sujetas a reglas aún más estrictas y asumen la misma responsabilidad directa en cuanto a la seguridad de la información que las que aplican para protegerse contra otras formas de actividad criminal.</p><p>El cumplimiento normativo puede ser incompatible con los servicios de IA externos, especialmente si usarlos implica la transmisión transfronteriza de datos.</p><p>Además, los eventos recientes muestran que las reglas que restringen la ubicación física de los almacenes de datos pueden no ser una fuente confiable de protección cuando los proveedores de servicios de nube internacionales están sujetos a la presión de gobiernos extranjeros. Las leyes locales pueden entrar en conflicto entre jurisdicciones, lo que exige el almacenamiento y procesamiento local de datos e imposibilita el uso de servicios de terceros. En algunos casos, la única solución es llevar todas las partes de tus procesos de forma interna, incluidos tus sistemas de IA.</p><h3>Riesgos de responsabilidad de la IA por la transmisión de datos de terceros</h3><p>Las leyes de protección de datos y los deberes de cuidado reconocidos respecto de los datos confidenciales suelen tener implicaciones de responsabilidad, a veces muy graves. Puedes ser responsable del manejo de tus datos por parte de terceros proveedores de servicios. Si bien los tribunales y los procedimientos legales pueden brindar algunas protecciones retrospectivas frente a proveedores de servicios que no cumplen los requisitos de seguridad, esos recursos no están disponibles ni son generalmente efectivos contra actores de seguridad nacional, las fuerzas de orden público o hackers criminales.</p><p>Para los gobiernos, ya ha habido casos de proveedores de servicios de nube transfronterizos que revelan información estatal confidencial a actores extranjeros.</p><p>Pero, aunque no te preocupen los gobiernos extranjeros o los hackers, y aunque tus proveedores de servicios de IA externos sean seguros en sí mismos, el solo hecho de que sean externos puede generar responsabilidades.</p><p>Por ejemplo, en la mayoría de las jurisdicciones, las comunicaciones de los abogados con sus clientes gozan de protecciones legales especiales, y los despachos de abogados tienen responsabilidades estrictas al grabar o almacenar esta información. En Estados Unidos, este “privilegio abogado-cliente” es tan famoso que es un elemento central en las tramas de películas y series de TV. Pero una de las formas en que ese privilegio se puede perder es comunicando información a alguien que no tiene este privilegio, y los avances recientes sugieren que los proveedores externos de servicios de IA podrían calificar.</p><p>Es posible, al menos en Estados Unidos, que el solo uso de servicios de IA de terceros a través de una API de internet, como modelos de incrustaciones que ofrecen servicios para indexar, infrinja reglas críticas de confidencialidad. Un bufete de abogados podría ser demandado, sancionado o inhabilitado tan solo por usar software hospedado externamente, incluso si no ocurre ninguna brecha de seguridad.</p><h3>IA local para sistemas offline, de borde y aislados físicamente</h3><p>Los sistemas informáticos no solo se aíslan por razones de seguridad. Por ejemplo, los vehículos en movimiento no pueden depender del acceso a Internet para ninguna función esencial. Los barcos y las aeronaves cuentan con sistemas informáticos a bordo muy amplios que deben funcionar sin conexiones a Internet y, por lo tanto, no pueden usar servicios de IA externos. Las plataformas marítimas, las instalaciones remotas en zonas silvestres y los servicios informáticos en el Ártico, la Antártida y pequeñas islas sin conexiones físicas adecuadas a las redes globales son ejemplos de instalaciones que se benefician de hospedar localmente todos los servicios que necesitan. A medida que aumenta el rol de la IA en la informática empresarial, resulta más importante abordar estas limitaciones.</p><p>Las aplicaciones emergentes de la IA a sistemas físicos (robótica y otros casos de uso espacialmente delimitados u orientados al mundo exterior, como sistemas de gestión logística o incluso cajas de supermercado) pueden estar conectadas a la internet global, pero no tienen tolerancia a las fallas de conexión o los picos de latencia. Si dependen de un sistema de IA para funcionar, ese sistema de IA debe ser lo más local y confiable posible.</p><h2>¿Quién no necesita IA local?</h2><p>Los servicios de software remotos y la IA fuera de las instalaciones sí tienen beneficios. Ejecutar modelos de IA puede requerir procesadores costosos y de alto consumo de energía con una vida útil notoriamente corta. El acceso a hardware de alta calidad es particularmente difícil en este momento debido a factores del mercado e impactos económicos externos. Dadas las circunstancias, puede tener sentido pagar por token para usar una API externa en lugar de asumir los elevados costos de capital de la IA local.</p><p>Las API externas son más útiles para los usuarios intermitentes. Si usas modelos de IA principalmente para procesar datos en batch para análisis, en lugar de ejecutar un sistema de búsqueda que tenga que estar en línea todo el tiempo, tiene poco sentido invertir en hardware con uso intensivo de capital e instalaciones locales.</p><p>Además, cuando el procesamiento de tus datos ya en la nube por razones de confiabilidad y accesibilidad, usar servicios de IA ubicados en la misma infraestructura de nube puede ofrecer una mejor relación precio-calidad que introducir tu propio despliegue de modelo de IA con licencia. Ya dependes de tu proveedor de servicios en la nube, por lo que depender de sus servicios de IA no añade mucho riesgo.</p><p>Si tu caso de uso se ajusta a esa descripción, los modelos de Jina AI están disponibles en <a href="https://www.elastic.co/docs/explore-analyze/elastic-inference/eis">EIS</a>, <a href="https://aws.amazon.com/marketplace/seller-profile?id=seller-stch2ludm6vgy">AWS Marketplace</a> y <a href="https://console.cloud.google.com/marketplace/browse?q=jina">Google Cloud Platform</a> específicamente para satisfacer tus necesidades.</p><p>La tabla a continuación resume los factores clave. La respuesta que obtengas depende de tus datos, infraestructura y patrón de uso.</p><p>Factor</p><p>Preferentemente local</p><p>API de nube preferida</p><p>Patrón de uso</p><p>Inferencia continua o de alto volumen</p><p>Procesamiento intermitente o por batch</p><p>Sensibilidad de los datos</p><p>Regulado, soberano o clasificado</p><p>Sin restricciones transfronterizas ni de terceros</p><p>Entorno de red</p><p>Aislado, protegido por firewall o poco confiable</p><p>Internet estable y siempre activa</p><p>Infraestructura actual</p><p>Tienes o puedes adquirir hardware de GPU</p><p>Ya hospedada en la nube con IA coubicada</p><p>Modelo de costos</p><p>Hardware fijo + licencia; predecible a escala</p><p>Por token; menor costo inicial, variable a largo plazo</p><p>Tolerancia a la latencia</p><p>Ninguna (robótica, borde, tiempo real)</p><p>La variabilidad de la red es aceptable</p><p>Responsabilidad operativa</p><p>Tu equipo administra el hardware y la disponibilidad</p><p>El proveedor gestiona el hardware y las actualizaciones; tú gestionas la integración</p><p>Tienes que considerar los costos y beneficios a la luz de tus circunstancias particulares y de tus casos de uso, teniendo en cuenta los problemas destacados en la sección anterior que se apliquen a ti. El análisis costo-beneficio sin duda cambiará con el tiempo. No podemos predecir el futuro de la industria de la IA o los precios del hardware incluso a corto plazo.</p><h2>Presentamos Jina On-Prem</h2><p>Para los usuarios que pueden beneficiarse de los servicios de IA locales, presentamos <a href="https://github.com/jina-ai/jina-on-prem/wiki/">Jina On-Prem</a>, una suite de instalación totalmente independiente para los modelos de alto rendimiento de Jina AI.</p><p>Los modelos de Jina AI igualan la precisión de los modelos de incrustación <a href="https://mteb-leaderboard.hf.space/benchmark/MTEB(Multilingual%2C%20v2)">varias veces más grandes</a>, lo que reduce los costos informáticos, la huella de memoria y los requisitos de hardware. Esto los convierte en una opción ideal para los usuarios que quieren o necesitan mantener su IA de forma local. Las licencias comerciales están disponibles con soluciones escalables y de precio proporcional para casos de uso de todas las envergaduras.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt190865fb3ebde472/6a6a33d0065b162508701ff9/02559ceca556a26c53eb703ae87d421452b27251-1374x1400.png" alt="MMTEB Multilingual v2 leaderboard showing Jina AI embedding model rankings: jina-embeddings-v5-omni-small and jina-embeddings-v5-text-small ranked 13th, jina-embeddings-v5-omni-nano and jina-embeddings-v5-text-nano ranked 19th, competing against models from Microsoft, Google, Tencent, NVIDIA and Qwen" /><h3>¿Qué esquemas de API soporta Jina On-Prem?</h3><ul><li><p>Disponible como una colección completa de dependencias para instalación local o como un <a href="https://www.docker.com/">contenedor docker</a> que puedes instalar y ejecutar en minutos.</p></li><li><p>Las instalaciones de Jina On-Prem <em>no</em> hacen llamadas a sistemas externos.</p><ul><li><p>Sin llamadas a Hugging Face Hub ni a ningún registro de modelos (HF_HUB_OFFLINE=1 y TRANSFORMERS_OFFLINE=1 están integrados).</p></li><li><p>No hay un servidor de licencias.</p></li><li><p>No hay endpoints de telemetría o de logging.</p></li></ul></li><li><p>Soporta hardware de CPU y GPU, con autodetección de GPU.</p></li><li><p>Todos los 28 modelos de Jina AI disponibles, incluidos los últimos modelos de incrustación multimodal <a href="https://www.elastic.co/es/search-labs/blog/jina-embeddings-v5-omni-all-media-one-index">jina-embeddings-v5-omni</a> y <a href="https://www.elastic.co/es/search-labs/tutorials/jina-tutorial/jina-reranker-v3">jina-reranker-v3</a>.</p></li><li><p>Acceso mediante esquemas estándar de API de IA: <a href="https://jina.ai/api-dashboard">API de Jina</a>, OpenAI, Cohere, Voyage AI y Gemini. Jina On-Prem es una solución directa para las aplicaciones creadas sobre esos esquemas.</p></li><li><p>Reemplazo directo para modelos servidos por el <a href="https://www.elastic.co/docs/explore-analyze/elastic-inference/eis">EIS</a>. Jina On-Prem se integra directamente con <a href="https://www.elastic.co/es/blog/deploy-elastic-air-gapped-disconnected-environments">despliegues de Elastic aislados de la red</a>.</p></li></ul><h2>Requisitos de hardware para los modelos locales de Jina AI</h2><p>Los requisitos de hardware varían para los diferentes modelos de Jina. La tabla de abajo muestra las recomendaciones para los modelos más recientes usando la configuración de GPU. No necesitas nada más potente que una GPU NVIDIA L4, aunque se recomienda una A100 para los modelos de incrustación v5. Nuestro modelo de incrustación más reciente requiere actualmente un mínimo de 8 GB de VRAM.</p><p>Modelo</p><p>VRAM mínima</p><p>GPU recomendada</p><p>jina-embeddings-v5-text-nano</p><p>2 GB</p><p>T4 / L4</p><p>jina-embeddings-v5-text-small</p><p>3 GB</p><p>L4 / A10G</p><p>jina-embeddings-v5-omni-small</p><p>8 GB</p><p>L4 / A10G / A100</p><p>jina-reranker-v3</p><p>3 GB</p><p>L4</p><p>jina-clip-v2</p><p>4 GB</p><p>L4</p><p>jina-code-embeddings-1.5b</p><p>4 GB</p><p>L4</p><p>ReaderLM-v2</p><p>4 GB</p><p>L4</p><p>Si usas más de un modelo a la vez, los requisitos de VRAM aumentarán. Consulta la <a href="https://github.com/jina-ai/jina-on-prem/wiki/Sizing-And-Hardware">página de Dimensionamiento y hardware</a> para obtener más información.</p><h2>Cómo instalar Jina On-Prem con docker</h2><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt20265d09e2d8d0f4/6a6a33d1065b162105701ffd/ada9881af407168298b1940f8537ad71a5411c89-1999x1200.png" alt="" /><p>La forma más rápida de dar los primeros pasos es <a href="https://www.docker.com/get-started/">instalar docker</a> (si aún no lo has hecho) y seguir las instrucciones de la página <a href="https://github.com/jina-ai/jina-on-prem/wiki/QuickStart">Inicio rápido de Jina On-Prem</a>.</p><p>Hay contenedores docker preconfigurados para los 28 modelos de Jina. Descarga uno y transfiérelo a tu destino de instalación, y podrás tener modelos de Jina AI ejecutándose en menos de cinco minutos.</p><p>Para compilaciones multimodales o personalizadas, o para descargar el conjunto completo de dependencias para la instalación fuera de un contenedor, sigue los pasos descritos en la <a href="https://github.com/jina-ai/jina-on-prem/wiki/Bundling-Guide">guía de empaquetado</a>.</p><p>Tu instalación de Jina On-Prem brinda soporte para toda la funcionalidad de la API de Jina y de EIS, y para la generación de incrustaciones mediante las API de OpenAI, Cohere, Voyage AI y Gemini, por lo que puede integrarse en aplicaciones preexistentes que usen interfaces estándar. Consulta la <a href="https://github.com/jina-ai/jina-on-prem/wiki/API-Reference">documentación de la API</a> para obtener más información.</p><p>Los modelos de Jina, incluidos los modelos instalados con Jina On-Prem, están disponibles bajo diversos términos de licencia, y los últimos modelos son gratuitos para uso no comercial bajo una licencia <a href="https://creativecommons.org/licenses/by-nc/4.0/deed.en">CC BY-NC 4.0</a>. Para adquirir la licencia de Jina On-Prem para uso comercial, ponte en contacto con <a href="https://www.elastic.co/es/contact">Ventas de Elastic</a>.</p>]]></content:encoded>
    <link>https://www.elastic.co/search-labs/blog/on-prem-ai-jina-embedding-models</link>
    <guid isPermaLink="true">https://www.elastic.co/search-labs/blog/on-prem-ai-jina-embedding-models</guid>
    <category><![CDATA[Jina AI]]></category>
    <category><![CDATA[Integraciones]]></category>
    <dc:creator><![CDATA[Scott Martens]]></dc:creator>
    <enclosure url="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt17731ab0c6ec66f6/6a6a33d140a4941014ca5c9a/09bc6dac4e6a86c7877f8ed78d68f5d581aeffa9-1999x1200.png" length="0" type="image/png"/>
    <pubDate>Thu, 23 Jul 2026 00:00:00 GMT</pubDate>
  </item>
  <item>
    <title><![CDATA[Un índice, todos los medios: presentamos jina-embeddings-v5-omni]]></title>
    <description><![CDATA[jina-embeddings-v5-omni te permite incrustar texto, imágenes, video y audio en un único índice de Elasticsearch y realizar búsquedas en todos a la vez.]]></description>
    <content:encoded><![CDATA[<p><code>jina-embeddings-v5-omni</code> reúne texto, imágenes, video y audio en un único índice de Elasticsearch. Ampliando los mejores modelos de <a href="https://www.elastic.co/search-labs/blog/jina-embeddings-v5-text"><code>jina-embeddings-v5-text</code></a> en su clase, la suite v5-omni agrega codificación visual y de audio mediante una arquitectura innovadora que mantiene la columna vertebral de texto idéntica y otorga un rendimiento de vanguardia en un modelo de incrustación muy compacto.</p><p>Ahora puedes crear incrustaciones semánticas de alto rendimiento para <strong>texto</strong>, <strong>imágenes</strong>, <strong>videos</strong> y <strong>grabaciones de audio</strong>, que abarcan <strong>casi 100 idiomas</strong>, y utilizarlas para clasificar, agrupar, medir la similitud semántica e indexar para recuperar información. Si tus datos se encuentran en archivos PDF, grabaciones y videos junto al texto, ya no necesitas pipelines separados para cada uno.</p><p>La familia <code>jina-embeddings-v5-omni</code> es el <strong>modelo de incrustación más compacto actualmente en el mercado con soporte para imágenes, voz, impresión y video</strong>. Ofrece:</p><ul><li><p><strong><code>jina-embeddings-v5-text</code></strong><strong>incrustaciones de texto de clase vanguardia</strong> para recuperación, análisis y aplicaciones de agentes de IA.</p></li><li><p><strong>Incrustaciones líderes en su categoría de tamaño</strong> <strong>para similitud semántica visual, comprensión visual y recuperación de imágenes.</strong> <code>jina-embeddings-v5-omni-small</code> tiene el mejor rendimiento en benchmarks de imagen de cualquier modelo de la categoría de 1000 millones (10⁹) de parámetros y es superior a nuestro propio <a href="https://www.elastic.co/search-labs/blog/jina-models-elasticsearch-guide#jina-clip-v2"><code>jina-clip-v2</code></a> anterior. Solo unos pocos modelos que poseen tres a 30 veces más parámetros pueden superarlo.</p></li><li><p><strong>Incrustaciones de vanguardia para la comprensión y recuperación visual multilingüe</strong> que superan modelos hasta 20 veces más grandes.</p></li><li><p><strong>Incrustaciones de audio de los mejores en su categoría de tamaño</strong>, con solo modelos que tienen el doble o más de parámetros que logran mejores resultados en las referencias estándar.</p></li><li><p><strong>Soporte para video</strong>, especialmente para localizar objetos y eventos en el metraje.</p></li></ul><p>Esto tiene aplicaciones en todos los ámbitos de la recuperación de información, el procesamiento de documentos y el análisis de datos. <code>jina-embeddings-v5-omni</code> abre el acceso a la información encerrada en diferentes silos de medios y la pone a disposición para su recuperación, análisis y uso por parte de agentes de IA. La información contenida en grabaciones de audio y video, archivos PDF, escaneos de páginas impresas e infografías tiene el mismo valor que los textos digitalizados en tu ecosistema de datos.</p><p>Al igual que <code>jina-embeddings-v5-text</code>, estos modelos vienen en dos tamaños: <code>small</code> y <code>nano</code>. Ambos modelos amplían su equivalente textual con módulos adicionales que admiten entradas de audio y vídeo. Los usuarios pueden seleccionar módulos en el momento de la carga. Además, las extensiones específicas para cada tarea —como la similitud semántica, la clasificación, la agrupación y la recuperación de información— se han implementado como adaptadores compactos de rango bajo (LoRA) y están todas cargadas, así que los usuarios pueden seleccionarlas en el momento de la inferencia.</p><p>Ambos modelos son muy compactos. <code>jina-embeddings-v5-omni-small</code> puede ejecutarse en servidores convencionales equipados con GPU y <code>jina-embeddings-v5-omni-nano</code> es lo suficientemente pequeño como para ejecutarse en hardware estándar. Esto representa un gran ahorro potencial en costos de cómputo y hace posible la instalación local con licencia y el procesamiento perimetral, lo que reduce la latencia y aumenta tu control sobre tus propios datos.</p><p>La suite v5-omni utiliza técnicas innovadoras de diseño de modelos y machine learning para crear nuevos modelos de incrustación a partir de otros ya entrenados, sin necesidad de volver a entrenarlos. Usamos codificadores de modelos preentrenados y alineados con el lenguaje para medios de audio y video como preprocesadores de entrada para nuestro conjunto de modelos de <code>jina-embeddings-v5-text</code> existente. Los modelos resultantes generan incrustaciones para imágenes y grabaciones de audio que son semánticamente compatibles con las incrustaciones que genera para los textos.</p><p>Los modelos v5-omni producen incrustaciones de texto idénticas a las <code>jina-embeddings-v5-text</code> (es decir, <code>jina-embeddings-v5-omni-small</code> con <code>jina-embeddings-v5-text-small</code>; y <code>jina-embeddings-v5-omni-nano</code> con <code>jina-embeddings-v5-text-nano</code>), por lo que puedes extender los repositorios existentes de recuperación de texto a aplicaciones multimedia sin reconstruir tus índices.</p><p>Los codificadores integrados derivan de fuentes de código abierto. Para imágenes y video, hemos utilizado codificadores de los modelos <a href="https://qwen.ai/blog?id=qwen3.5">Qwen3.5</a>:</p><ul><li><p>Para <code>jina-embeddings-v5-omni-nano</code>, el codificador <a href="https://huggingface.co/google/siglip2-base-patch16-224">SigLIP2 Base</a> ajustado de <a href="https://huggingface.co/Qwen/Qwen3.5-0.8B">Qwen3.5-0.8B</a>.</p></li><li><p>Para <code>jina-embeddings-v5-omni-small</code>, el codificador <a href="https://huggingface.co/google/siglip2-so400m-patch14-384">SigLIP2 So400m</a> ajustado específicamente a partir de <a href="https://huggingface.co/Qwen/Qwen3.5-2B">Qwen3.5-2B</a>.</p></li><li><p>Para soporte de audio, agregamos el codificador de <a href="https://huggingface.co/openai/whisper-large-v3">Whisper-large-v3</a>, extraído de <a href="https://huggingface.co/Qwen/Qwen2.5-Omni-7B">Qwen2.5-Omni-7B</a>, tanto a la versión pequeña como a la nano.</p></li></ul><p>Hemos conectado estos codificadores específicos para cada tipo de medio a la columna vertebral de procesamiento de texto mediante proyectores multimodales entrenados. Estos proyectores traducen sus salidas nativas a incrustaciones de entrada compatibles con <code>jina-embeddings-v5-text</code>. Las únicas partes recién entrenadas de los modelos <code>jina-embeddings-v5-omni</code> son los pesos en esos proyectores.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt62dc05bfa3d054b6/6a17e86eb1e113340b79f29c/4cb834b7e5fd63cdd78600de313615feffabbb1f-1999x1000.jpg" alt="" /><p>Esta arquitectura significa que solo necesitamos entrenar los proyectores entre modelos, aproximadamente 5.5 millones de parámetros para <code>jina-embeddings-v5-omni-small</code> y menos de 3.5 millones para <code>jina-embeddings-v5-omni-nano</code>, para cada uno de los cuatro adaptadores LoRA. Este enfoque reduce al mínimo el entrenamiento adicional necesario para conectar diferentes modelos de incrustación, y aprovecha el entrenamiento específico de cada uno de ellos para crear un conjunto de incrustaciones modular, extremadamente compacto y de alto rendimiento.</p><h2>Propiedades del modelo seleccionado</h2><h3>Entrada/salida</h3><p>Nombre del modelo</p><p>Tamaño de la ventana de contexto de entrada</p><p>Tamaño de incrustación</p><p>jina-embeddings-v5-omni-small</p><p>32,768 tókenes*</p><p>1024 dims (mínimo: 32)</p><p>jina-embeddings-v5-omni-nano</p><p>8,192 tókenes*</p><p>768 dims (mínimo: 32)</p><p>* Consulta <strong>Uso de jina-embeddings-v5-omni</strong> a continuación para obtener más información sobre cómo se tokenizan los medios que no son de texto.</p><h3>Tamaño</h3><p>Nombre del modelo</p><p>Tamaño total</p><p>jina-embeddings-v5-omni-small (modelo base de solo texto + 4 adaptadores LoRA)</p><p>700 millones de parámetros</p><p>Soporte de imagen/video (codificador SigLIP2 So400m extraído de Qwen3.5-2B)</p><p>1.006 millones de parámetros</p><p>soporte de audio (codificador Whisper-large-v3 extraído de Qwen2.5-Omni-7B)</p><p>1.354 millones de parámetros</p><p>ambos</p><p>1.660 millones de parámetros</p><p>Adaptadores LoRA (cada uno)</p><p>20M</p><p>jina-embeddings-v5-omni-nano (modelo base de solo texto + 4 adaptadores LoRa)</p><p>266M parámetros</p><p>soporte de imagen/video (codificador SigLIP2 Base extraído de Qwen3.5-0.8B)</p><p>354M parámetros</p><p>soporte de audio (codificador Whisper-large-v3 extraído de Qwen2.5-Omni-7B)</p><p>916M parámetros</p><p>ambos</p><p>1 004 millones de parámetros</p><p>Adaptadores LoRA (cada uno)</p><p>7M</p><p>* Consulta <strong>Uso de jina-embeddings-v5-omni</strong> a continuación para obtener más información sobre cómo se tokenizan los medios que no son de texto.</p><h2>Capacitación específica por tarea</h2><p>La familia de <code>jina-embeddings-v5-omni</code> admite los mismos adaptadores LoRA específicos para tareas que <code>jina-embeddings-v5-text</code>:</p><p>Tarea</p><p>Ejemplos de usos</p><p>Recuperación</p><p>Recuperación de información, por sí sola o en conjunto con otras técnicas de recuperación y evaluación de candidatos. Con los modelos v5-omni, puedes recuperar audio, video e imágenes en una sola búsqueda desde un solo índice.</p><p>Agrupación</p><p>Descubrimiento de temas y organización automática de temas en todos los medios.</p><p>Clasificación</p><p>Categorización, análisis de sentimiento y tareas relacionadas.</p><p>Similitud semántica</p><p>Deduplicación de datos en medios, sistemas de recomendación, medios relacionados, búsqueda de textos que coincidan con el discurso, identificación de traducciones y tareas similares.</p><p>Las representaciones de salida dependen de la categoría de tarea seleccionada. Por ejemplo, no deberías usar representaciones orientadas a recuperación para agrupar o representaciones de similitud semántica para clasificación.</p><h2>Multimedia, multimodal, multilingüe, multifuncional</h2><p>Para mostrar lo que <code>jina-embeddings-v5-omni</code> puede hacer, tomemos los famosos pasajes iniciales de dos novelas y midamos su similitud semántica:</p><p><em><strong>A Tale of Two Cities</strong></em><strong> (Charles Dickens)</strong></p>It was the best of times, it was the worst of times, it was the
age of wisdom, it was the age of foolishness, 
it was the epoch of belief, it was the epoch of incredulity,
it was the season of Light, it was the season of Darkness,
it was the spring of hope, it was the winter of despair,
we had everything before us, we had nothing before us,
we were all going direct to Heaven, we were all going
direct the other way—in short, the period was so far like
the present period, that some of its noisiest authorities
insisted on its being received, for good or for evil, in 
the superlative degree of comparison only.<p><em><strong>Pride and Prejudice</strong></em><strong> (Jane Austen)</strong></p>It is a truth universally acknowledged, that a 
single man in possession of a good fortune must
be in want of a wife. However little known the
feelings or views of such a man may be on his first
entering a neighbourhood, this truth is so well
fixed in the minds of the surrounding families,
that he is considered as the rightful property of
some one or other of their daughters.<p>Si se usa <code>jina-embeddings-v5-omni-small</code>, con su adaptador de similitud semántica, estos textos tienen una similitud de <strong>0,5329</strong>.</p><p>Ese número no significa mucho sin algo con qué compararlo, así que comparemos estos dos textos con sus traducciones al francés usando el mismo modelo y adaptador:</p><p><strong>Puntuaciones de similitud semántica para textos en diferentes idiomas</strong></p><p></p><p>A Tale of Two Cities (inglés)</p><p>Pride and Prejudice (inglés)</p><p>Tale of Two Cities (francés) (París y Londres en 1783, tr. H. Loreau)</p><p>0.9095</p><p>0.5074</p><p>Orgullo y prejuicio (francés) (Orgueil et Préjugés, tr. Leconte et Pressoir)</p><p>0.4826</p><p>0.8784</p><p>Los dos textos se parecen mucho más a sus traducciones que a otros textos del mismo idioma o de otro idioma. Esto refleja el rendimiento muy alto de las incrustaciones semánticas multilingües de <code>jina-embeddings-v5-text-small</code>, incluidas sin cambios en <code>jina-embeddings-v5-omni-small</code>.</p><p>Si se agrega soporte multimedia a <code>jina-embeddings-v5-omni</code> significa que podemos extender este experimento a otros tipos de datos. Por ejemplo, obtuvimos escaneos de las primeras páginas de ambas novelas de ediciones impresas antiguas:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt95d451adb5680e20/6a17e871445de9e88a4d016c/e92d928a4813ccecc7d02639eea699e3a71c66e3-1999x1692.png" alt="Dos páginas de libro antiguas muestran los pasajes iniciales de &quot;A Tale of Two Cities&quot; y &quot;Pride and Prejudice&quot;, donde la página izquierda muestra el comienzo del primer capítulo de una edición no fechada del siglo XIX de &quot;A Tale of Two Cities&quot; y la página derecha muestra el comienzo del primer capítulo de la edición Macmillan de 1903 de &quot;Pride and Prejudice&quot;." /><p><strong>Figura 2:</strong> <em>A Tale of Two Cities</em>, edición no fechada del siglo XIX, y <em>Pride and Prejudice</em>, edición Macmillan de 1903.</p><p>Comparemos ambos textos con los escaneos, usando de nuevo el adaptador de similitud semántica:</p><p><strong>Puntuaciones de similitud semántica entre textos e imágenes</strong></p><p></p><p>Historia de dos ciudades (escaneo)</p><p>Pride and Prejudice (escaneo)</p><p>Tale of Two Cities (texto)</p><p>0.7336</p><p>0.4891</p><p>Orgullo y prejuicio (texto)</p><p>0.4804</p><p>0.7213</p><p>Observarás que las puntuaciones de similitud semántica favorecen fuertemente a los textos que coinciden con el contenido de las imágenes.</p><p>También podemos comparar los textos con una captura de pantalla de una publicación en redes sociales y un meme que hacen referencia a esos textos, usando la misma configuración:</p><p><strong>Figura 3:</strong> Un tuit de Elon Musk haciendo referencia a <em>A Tale of Two Cities</em> y un meme haciendo referencia al famoso inicio de <em>Pride and Prejudice</em>.</p><p><strong>Puntuaciones de similitud semántica entre textos e imágenes</strong></p><p></p><p>A Tale of Two Cities</p><p>Pride and Prejudice</p><p>Tweet de Musk (imagen)</p><p>0.7156</p><p>0.4912</p><p>Meme «Keep calm» (imagen)</p><p>0.4555</p><p>0.6244</p><p>Podemos hacer lo mismo con la voz. Obtuvimos grabaciones de lecturas de ambos textos, en inglés y en francés:</p><ul><li><p><a href="https://drive.google.com/file/d/1IK_bR6L47TSrnESdXLEpHCX6o-FzPmOx/view?usp=sharing"><em>A Tale of Two Cities</em></a><a href="https://drive.google.com/file/d/1IK_bR6L47TSrnESdXLEpHCX6o-FzPmOx/view?usp=sharing"> (audio en inglés de Librivox).</a></p></li><li><p><a href="https://drive.google.com/file/d/1KurbhD6INc6oZlq_SJcWq7MBVfJQ3pof/view?usp=sharing"><em>Una historia de dos ciudades</em></a><a href="https://drive.google.com/file/d/1KurbhD6INc6oZlq_SJcWq7MBVfJQ3pof/view?usp=sharing"> (audio en francés generado por OmniVoice AI)</a>.</p></li><li><p><a href="https://drive.google.com/file/d/1D_G2FOCb7ct-FBVY1fyivXlY2e_yGZw1/view?usp=sharing"><em>Orgullo y prejuicio</em></a><a href="https://drive.google.com/file/d/1D_G2FOCb7ct-FBVY1fyivXlY2e_yGZw1/view?usp=sharing"> (audio en inglés de Librivox).</a></p></li><li><p><a href="https://drive.google.com/file/d/1jutY61YSFGBIyE8m-ltEJx-8dEXNJJ5N/view?usp=sharing"><em>Pride and Prejudice</em></a><a href="https://drive.google.com/file/d/1jutY61YSFGBIyE8m-ltEJx-8dEXNJJ5N/view?usp=sharing"> (audio en francés generado por OmniVoice AI).</a></p></li></ul><p><strong>Puntuaciones de similitud semántica entre textos y audio en diferentes idiomas</strong></p><p></p><p>A Tale of Two Cities (audio en inglés)</p><p>A Tale of Two Cities (audio en francés)</p><p>Pride and Prejudice (audio en inglés)</p><p>Pride and Prejudice (audio en francés)</p><p>A Tale of Two Cities (Texto en inglés)</p><p>0.3816</p><p>0.3106</p><p>0.1607</p><p>0.1774</p><p>A Tale of Two Cities (texto en francés)</p><p>0.3528</p><p>0.3253</p><p>0.1598</p><p>0.1721</p><p>Pride and Prejudice (texto en inglés)</p><p>0.1910</p><p>0.1682</p><p>0.3511</p><p>0.3398</p><p>Orgullo y prejuicio (texto en francés)</p><p>0.1667</p><p>0.1474</p><p>0.3018</p><p>0.3702</p><p>Esta capacidad multilingüe y multimedia se extiende a la recuperación de información.</p><p>Los adaptadores de recuperación de los modelos de <code>jina-embeddings-v5-omni</code> implementan recuperación asimétrica. Esto significa que generan incrustaciones de las búsquedas de forma distinta a las incrustaciones de los documentos objetivo de recuperación; por eso, las búsquedas multimodales siempre tienen una dirección, con búsquedas en un archivo multimedia y documentos en otra y la puntuación cambia si se invierten.</p><p>Las tablas a continuación muestran las puntuaciones de recuperación para texto, audio e imágenes de escaneo de página para <em>A Tale of Two Cities</em> y <em>Pride and Prejudice</em>, cuando el texto de <em>A Tale of Two Cities</em> (en inglés) se codifica como la búsqueda:</p><p><strong>Texto a texto</strong></p><p>Documento</p><p>Puntuación de recuperación</p><p>A Tale of Two Cities (extracto de texto en francés)</p><p>0.7597</p><p>Pride and Prejudice (fragmento del texto en inglés)</p><p>0.1482</p><p>Pride and Prejudice (extracto de texto en francés)</p><p>0.0523</p><p><strong>Texto a imagen</strong></p><p>Documento</p><p>Puntuación de recuperación</p><p>A Tale of Two Cities (Escaneo de página en inglés)</p><p>0.5517</p><p>A Tale of Two Cities (Escaneo de página en francés)</p><p>0.3576</p><p>Orgullo y prejuicio (escaneo de página en inglés)</p><p>0.1917</p><p><strong>De texto a audio</strong></p><p>Documento</p><p>Puntuación de recuperación</p><p>A Tale of Two Cities (audio en inglés)</p><p>0.3277</p><p>A Tale of Two Cities (audio en francés)</p><p>0.1980</p><p>Pride and Prejudice (audio en inglés)</p><p>0.1419</p><p>Pride and Prejudice (audio en francés)</p><p>0.1759</p><p>Los usuarios también pueden ejecutar la búsqueda al revés, es decir, realizar búsquedas de audio a texto y de imagen a texto.</p><p>A continuación se muestran las puntuaciones utilizando el audio en inglés de <em>A Tale of Two Cities</em> como búsqueda y varios textos como documentos:</p><p><strong>De imagen a texto</strong></p><p>Documento</p><p>Puntuación de recuperación</p><p>A Tale of Two Cities (extracto de texto en inglés)</p><p>0.3352</p><p>A Tale of Two Cities (extracto de texto en francés)</p><p>0.2650</p><p>Pride and Prejudice (fragmento del texto en inglés)</p><p>0.1626</p><p>Pride and Prejudice (extracto de texto en francés)</p><p>0.1385</p><p>Y las puntuaciones usando un escaneo de la página uno de <em>A Tale of Two Cities</em> (en inglés) como búsqueda:</p><p><strong>De audio a texto</strong></p><p>Documento</p><p>Puntuación de recuperación</p><p>A Tale of Two Cities (extracto de texto en inglés)</p><p>0.5304</p><p>A Tale of Two Cities (extracto de texto en francés)</p><p>0.4845</p><p>Pride and Prejudice (fragmento del texto en inglés)</p><p>0.1467</p><p>Pride and Prejudice (extracto de texto en francés)</p><p>0.0761</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt501b2c594f45f2e3/6a17e877a292992e3ad02c9a/673f5116c1d7a5a6f9adfbb2f48b9e6920e3229b-668x130.png" alt="Un cuadro de notificación rectangular con un fondo azul claro muestra un icono de triángulo de advertencia amarillo junto al texto que explica que jina‑embeddings‑v5‑omni fue entrenado para encontrar audio, video e imágenes a partir de búsquedas de texto y que las búsquedas no textuales pueden ser menos efectivas." /><h2>Búsqueda de vídeos</h2><p>Las capacidades de <code>jina-embeddings-v5-omni</code>para la indexación y la búsqueda de video aportan nuevas funcionalidades a las bases de datos de Elasticsearch, pero están sujetas a muchas de las mismas advertencias que aplican a los textos. Generar una única incrustación para una película larga es como incrustar una novela muy larga: la información detallada se verá inundada y la incrustación resultante será una buena coincidencia para muchas búsquedas irrelevantes.</p><p>Si incorporas el texto completo de <em>"Lord of the Rings"</em> (unas 500 000 palabras), es probable que sea una coincidencia buena para la mayoría de las búsquedas, sin importar lo que estés buscando. Del mismo modo, si indexas una película de Hollywood de dos horas, obtendrás muchas coincidencias irrelevantes y detalles que se pierden por completo. <code>jina-embeddings-v5-omni</code> es óptimo con clips cortos.</p><p>Para este ejemplo, descargamos el tráiler de la película de 1961 <em>Breakfast At Tiffany’s</em>, que dura solo 158 segundos y es de dominio público. Puedes ver el tráiler <a href="https://archive.org/details/turner_video_311/311.mp4">en Internet Archive</a>.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt06633fdd1c8334dd/6a17e8790b0bed7d9add35b2/1948f585027d1342528c0dd93fe99e3ec7ba17f9-800x1200.png" alt="Un afiche vintage de la película Breakfast at Tiffany’s muestra una imagen ilustrada de cuerpo entero de Audrey Hepburn con un vestido largo negro con guantes negros, un collar de perlas y un portacigarrillos, con un gato en el hombro. Una ilustración de fondo más pequeña muestra a una pareja abrazándose cerca de un paisaje urbano, y el póster incluye bordes coloridos junto con los créditos del elenco y de producción." /><p><strong>Figura 4: </strong>El póster teatral para <em>Breakfast at Tiffany’s</em>.</p><p>Usamos <a href="https://www.scenedetect.com/">PySceneDetect </a>para dividir el tráiler en 28 escenas individuales, con duraciones que van desde los 1.877 segundos (45 fotogramas) hasta los 18.393 segundos (441 fotogramas). La detección de escenas no es perfecta, pero ofrece un mecanismo adecuado para dividir el video en fragmentos más pequeños que faciliten su búsqueda. Luego generamos representaciones de documentos para cada uno de los 28 segmentos, usando <code>jina-embeddings-v5-omni-small</code>, para poder comprobar si las búsquedas de texto servían para encontrar elementos específicos en el video.</p><p>Por ejemplo, la búsqueda de “gato” devolvió los siguientes clips como los tres resultados principales. La única escena con un gato está en la parte superior, con una puntuación de <strong>0.1634</strong>:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt6dca953a4afd5c1b/6a17e87baf47b65bf6cddfbc/82bd1759ebb65202f01a1e290447619af39f9a3d-735x426.png" alt=" Una miniatura de video muestra a una persona arrodillada en el piso de la cocina estirando el brazo hacia un refrigerador abierto mientras un gato está cerca (puntuación 0.1634)." /><p><a href="https://drive.google.com/file/d/1O3r-97rQJE7HAlUHsLygmFLwlZihRF26/view?usp=drive_link">Mira el clip uno</a>.</p><p>La siguiente coincidencia más alta, con una puntuación de <strong>0.1237</strong>, es mucho más baja:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltcc2cc1ef9ff9ce4b/6a17e87d7c026e725cf146b3/de4eb704ef751cc4df2bead7faa177decd20b1b3-735x426.png" alt="Una miniatura de video muestra a una persona sosteniendo una máscara colorida cerca de su cara con el nombre “GEORGE PEPPARD” superpuesto en la imagen (puntuación 0.1237)." /><p><a href="https://drive.google.com/file/d/1DEK2H4bCpLVzyipJri9NSqE2jkeZ5jLm/view?usp=drive_link">Mira el clip 2</a>.</p><p>También puedes hacer búsquedas de acciones. Si haces una búsqueda con el texto "beso", las cuatro primeras coincidencias contienen todas besos:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt85bf55536faf5156/6a17e87f25daab4bb608a269/18efdcbbb31954dfab8eafe5055773b6b8e3de72-735x426.png" alt="Una miniatura de video muestra a tres personas en interiores, con una persona de pie a la izquierda dando la espalda a la cámara y dos personas a la derecha que parecen abrazarse cerca de una cortina y una puerta (puntuación 0.2864)." /><p><a href="https://drive.google.com/file/d/1Pmr_D4wKjUCCiq_Dzy5PQeWldJLjZ8kI/view?usp=drive_link">Mira el clip 3.</a> Su puntuación es 0.2864.</p><p>Puntuaciones: Para la <a href="https://drive.google.com/file/d/1sS_4qTnmHU2uOwbN1fmdXeS3IvZAI_IN/view?usp=drive_link">segunda coincidencia</a> (0.2494), <a href="https://drive.google.com/file/d/1ofsrZHTUb3huwQ0JB6Hs5dOw4myTj-sk/view?usp=drive_link">tercera coincidencia</a> (0.2099) y <a href="https://drive.google.com/file/d/1qaS4eueUCcQWdHLEjfEfneXsaWsx6P_5/view?usp=drive_link">cuarta coincidencia</a> (0.2068), respectivamente</p><p>Y puedes buscar el texto que se muestra en los videos, como “Buddy Ebsen”, que solo aparece una vez. <code>jina-embeddings-v5-omni-small</code> lo identifica fácilmente como la mejor coincidencia con una puntuación de <strong>0.3885</strong>, considerablemente más alta que la siguiente mejor coincidencia:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt4c3fd86052f17ce8/6a17e886e9ea8795d8a9c601/dabcae9f44b9d4a671f88717aa21a2c6cf685f6b-735x426.png" alt="Una miniatura de video que muestra a un hombre con traje de pie junto a una escalera con balaustres blancos y una barandilla oscura, con el texto superpuesto “Buddy Ebsen” (puntuación 0.3885)." /><p><a href="https://drive.google.com/file/d/1rdQ1OqtPBD-3iGG8A900jU5DpC-muye4/view?usp=sharing">Clip de Buddy Ebsen</a>.</p><h2>Recuperación visual de documentos</h2><p>Los modelos de incrustación multimodal de Jina AI son líderes en el procesamiento de documentos visuales y están a la vanguardia en el procesamiento de documentos visuales multilingües. Esto significa manejar datos de imágenes que contienen texto, figuras e información estructurada. Los datos importantes suelen estar en forma de escaneos impresos, archivos PDF, diagramas, dibujos técnicos, capturas de pantalla, imágenes, infografías y similares. Estos tipos de imágenes a menudo son compuestas mecánicamente o generadas por computadora. No suelen poder reducirse a texto sin pérdida de significado y son poco adecuados para los modelos de visión computacional diseñados para la fotografía de escenas naturales.</p><p><code>jina-embeddings-v5-omni</code>Las incrustaciones abarcan información sobre las cosas en la imagen, el texto impreso en ellas y las relaciones entre ambos. La recuperación visual de documentos hace posible indexar imágenes enriquecida que contienen tanto objetos como texto relevante y hacerlo a través de diferentes idiomas.</p><p>A modo de ejemplo, vamos a usar cuatro imágenes de productos de diferentes sitios web de comercio electrónico:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt620568521e2a3057/6a17e888f7018418c89a68a8/639481349aed78d4139f0d388d44f79b6ba29f88-1297x650.png" alt="" /><p>Ahora, veamos qué tan bien <code>jina-embeddings-v5-omni-small</code> puntúa estas cuatro imágenes para la búsqueda «fideos ramen»:</p><p>Sopa de pollo con trozos de Campbell’s (envase canadiense)</p><p>Kraft Dinner (envase canadiense)</p><p>Ramen Maruchan fresco con sabor a miso (envase japonés)</p><p>Birkel Spaghetti (embalaje alemán)</p><p>0.0872</p><p>0.0711</p><p>0.1123</p><p>0.0886</p><p>Fácilmente encuentra la coincidencia japonesa.</p><p>Ahora, intentemos una búsqueda para «マカロニチーズ» (<em>macarrones con queso</em> en japonés):</p><p>Sopa de pollo con trozos de Campbell’s (envase canadiense)</p><p>Kraft Dinner (envase canadiense)</p><p>Ramen Maruchan fresco con sabor a miso (envase japonés)</p><p>Birkel Spaghetti (embalaje alemán)</p><p>0.2207</p><p>0.3487</p><p>0.2760</p><p>0.2674</p><p>Encuentra la coincidencia correcta con la misma facilidad que una búsqueda en inglés.</p><p><code>jina-embeddings-v5-omni</code> también sobresale en la interpretación de imágenes con abundante información, como los gráficos. Para ver esto en acción, mira estos dos gráficos de barras:</p><p>Dos gráficos, <strong>Gráfico 1</strong> a la izquierda, sobre la carga mundial de enfermedad, y <strong>Gráfico 2</strong> a la derecha, sobre la esperanza de vida de las razas de perros.</p><p>Veamos qué tal se adaptan a dos posibles preguntas de texto, cada una de ellas relacionada con uno de los gráficos, pero no con ambos, utilizando <code>jina-embeddings-v5-omni-small</code> para la búsqueda:</p><p>Pregunta de texto</p><p>Gráfico 1</p><p>Gráfico 2</p><p>“¿Cuáles son algunos de los problemas médicos más comunes para las personas mayores?”</p><p>0.2787</p><p>0.1099</p><p>“¿Cuánto tiempo viven los perros?”</p><p>0.1350</p><p>0.3564</p><p>También puedes revertir la búsqueda, usando imágenes como búsquedas para encontrar textos. La tabla a continuación muestra los documentos objetivo extraídos de los resúmenes de artículos científicos relacionados con el tema y sus puntuaciones de recuperación, utilizando las imágenes del gráfico como búsquedas:</p><p></p><p>Texto 1</p><p>Texto 2</p><p></p><p>La salud de las poblaciones que viven en la pobreza extrema ha sido desde hace tiempo un tema central de los esfuerzos de desarrollo a nivel mundial, y sigue siendo una prioridad en la era de los Objetivos de Desarrollo Sostenible. Sin embargo, no ha habido un intento sistemático de cuantificar la magnitud y las causas de la carga en esta población específica por casi dos décadas. Hemos estimado las tasas de enfermedades por causa en los mil millones de personas más pobres del mundo y comparamos estas tasas con las de las poblaciones de ingresos altos.</p><p>El perro de compañía es una de las especies fenotípicamente más diversas. La variabilidad entre razas no solo se extiende a la morfología y a aspectos del comportamiento, sino también a la longevidad. A pesar de ello, pocos estudios se han dedicado a evaluar la variación en la esperanza de vida entre razas o el potencial de caracterización filogenética de la longevidad.</p><p>Gráfico 1</p><p>0.2377</p><p>0.1357</p><p>Gráfico 2</p><p>0.0673</p><p>0.3576</p><h2>Características</h2><h3>Incrustaciones truncables</h3><p>Entrenamos los modelos base <code>jina-embeddings-v5-text</code> que sustentan <code>jina-embeddings-v5-omni</code> con <a href="https://arxiv.org/abs/2205.13147">Aprendizaje de representación Matryoshka</a>, para que puedas truncar tanto las incrustaciones de texto como las de multimedia de estos modelos.</p><p>De forma predeterminada, <code>jina-embeddings-v5-omni-small</code> genera incrustaciones con 1024 dimensiones, lo que toma 2 KB para almacenarse con una precisión de 16 bits. Las incrustaciones de <code>jina-embeddings-v5-omni-nano</code>tienen 768 dimensiones y ocupan aproximadamente 1.5KB. Puedes reducir el tamaño de estas incrustaciones a 32 dimensiones (64 bytes), lo que supone una cierta pérdida de precisión, pero a cambio obtienes una gran mejora en la velocidad de procesamiento y una reducción en los costos de recursos. En general, reducir el tamaño de las incrustaciones a la mitad disminuye la precisión en un 2 %, hasta llegar a 128 dimensiones; por debajo de ese nivel, la precisión cae mucho más rápido.</p><p>Las incrustaciones truncables permiten a los usuarios decidir el equilibrio óptimo entre precisión, velocidad y costo, según sus propios casos de uso.</p><h3>Cuantificación</h3><p>La familia de <code>jina-embeddings-v5-omni</code> también hereda un rendimiento sólido bajo cuantización de la base de <code>jina-embeddings-v5-text</code>. Esto aumenta aún más la velocidad y reduce los costos de cálculo y almacenamiento al almacenar números menos precisos. Los capacitamos para trabajar con <a href="https://www.elastic.co/docs/reference/elasticsearch/mapping-reference/bbq">Better Binary</a>Quantization(BBQ) de Elasticsearch para ofrecer un rendimiento <a href="https://elastic.co/elasticsearch">casi idéntico a las incrustaciones no cuantizadas.</a> En el conjunto de referencias de recuperación Massive Text Embedding Benchmark (MTEB), la binarización reduce el rendimiento en menos de un 3 % en comparación con los valores completos de 16 bits, a la vez que ahorra el 93 % del espacio y aumenta significativamente las velocidades de procesamiento y recuperación.</p><h3>Rendimiento entre idiomas</h3><p><code>jina-embeddings-v5-text</code>El extenso entrenamiento multilingüe se traslada a <code>jina-embeddings-v5-omni</code>, con casi 100 idiomas en el preentrenamiento de <code>jina-embeddings-v5-text-small</code>y 15 idiomas globales principales en el de <code>jina-embeddings-v5-text-nano</code>. Para medios de audio, el modelo <code>Whisper-large-v3</code> cuenta con aproximadamente 100 idiomas en su entrenamiento, y los modelos de visión SigLip2 modificados por Qwen integrados en <code>jina-embeddings-v5-omni-small</code> y <code>-nano</code> fueron entrenados con datos de 201 lenguas y dialectos distintos.</p><h2>Rendimiento de referencia</h2><h3>Texto</h3><p><code>jina-embeddings-v5-omni</code> los modelos son idénticos a los modelos de <code>jina-embeddings-v5-text</code> cuando se usan solo para texto. Son los de mejor rendimiento en el conjunto de <a href="https://huggingface.co/spaces/mteb/leaderboard">referencias MMTEB</a> en sus respectivas categorías de tamaño para incrustaciones de texto semánticas.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt14d87596ca463c88/6a17e88dec0f89dfb65a664f/8687106cf82e6ec2b3f79f893cfe011e4a5b4a21-1095x1095.png" alt="Un gráfico de barras y líneas compara las puntuaciones MMTEB y los tamaños de parámetros para nueve modelos de incrustación, donde jina‑v3‑omni‑small logra la puntuación más alta y snowflake‑arctic‑embed‑l‑v2 tiene el tamaño más pequeño." /><p><strong>Figura 5</strong>: Tamaño y rendimiento de <code>jina-embeddings-v5-omni</code>en puntos en referencias de texto, en comparación con los modelos de la competencia. El tamaño citado no tiene extensiones de carga para otros medios.</p><h3>Similitud semántica visual</h3><p>En las referencias estándar de similitud semántica visual, <code>jina-embeddings-v5-omni</code> obtiene las mejores puntuaciones entre los modelos de tamaño comparable. Los modelos <code>jina-embeddings-v5-omni</code> muestran, con diferencia, el mejor rendimiento entre los modelos públicos de pesos abiertos de tamaño comparable. <code>jina-embeddings-v5-omni-small</code> solo es superado por un modelo tres veces más grande en tareas de similitud semántica visual, y <code>jina-embeddings-v5-omni-nano</code> solo es superado por <code>jina-embeddings-v5-omni-small</code> y por modelos entre 10 y 25 veces más grandes.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt16ad3463d2aeefc5/6a17e88efaa9139b1493c8a9/f2ae56764865953bdf8c54747276189efd6d45e1-1496x877.png" alt="Un gráfico de barras y líneas compara las puntuaciones de similitud semántica visual y los tamaños de parámetros para siete modelos de incrustación, donde jina‑embeddings‑v5‑omni‑small logra la puntuación de similitud más alta y laion/CLIP‑ViT‑bigG‑14 tiene el tamaño de modelo más grande." /><p><strong>Figura 6</strong>: Puntuaciones promedio de referencia de similitud semántica visual para <code>jina-embeddings-v5-omni-small</code>, <code>jina-embeddings-v5-omni-nano</code> y modelos comparables, así como sus tamaños incluyendo extensiones de visión.</p><h3>Recuperación visual de documentos</h3><p><code>jina-embeddings-v5-omni-small</code> es competitivo con modelos de tres y siete mil millones de parámetros, mientras se mantiene por debajo de mil millones de parámetros. <code>jina-embeddings-v5-omni-nano</code> destaca igualmente por su tamaño y supera a modelos diez a sesenta veces más grandes.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltcbabd1477ec3459c/6a17e890e317912a242d5806/cde672f18de8f4a30dd81938b08bb06e08444be0-1223x905.png" alt="Un gráfico de barras y líneas compara las puntuaciones ViDoRe seleccionadas y los tamaños de parámetros para múltiples modelos de incrustación, donde LCO-Embedding-Omni-7B alcanza la puntuación más alta y laion/CLIP-ViT-bigG-14 tiene el tamaño de modelo más grande. El enfoque está en dos modelos de jina-embeddings." /><p><strong>Figura 7</strong>: Puntuaciones medias <a href="https://huggingface.co/spaces/vidore/vidore-leaderboard">de ViDoRe</a> en la recuperación visual de documentos en seis referencia: <em>DocVQA</em>, <em>InfoVQA</em>, <em>ShiftProj</em>, <em>SynAI</em>, <em>Tabfquad</em> y <em>TatDQA</em>.</p><h3>Recuperación de audio</h3><p>En las referencias estándar de recuperación de audio MAEB (Massive Audio Embedding Benchmark), tanto <code>jina-embeddings-v5-omni-small</code> como <code>jina-embeddings-v5-omni-nano</code> se clasifican entre los mejores rendimientos. Solo modelos muy grandes —más de tres veces más grandes que <code>jina-embeddings-v5-omni-small</code> — superaban su puntuación.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt80f517c1c0230031/6a17e892dbb4ff8498fb56ee/a8c896bbbd710026c7b053e38af460194e7730a6-1650x912.png" alt="Un gráfico de barras y de líneas compara los modelos de embedding y de audio a lo largo del eje x; las barras azules muestran la puntuación MAEB en el eje y izquierdo y una línea roja muestra el tamaño del modelo, en miles de millones de parámetros, en el eje y derecho. Las barras varían de aprox. 20 a 55, y la línea varía de 0 a 10." /><p><strong>Figura 8</strong>: Puntuación media para varios modelos en las referencias de recuperación de audio MAEB.</p><p>Aunque el modelo <code>larger_clap_general</code> de LAION mejora el puntaje de jina-embeddings-v5-omni-nano con menos parámetros, es un modelo solo de audio sin ninguna de las características multimodales adicionales de la suite v5-omni.</p><h3>Video</h3><p>En video, <code>jina-embeddings-v5-omni-small</code> sobresale en encontrar el lugar en un video que coincida con una búsqueda de texto. Las pruebas Charades-STA y MomentSeeker son las referencias estándar para esta tarea, y puedes ver en los gráficos a continuación que <code>jina-embeddings-v5-omni-small</code> es el que obtuvo la puntuación más alta entre los modelos de peso abierto comparables, a pesar de tener un tamaño mucho más pequeño.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltc8d7e7570b64d45a/6a17e8944b055d34e643221b/a2d7744d39fefb6b8b1f66e5b3f227828ef4ad4e-1350x672.png" alt="Un gráfico de barras y líneas muestra las puntuaciones de Charades‑STA y los tamaños de modelo para seis modelos de incrustación. El eje x enumera los modelos, el eje y izquierdo muestra las puntuaciones de Charades-STA de 20 a 60, y el eje y derecho muestra el tamaño del modelo en miles de millones de parámetros de 0 a 10. Las barras azules representan las puntuaciones, y una línea roja con marcadores representa los tamaños de los modelos." /><p><strong>Figura 9</strong>: puntuaciones de Charades-STA para varios modelos, junto con sus tamaños.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltfbce6716a3a33ca5/6a17e89525daab2e8a08a26d/cf7578863fd509edb62c15878816d39657abc715-1550x845.png" alt="Un gráfico de barras y líneas compara seis modelos de incrustación al usar puntuaciones de MomentSeeker y el tamaño del modelo. El eje x enumera los modelos, el eje y izquierdo muestra las puntuaciones de MomentSeeker de aproximadamente 44 a 60, y el eje y derecho muestra el tamaño del modelo en miles de millones de parámetros de 0 a 10. Las barras azules representan las puntuaciones, y una línea roja con marcadores representa los tamaños de los modelos." /><p><strong>Figura 10</strong>: puntuaciones de MomentSeeker para varios modelos, junto con sus tamaños.</p><p>También comparamos <code>jina-embeddings-v5-omni-small</code> con <a href="https://seed.bytedance.com/en/blog/built-on-seed1-6-flash-seed-1-6-embedding-launched">Seed 1.6</a> de ByteDance, un modelo de peso cerrado con un número de parámetros no revelado. Nuestro modelo supera ampliamente a Seed 1.6 en la referencia de Charades-STA y casi lo iguala en MomentSeeker.</p><p>Modelo</p><p>Puntuación Charades-STA</p><p>Puntuación MomentSeeker</p><p>seed-1.6-embedding</p><p>29.30</p><p>59.30</p><p>jina-embeddings-v5-omni-small</p><p>55.57</p><p>58.93</p><h2>Fortalezas y limitaciones</h2><p><code>jina-embeddings-v5-omni</code> los modelos amplían la capacidad de los usuarios para indexar, buscar y analizar información digitalizada de varias maneras, particularmente:</p><ul><li><p>Recuperación de voz multilingüe a partir de búsquedas de texto.</p></li><li><p>PDF, escaneos y búsqueda visual de documentos.</p></li><li><p>Localización temporal de videos, es decir, identificar partes de videos que coinciden con descripciones de texto en lenguaje natural.</p></li><li><p>Clasificación de géneros de audio, incluyendo géneros musicales.</p></li><li><p>Clasificación de imágenes basada en información de escena e identificación de objetos.</p></li></ul><p>El rendimiento es más limitado en algunas otras áreas. Puede que sea posible usar <code>jina-embeddings-v5-omni</code> para realizar estas tareas, pero no nos capacitamos para ellas y los resultados pueden ser pobres.</p><p>Estamos trabajando activamente en mejorar nuestra tecnología en estas áreas:</p><ul><li><p>Encontrar videos específicos a partir de descripciones en lenguaje natural.</p></li><li><p>Similitud semántica de imagen a imagen y recuperación.</p></li><li><p>Clasificación de intención en la voz, como el reconocimiento de comandos verbales.</p></li><li><p>Procesamiento de entradas de medios mixtos, es decir, imágenes y texto acompañantes, o audio, imágenes y textos combinados.</p></li></ul><h2>Usando <strong>jina-embeddings-v5-omni</strong></h2><p>Esta suite de modelos admite la entrada a través de tres puntos de entrada: texto, audio e imágenes y video juntos. <code>jina-embeddings-v5-omni</code> se ejecuta dentro de un marco de trabajo que convierte una amplia gama de formatos estándar y realiza otros preprocesamientos.</p><p>Procesamos imágenes usando el mismo <a href="https://arxiv.org/abs/2502.14786">enfoque de NaFlex</a> de la versión inicial de Siglip2: si la entrada es menor que 262,144 píxeles (equivalente a 512x512), se ampliará hasta que sea mayor que ese mínimo; y si es mayor que 3,072,000 píxeles, entonces se reduce hasta que sea menor que ese máximo. El proceso de conversión garantiza que tanto la altura como el ancho de la imagen sean múltiplos de 14 píxeles, con la menor distorsión posible de la relación de aspecto para lograr ese objetivo. El resultado se divide en mosaicos de 28x28 píxeles, por lo que el número total de mosaicos es la cantidad de cuadrados de 28x28 necesarios para cubrir la imagen. Cada parche se trata como un solo token en el momento de la inferencia, y cada entrada de imagen va acompañada de tokens especiales de inicio y fin para delimitar una sola imagen.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltf192cdba41155257/6a17e897abe0f2faaedfea2a/5ab7a8951780afdfe6eda9dca14add0375ae36bd-668x130.png" alt="Un cuadro de notificación rectangular con un fondo azul claro muestra un icono de triángulo de advertencia amarillo junto al texto que explica que jina‑embeddings‑v5‑omni fue entrenado para encontrar audio, video e imágenes a partir de búsquedas de texto y que las búsquedas no textuales pueden ser menos efectivas." /><p>Los modelos <code>jina-embeddings-v5-omni</code> modifican la resolución del video de la misma manera que se modifican las imágenes (ver arriba) y extraemos hasta 32 fotogramas del video. Si el video tiene más de 32 fotogramas (lo cual es probable, ya que los formatos estándar suelen ser de al menos 24 fotogramas por segundo), espaciamos uniformemente los fotogramas que extraemos. Luego, por cada dos fotogramas, el preprocesador de video genera un conjunto de tokens igual al número de cuadrados de 28x28 necesarios para cubrir el video.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt0acd4ddd95a66a53/6a17e898445de966214d0176/a38491c1cc47cfc65344c786e8ab57b9abf67e0b-1999x851.png" alt="Un collage de fotogramas de video secuenciales está organizado con flechas que muestran la progresión, que representan una serie de escenas con Audrey Hepburn en diferentes momentos, y terminan con un fotograma que muestra la tarjeta de título “Breakfast at Tiffany's”. El diseño muestra que el modelo extrae 64 fotogramas espaciados uniformemente de un video, lo que puede causar una pérdida significativa de contenido cuando el video es largo." /><p><strong>Figura 11:</strong> <code>jina-embeddings-v5-omni</code> extrae 32 fotogramas equidistantes del video. Si tienes un video largo, esto significa que se perderá mucho.</p><p>Para obtener más detalles sobre el preprocesamiento de video, consulta la <a href="https://arxiv.org/abs/2502.14786">documentación técnica de SigLip2</a>.</p><p>La tokenización de audio sigue el enfoque integrado en Qwen-2.5-Omni: Los archivos de audio se cortan en segmentos de 30 segundos; si duran más de 30 segundos, se remuestrean a 16 kHz y se transforman en un espectrograma Mel de 128 canales. Cada 40 ms se considera un solo token, así que cada segmento de 30 segundos se maneja como 750 tokens: un token por cada 40 ms de audio, más tokens especiales de inicio y fin para delimitar una sola muestra.</p><p>Para más detalles sobre el preprocesamiento de audio, consulta el <a href="https://arxiv.org/abs/2503.20215">reporte técnico de Qwen-2.5-Omni</a>.</p><h2>Disponibilidad</h2><p>Tanto <code>jina-embeddings-v5-omni-small</code> como <code>jina-embeddings-v5-omni-nano</code> están disponibles en el <a href="https://www.elastic.co/docs/explore-analyze/elastic-inference/eis">Servicio de inferencia de Elastic</a> (EIS), a través de la <a href="https://jina.ai/embeddings">API de Jina</a> y para instalación local mediante descarga (<a href="https://huggingface.co/jinaai/jina-embeddings-v5-omni-small"><code>small</code></a> y <a href="https://huggingface.co/jinaai/jina-embeddings-v5-omni-nano"><code>nano</code></a>). Los pesos del modelo se distribuyen libremente para probar bajo una licencia no comercial. Ponte en contacto con <a href="https://www.elastic.co/contact?pg=global&amp;plcmt=nav&amp;cta=205352">Ventas de Elastic</a> para uso comercial.</p><h2>Primeros pasos</h2><p>Para usar <code>jina-embeddings-v5-omni</code> para texto, puedes integrar usando el campo <code>semantic_text</code> igual que con <code>jina-embeddings-v5-text</code>. Solo tienes que poner la <code>inference_id</code> en <code>.jina-embeddings-v5-omni-small</code> o <code>.jina-embeddings-v5-omni-nano</code>. Consulta la <a href="https://www.elastic.co/docs/reference/elasticsearch/mapping-reference/semantic-text-how-tos">Guía de referencia</a> para las instrucciones.</p><p>Para incrustar otros medios con <code>jina-embeddings-v5-omni</code>, tienes que <a href="https://www.elastic.co/docs/api/doc/elasticsearch/operation/operation-inference-embedding">usar la API de inferencia</a>. Por ejemplo:</p>POST _inference/embedding/.jina-embeddings-v5-omni-small
{
  "input": [
    {
      "content": { 
        "type": "image", 
        "format": "base64", 
        "value": "data:image/jpeg;base64,..." 
      } 
    }, 
    { 
      "content": { 
        "type": "text", 
        "value": "Some text to create an embedding" 
      } 
    } 
  ] 
}<p>Para <code>jina-embeddings-v5-omni-nano</code>, cambia el URI de <code>POST</code> a <code>_inference/embedding/.jina-embeddings-v5-omni-nano</code>.</p><p>Para codificar documentos en otros formatos o generar incrustaciones para la clasificación o el agrupamiento, debes <a href="https://www.elastic.co/docs/api/doc/elasticsearch-serverless/operation/operation-inference-put-jinaai"><u>crear un endpoint de inferencia con el servicio </u></a><u><code>jinaai</code></u><a href="https://www.elastic.co/docs/api/doc/elasticsearch-serverless/operation/operation-inference-put-jinaai"></a>.</p><p>Para las búsquedas, usa el generador de búsquedas como en el ejemplo que aparece a continuación. Sustituye el valor <code>inference_id</code> por <code>.jina-embeddings-v5-omni-nano</code> para usar el modelo <code>nano</code> en lugar de <code>small</code>.</p>POST my-index/_search
{
  "knn": {
    "field": "dense-vector-field",
    "k": 10,
    "num_candidates": 100,
    "query_vector_builder": {
      "embedding": {
        "inference_id": ".jina-embeddings-v5-omni-small",
        "input": {
          "type": "image",
          "format": "base64",
          "value": "data:image/jpeg;base64,..."
        }
      }
    }
  }
}<p>Consulta la <a href="https://www.elastic.co/docs/reference/query-languages/query-dsl/query-dsl-knn-query#knn-query-builder-embedding">documentación sobre el generador de búsquedas</a> para obtener más información.</p><p>Para usar BBQ con <code>jina-embeddings-v5-omni</code>, sigue<a href="https://www.elastic.co/docs/reference/elasticsearch/mapping-reference/bbq"> las instrucciones para la indexación de BBQ</a>.</p><h2>Más información</h2><p>Para obtener más información sobre <code>jina-embeddings-v5-omni</code>, consulte el <a href="https://arxiv.org/html/2605.08384v2">reporte técnico</a> y la página del modelo en el <a href="https://jina.ai/models/">sitio web de Jina AI</a>. La <a href="https://huggingface.co/collections/jinaai/jina-embeddings-v5-omni">página de la colección jina-embeddings-v5-omni en Hugging Face</a> también contiene información técnica e instrucciones para descargar y ejecutar estos modelos localmente. Los modelos de <code>jina-embeddings-v5-omni</code> pueden descargarse con una licencia <a href="https://creativecommons.org/licenses/by-nc/4.0/deed.en">CC-BY-NC-4.0</a>, por lo que puedes probarlos libremente, pero, para uso comercial, ponte en contacto con el departamento de ventas de Elastic.</p>]]></content:encoded>
    <link>https://www.elastic.co/search-labs/blog/jina-embeddings-v5-omni-all-media-one-index</link>
    <guid isPermaLink="true">https://www.elastic.co/search-labs/blog/jina-embeddings-v5-omni-all-media-one-index</guid>
    <category><![CDATA[Jina AI]]></category>
    <dc:creator><![CDATA[Scott Martens]]></dc:creator>
    <enclosure url="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt61bf5ce9de247ac5/6a17e89a7b54f9f4108b390f/b51e488ba5b90bec77f75af0b9cb4f0e25e20b91-1130x635.png" length="0" type="image/png"/>
    <pubDate>Mon, 11 May 2026 00:00:00 GMT</pubDate>
  </item>
  <item>
    <title><![CDATA[jina-embeddings-v5-text: incrustaciones de texto compactas y de última generación para aplicaciones de búsqueda e inteligentes]]></title>
    <description><![CDATA[Introducimos los modelos jina-embeddings-v5-text, lo que incluye jina-embeddings-v5-text-small y jina-embeddings-v5-text-nano, y explicamos cómo usar estos modelos de incrustación multilingüe a través del Elastic Inference Service (EIS).]]></description>
    <content:encoded><![CDATA[<p>Jina AI y Elastic están lanzando <code>jina-embeddings-v5-text</code>, una familia de nuevos modelos compactos de incrustación de texto de alto rendimiento con un rendimiento de última generación para modelos de tamaño comparable en todos los tipos de tareas principales.</p><p>La familia incluye dos modelos:</p><ul><li><p><code>jina-embeddings-v5-text-small</code></p></li><li><p><code>jina-embeddings-v5-text-nano</code></p></li></ul><p>Estos modelos son el resultado exitoso de una receta de entrenamiento innovadora para modelos de incrustación. Ambos superan a modelos varias veces más grandes, lo que genera ahorros en memoria y recursos informáticos y responde más rápido a las solicitudes.</p><p>El modelo <code>jina-embeddings-v5-text-small</code> tiene 677 millones de parámetros, admite una ventana de contexto de entrada de 32 768 tokens y produce incrustaciones de 1024 dimensiones por defecto.</p><p><code>jina-embeddings-v5-text-nano</code> Pesa aproximadamente un tercio del tamaño de su hermano, con 239 millones de parámetros y una ventana de contexto de entrada de 8192 tokens, lo que produce incrustaciones compactas de 768 dimensiones.</p><p>Nombre del modelo</p><p>Tamaño total</p><p>Tamaño de la ventana de contexto de entrada</p><p>Tamaño de incrustación</p><p>jina-v5-text-small</p><p>677M parámetros</p><p>32768 tokens</p><p>1024 dimensiones</p><p>jina-v5-text-nano</p><p>239M parámetros</p><p>8192 tokens</p><p>768 dimensiones</p><p>Estos dos modelos son los mejores en su categoría en cuanto al rendimiento general en la evaluación comparativa MMTEB (<a href="https://huggingface.co/spaces/mteb/leaderboard">MTEB multilingüe</a>). Entre los modelos con menos de 500 millones de parámetros, <code>jina-embeddings-v5-text-nano</code> es el de mejor rendimiento, a pesar de tener menos de 250 millones de parámetros, y el modelo <code>jina-embeddings-v5-text-small</code> es el líder entre los modelos de incrustación multilingüe con menos de 750 millones de parámetros.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltb2f2be8618f5e240/6a17dbb83e9e45b7f3ba1344/d97126285fa196c3045b1913b7754e4b186c1e4c-1300x1100.png" alt="Puntajes de jina-embeddings-v5-text MMTEB" /><p>Estos modelos están disponibles a través del Elastic Inference Service (EIS), mediante una API en línea y están disponibles para alojamiento local. Para obtener instrucciones sobre cómo acceder a los modelos <code>jina-embeddings-v5-text</code>, consulta la sección “<strong>Primeros pasos</strong>” a continuación.</p><p>Los modelos de incrustación y la indexación semántica aumentan considerablemente la precisión de los algoritmos de búsqueda, pero también tienen otros usos para tareas relacionadas con la similitud semántica y la extracción de significado, por ejemplo:</p><ul><li><p>Búsqueda de textos duplicados.</p></li><li><p>Reconocimiento de paráfrasis y traducciones.</p></li><li><p>Descubrimiento de temas.</p></li><li><p>Motores de recomendación.</p></li><li><p>Análisis de sentimiento e intención.</p></li><li><p>Filtrado de spam.</p></li><li><p>Y muchos otros.</p></li></ul><h2><strong>Características</strong></h2><p>Esta nueva familia de modelos cuenta con varias características diseñadas para mejorar la relevancia y reducir costos.</p><h3>Optimización de tareas</h3><p>Optimizamos los modelos <code>jina-embeddings-v5-text</code> para cuatro tipos generales de tareas:</p><p>Tarea</p><p>Ejemplos de casos de uso</p><p>Recuperación</p><p>Buscar con consultas en lenguaje natural y recuperar las coincidencias más relevantes en una colección de documentos.</p><p>Coincidencia de texto</p><p>Similitud semántica, deduplicación, paráfrasis y alineación de traducciones, y mucho más.</p><p>Agrupación</p><p>Descubrimiento de temas, organización automática de colecciones de documentos.</p><p>Clasificación</p><p>Categorización de documentos, detección de sentimientos e intenciones, tareas similares.</p><p>La optimización para una tarea suele implicar tener que renunciar a otra, por lo que la mayoría de los modelos de incrustación solo tienen un rendimiento competitivo para un tipo de tarea. Pero los modelos <code>jina-embeddings-v5-text</code> pueden especializarse en las cuatro áreas sin comprometer el entrenamiento de <a href="https://arxiv.org/abs/2106.09685">adaptadores de Low-Rank Adaptation (LoRA)</a> específicos para cada tarea.</p><p>Los adaptadores de LoRA son un tipo de plugin para un modelo de AI que cambia drásticamente su comportamiento y solo aumenta ligeramente el tamaño total. En lugar de tener un modelo completo para cada tarea, cada uno con cientos de millones de parámetros, la familia de modelos <code>jina-embeddings-v5-text</code> te permite usar solo un modelo con un adaptador de LoRA compacto para cada tarea. Esto ahorra memoria, espacio de almacenamiento y costos de inferencia.</p><h3>Incrustaciones truncadas</h3><p>Entrenamos los modelos <code>jina-embeddings-v5-text</code> utilizando <a href="https://arxiv.org/abs/2205.13147">Aprendizaje de representación de Matryoshka</a>, que te permite reducir tus incrustaciones a tamaños más pequeños con un costo mínimo para su calidad.</p><p>Por defecto, <code>jina-embeddings-v5-text-small</code> genera vectores de incrustación de 1024 dimensiones, cada uno representado por un número de 16 bits, lo que hace que cada incrustación tenga 2 KB de tamaño. En el caso de una gran colección de documentos, esto puede suponer una gran cantidad de datos que almacenar, y la búsqueda en una base de datos vectorial llena de incrustaciones es proporcional tanto al tamaño de la base de datos como al número de dimensiones que tiene cada vector almacenado.</p><p>Pero puedes simplemente reducir a la mitad el tamaño de las incrustaciones (desechar 512 de las 1024 dimensiones) y ocupar la mitad del espacio mientras duplicas las velocidades de búsqueda. Esto tiene un impacto en el rendimiento. Eliminar parte de la información reduce la precisión. Sin embargo, como muestra el grafo siguiente, incluso al eliminar la mitad de la incrustación, el rendimiento solo se reduce ligeramente:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt8deea6ee69a6b77d/6a17dbba0b0bed2217dd347e/f11969682c81bcf22b5b29a6204ba6ec40471b3d-900x700.png" alt="Tamaño de incrustación de jina-embeddings-v5-text-small y jina-embeddings-v5-text-nano" /><p>Siempre y cuando tus incrustaciones tengan al menos 256 dimensiones, la pérdida de precisión debería ser bastante pequeña. Sin embargo, por debajo de ese nivel, la relevancia y la precisión se deterioran rápidamente.</p><p>Las incrustaciones truncadas como esta permiten a los usuarios gestionar sus propias compensaciones entre precisión y costos de computación. Te dan las herramientas para obtener grandes ganancias de eficiencia y grandes ahorros de costos de tu AI de búsqueda.</p><h3>Cuantización robusta</h3><p><em>La cuantización </em>es otra forma de reducir el tamaño de las incrustaciones. En lugar de desechar parte de cada incrustación, la cuantización reduce la precisión de los números en la incrustación. Los modelos <code>jina-embeddings-v5-text</code> generan incrustaciones con números de 16 bits, pero podemos redondear esos números, reduciendo su precisión y la cantidad de bits necesarios para almacenarlos. En el caso más extremo, podemos reducir cada número a un bit (0 o 1), comprimiendo las incrustaciones predeterminadas de 1024 dimensiones <code>jina-embeddings-v5-text</code>de 2 kilobytes a 128 bytes, una reducción del 94 % solo por cuantización binaria. Al igual que para el truncamiento, esto produce grandes ahorros en memoria y costos de computación. Sin embargo, al igual que el truncamiento, la cuantización reduce la precisión de las incrustaciones.</p><p>Entrenamos los modelos de <code>jina-embeddings-v5-text</code> para que funcionen con <a href="https://www.elastic.co/docs/reference/elasticsearch/mapping-reference/bbq">Better Binary Quantization</a> de <a href="https://www.elastic.co/es/elasticsearch">Elasticsearch</a> al minimizar esa pérdida de precisión, y las pruebas de evaluación comparativa de incrustaciones binarizadas de estos modelos muestran un rendimiento casi igual al de sus equivalentes no binarizados. Consulta <a href="https://arxiv.org/abs/2602.15547">el reporte técnico</a> para obtener estudios detallados sobre el rendimiento de la binarización.</p><h3>Rendimiento multilingüe</h3><p>Muchos modelos de incrustación son multilingües porque se entrenaron con materiales que incluyen un gran número de idiomas. Pero eso no significa que todos funcionen igual de bien en todos los idiomas compatibles.</p><p>Identificamos 211 idiomas en la evaluación comparativa multilingüe MMTEB y los separamos para poder comparar nuestros modelos con modelos similares idioma por idioma. La imagen de abajo resume nuestros resultados como un mapa de calor. Cada parche es un idioma (identificado por su código ISO-639), y cuanto más verde sea, mejor rendimiento tuvo el modelo en comparación con el promedio de modelos similares:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltee08033102f46c4f/6a17dbbc420229503229f4c8/852ac5d0f1977bb0c1124d87f8863a9bb94eb7da-1600x765.png" alt="Idiomas de jina-embeddings-v5-text-nano y jina-embeddings-v5-text-small en la evaluación comparativa multilingüe MMTEB" /><p>Aunque la precisión varía entre idiomas, los modelos <code>jina-embeddings-v5-text</code> son de última generación o casi lo son en la mayoría de los idiomas del mundo.</p><p>Para obtener detalles sobre el rendimiento multilingüe, consulta el<a href="https://arxiv.org/abs/2602.15547"> reporte técnico</a> <a href="https://arxiv.org/abs/2602.15547"><code>jina-embeddings-v5-text</code></a>.</p><h2><strong>Jina en Elastic: IA nativa de última generación para búsqueda</strong></h2><p>Con los modelos <code>jina-embeddings-v5-text</code> en EIS, puedes ejecutar modelos de incrustación multilingüe de alto rendimiento de forma nativa en <a href="https://www.elastic.co/es/elasticsearch">Elasticsearch</a>, con inferencia totalmente gestionada y acelerada por GPU y sin infraestructura para aprovisionar o escalar. Los modelos <code>jina-embeddings-v5-text</code> amplían el creciente catálogo de modelos EIS con modelos compactos y multilingües impulsados por los últimos desarrollos en AI. Estos modelos tienen un rendimiento de última generación en recuperación de información y análisis de datos estándar, y ofrecen un soporte multilingüe inigualable que abarca todo el globo.</p><p>Con dos modelos de tamaños muy diferentes, los usuarios pueden determinar cuál es el más adecuado para sus aplicaciones y presupuestos. Además, con incrustaciones sólidas que siguen siendo eficientes cuando se truncan a tamaños más pequeños o se cuantifican con menor precisión, los modelos <code>jina-embeddings-v5-text </code>ofrecen oportunidades para ahorros concretos adicionales en costos de almacenamiento y computación, así como en latencia de procesamiento.</p><p>Con la familia <code>jina-embeddings-v5-text</code> , Jina Reranker y la rápida búsqueda vectorial y BM25 de Elastic, los usuarios ahora tienen acceso a <a href="https://www.elastic.co/docs/solutions/search/hybrid-search">la búsqueda híbrida</a> de última generación de extremo a extremo de Elastic. Cuando necesitas los resultados más relevantes, ya sea para pipelines de Retrieval-Augmented Generation (RAG), aplicaciones de búsqueda o análisis de datos, Elastic con modelos de AI de búsqueda Jina ofrece una calidad estable y rentable.</p><h2><strong>Primeros pasos</strong></h2><p>Los modelos <code>jina-embeddings-v5-text</code> están completamente integrados en <a href="https://www.elastic.co/docs/explore-analyze/elastic-inference/eis">EIS</a> y puedes usarlos al configurar el campo<strong><code>type</code></strong>en<strong><code>semantic_text</code></strong> al crear tu índice y especificar el modelo (<code>jina-embeddings-v5-text-small</code> o <code>jina-embeddings-v5-text-nano</code>) en el campo <code>inference_id</code>, como en este ejemplo:</p>PUT multilingual-semantic-index
{
  "mappings": {
    "properties": {
      "content": {
        "type": "semantic_text",
        "inference_id": ".jina-embeddings-v5-text-small"
      }
    }
  }
}

# Ingest data about France
POST multilingual-semantic-index/_doc
{
  "content": "The capital of France is Paris"}

GET multilingual-semantic-index/_search
{
  "query": {
    "semantic": {
      "field": "content",
      "query": "What is the French capital?"
    }
  }
}<p><a href="https://www.elastic.co/es/elasticsearch">Elasticsearch</a> selecciona automáticamente el adaptador de LoRA adecuado durante la indexación y la recuperación. Las dimensiones de incrustación (consulta la sección “<strong>Incrustaciones truncadas</strong>” anterior) se pueden establecer al <a href="https://www.elastic.co/docs/api/doc/elasticsearch/operation/operation-inference-put">crear un endpoint de inferencia personalizado</a>.</p><p>Consulta la <a href="https://www.elastic.co/docs/reference/elasticsearch/mapping-reference/dense-vector">documentación de Elasticsearch</a> para obtener más información sobre el uso de modelos <strong><code>jina-embeddings-v5-text</code></strong> .</p><h2><strong>Más información</strong></h2><p>Para obtener más información sobre los modelos <code>jina-embeddings-v5-text</code>, lee las <a href="https://jina.ai/news/jina-embeddings-v5-text-distilling-4b-quality-into-sub-1b-multilingual-embeddings/">notas de lanzamiento en el blog de Jina AI</a> y el <a href="https://arxiv.org/abs/2602.15547">reporte técnico</a>, con información técnica más detallada sobre el rendimiento y el nuevo procedimiento de entrenamiento innovador de Jina AI. Para obtener información sobre cómo descargar y ejecutar estos modelos localmente, visita la <a href="https://huggingface.co/collections/jinaai/jina-embeddings-v5-text"><code>jina-embeddings-v5-text</code></a><a href="https://huggingface.co/collections/jinaai/jina-embeddings-v5-text"> página de la colección</a> en Hugging Face.</p><p>Los modelos de Jina AI están disponibles bajo <a href="https://spdx.org/licenses/CC-BY-NC-4.0">una licencia CC-BY-NC-4.0</a>, así que puedes descargarlos y probarlos libremente, pero para uso comercial, ponte en contacto con <a href="https://www.elastic.co/contact?pg=global&amp;plcmt=nav&amp;cta=205352">Ventas de Elastic</a>.</p>]]></content:encoded>
    <link>https://www.elastic.co/search-labs/blog/jina-embeddings-v5-text</link>
    <guid isPermaLink="true">https://www.elastic.co/search-labs/blog/jina-embeddings-v5-text</guid>
    <category><![CDATA[Jina AI]]></category>
    <dc:creator><![CDATA[Scott Martens,Sofia Vasileva]]></dc:creator>
    <enclosure url="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltfd81be89ffe5b036/6a17dbbd445de9b55e4cffd1/e98dd30ab925b4bb32830228d71a1a51d02a0917-1600x840.png" length="0" type="image/png"/>
    <pubDate>Mon, 23 Feb 2026 00:00:00 GMT</pubDate>
  </item>
  <item>
    <title><![CDATA[Introducción a los modelos de Jina, su funcionalidad y usos en Elasticsearch]]></title>
    <description><![CDATA[Explora las incrustaciones multimodales de Jina, Reranker v3 y los modelos de incrustación semántica, y aprende cómo usarlos de forma nativa en Elasticsearch.]]></description>
    <content:encoded><![CDATA[<p>Jina de Elastic proporciona modelos fundamentales de búsqueda para aplicaciones y una automatización de procesos empresariales. Estos modelos proporcionan funcionalidad del núcleo para llevar la IA a las aplicaciones de Elasticsearch y a los proyectos innovadores de IA.</p><p>Los modelos de Jina se dividen en tres amplias categorías diseñadas para apoyar el procesamiento, la organización y la recuperación de información:</p><ul><li><p>Modelos de incrustación semántica</p></li><li><p>Modelos de reordenamiento</p></li><li><p>Pequeños modelos de lenguaje generativo</p></li></ul><h2>Modelos de incrustación semántica</h2><p>La idea detrás de las incrustaciones semánticas es que un modelo de IA puede aprender a representar aspectos del significado de sus entradas en términos de la geometría de espacios de alta dimensión.</p><p>Puedes pensar en una incrustación semántica como un punto (técnicamente un <em>vector</em>) en un espacio de alta dimensión. Un modelo de incrustación es una red neuronal que toma algunos datos digitales como entrada (potencialmente cualquier cosa, pero con mayor frecuencia un texto o una imagen) y genera la ubicación de un punto de alta dimensión correspondiente como un conjunto de coordenadas numéricas. Si el modelo funciona bien, la distancia entre dos incrustaciones semánticas es proporcional a la medida en que sus objetos digitales correspondientes significan lo mismo.</p><p>Para entender cómo esto es importante para las aplicaciones de búsqueda, imagina una incrustación para la palabra “perro” y una para la palabra “gato” como puntos en el espacio:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltbad74e5d8292a60e/6a17db73abe0f2114edfe8d2/802cf9bbcb82180d3fc91009f9f62027eee8f031-615x615.png" alt="" /><p>Un buen modelo de incrustación debe generar una para la palabra “felino” que esté mucho más cerca de “gato” que de “perro”, y “canino” debe tener una incrustación mucho más cercana a “perro” que de “gato”, porque esas palabras significan casi lo mismo:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltdb2b25691801a881/6a17db747b54f946d28b37a5/bce49daf9a31b8fb7ce1c6ef7ae4e8117a4e8b33-615x615.png" alt="" /><p>Si un modelo es multilingüe, esperaríamos lo mismo para las traducciones de “gato” y “perro”:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt976ba40be7776449/6a17db75be6086c2bd0045f2/ce4d030385324526cbd7539140e0e634d939371c-615x615.png" alt="" /><p>Los modelos de incrustación traducen la similitud o diferencia en el significado entre las cosas en relaciones espaciales entre incrustaciones. Las imágenes anteriores solo tienen dos dimensiones para que puedas verlas en una pantalla, pero los modelos de incrustación producen vectores con docenas o miles de dimensiones. Esto les permite codificar sutilezas de significado para textos completos y asignar un punto en un espacio que tenga cientos o miles de dimensiones para documentos de miles de palabras o más.</p><h2>Incrustaciones multimodales</h2><p>Los modelos multimodales amplían el concepto de incrustaciones semánticas a otros elementos, además de los textos, especialmente a las imágenes. Esperaríamos que una incrustación para una imagen esté cerca de una incrustación de una descripción fiel de la imagen:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt66dc8895485734ec/6a17db77b1e11318d279f155/1ac6aef5b1423e5fe4853e8a547a74e66b0885c2-615x615.png" alt="" /><p>Las incrustaciones semánticas tienen muchos usos. Entre otras cosas, puedes utilizarlos para crear clasificadores eficientes, agrupar datos y llevar a cabo una variedad de tareas, como la deduplicación de datos y la investigación de la diversidad de datos, ambas importantes para aplicaciones de big data que implican trabajar con demasiados datos para gestionarlos manualmente.</p><p>El mayor uso directo de las incrustaciones es en la recuperación de información. Elasticsearch puede almacenar objetos de recuperación con incrustaciones como claves. Las consultas se convierten en vectores de incrustación y una búsqueda devuelve los objetos almacenados cuyas claves son las más cercanas a la incrustación de la consulta.</p><p>Donde la recuperación tradicional <em>basada en vectores</em> (a veces llamada <em>recuperación de vectores dispersos</em>) utiliza vectores basados en palabras o <em>metadatos</em> en documentos y búsquedas, la <em>recuperación basada en incrustaciones</em> (también conocida como recuperación de vectores densos) utiliza significados evaluados por la IA en lugar de palabras. Esto los hace, en general, mucho más flexibles y precisos que los métodos de búsqueda tradicionales.</p><h2>Aprendizaje de representación de Matryoshka</h2><p>El número de dimensiones que tiene una incrustación y la precisión de los números que contiene tienen un impacto significativo en el rendimiento. Los espacios de muy alta dimensión y los números extremadamente de alta precisión pueden representar información muy detallada y compleja, pero exigen modelos de IA más grandes que sean más caros de entrenar y de ejecutar. Los vectores que generan requieren más espacio de almacenamiento y se necesitan más ciclos de computación para calcular las distancias entre ellos. El uso de modelos de incrustación semántica implica hacer compensaciones importantes entre la precisión y el consumo de recursos.</p><p>Para maximizar la flexibilidad para los usuarios, los modelos de Jina se entrenan con una técnica llamada <a href="https://arxiv.org/abs/2205.13147">Aprendizaje de representación de Matryoshka</a>. Esto hace que los modelos carguen las distinciones semánticas más importantes en las primeras dimensiones del vector de incrustación para que simplemente puedas cortar las dimensiones superiores y aún obtener un buen rendimiento.</p><p>En la práctica, esto significa que los usuarios de los modelos de Jina pueden elegir cuántas dimensiones desean que tengan sus incrustaciones. Elegir menos dimensiones reduce la precisión, pero la degradación en el rendimiento es menor. En la mayoría de las tareas, las métricas de rendimiento de los modelos de Jina disminuyen entre un 1 % y un 2 % cada vez que reduces el tamaño de la incrustación en un 50 %, hasta aproximadamente una reducción del 95 % en el tamaño.</p><h2>Recuperación asimétrica</h2><p>La similitud semántica usualmente se mide de manera simétrica. El valor que obtienes al comparar “gato” con “perro” es el mismo que el valor que obtendrías al comparar “perro” con “gato”. Pero cuando usas incrustaciones para la recuperación de información, funcionan mejor si rompes la simetría y codificas las búsquedas de manera diferente a como codificas los objetos de recuperación.</p><p>Esto se debe a la forma en que entrenamos los modelos de incrustación. Los datos de entrenamiento contienen ejemplos de los mismos elementos, como palabras, en muchos contextos diferentes, y los modelos aprenden semántica al comparar las similitudes y diferencias contextuales entre los elementos.</p><p>Entonces, por ejemplo, podríamos encontrar que la palabra “animal” no aparece en muchos de los mismos contextos que “gato” o “perro”, y por lo tanto, la incrustación para “animal” podría no estar particularmente cerca de “gato” o “perro”:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltf219074e18a6290a/6a17db78be6086cf060045f6/9a33163405af6c71ee7f4ba8ebc86af39e295a69-615x615.png" alt="" /><p>Esto hace que sea menos probable que una búsqueda de "animal" recupere documentos sobre gatos y perros, lo cual es lo opuesto a nuestro objetivo. Así que, en su lugar, codificamos "animal" de forma diferente cuando es una consulta que cuando es un objetivo para la recuperación:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt33438b4964001467/6a17db79b1e113101c79f159/363992d4f0affba7937c0c8a9f82c9a531fcd3ba-615x615.png" alt="" /><p>La <em>recuperación asimétrica</em> significa usar un modelo diferente para las búsquedas o entrenar especialmente un modelo de incrustación para codificar cosas de una manera cuando se almacenan para su recuperación y para codificar consultas de otra manera.</p><h2>Incrustaciones multivectoriales</h2><p>Las incrustaciones únicas son buenas para la recuperación de información porque se ajustan al marco de trabajo básico de una base de datos indexada: almacenamos objetos para su recuperación con un único vector de incrustación como clave de recuperación. Cuando los usuarios consultan el almacén de documentos, sus búsquedas se traducen en vectores de incrustación y los documentos cuyas claves están más cercanas a la incrustación de búsquedas (en el espacio de incrustación de alta dimensión) se recuperan como posibles coincidencias.</p><p>Las incrustaciones multivectoriales funcionan un poco diferente. En lugar de generar un vector de longitud fija para representar una búsqueda y un objeto almacenado completo, producen una secuencia de incrustaciones que representan partes más pequeñas de ellos. Las partes suelen ser tokens o palabras para textos y son mosaicos de imagen para datos visuales. Estas incrustaciones reflejan el significado de la parte en su contexto.</p><p>Por ejemplo, considera estas oraciones:</p><ul><li><p>Ella tenía un corazón de oro.</p></li><li><p>Ella cambió de opinión con el corazón.</p></li><li><p>Ella tuvo un ataque al corazón.</p></li></ul><p>Superficialmente, se ven muy similares, pero un modelo multivectorial probablemente generaría incrustaciones muy diferentes para cada instancia de "corazón", representando cómo cada una significa algo diferente en el contexto de la oración completa:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt5c81f089771e6029/6a17db7b7f6f157601c099ec/a33e60c8d8ee3d312bca8375ca2a8b0a0cd40ba9-615x615.png" alt="" /><p>La comparación de dos objetos a través de sus incrustaciones multivectoriales a menudo implica medir su distancia de chaflán: comparar cada parte de una incrustación multivectorial con cada parte de otra y sumar las distancias mínimas entre ellas. Otros sistemas, incluidos los Jina Rerankers que se describen a continuación, los incluyen en un modelo de IA entrenado específicamente para evaluar su similitud. Ambos enfoques suelen tener mayor precisión que la simple comparación de incrustaciones de un solo vector, ya que las incrustaciones multivectoriales contienen información mucho más detallada que las de un solo vector.</p><p>Sin embargo, las incrustaciones multivectoriales no son adecuadas para indexar. A menudo se utilizan en tareas de reclasificación, como se describe para el modelo de <code>jina-colbert-v2</code> en la siguiente sección.</p><h2>Modelos de incrustación de Jina</h2><h3>Jina embeddings v4</h3><p><a href="https://jina.ai/news/jina-embeddings-v4-universal-embeddings-for-multimodal-multilingual-retrieval/"><strong>jina-embeddings-v4</strong></a> es un modelo de incrustación multilingüe y multimodal de 3.8 mil millones (3.8×10⁹) de parámetros que admite imágenes y textos en una variedad de idiomas ampliamente utilizados. Utiliza una arquitectura novedosa para aprovechar el conocimiento visual y el conocimiento del lenguaje para mejorar el rendimiento en ambas tareas, lo que le permite sobresalir en la recuperación de imágenes y especialmente en la recuperación <a href="https://huggingface.co/tasks/visual-document-retrieval">visual de documentos</a>. Esto significa que maneja imágenes como gráficos, diapositivas, mapas, capturas de pantalla, escaneos de páginas y diagramas, tipos comunes de imágenes que a menudo contienen texto importante incrustado y que quedan fuera del alcance de los modelos de visión artificial entrenados con imágenes de escenas del mundo real.</p><p>Hemos optimizado este modelo para varias tareas diferentes a través de <a href="https://huggingface.co/docs/peft/en/package_reference/lora">adaptadores de Low-Rank Adaptation (LoRA)</a> compactos. Esto nos permite entrenar un único modelo para que se especialice en varias tareas, sin comprometer el rendimiento en ninguna de ellas, con un costo adicional mínimo en memoria o procesamiento.</p><p>Las características principales incluyen las siguientes:</p><ul><li><p>Rendimiento de vanguardia en la recuperación visual de documentos, junto con texto multilingüe e imágenes regulares que superan significativamente a modelos mucho más grandes.</p></li><li><p>El soporte para un gran tamaño de contexto de entrada: 32.768 tokens equivale aproximadamente a 80 páginas de texto en inglés a doble espacio, y 20 megapíxeles equivalen a una imagen de 4.500 x 4.500 píxeles.</p></li><li><p>Tamaños de incrustación seleccionados por el usuario, desde un máximo de 2048 dimensiones hasta 128 dimensiones. Descubrimos empíricamente que el rendimiento se degrada significativamente por debajo de ese umbral.</p></li><li><p>Soporte para ambas incrustaciones simples y multivector. En el caso de los textos, la salida multivectorial consiste en una incrustación de 128 dimensiones para cada token de entrada. Para las imágenes, produce una incrustación de 128 dimensiones para cada mosaico de 28x28 píxeles necesario para cubrir la imagen.</p></li><li><p>Optimización para la recuperación asimétrica mediante un par de adaptadores LoRA entrenados específicamente para tal fin.</p></li><li><p>Un adaptador LoRA optimizado para el cálculo de similitud semántica.</p></li><li><p>Soporte especial para lenguajes de programación informática y marcos de trabajo de TI, también a través de un adaptador LoRA.</p></li></ul><p>Desarrollamos <code>jina-embeddings-v4</code> para servir como una herramienta general y multipropósito para una amplia variedad de tareas de búsqueda común, comprensión del lenguaje natural y análisis de IA. Es un modelo relativamente pequeño teniendo en cuenta sus capacidades, pero su despliegue requiere recursos considerables y es más adecuado para su uso a través de una API en la nube o en un entorno de gran volumen.</p><h3>Jina embeddings v3</h3><p><a href="https://jina.ai/news/jina-embeddings-v3-a-frontier-multilingual-embedding-model/"><strong>jina-embeddings-v3</strong></a> es un modelo de incrustación compacto, de alto rendimiento, multilingüe y solo de texto con menos de 600 millones de parámetros. Admite hasta 8192 tokens de entrada de texto y genera incrustaciones de vector único con tamaños elegidos por el usuario, desde un valor predeterminado de 1024 dimensiones hasta 64.</p><p>Capacitamos a <code>jina-embeddings-v3</code> para una variedad de tareas de texto. No solo para la recuperación de información y la similitud semántica, sino también para tareas de clasificación, como análisis de sentimiento y moderación de contenido, así como tareas de agrupar, como agregación de noticias y recomendaciones. Al igual que <code>jina-embeddings-v4</code>, este modelo proporciona adaptadores LoRA especializados para las siguientes categorías de uso:</p><ul><li><p>Recuperación asimétrica</p></li><li><p>Similitud semántica</p></li><li><p>Clasificación</p></li><li><p>Agrupación</p></li></ul><p><code>jina-embeddings-v3</code> es un modelo mucho más pequeño que <code>jina-embeddings-v4</code> con un tamaño de contexto de entrada significativamente reducido, pero su funcionamiento cuesta menos. No obstante, tiene un rendimiento muy competitivo, aunque solo para textos, y es una mejor opción para muchos casos de uso.</p><h3>Inmercaciones del código Jina</h3><p>Los modelos especializados de incrustación de código de Jina, <a href="https://jina.ai/models/jina-code-embeddings-1.5b"><strong>jina-code-embeddings (0.5b y 1.5b)</strong></a>, admiten 15 esquemas y marcos de trabajo de programación, así como textos en inglés relacionados con la informática y la tecnología de la información. Son modelos compactos con quinientos millones (0.5x10⁹) y mil quinientos millones (1.5x10⁹) de parámetros, respectivamente. Ambos modelos admiten tamaños de contexto de entrada de hasta 32.768 tokens y permiten a los usuarios seleccionar los tamaños de su incrustación de salida, desde 896 hasta 64 dimensiones para el modelo más pequeño y 1536 hasta 128 para el modelo más grande.</p><p>Estos modelos admiten la recuperación asimétrica para cinco especializaciones específicas de tareas, mediante el <a href="https://arxiv.org/abs/2101.00190">ajuste de prefijos</a> en lugar de adaptadores LoRA:</p><ul><li><p><strong>Código a código.</strong> Recupera un código similar en todos los lenguajes de programación. Esto se utiliza para la alineación de códigos, deduplicación de códigos y soporte para la traslación y refactorización.</p></li><li><p><strong>Lenguaje natural para programar.</strong> Recupera códigos para hacer coincidir consultas, comentarios, descripciones y documentación en lenguaje natural.</p></li><li><p><strong>Código a lenguaje natural. </strong>Haz coincidir el código con la documentación u otros textos en lenguaje natural.</p></li><li><p><strong>Finalización de código a código.</strong> Sugiere un código relevante para completar o mejorar el código existente.</p></li><li><p><strong>Preguntas y respuestas técnicas.</strong> Identifica las respuestas en lenguaje natural a las preguntas sobre tecnologías de la información, que son ideales para casos de uso de soporte técnico.</p></li></ul><p>Estos modelos ofrecen un rendimiento superior para tareas relacionadas con documentación informática y materiales de programación con un costo computacional relativamente bajo. Son muy adecuados para integrarse en entornos de desarrollo y asistentes de código.</p><h3>Jina ColBERT v2</h3><p><a href="https://jina.ai/models/jina-colbert-v2"><strong>jina-colbert-v2</strong></a> es un modelo de incrustación de texto multivectorial de 560 millones de parámetros. Es multilingüe, entrenado con materiales en 89 idiomas, y soporta tamaños de incrustación variables y recuperación asimétrica.</p><p>Como se ha señalado anteriormente, las incrustaciones multivectoriales no son adecuadas para la indexación, pero resultan muy útiles para aumentar la precisión de los resultados de otras estrategias de búsqueda. Mediante <code>jina-colbert-v2</code><strong>,</strong> puedes calcular incrustaciones multivector de antemano y luego usarlas para reclasificar candidatos de recuperación al momento de la búsqueda. Este enfoque es menos preciso que usar uno de los modelos de reclasificación en la siguiente sección, pero es mucho más eficiente porque simplemente implica comparar incrustaciones multivectoriales almacenadas en lugar de invocar todo el modelo de IA para cada búsqueda y coincidencia posible. Es ideal para casos de uso en los que la latencia y la sobrecarga computacional que supone el uso de modelos de reclasificación son demasiado grandes, o cuando el número de candidatos que comparar es demasiado elevado para los modelos de reclasificación.</p><p>Este modelo genera una secuencia de incrustaciones, una por token de entrada, y los usuarios pueden seleccionar incrustaciones de token de 128, 96 o 64 dimensiones. Las coincidencias de texto de candidatos están limitadas a 8,192 tokens. Las búsquedas se codifican de manera asimétrica, por lo que los usuarios deben especificar si un texto es una búsqueda o una coincidencia candidata y deben limitar las búsquedas a 32 tokens.</p><h3>Jina CLIP v2</h3><p><a href="https://jina.ai/news/jina-clip-v2-multilingual-multimodal-embeddings-for-text-and-images/"><strong>Jina-Clip-V2</strong></a> es un modelo de incrustación multimodal de 900 millones de parámetros, y está capacitado para que los textos e imágenes produzcan incrustaciones muy cercanas si el texto describe el contenido de la imagen. Su uso principal es para recuperar imágenes basadas en consultas de textura, pero también es un modelo de solo texto de alto rendimiento, lo que reduce los costos de usuario porque no necesitas modelos separados para la recuperación de texto a texto y de texto a imagen.</p><p>Este modelo admite un contexto de entrada de texto de 8,192 tokens, y las imágenes se escalan a 512x512 píxeles antes de generar incrustaciones.</p><p>Las arquitecturas de preentrenamiento de lenguaje-imagen contrastivo (CLIP) son fáciles de entrenar y operar y pueden producir modelos muy compactos, pero tienen algunas limitaciones fundamentales. No pueden utilizar los conocimientos adquiridos en un medio para mejorar su rendimiento en otro. No pueden usar un medio para mejorar su rendimiento en otro. Así que, aunque pueda saber que las palabras "perro" y "gato" están más cercanas en significado que a "auto", no necesariamente sabrá que una foto de un perro y una de un gato están más relacionadas que cualquiera de las dos con una foto de un auto.</p><p>También sufren de lo que se llama la <em>brecha de modalidad</em>: es probable que una incrustación de un texto sobre perros esté más cerca de una incrustación de un texto sobre gatos que de una incrustación de una imagen de perros. Debido a esta limitación, te recomendamos utilizar CLIP como modelo de recuperación de texto a imagen o como modelo de solo texto, pero sin mezclar los dos en una sola búsqueda.</p><h2>Modelos de reordenamiento</h2><p>Los modelos de reclasificación toman una o más coincidencias candidatas, junto con una consulta como entrada al modelo, y las comparan directamente, produciendo coincidencias de mucha mayor precisión.</p><p>En principio, podrías usar un reranker directamente para la recuperación de información al comparar cada búsqueda con cada documento almacenado, pero esto sería muy costoso desde el punto de vista computacional y no es práctico para cualquier colección excepto para las más pequeñas. Como resultado, los rerankers tienden a usarse para evaluar listas relativamente cortas de coincidencias de candidatos encontradas por otros medios, como la búsqueda basada en incrustaciones u otros algoritmos de recuperación. Los modelos de reclasificación son ideales para esquemas de búsqueda híbridos y federados, donde realizar una búsqueda puede significar que las consultas se envían a sistemas de búsqueda separadas con conjuntos de datos distintos, cada una devolviendo resultados distintos. Funcionan muy bien al combinar resultados diversos en un único resultado de alta calidad.</p><p>La búsqueda basada en incrustaciones puede ser un gran compromiso, ya que implica reindexar todos tus datos almacenados y cambiar las expectativas del usuario sobre los resultados. Agregar un reranker a un esquema de búsqueda existente puede sumar muchos de los beneficios de la IA sin necesidad de rediseñar toda tu solución de búsqueda.</p><h2>Modelos de reordenación de Jina</h2><h3>Jina Reranker m0</h3><p><a href="https://jina.ai/models/jina-reranker-m0/"><strong>jina-reranker-m0</strong></a> es un reranker multimodal de 2.4 mil millones (2.4x10⁹) de parámetros que admite consultas textuales y coincidencias candidatas que consisten en textos y/o imágenes. Es el modelo líder en recuperación visual de documentos, lo que lo convierte en una solución ideal para almacenar archivos PDF, escaneos de texto, capturas de pantalla y otras imágenes generadas o modificadas por computadora que contengan texto u otra información semiestructurada, así como datos mixtos que consistan en documentos de texto e imágenes.</p><p>Este modelo toma una búsqueda única y una coincidencia candidata y devuelve una puntuación. Cuando la misma consulta se usa con diferentes candidatos, las puntuaciones son comparables y pueden usarse para clasificarlas. Soporta un tamaño total de entrada de hasta 10 240 tokens, incluido el texto de la consulta y el texto o imagen candidata. Cada mosaico de 28x28 píxeles necesario para cubrir una imagen cuenta como un token para calcular el tamaño de entrada.</p><h3>Jina Reranker v3</h3><p><a href="https://jina.ai/models/jina-reranker-v3/"><strong>jina-reranker-v3</strong></a> es un reranker de texto de 600 millones de parámetros con rendimiento de vanguardia para modelos de tamaño comparable. A diferencia de <code>jina-reranker-m0</code>, toma una sola búsqueda y una lista de hasta 64 candidatos coincidentes y devuelve el orden de clasificación. Tiene un contexto de entrada de 131 000 tokens, incluida la consulta y todos los candidatos de texto.</p><h3>Jina Reranker v2</h3><p><a href="https://jina.ai/models/jina-reranker-v2"><strong>jina-reranker-v2-base-multilingual</strong></a> es un reranker muy compacto y de uso general con características adicionales diseñadas para admitir llamadas a funciones y consultas SQL. Con un peso inferior a 300 millones de parámetros, proporciona una reclasificación de texto multilingüe rápido, eficiente y preciso, con soporte adicional para seleccionar tablas SQL y funciones externas que coincidan con consultas de texto, lo que lo hace adecuado para casos de uso de agentes.</p><h2>Pequeños modelos de lenguaje generativo</h2><p>Los modelos de lenguaje generativo son modelos como ChatGPT de OpenAI, Google Gemini y Claude de Anthropic que toman entradas de texto o multimedia y responden con salidas de texto. No existe una línea bien definida que separe los modelos de lenguaje <em>grandes</em> (LLM) de los modelos de lenguaje <em>pequeños</em> (SLM), pero los problemas prácticos de desarrollar, operar y utilizar LLM de primera línea son bien conocidos. Los más conocidos no se distribuyen públicamente, por lo que solo podemos estimar su tamaño, pero se espera que ChatGPT, Gemini y Claude estén en el rango de parámetros de 1 a 3 billones (1–3x10¹²).</p><p>Ejecutar estos modelos, incluso si están disponibles públicamente, está muy lejos del alcance del hardware convencional, que requiere los chips más avanzados dispuestos en grandes matrices paralelas. Puedes acceder a LLMs a través de API pagas, pero esto conlleva costos significativos, tiene una gran latencia y es difícil de alinear con las demandas de protección de datos, la soberanía digital y la repatriación en la nube. Además, los costos relacionados con la capacitación y la personalización de modelos de ese tamaño pueden ser considerables.</p><p>En consecuencia, se han realizado numerosas investigaciones para desarrollar modelos más pequeños que, aunque carecen de todas las capacidades de los LLM más grandes, pueden realizar determinados tipos de tareas con la misma eficacia y a un menor costo. Las empresas generalmente despliegan software para abordar problemas específicos, y el software de IA no es diferente, por lo que las soluciones basadas en SLM se suelen preferir a las de LLM. Por lo general, pueden ejecutarse en hardware básico, son más rápidos y consumen menos energía para ejecutarse, y son mucho más fáciles de personalizar.</p><p>Las ofertas de SLM de Jina están creciendo a medida que nos enfocamos en la mejor manera de llevar la IA a soluciones de búsqueda prácticas.</p><h2>Jina SLM</h2><h3>ReaderLM v2</h3><p><a href="https://jina.ai/models/ReaderLM-v2"><strong>ReaderLM-v2</strong></a> es un modelo de lenguaje generativo que convierte HTML en Markdown o JSON, según los esquemas JSON proporcionados por el usuario y las instrucciones en lenguaje natural.</p><p>El preprocesamiento y la normalización de datos son una parte esencial del desarrollo de buenas soluciones de búsqueda para datos digitales, pero los datos del mundo real, especialmente la información derivada de la web, suelen ser caóticos, y las estrategias de conversión simples a menudo resultan ser muy frágiles. En cambio, <code>ReaderLM-v2</code> ofrece una solución de modelo de IA inteligente que puede entender el caos de un volcado de árbol DOM de una página web e identificar de manera segura elementos útiles.</p><p>Con 1500 millones (1,5 x 10⁹) de parámetros, es tres órdenes de magnitud más compacto que los LLM de última generación, pero su rendimiento es similar al de estos en esta tarea específica.</p><h3>Jina VLM</h3><p><a href="https://jina.ai/models/jina-vlm"><strong>jina-vlm</strong></a> es un modelo de lenguaje generativo con 2400 millones (2,4 x 10⁹) de parámetros que está entrenado para responder preguntas en lenguaje natural sobre imágenes. Tiene un fuerte soporte para el análisis visual de documentos, es decir, responder preguntas sobre escaneos, capturas de pantalla, diapositivas, diagramas y datos similares de imágenes no naturales.</p><p>Por ejemplo:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt124b9932e01dcd40/6a17db7d4202291eca29f4bc/adfa1420d079ca4fd5582eef4349b1265b378e76-950x500.png" alt="" /><p>También es muy bueno para leer texto en imágenes:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt1a862a9c9a0e42ce/6a17db7fb1e1133a2979f15d/ea3956e7ad86f8e171841cab2c28c8b3498da1d4-1002x500.png" alt="" /><p>Pero donde <code>jina-vlm</code> realmente se destaca es en entender el contenido de las imágenes informativas y creadas por el hombre:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt761cf621ea32e4ae/6a17db8163baff7730741b26/f68606f9d2d99e2cd616d4ff81db3574dc4e26a5-1020x700.png" alt="" /><p>O:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt4df4d31e574df7e3/6a17db82e3179134e02d56e9/297e85e7e78f296388a02301e1e08fed70827423-1000x500.png" alt="" /><p><code>jina-vlm</code> es adecuado para la generación automática de subtítulos, descripciones de productos, texto alternativo de imágenes y aplicaciones de accesibilidad para personas con discapacidad visual. También crea posibilidades para que los sistemas de generación aumentada por recuperación (RAG) utilicen información visual y para que los agentes de IA procesen imágenes sin ayuda humana.</p>]]></content:encoded>
    <link>https://www.elastic.co/search-labs/blog/jina-models-elasticsearch-guide</link>
    <guid isPermaLink="true">https://www.elastic.co/search-labs/blog/jina-models-elasticsearch-guide</guid>
    <category><![CDATA[Integraciones]]></category>
    <category><![CDATA[Jina AI]]></category>
    <dc:creator><![CDATA[Scott Martens]]></dc:creator>
    <enclosure url="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blta03919124faf767a/6a17db84ec0f89b8fe5a64d8/407b4c862b51ebdfc7f26db4e25950a65caf1673-656x442.png" length="0" type="image/png"/>
    <pubDate>Thu, 01 Jan 2026 00:00:00 GMT</pubDate>
  </item>
  </channel>
</rss>