<?xml version="1.0" encoding="UTF-8"?>
<rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0">
  <channel>
    <title><![CDATA[Scott Martens - Elasticsearch Labs]]></title>
    <description><![CDATA[Articles and tutorials from the Search team at Elastic]]></description>
    <copyright><![CDATA[© 2026. Elasticsearch B.V. All Rights Reserved]]></copyright>
    <image>
      <title><![CDATA[Scott Martens - Elasticsearch Labs]]></title>
      <url>https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt1121c0bf0e8a6e65/6a88da6340a1841030ef456f/search-labs-thumbnail.png</url>
      <link>https://www.elastic.co/fr/search-labs/author/scott-martens</link>
    </image>
    <link>https://www.elastic.co/fr/search-labs/author/scott-martens</link>
    <atom:link href="https://www.elastic.co/fr/search-labs/rss/author/scott-martens.xml" rel="self" type="application/rss+xml"/>
    <language><![CDATA[fr]]></language>
    <lastBuildDate>Tue, 22 Sep 2026 09:38:08 GMT</lastBuildDate>
  <item>
    <title><![CDATA[On-prem en moins de 5 minutes : modèles d'embedding Jina maintenant disponibles pour un déploiement sur site]]></title>
    <description><![CDATA[Les 28 modèles de Jina AI, y compris les modèles de reclassement, sont disponibles sous forme de conteneurs Docker prêts à être déployés, sans télémétrie ni serveur de licence. Ils sont directement compatibles avec les API d'OpenAI, de Cohere, de Voyage AI et d'Elastic Inference Service.]]></description>
    <content:encoded><![CDATA[<p>Les 28 modèles d'embedding et de reclassement Jina AI sont désormais proposés sous forme de conteneurs Docker entièrement hors ligne pour un déploiement sur site, y compris <a href="https://www.elastic.co/fr/search-labs/blog/jina-embeddings-v5-omni-all-media-one-index">jina-embeddings-v5-omni</a><a href="https://www.elastic.co/fr/search-labs/blog/jina-embeddings-v5-omni-all-media-one-index"> </a>et <a href="https://www.elastic.co/fr/search-labs/tutorials/jina-tutorial/jina-reranker-v3">jina-reranker-v3</a>. Il suffit d'en télécharger un et de le transférer vers un système sur site air gap ou protégé par un pare-feu pour que l'inférence locale soit opérationnelle en moins de cinq minutes. Ces conteneurs sont totalement autonomes et n'établissent aucune connexion externe ; ils ne font appel ni à Hugging Face ni à un quelconque registre de modèles, et ne nécessitent ni serveur de licence, ni télémétrie, ni points de terminaison de logging. Pour les secteurs réglementés, les environnements soumis à des exigences de souveraineté des données ou les situations où l'accès à Internet est instable voire inexistant, cette solution élimine la dépendance vis-à-vis de services d'IA tiers. Jina On-Prem prend en charge les schémas d'Elastic Inference Service (EIS), d'OpenAI, de Cohere, de Voyage AI et de l'API Gemini ; les applications existantes fonctionnent donc sans modification du code.</p><p>Les modèles d'IA les plus puissants fonctionnent sur des infrastructures cloud distantes accessibles via une API web ; vous devez donc faire confiance à votre fournisseur de services d'IA pour garantir la sécurité, la disponibilité du service et la stabilité des tarifs. Il est difficile de concilier des exigences légitimes en matière de fiabilité, de confidentialité, de maîtrise des coûts et de bonne gouvernance des données avec une utilisation de l'IA toujours plus puissante, sophistiquée et gourmande en ressources.</p><p>Les réglementations gouvernementales, les décisions de justice et les décisions commerciales prises dans l'intérêt de tiers ont récemment conduit à restreindre l'accès à certains services. Or, même s'il est possible de se tourner vers d'autres solutions, les modèles d'IA ne sont pas des composants que l'on peut remplacer au gré de ses envies. Les applications qui exploitent les embeddings sémantiques nécessitent l'accès aux mêmes modèles lors de l'interrogation que lors de l'ingestion des données ; perdre l'accès à votre modèle d'embedding revient donc à paralyser votre système de recherche.</p><p>Les modèles de tarification de l'IA accentuent ce risque. Les récentes informations financières communiquées par les principaux fournisseurs d'IA donnent aux clients de bonnes raisons de s'inquiéter d'éventuelles hausses de prix. Le recours à des produits aux coûts imprévisibles accroît encore les risques associés à des investissements massifs dans l'IA, dont le retour sur investissement peut s'avérer aléatoire.</p><p>Jina On-Prem est la réponse d'Elastic à ces défis.</p><h2>Qui a besoin d'une IA sur site ?</h2><p>L'hébergement local et le contrôle direct de vos modèles d'IA répondent à diverses contraintes techniques, exigences sectorielles et impératifs commerciaux.</p><p>Une installation locale réduit les frais payés à vos fournisseurs de services d'IA, mais elle fait peser sur votre organisation les coûts liés au matériel et à la fiabilité de l'accès. Selon votre volume d'utilisation, cette option peut s'avérer plus économique. Toutefois, d'autres contraintes justifient d'envisager l'exploitation de votre propre système d'IA. Si l'un des problèmes décrits ci-dessous concerne votre entreprise, envisagez une solution d'IA locale telle que Jina On-Prem. Cette liste n'est pas exhaustive.</p><p>Cas d'utilisation</p><p>Pourquoi sur site</p><p>Exemple</p><p>Air gap/haute sécurité</p><p>Aucune transmission de données sortante ; isolation complète du réseau</p><p>Défense, renseignement, recherche classifiée</p><p>Conformité réglementaire</p><p>Souveraineté des données ; aucune transmission transfrontalière ni exposition à des tiers</p><p>Santé (Health Insurance Portability and Accountability Act [HIPAA]), finance, entreprises de l'UE (Règlement général sur la protection des données [RGPD])</p><p>Sensible à la latence</p><p>Dépendance réseau nulle ; aucune tolérance aux échecs de connexion</p><p>Robotique, edge computing, véhicules, navires</p><p>Prévisibilité des coûts</p><p>Coût d'infrastructure fixe vs tarification au jeton avec des tarifs futurs incertains</p><p>Charges de travail d'inférence continue à fort volume</p><p>Réduction de la responsabilité</p><p>Aucune exposition de données de tiers ; préservation de la confidentialité des communications et du devoir de diligence</p><p>Cabinets d'avocats, organismes publics</p><h3>Pourquoi les systèmes air gap et protégés par pare-feu ont besoin d'une IA sur site</h3><p>Les systèmes air gap et protégés par un pare-feu ne peuvent pas utiliser d'API d'IA externes. Jina On-Prem s'exécute entièrement au sein de votre infrastructure, sans aucune connexion sortante.</p><p>Pour les organisations qui gèrent des données particulièrement sensibles, les questions de sécurité et de confidentialité sont primordiales. Il est peu utile d'investir dans la protection de vos données sensibles si vous les confiez aussitôt à un tiers distant dont les mesures de sécurité pourraient être insuffisantes ou qui pourrait être soumis aux exigences d'un gouvernement étranger.</p><p>Les employés des organisations qui manipulent des données sensibles reçoivent souvent une formation sur la gestion sécurisée de ces données. Toutefois, cette mesure perd de son efficacité dès lors qu'ils disposent de navigateurs web susceptibles d'accéder à n'importe quelle page d'Internet pendant qu'ils traitent ces informations. L'isolation constitue la mesure de sécurité la plus efficace, qu'elle soit assurée par une séparation physique totale ou par des pare-feux très restrictifs, mais elle entrave considérablement l'utilisation de services externes, quels qu'ils soient.</p><h3>IA sur site pour les systèmes sensibles à la latence et à haute disponibilité</h3><p>Le logiciel en tant que service (SaaS) et le cloud computing constituent un compromis entre le coût lié à l'hébergement de services hautement accessibles et fiables sur vos propres infrastructures et le choix de confier cette tâche à un tiers. Toutefois, ces solutions s'accompagnent d'une latence variable, d'interruptions de service et d'une perte totale de contrôle en cas de dysfonctionnement. Les services d'IA ne font pas exception à la règle : si votre système de recherche devient indisponible parce que vous ne pouvez plus accéder à votre modèle d'embedding, ce compromis pourrait apparaître bien moins avantageux.</p><p>Par ailleurs, le recours à une IA externe comporte toujours des risques difficiles à anticiper ou à gérer. L'accès à Internet et la latence du réseau peuvent se dégrader sans préavis, sous l'effet d'événements politiques, d'intempéries ou du passage d'ancres de navires sur des câbles sous-marins à fibre optique. Les gouvernements peuvent, et l'ont fait récemment, recourir à des interdictions d'exportation pour bloquer soudainement l'accès à des modèles d'IA. Les fournisseurs de services d'IA retirent parfois certains modèles pour inciter les utilisateurs à adopter des versions plus récentes. Il convient donc de mettre en balance la flexibilité et la maîtrise des coûts qu'offrent les services externes avec les risques de dépendance qu'ils engendrent.</p><h3>IA sur site pour le respect des exigences du RGPD, de la loi HIPAA et de souveraineté des données</h3><p>Les organisations qui collectent des données personnelles sont soumises à des réglementations de plus en plus strictes qui diffèrent souvent d'une juridiction à l'autre et peuvent imposer des exigences contradictoires. Ainsi, les <a href="https://www.hhs.gov/hipaa/for-professionals/privacy/laws-regulations/index.html">règles HIPAA</a> imposent des protections des données très strictes aux prestataires de santé américains, et des législations strictes sur la protection générale des données au <a href="https://laws-lois.justice.gc.ca/eng/acts/p-8.6/">Canada</a>, dans l'<a href="https://gdpr-info.eu/">Union européenne</a> et dans de <a href="https://www.japaneselawtranslation.go.jp/en/laws/view/4241">nombreuses juridictions asiatiques</a> exigent que toutes les entreprises qui traitent des informations personnelles le fassent de manière sécurisée et limitent la transmission de ces données à des tiers ou à d'autres juridictions. Ces règles peuvent même imposer des obligations à des entités étrangères si elles comptent des clients dans ces juridictions. Les institutions financières sont souvent soumises à des règles encore plus strictes et assument, en matière de sécurité de l'information, la même responsabilité directe que celle qui leur incombe pour se prémunir contre d'autres formes d'activités criminelles.</p><p>La conformité réglementaire peut être incompatible avec les services d'IA tiers, en particulier si leur utilisation implique un transfert de données transfrontalier.</p><p>En outre, des événements récents montrent que les règles restreignant la localisation physique des espaces de stockage de données ne constituent pas nécessairement une garantie de protection fiable lorsque les fournisseurs internationaux de services cloud sont soumis à des pressions de la part de gouvernements étrangers. Les législations locales peuvent présenter des divergences d'une juridiction à l'autre, ce qui impose le stockage et le traitement des données au niveau local et rend impossible le recours à des services tiers. Dans certains cas, la seule solution consiste à internaliser l'ensemble de vos processus, y compris vos systèmes d'IA.</p><h3>Risques de responsabilité liés à la transmission de données à des tiers dans le cadre de l'IA</h3><p>Les lois sur la protection des données et les obligations de vigilance reconnues concernant les données sensibles entraînent régulièrement des conséquences en matière de responsabilité, parfois très lourdes. Vous pouvez être tenu pour responsable de la manière dont des prestataires de services tiers traitent vos données. Si les tribunaux et les procédures judiciaires peuvent offrir certaines protections a posteriori face à des prestataires peu fiables, ces recours ne sont ni disponibles ni généralement efficaces contre les acteurs de la sécurité nationale, les forces de l'ordre ou les cybercriminels.</p><p>Pour les gouvernements, des cas ont déjà été signalés où des fournisseurs de services cloud transfrontaliers ont divulgué des informations sensibles de l'État à des acteurs étrangers.</p><p>Toutefois, même si vous ne craignez ni les gouvernements étrangers ni les pirates informatiques, et que vos prestataires externes de services d'IA sont eux-mêmes sécurisés, le simple fait qu'ils soient externes peut engendrer des risques de responsabilité.</p><p>Par exemple, dans la plupart des juridictions, les communications entre avocats et clients bénéficient de protections juridiques spécifiques, et les cabinets d'avocats sont soumis à des obligations strictes concernant l'enregistrement ou le stockage de ces informations. Aux États-Unis, cette confidentialité des communications est si célèbre qu'il constitue un élément central de nombreux scénarios de films et de séries télévisées. Or, ce privilège peut être perdu si des informations sont communiquées à une personne n'étant pas couverte par ce secret ; des évolutions récentes suggèrent que les prestataires externes de services d'IA pourraient entrer dans cette catégorie.</p><p>Il est possible, du moins aux États-Unis, que le simple recours à des services d'IA tiers via une API Internet, comme l'intégration de modèles assurant des services d'indexation, enfreigne des règles de confidentialité essentielles. Un cabinet d'avocats pourrait faire l'objet de poursuites, de sanctions disciplinaires ou d'une radiation du barreau pour la simple utilisation d'un logiciel hébergé en externe, même en l'absence de toute faille de sécurité.</p><h3>IA sur site pour les systèmes hors ligne, en périphérie et physiquement isolés</h3><p>Les systèmes informatiques ne sont pas isolés uniquement pour des raisons de sécurité. Par exemple, les véhicules en déplacement ne peuvent pas dépendre d'un accès à Internet pour assurer des fonctions essentielles. Les navires et les aéronefs sont dotés de systèmes informatiques embarqués très complets qui doivent fonctionner sans connexion Internet et ne peuvent donc pas recourir à des services d'IA externes. Les plateformes offshore, les installations isolées en pleine nature, ainsi que les services informatiques situés dans l'Arctique, l'Antarctique ou sur de petites îles dépourvues de liaisons physiques adéquates avec les réseaux mondiaux, sont autant d'exemples d'installations qui tirent parti de l'hébergement local de tous les services dont elles ont besoin. À mesure que l'IA prend de l'importance dans l'informatique d'entreprise, il devient crucial de prendre en compte ces contraintes.</p><p>Les applications émergentes de l'IA aux systèmes physiques (robotique et autres cas d'utilisation confinés à un espace donné ou axés sur le monde extérieur, tels que les systèmes de gestion logistique ou même les caisses de supermarché) peuvent être connectées à l'Internet mondial, mais elles ne tolèrent ni les interruptions de connexion ni les pics de latence. Si leur fonctionnement repose sur un système d'IA, celui-ci doit être aussi local et fiable que possible.</p><h2>Qui n'a pas besoin d'une IA sur site ?</h2><p>Les services logiciels à distance et l'IA externalisée présentent des avantages. L'exécution de modèles d'IA peut nécessiter des processeurs coûteux et énergivores, dont la durée de vie est notoirement courte. L'accès à du matériel de haute qualité est particulièrement difficile à l'heure actuelle en raison de facteurs liés au marché et de chocs économiques externes. Dans ce contexte, il peut être judicieux de payer au jeton consommé pour utiliser une API externe, plutôt que de supporter les lourds investissements initiaux qu'implique une IA locale.</p><p>Les API externes constituent la solution la plus pertinente pour les utilisateurs occasionnels. Si vous exploitez des modèles d'IA principalement pour le traitement de données par lots à des fins d'analyse plutôt que pour faire fonctionner un système de recherche devant rester disponible en permanence, il est peu judicieux d'investir dans du matériel coûteux et des installations locales.</p><p>De plus, lorsque vos processus de traitement de données reposent déjà sur le cloud (comme c'est le cas, par exemple, d'un site e-commerce hébergé dans le cloud pour des raisons de fiabilité et d'accessibilité), le recours à des services d'IA intégrés à cette même infrastructure peut s'avérer plus rentable que de déployer votre propre modèle d'IA sous licence. Dans la mesure où vous dépendez déjà de votre fournisseur de services cloud, dépendre également de ses services d'IA n'ajoute pas de risque significatif.</p><p>Si votre cas d'utilisation correspond à cette description, les modèles Jina AI sont disponibles sur <a href="https://www.elastic.co/docs/explore-analyze/elastic-inference/eis">EIS</a>, <a href="https://aws.amazon.com/marketplace/seller-profile?id=seller-stch2ludm6vgy">AWS Marketplace</a> et <a href="https://console.cloud.google.com/marketplace/browse?q=jina">Google Cloud Platform</a> spécifiquement pour répondre à vos besoins.</p><p>Le tableau ci-dessous résume les facteurs clés. Votre réponse dépend de vos données, de votre infrastructure et de votre modèle d'utilisation.</p><p>Facteur</p><p>Sur site privilégié</p><p>API Cloud privilégiée</p><p>Modèle d'utilisation</p><p>Inférence continue ou à volume élevé</p><p>Traitement intermittent ou par lots</p><p>Sensibilité des données</p><p>Réglementées, souveraines ou classifiées</p><p>Aucune restriction transfrontalière ou liée à des tiers</p><p>Environnement réseau</p><p>Air gap, protégé par un pare-feu ou peu fiable</p><p>Internet stable et permanent</p><p>Infrastructure existante</p><p>Disposer de matériel GPU ou pouvoir s'en procurer</p><p>Déjà hébergé dans le cloud avec une IA en colocation</p><p>Modèle de coût</p><p>Matériel fixe + licence ; prévisible à grande échelle</p><p>Au jeton ; plus faible au départ, variable à long terme</p><p>Tolérance à la latence</p><p>Aucune (robotique, périphérie, temps réel)</p><p>La variabilité du réseau est acceptable</p><p>Responsabilité opérationnelle</p><p>Votre équipe gère le matériel et la disponibilité</p><p>Le fournisseur gère le matériel et les mises à jour ; vous gérez l'intégration</p><p>Vous devez évaluer les coûts et les avantages au regard de votre situation et de vos cas d'utilisation spécifiques, en tenant compte des points soulevés dans la section précédente qui vous concernent. Cette analyse coûts-avantages évoluera sans aucun doute avec le temps. Il est impossible de prédire l'avenir du secteur de l'IA ou l'évolution des prix du matériel, même à court terme.</p><h2>Présentation de Jina On-Prem</h2><p>Pour les utilisateurs pouvant tirer parti de services d'IA locaux, nous lançons <a href="https://github.com/jina-ai/jina-on-prem/wiki/">Jina On-Prem</a>, une suite d'installation entièrement autonome pour les modèles haute performance de Jina AI.</p><p>Les modèles de Jina AI égalent la précision de modèles d'embedding <a href="https://mteb-leaderboard.hf.space/benchmark/MTEB(Multilingual%2C%20v2)">bien plus volumineux</a>, tout en réduisant les coûts de calcul, l'empreinte mémoire et les besoins matériels. Ils sont ainsi le choix idéal pour les utilisateurs qui souhaitent ou doivent héberger leur IA sur site. Des licences commerciales sont disponibles avec des solutions scalables dont le tarif est proportionnel à l'utilisation afin de répondre aux cas d'utilisation de toute envergure.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt190865fb3ebde472/6a6a33d0065b162508701ff9/02559ceca556a26c53eb703ae87d421452b27251-1374x1400.png" alt="MMTEB Multilingual v2 leaderboard showing Jina AI embedding model rankings: jina-embeddings-v5-omni-small and jina-embeddings-v5-text-small ranked 13th, jina-embeddings-v5-omni-nano and jina-embeddings-v5-text-nano ranked 19th, competing against models from Microsoft, Google, Tencent, NVIDIA and Qwen" /><h3>Quels schémas d'API Jina On-Prem prend-il en charge ?</h3><ul><li><p>Disponibles sous la forme d'une collection complète de dépendances pour une installation locale ou d'un <a href="https://www.docker.com/">conteneur Docker</a> que vous pouvez installer et exécuter en quelques minutes.</p></li><li><p>Les installations Jina On-Prem <em>ne font pas</em> appel à des systèmes externes.</p><ul><li><p>Aucun appel au hub Hugging Face ni à aucun registre de modèles (HF_HUB_OFFLINE=1 et TRANSFORMERS_OFFLINE=1 sont intégrés).</p></li><li><p>Pas de serveur de licence.</p></li><li><p>Pas de points de terminaison de télémétrie ou de logging.</p></li></ul></li><li><p>Compatibles avec le matériel basé sur processeur et sur GPU, avec détection automatique du GPU.</p></li><li><p>Les 28 modèles Jina AI sont tous disponibles, y compris les derniers modèles d'embeddings multimodaux <a href="https://www.elastic.co/fr/search-labs/blog/jina-embeddings-v5-omni-all-media-one-index">jina-embeddings-v5-omni</a> et <a href="https://www.elastic.co/fr/search-labs/tutorials/jina-tutorial/jina-reranker-v3">jina-reranker-v3</a>.</p></li><li><p>Accès via des schémas API d'IA standards : <a href="https://jina.ai/api-dashboard">API Jina</a>, OpenAI, Cohere, Voyage AI et Gemini. Jina On-Prem est une solution clé en main pour les applications conçues sur ces schémas.</p></li><li><p>Remplacement direct pour les modèles servis par <a href="https://www.elastic.co/docs/explore-analyze/elastic-inference/eis">EIS</a>. Jina On-Prem s'intègre directement aux <a href="https://www.elastic.co/fr/blog/deploy-elastic-air-gapped-disconnected-environments">déploiements Elastic air gap</a>.</p></li></ul><h2>Configuration matérielle requise pour les modèles sur site Jina AI</h2><p>Les exigences matérielles varient selon les modèles Jina. Le tableau ci-dessous présente les recommandations pour les modèles les plus récents utilisant des GPU. Il n'est pas nécessaire de disposer d'une puissance supérieure à celle d'un GPU NVIDIA L4, bien qu'un modèle A100 soit recommandé pour les modèles d'embedding v5. Notre modèle d'embedding le plus récent nécessite actuellement un minimum de 8 Go de VRAM.</p><p>Modèle</p><p>VRAM minimum</p><p>GPU recommandé</p><p>jina-embeddings-v5-text-nano</p><p>2 Go</p><p>T4/L4</p><p>jina-embeddings-v5-text-small</p><p>3 Go</p><p>L4/A10G</p><p>jina-embeddings-v5-omni-small</p><p>8 Go</p><p>L4/A10G/A100</p><p>jina-reranker-v3</p><p>3 Go</p><p>L4</p><p>jina-clip-v2</p><p>4 Go</p><p>L4</p><p>jina-code-embeddings-1.5b</p><p>4 Go</p><p>L4</p><p>ReaderLM-v2</p><p>4 Go</p><p>L4</p><p>Si vous utilisez plus d'un modèle à la fois, les besoins en VRAM augmenteront. Pour plus d'informations, veuillez consulter la page <a href="https://github.com/jina-ai/jina-on-prem/wiki/Sizing-And-Hardware">Dimensionnement et matériel</a>.</p><h2>Comment installer Jina On-Prem avec Docker</h2><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt20265d09e2d8d0f4/6a6a33d1065b162105701ffd/ada9881af407168298b1940f8537ad71a5411c89-1999x1200.png" alt="" /><p>Le moyen le plus rapide de démarrer est d'<a href="https://www.docker.com/get-started/">installer Docker</a> (si ce n'est pas déjà fait) et de suivre les instructions sur la page <a href="https://github.com/jina-ai/jina-on-prem/wiki/QuickStart">Démarrage rapide de Jina On-Prem</a>.</p><p>Des conteneurs Docker préconfigurés sont disponibles pour les 28 modèles Jina. Il vous suffit d'en télécharger un et de le transférer vers votre environnement cible pour faire fonctionner les modèles Jina AI en moins de cinq minutes.</p><p>Pour les builds multimodaux ou personnalisés, ou pour télécharger l'ensemble complet des dépendances pour une installation en dehors d'un conteneur, suivez les étapes indiquées dans le <a href="https://github.com/jina-ai/jina-on-prem/wiki/Bundling-Guide">guide de regroupement</a>.</p><p>Votre installation Jina On-Prem prend en charge l'ensemble des fonctionnalités de l'API Jina et d'EIS ainsi que la génération d'embeddings via les API OpenAI, Cohere, Voyage AI et Gemini, afin de pouvoir s'intégrer dans des applications préexistantes à l'aide d'interfaces standard. Consultez la <a href="https://github.com/jina-ai/jina-on-prem/wiki/API-Reference">documentation de l'API</a> pour plus d'informations.</p><p>Les modèles Jina, y compris les modèles installés avec Jina On-Prem, sont disponibles selon diverses conditions de licence, les derniers modèles étant gratuits pour un usage non commercial sous licence <a href="https://creativecommons.org/licenses/by-nc/4.0/deed.en">CC BY-NC 4.0</a>. Pour obtenir une licence Jina On-Prem à des fins commerciales, veuillez contacter <a href="https://www.elastic.co/fr/contact">Elastic Sales</a>.</p>]]></content:encoded>
    <link>https://www.elastic.co/search-labs/blog/on-prem-ai-jina-embedding-models</link>
    <guid isPermaLink="true">https://www.elastic.co/search-labs/blog/on-prem-ai-jina-embedding-models</guid>
    <category><![CDATA[Jina AI]]></category>
    <category><![CDATA[Intégrations]]></category>
    <dc:creator><![CDATA[Scott Martens]]></dc:creator>
    <enclosure url="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt17731ab0c6ec66f6/6a6a33d140a4941014ca5c9a/09bc6dac4e6a86c7877f8ed78d68f5d581aeffa9-1999x1200.png" length="0" type="image/png"/>
    <pubDate>Thu, 23 Jul 2026 00:00:00 GMT</pubDate>
  </item>
  <item>
    <title><![CDATA[Un seul index, tous les médias : présentation de jina-embeddings-v5-omni]]></title>
    <description><![CDATA[jina-embeddings-v5-omni vous permet d’intégrer du texte, des images, des vidéos et de l’audio dans un seul index Elasticsearch, et d’effectuer des requêtes sur tous ces éléments à la fois.]]></description>
    <content:encoded><![CDATA[<p><code>jina-embeddings-v5-omni</code> rassemble texte, images, vidéo et audio dans un seul index Elasticsearch. En étendant les meilleurs modèles de <a href="https://www.elastic.co/search-labs/blog/jina-embeddings-v5-text"><code>jina-embeddings-v5-text</code></a> , la suite v5-omni ajoute un encodage visuel et audio grâce à une architecture innovante qui rend la dorsale textuelle identique, offrant des performances de classe frontière dans un modèle d’embarquement très compact.</p><p>Vous pouvez désormais créer des représentations sémantiques performantes pour <strong>les textes</strong>, <strong>les images</strong>, <strong>les vidéos</strong> et <strong>les enregistrements audio</strong>, couvrant <strong>près de 100 langues</strong>, et les utiliser pour la classification, le clustering, la mesure de la similarité sémantique et l’indexation pour la recherche. Si vos données se trouvent dans des PDF, des enregistrements et des vidéos aux côtés du texte, vous n’avez plus besoin de pipelines distincts pour chacun.</p><p>La famille <code>jina-embeddings-v5-omni</code> est le <strong>modèle de représentations vectorielles le plus compact actuellement sur le marché, avec prise en charge des images, de la parole, du texte imprimé et de la vidéo</strong>. Il propose :</p><ul><li><p><strong><code>jina-embeddings-v5-text</code></strong><strong>L’intégration de textes de classe avancée</strong> pour la recherche, l’analyse et les applications d’agents d’IA.</p></li><li><p><strong>Les meilleurs embeddings</strong> <strong>pour la similarité sémantique visuelle, la compréhension visuelle et la recherche d’images.</strong> <code>jina-embeddings-v5-omni-small</code> a la meilleure performance sur les benchmarks d’images de tous les modèles comportant un 1 milliard (10⁹) de paramètres et est supérieur à notre propre modèle précédent <a href="https://www.elastic.co/search-labs/blog/jina-models-elasticsearch-guide#jina-clip-v2"><code>jina-clip-v2</code></a>. Seuls quelques modèles dotés de trois à 30 fois plus de paramètres peuvent le battre.</p></li><li><p>Des <strong>embeddings de pointe pour la compréhension et la recherche visuelle multilingue</strong>, surpassant des modèles jusqu’à 20 fois plus grands.</p></li><li><p><strong>Les meilleurs embeddings audio de leur catégorie</strong>, seuls les modèles ayant au moins le double de paramètres étant plus performants sur les critères de référence standard.</p></li><li><p><strong>Compatible avec la vidéo</strong>, en particulier pour localiser des objets et des événements sur des séquences vidéo.</p></li></ul><p>Cela s’applique à tous les domaines de la recherche d’informations, du traitement des documents et de l’analyse des données. <code>jina-embeddings-v5-omni</code> ouvre l’accès à des informations enfermées dans différents silos médiatiques et les rend accessibles pour la récupération, l’analyse et l’utilisation par les agents d’IA. Les informations contenues dans les enregistrements audio et vidéo, les PDF, les scans de pages imprimées et les infographies sont sur un pied d’égalité avec les textes numérisés dans votre écosystème de données.</p><p>Tout comme <code>jina-embeddings-v5-text</code>, ces modèles existent en deux tailles : <code>small</code> et <code>nano</code>. Les deux modèles étendent leur équivalent textuel avec des modules supplémentaires prenant en charge l'entrée audio et visuelle. Les utilisateurs peuvent sélectionner les modules au moment du chargement. De plus, des extensions spécifiques à chaque tâche pour la similarité sémantique, la classification, le clustering et la récupération d’informations sont implémentées sous forme d’adaptateurs LoRA (Low-Rank Adaptation) compacts et sont toutes chargées, permettant aux utilisateurs de les sélectionner au moment de l’inférence.</p><p>Les deux modèles sont très compacts. <code>jina-embeddings-v5-omni-small</code> peut fonctionner sur des serveurs conventionnels équipés de GPU, et <code>jina-embeddings-v5-omni-nano</code> est suffisamment petit pour fonctionner sur du matériel de base. Cela représente une importante économie potentielle en coûts de calcul et rend possible l’installation locale sous licence et le traitement en périphérie, réduisant la latence et augmentant votre contrôle sur vos propres données.</p><p>La suite v5-omni utilise des techniques innovantes de conception de modèles et de machine learning pour créer de nouveaux modèles d’encodage à partir de modèles déjà entraînés, sans qu’il soit nécessaire de les réentraîner. Nous utilisons des encodeurs provenant de modèles d’embedding préentraînés et alignés linguistiquement, pour les médias audio et vidéo, comme préprocesseurs en entrée de notre suite de modèles <code>jina-embeddings-v5-text</code> existante. Les modèles ainsi obtenus génèrent des embeddings pour les images et les enregistrements sonores, sémantiquement compatibles avec ceux qu’ils génèrent pour les textes.</p><p>Les modèles v5-omni produisent des embeddings de texte identiques à <code>jina-embeddings-v5-text</code> (c’est-à-dire <code>jina-embeddings-v5-omni-small</code> avec <code>jina-embeddings-v5-text-small</code> ; et <code>jina-embeddings-v5-omni-nano</code> avec <code>jina-embeddings-v5-text-nano</code>), ce qui permet d’étendre les référentiels de récupération de texte existants vers des applications multimédias sans reconstruire vos index.</p><p>Les encodeurs intégrés sont tous dérivés de sources open-weight. Pour les images et les vidéos, nous avons utilisé des encodeurs issus de modèles <a href="https://qwen.ai/blog?id=qwen3.5">Qwen3.5</a> :</p><ul><li><p>Pour <code>jina-embeddings-v5-omni-nano</code>, encodeur optimisé <a href="https://huggingface.co/google/siglip2-base-patch16-224">SigLIP2 Base</a> issu de <a href="https://huggingface.co/Qwen/Qwen3.5-0.8B">Qwen3.5-0.8B</a>.</p></li><li><p>Pour <code>jina-embeddings-v5-omni-small</code>, encodeur optimisé <a href="https://huggingface.co/google/siglip2-so400m-patch14-384">SigLIP2 So400m</a> issu de <a href="https://huggingface.co/Qwen/Qwen3.5-2B">Qwen3.5-2B</a>.</p></li><li><p>Pour la compatibilité audio, nous avons ajouté l’encodeur de <a href="https://huggingface.co/openai/whisper-large-v3">Whisper-large-v3</a>, extrait de <a href="https://huggingface.co/Qwen/Qwen2.5-Omni-7B">Qwen2.5-Omni-7B</a>, aux versions petite et nano.</p></li></ul><p>Nous avons connecté ces encodeurs spécifiques aux médias à la structure de base de traitement du texte avec des projecteurs intermodaux entraînés. Ces projecteurs traduisent leurs sorties natives en enregistrements d’entrée compatibles avec <code>jina-embeddings-v5-text</code>. Les seules parties nouvellement formées des modèles <code>jina-embeddings-v5-omni</code> sont les poids de ces projecteurs.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt62dc05bfa3d054b6/6a17e86eb1e113340b79f29c/4cb834b7e5fd63cdd78600de313615feffabbb1f-1999x1000.jpg" alt="" /><p>Cette architecture signifie que nous n’avons qu’à entraîner les projecteurs multimodèles, avec environ 5,5 millions de paramètres pour <code>jina-embeddings-v5-omni-small</code> et moins de 3,5 millions pour <code>jina-embeddings-v5-omni-nano</code>, pour chacun des quatre adaptateurs LoRa. Cette approche réduit fortament la formation supplémentaire nécessaire pour connecter les différents modèles d’intégration, en tirant parti de la formation spécialisée de chacun pour produire une suite d’intégration modulaire extrêmement compacte et performante.</p><h2>Propriétés du modèle sélectionné</h2><h3>Entrée/sortie</h3><p>Nom du modèle</p><p>Taille de la fenêtre contextuelle d’entrée</p><p>Taille des embeddings</p><p>jina-embeddings-v5-omni-small</p><p>32 768 jetons*</p><p>1024 dimensions (minimum : 32)</p><p>jina-embeddings-v5-omni-nano</p><p>8 192 jetons *</p><p>768 dimensions (minimum: 32)</p><p>* Voir <strong>Utilisation de jina-embeddings-v5-omni</strong> ci-dessous pour en savoir plus sur la tokenisation des médias non textuels.</p><h3>Taille</h3><p>Nom du modèle</p><p>Taille totale</p><p>jina-embeddings-v5-omni-small (modèle de base texte uniquement + 4 adaptateurs LoRA)</p><p>700M paramètres</p><p>Prise en charge image/vidéo (encodeur SigLIP2 So400m extrait de Qwen3.5-2B)</p><p>1 006 mds de paramètres</p><p>prise en charge de l’audio (encodeur Whisper-large-v3 extrait de Qwen2.5-Omni-7B)</p><p>1 354 mds de paramètres</p><p>les deux</p><p>1 660 mds de paramètres</p><p>adaptateurs LoRA (chacun)</p><p>20M</p><p>jina-embeddings-v5-omni-nano (modèle de base texte uniquement + 4 adaptateurs LoRA)</p><p>266M paramètres</p><p>Prise en charge de l’image/de la vidéo (encodeur de base SigLIP2 extrait de Qwen3.5-0,8B)</p><p>354M paramètres</p><p>prise en charge de l’audio (encodeur Whisper-large-v3 extrait de Qwen2.5-Omni-7B)</p><p>916M paramètres</p><p>les deux</p><p>1,004B paramètres</p><p>adaptateurs LoRA (chacun)</p><p>7M</p><p>* Voir <strong>Utilisation de jina-embeddings-v5-omni</strong> ci-dessous pour en savoir plus sur la tokenisation des médias non textuels.</p><h2>Formation spécifique à la tâche</h2><p>La famille <code>jina-embeddings-v5-omni</code> prend en charge les mêmes adaptateurs LoRA spécifiques à la tâche que <code>jina-embeddings-v5-text</code> :</p><p>Tâche</p><p>Exemples d'utilisation</p><p>Récupération</p><p>La recherche d’informations, qu’elle soit utilisée seule ou en combinaison avec d’autres techniques de recherche et d’évaluation des candidats. Avec les modèles v5-omni, vous pouvez récupérer l’audio, la vidéo et les images en une seule requête à partir d’un seul index.</p><p>Clustering</p><p>Recherche de thèmes et organisation automatique des thèmes dans tous les médias.</p><p>Classification</p><p>Catégorisation, analyse des sentiments et types de tâches associées.</p><p>Similarité sémantique</p><p>Déduplication des données à travers les médias, les systèmes de recommandation, les médias connexes, la recherche de textes correspondant à la parole, l’identification des traductions et des tâches similaires.</p><p>Les embeddings de sortie dépendent de la catégorie de tâche sélectionnée. Par exemple, il est déconseillé d’utiliser des embeddings orientés vers la récupération pour le clustering ou des embeddings de similarité sémantique pour la classification.</p><h2>Multimédia, multimodal, multilingue, multifonctionnel</h2><p>Pour démontrer ce que <code>jina-embeddings-v5-omni</code> peut accomplir, examinons les célèbres passages d’ouverture de deux romans et évaluons leur similarité sémantique :</p><p><em><strong>Le conte de deux cités</strong></em><strong> (Charles Dickens)</strong></p>It was the best of times, it was the worst of times, it was the
age of wisdom, it was the age of foolishness, 
it was the epoch of belief, it was the epoch of incredulity,
it was the season of Light, it was the season of Darkness,
it was the spring of hope, it was the winter of despair,
we had everything before us, we had nothing before us,
we were all going direct to Heaven, we were all going
direct the other way—in short, the period was so far like
the present period, that some of its noisiest authorities
insisted on its being received, for good or for evil, in 
the superlative degree of comparison only.<p><em><strong>Orgueil et préjugés</strong></em><strong> (Jane Austen)</strong></p>It is a truth universally acknowledged, that a 
single man in possession of a good fortune must
be in want of a wife. However little known the
feelings or views of such a man may be on his first
entering a neighbourhood, this truth is so well
fixed in the minds of the surrounding families,
that he is considered as the rightful property of
some one or other of their daughters.<p>En utilisant <code>jina-embeddings-v5-omni-small</code>, avec son adaptateur de similarité sémantique, ces textes ont une similarité de <strong>0,5329</strong>.</p><p>Ce chiffre ne signifie pas grand-chose sans point de comparaison, alors comparons ces deux textes à leurs traductions françaises en utilisant le même modèle et le même adaptateur :</p><p><strong>Scores de similarité sémantique pour des textes dans différentes langues</strong></p><p></p><p>A Tale of Two Cities (anglais)</p><p>Pride and prejudice (anglais)</p><p>Le Conte de deux cités (français) (Paris et Londres en 1783, tr. H. Loreau)</p><p>0,9095</p><p>0,5074</p><p>Pride and Prejudice (français) (Orgueil et Préjugés, tr. Leconte et Pressoir)</p><p>0,4826</p><p>0,8784</p><p>Les deux textes présentent beaucoup plus de similitudes avec leurs traductions qu’avec d’autres textes de la même langue ou d’une langue différente. Ceci reflète les très hautes performances des embeddings sémantiques multilingues de <code>jina-embeddings-v5-text-small</code>, repris tels quels dans <code>jina-embeddings-v5-omni-small</code>.</p><p>L’ajout du support multimédia à <code>jina-embeddings-v5-omni</code> signifie que nous pouvons étendre cette expérience à d’autres types de données. Par exemple, nous avons récupéré des scans des premières pages des deux romans à partir d’anciennes éditions imprimées :</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt95d451adb5680e20/6a17e871445de9e88a4d016c/e92d928a4813ccecc7d02639eea699e3a71c66e3-1999x1692.png" alt="Deux pages de livre anciennes contiennent les premiers passages de « A Tale of Two Cities » et « Pride and Prejudice », la page de gauche indiquant le début du premier chapitre d’une édition non datée du XIXe siècle de « A Tale of Two Cities » et la page de droite le début du premier chapitre de l’édition Macmillan de 1903 de « Pride and Prejudice »." /><p><strong>Illustration 2 :</strong> <em>Le Conte de deux cités</em>, édition non datée du XIXe siècle, et <em>Orgueil et préjugés</em>, édition Macmillan de 1903.</p><p>Comparaison des deux textes avec les scans, à nouveau en utilisant l’adaptateur de similarité sémantique :</p><p><strong>Scores de similarité sémantique entre textes et images</strong></p><p></p><p>A Tale of Two Cities (numérisation)</p><p>Pride and Prejudice (numérisation)</p><p>Tale of Two Cities (texte)</p><p>0,7336</p><p>0,4891</p><p>Pride and Prejudice (texte)</p><p>0,4804</p><p>0,7213</p><p>Vous voyez que les scores de similarité sémantique favorisent fortement les textes qui correspondent au contenu des images.</p><p>Nous pouvons également comparer les textes à une capture d’écran d’une publication sur les réseaux sociaux et d’un mème qui font référence à ces textes, en utilisant la même configuration :</p><p><strong>Illustration 3 :</strong> Un tweet d’Elon Musk faisant référence à <em>Le Conte de deux cités</em>, et un mème faisant référence à la célèbre ouverture d’<em>Orgueil et préjugés</em>.</p><p><strong>Scores de similarité sémantique entre textes et images</strong></p><p></p><p>Le Conte de deux cités</p><p>Orgueil et préjugés</p><p>Tweet de Musk (image)</p><p>0,7156</p><p>0,4912</p><p>Mème Keep Calm (image)</p><p>0,4555</p><p>0,6244</p><p>Nous pouvons faire la même chose pour la parole. Nous avons obtenu des enregistrements de lectures des deux textes, en anglais et en français :</p><ul><li><p><a href="https://drive.google.com/file/d/1IK_bR6L47TSrnESdXLEpHCX6o-FzPmOx/view?usp=sharing"><em>A Tale of Two Cities</em></a><a href="https://drive.google.com/file/d/1IK_bR6L47TSrnESdXLEpHCX6o-FzPmOx/view?usp=sharing"> (audio en anglais de Librivox).</a>.</p></li><li><p><a href="https://drive.google.com/file/d/1KurbhD6INc6oZlq_SJcWq7MBVfJQ3pof/view?usp=sharing"><em>Un conte de deux villes</em></a><a href="https://drive.google.com/file/d/1KurbhD6INc6oZlq_SJcWq7MBVfJQ3pof/view?usp=sharing"> (audio français généré par OmniVoice IA)</a>.</p></li><li><p><a href="https://drive.google.com/file/d/1D_G2FOCb7ct-FBVY1fyivXlY2e_yGZw1/view?usp=sharing"><em>Pride and Prejudice</em></a><a href="https://drive.google.com/file/d/1D_G2FOCb7ct-FBVY1fyivXlY2e_yGZw1/view?usp=sharing"> (audio anglais tiré de Librivox).</a></p></li><li><p><a href="https://drive.google.com/file/d/1jutY61YSFGBIyE8m-ltEJx-8dEXNJJ5N/view?usp=sharing"><em>Orgueil et préjugés</em></a><a href="https://drive.google.com/file/d/1jutY61YSFGBIyE8m-ltEJx-8dEXNJJ5N/view?usp=sharing"> (audio français généré par OmniVoice IA)</a>.</p></li></ul><p><strong>Scores de similarité sémantique entre textes et fichiers audio dans différentes langues</strong></p><p></p><p>A tale of two cities (audio en anglais)</p><p>Le Conte de deux cités (audio en français)</p><p>Pride and Prejudice (audio en anglais)</p><p>Orgueil et préjugés (audio en français)</p><p>Le Conte de deux cités (texte anglais)</p><p>0,3816</p><p>0,3106</p><p>0,1607</p><p>0,1774</p><p>Le Conte de deux cités (texte français)</p><p>0,3528</p><p>0,3253</p><p>0,1598</p><p>0,1721</p><p>Pride and Prejudice (texte en anglais)</p><p>0,1910</p><p>0,1682</p><p>0,3511</p><p>0,3398</p><p>Orgueil et préjugés (texte français)</p><p>0,1667</p><p>0,1474</p><p>0,3018</p><p>0,3702</p><p>Cette capacité multilingue et multimédia s'étend à la récupération d'informations.</p><p>Les adaptateurs de récupération pour les modèles <code>jina-embeddings-v5-omni</code> implémentent une récupération asymétrique. Ils intègrent donc les requêtes différemment de la manière dont ils intègrent les documents cibles de récupération, de sorte que les requêtes intermodales sont toujours dans une certaine direction, avec des requêtes dans un média et des documents dans un autre, donnant des scores différents de ceux obtenus lorsqu’ils sont inversés.</p><p>Les tableaux ci-dessous montrent les scores de récupération pour le texte, l’audio et la numérisation de pages pour <em>Le Conte de deux cités</em> et <em>Orgueil et préjugés</em>, lorsque le texte de <em>Le Conte de deux cités</em> (en anglais) est codé comme requête :</p><p><strong>Texte à texte</strong></p><p>Document</p><p>Score de récupération</p><p>L'histoire de deux villes (extrait du texte français)</p><p>0,7597</p><p>Pride and Prejudice (extrait en anglais)</p><p>0,1482</p><p>Orgueil et préjugés (extrait de texte en français)</p><p>0,0523</p><p><strong>Image en texte</strong></p><p>Document</p><p>Score de récupération</p><p>A Tale of Two Cities (scan de la page en anglais)</p><p>0,5517</p><p>Le Conte de deux cités (scan de la page en français)</p><p>0,3576</p><p>Pride and Prejudice (scan de la page en anglais)</p><p>0,1917</p><p><strong>Texte en audio</strong></p><p>Document</p><p>Score de récupération</p><p>A tale of two cities (audio en anglais)</p><p>0,3277</p><p>Le Conte de deux cités (audio en français)</p><p>0,1980</p><p>Pride and Prejudice (audio en anglais)</p><p>0,1419</p><p>Orgueil et préjugés (audio en français)</p><p>0,1759</p><p>Les utilisateurs peuvent également exécuter la requête dans l’autre sens, en effectuant une récupération audio-texte et image-texte.</p><p>Vous trouverez ci-dessous les scores en utilisant l’audio anglais de <em>Le Conte de deux cités</em> comme requête et différents textes comme documents :</p><p><strong>Image en texte</strong></p><p>Document</p><p>Score de récupération</p><p>A Tale of Two Cities (extrait du texte anglais)</p><p>0,3352</p><p>L'histoire de deux villes (extrait du texte français)</p><p>0,2650</p><p>Pride and Prejudice (extrait en anglais)</p><p>0,1626</p><p>Orgueil et préjugés (extrait de texte en français)</p><p>0,1385</p><p>Et les scores utilisant une numérisation de la page un de <em>Le Conte de deux cités</em> (en anglais) comme requête :</p><p><strong>Audio en texte</strong></p><p>Document</p><p>Score de récupération</p><p>A Tale of Two Cities (extrait du texte anglais)</p><p>0,5304</p><p>L'histoire de deux villes (extrait du texte français)</p><p>0,4845</p><p>Pride and Prejudice (extrait en anglais)</p><p>0,1467</p><p>Orgueil et préjugés (extrait de texte en français)</p><p>0,0761</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt501b2c594f45f2e3/6a17e877a292992e3ad02c9a/673f5116c1d7a5a6f9adfbb2f48b9e6920e3229b-668x130.png" alt="Une fenêtre de notification rectangulaire sur fond bleu clair affiche une icône représentant un triangle d’avertissement jaune à côté d’un texte expliquant que jina‑embeddings‑v5‑omni est conçu pour trouver des fichiers audio, vidéo et des images à partir de requêtes textuelles, et que les requêtes non textuelles peuvent s’avérer moins efficaces." /><h2>Recherche de vidéo</h2><p>Les capacités de <code>jina-embeddings-v5-omni</code>pour l’indexation et la recherche vidéo apportent de nouvelles possibilités aux bases de données Elasticsearch, mais elles sont soumises à de nombreuses mises en garde similaires à celles qui s’appliquent aux textes. Générer un embedding unique pour un long film revient à créer un embedding pour un très long roman : les informations détaillées seront noyées, et l’embedding résultant correspondra à de nombreuses requêtes non pertinentes.</p><p>Si vous intégrez l’intégralité du texte du <em>Seigneur des anneaux</em> (environ 500 000 mots), il est probable qu’il corresponde à la plupart des requêtes, quelle que soit la nature de votre recherche. De même, si vous indexez un film hollywoodien de deux heures, vous obtiendrez beaucoup de correspondances fallacieuses et de détails totalement manqués. <code>jina-embeddings-v5-omni</code> est optimal avec les clips courts.</p><p>Pour cet exemple, nous avons téléchargé la bande-annonce du film de 1961 <em>Diamants sur canapé (Breakfast At Tiffany’s)</em>, qui ne dure que 158 secondes et est dans le domaine public. Vous pouvez voir la bande annonce <a href="https://archive.org/details/turner_video_311/311.mp4">sur Internet Archive</a>.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt06633fdd1c8334dd/6a17e8790b0bed7d9add35b2/1948f585027d1342528c0dd93fe99e3ec7ba17f9-800x1200.png" alt="L’affiche du film Diamants sur canapé (Breakfast at Tiffany’s) représente Audrey Hepburn dans une longue robe noire, avec des gants noirs, un collier de perles et un porte-cigarette, avec un chat sur son épaule. Une illustration de fond plus petite montre un couple s’embrassant près d’un paysage urbain, et l’affiche comprend des bordures colorées ainsi que les noms des acteurs et les crédits de production." /><p><strong>Illustration 4 : </strong>L’affiche du film <em>Diamants sur canapé (Breakfast At Tiffany’s)</em>.</p><p>Nous avons utilisé <a href="https://www.scenedetect.com/">PySceneDetect </a>pour diviser la bande-annonce en 28 scènes individuelles, dont la durée varie de 1,877 seconde (45 images) à 18,393 secondes (441 images). La détection des scènes est imparfaite, mais elle fournit un mécanisme adéquat pour diviser la vidéo en parties de taille réduite pour la récupération. Ensuite, nous avons généré des plongements de documents pour chacun des 28 segments, en utilisant <code>jina-embeddings-v5-omni-small</code>, afin de tester l’efficacité des requêtes textuelles pour trouver des éléments spécifiques dans la vidéo.</p><p>Par exemple, la requête pour « cat » (chat) a renvoyé les extraits suivants comme les trois premiers résultats. La seule scène avec un chat est en tête, avec un score de <strong>0,1634</strong>:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt6dca953a4afd5c1b/6a17e87baf47b65bf6cddfbc/82bd1759ebb65202f01a1e290447619af39f9a3d-735x426.png" alt=" Une vignette vidéo montrant une personne agenouillée sur le sol de la cuisine, tendant la main vers un réfrigérateur ouvert, tandis qu'un chat se tient à proximité (score 0,1634)." /><p><a href="https://drive.google.com/file/d/1O3r-97rQJE7HAlUHsLygmFLwlZihRF26/view?usp=drive_link">Regardez le premier clip</a>.</p><p>La correspondance suivante, avec un score de <strong>0,1237</strong>, est bien plus faible :</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltcc2cc1ef9ff9ce4b/6a17e87d7c026e725cf146b3/de4eb704ef751cc4df2bead7faa177decd20b1b3-735x426.png" alt="Une miniature de vidéo montrant une personne tenant un masque coloré près de son visage, avec le nom « GEORGE PEPPARD » superposé à l’image (score 0,1237)." /><p><a href="https://drive.google.com/file/d/1DEK2H4bCpLVzyipJri9NSqE2jkeZ5jLm/view?usp=drive_link">Regardez l’extrait 2</a>.</p><p>Vous pouvez également rechercher des actions. Si vous effectuez une requête avec la chaîne « kiss » (baiser), les quatre premiers résultats correspondent tous à des baisers :</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt85bf55536faf5156/6a17e87f25daab4bb608a269/18efdcbbb31954dfab8eafe5055773b6b8e3de72-735x426.png" alt="Une miniature vidéo montrant trois personnes à l’intérieur, une personne debout à gauche, tournée dos à la caméra, et deux personnes à droite semblant s’enlacer près d’un rideau et d’une porte (score 0,2864)." /><p><a href="https://drive.google.com/file/d/1Pmr_D4wKjUCCiq_Dzy5PQeWldJLjZ8kI/view?usp=drive_link">Regardez le clip 3.</a> Son score est de 0,2864.</p><p>Scores : pour le <a href="https://drive.google.com/file/d/1sS_4qTnmHU2uOwbN1fmdXeS3IvZAI_IN/view?usp=drive_link">deuxième match</a> (0,2494), <a href="https://drive.google.com/file/d/1ofsrZHTUb3huwQ0JB6Hs5dOw4myTj-sk/view?usp=drive_link">le troisième match</a> (0,2099) et <a href="https://drive.google.com/file/d/1qaS4eueUCcQWdHLEjfEfneXsaWsx6P_5/view?usp=drive_link">le quatrième match</a> (0,2068), respectivement.</p><p>Et vous pouvez rechercher du texte affiché dans les vidéos, comme pour « Buddy Ebsen », qui n’apparaît qu’une seule fois. <code>jina-embeddings-v5-omni-small</code> le considère facilement comme la meilleure correspondance avec un score de <strong>0,3885</strong>, soit bien plus que la meilleure correspondance suivante :</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt4c3fd86052f17ce8/6a17e886e9ea8795d8a9c601/dabcae9f44b9d4a671f88717aa21a2c6cf685f6b-735x426.png" alt="Une vignette de vidéo montrant un homme en costume debout à côté d’un escalier avec des balustres blancs et une rampe sombre, avec le texte superposé indiquant « Buddy Ebsen » (score 0,3885)." /><p><a href="https://drive.google.com/file/d/1rdQ1OqtPBD-3iGG8A900jU5DpC-muye4/view?usp=sharing">Clip de Buddy Ebsen</a>.</p><h2>Récupération visuelle de documents</h2><p>Les modèles d’intégration multimodale Jina AI sont les plus performants en traitement visuel de documents et sont à la pointe de la technologie en matière de traitement de documents visuels multilingues. Cela signifie gérer des données d’image contenant du texte, des illustrations et des informations structurées. Les données importantes prennent souvent la forme de scans imprimés, de fichiers PDF, de diagrammes, de dessins techniques, de captures d’écran, d’images, d’infographies, etc. Ces types d’images sont souvent composés mécaniquement ou générés par ordinateur. En général, ils ne peuvent pas être réduits à du texte sans perte de sens et sont peu adaptés aux modèles de vision par ordinateur conçus pour la photographie de scènes naturelles.</p><p><code>jina-embeddings-v5-omni</code>Les embeddings englobent des informations sur les éléments de l’image, le texte qui y est imprimé et les relations entre les deux. La recherche de documents visuels permet d’indexer des images riches qui contiennent à la fois des objets et du texte pertinent, et ce, dans plusieurs langues.</p><p>Prenons comme exemple quatre images de produits provenant de différents sites web de commerce électronique :</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt620568521e2a3057/6a17e888f7018418c89a68a8/639481349aed78d4139f0d388d44f79b6ba29f88-1297x650.png" alt="" /><p>Voyons maintenant comment <code>jina-embeddings-v5-omni-small</code> évalue ces quatre images pour la requête « nouilles ramen » :</p><p>Campbell’s Chunky Chicken Noodle (emballage canadien)</p><p>Kraft Dinner (emballage canadien)</p><p>Ramen frais saveur miso Maruchan (emballage japonais)</p><p>Birkel Spaghetti (emballage allemand)</p><p>0,0872</p><p>0,0711</p><p>0,1123</p><p>0,0886</p><p>Il trouve facilement la correspondance japonaise.</p><p>Maintenant, essayons une requête pour « マカロニチーズ » (japonais pour <em>macaronis au fromage</em>) :</p><p>Campbell’s Chunky Chicken Noodle (emballage canadien)</p><p>Kraft Dinner (emballage canadien)</p><p>Ramen frais saveur miso Maruchan (emballage japonais)</p><p>Birkel Spaghetti (emballage allemand)</p><p>0,2207</p><p>0,3487</p><p>0,2760</p><p>0,2674</p><p>Il trouve la correspondance correcte avec la même facilité qu’une requête en anglais.</p><p><code>jina-embeddings-v5-omni</code> Il excelle également dans l’interprétation d’images riches en informations, comme les graphiques. Pour voir cela en action, regardez ces deux graphiques à barres :</p><p>Deux graphiques, le <strong>graphique 1</strong> à gauche, sur la charge mondiale de morbidité, et le <strong>graphique 2</strong> à droite, sur l’espérance de vie des races de chiens.</p><p>Voyons maintenant dans quelle mesure ils correspondent à deux questions textuelles potentielles, chacune étant pertinente pour l’un des graphiques mais pas pour les deux, en utilisant <code>jina-embeddings-v5-omni-small</code> pour la récupération :</p><p>Question en texte</p><p>Graphique 1</p><p>Tableau 2</p><p>« Quels sont les problèmes médicaux courants chez les personnes âgées ? »</p><p>0,2787</p><p>0,1099</p><p>« Combien de temps vivent les chiens ? »</p><p>0,1350</p><p>0,3564</p><p>Vous pouvez aussi inverser la recherche, en utilisant des images comme requêtes pour trouver des textes. Le tableau ci-dessous montre les documents cibles extraits des résumés d’articles scientifiques liés par thème et leurs scores de récupération, en utilisant les images de graphiques comme requêtes :</p><p></p><p>Texte 1</p><p>Texte 2</p><p></p><p>La santé des populations vivant dans l’extrême pauvreté est depuis longtemps au cœur des efforts de développement mondiaux et reste une priorité à l’ère des objectifs de développement durable. Cependant, depuis près de vingt ans, aucune tentative systématique n’a été faite pour quantifier l’ampleur et les causes de ce problème dans cette population spécifique. Nous avons estimé les taux de maladies par cause pour le milliard le plus pauvre du monde et comparé ces taux à ceux des populations à hauts revenus.</p><p>Le chien de compagnie est l’une des espèces les plus diversifiées sur le plan phénotypique. Les différences entre les races ne se limitent pas à la morphologie et aux aspects du comportement, mais concernent aussi la longévité. Malgré ce fait, peu de recherches ont été consacrées à l’évaluation des variations de l’espérance de vie entre les races ou à l’estimation du potentiel de caractérisation phylogénétique de la longévité.</p><p>Graphique 1</p><p>0,2377</p><p>0,1357</p><p>Tableau 2</p><p>0,0673</p><p>0,3576</p><h2>Fonctionnalités</h2><h3>Embeddings tronquables</h3><p>Nous avons formé les modèles de base <code>jina-embeddings-v5-text</code> qui sous-tendent <code>jina-embeddings-v5-omni</code> avec <a href="https://arxiv.org/abs/2205.13147">Matryoshka Representation Learning</a>, afin que vous puissiez tronquer à la fois les textes et les embeddings multimédias de ces modèles.</p><p>Par défaut, <code>jina-embeddings-v5-omni-small</code> génère des embeddings à 1024 dimensions, ce qui nécessite 2 Ko pour les stocker avec une précision de 16 bits. Les embeddings de <code>jina-embeddings-v5-omni-nano</code>ont 768 dimensions, occupant environ 1,5 Ko. Vous pouvez réduire la taille de ces embeddings à 32 dimensions (64 octets) au détriment de la précision, mais avec un gain important en termes de vitesse de traitement et de réduction des coûts de ressources. En général, réduire de moitié les tailles d’embeddings diminue la précision d’environ 2 %, jusqu’à 128 dimensions, en dessous desquelles la précision chute beaucoup plus rapidement.</p><p>Les embeddings tronquables permettent aux utilisateurs de décider du compromis optimal entre précision, rapidité et coût, compte tenu de leurs propres cas d’utilisation.</p><h3>Quantification</h3><p>La famille <code>jina-embeddings-v5-omni</code> hérite également de solides performances en matière de quantification grâce à son architecture <code>jina-embeddings-v5-text</code>. Cela permet d’augmenter la vitesse et de réduire les coûts de calcul et de stockage en stockant des nombres moins précis. Nous les avons entraînés à fonctionner avec la <a href="https://elastic.co/elasticsearch">Better Binary Quantization</a>(BBQ) d’<a href="https://www.elastic.co/docs/reference/elasticsearch/mapping-reference/bbq">Elasticsearch</a> afin d’obtenir des performances quasiment identiques à celles des intégrations non quantifiées. Sur la suite de benchmarks de récupération Massive Text Embedding Benchmark (MTEB), la binarisation réduit les performances de moins de 3 % par rapport aux valeurs complètes sur 16 bits, tout en économisant 93 % de l’espace et en augmentant considérablement les vitesses de traitement et de récupération.</p><h3>Performance inter-langues</h3><p><code>jina-embeddings-v5-text</code>Cet entraînement multilingue approfondi se retrouve dans <code>jina-embeddings-v5-omni</code>, avec près de 100 langues lors du pré-entraînement de <code>jina-embeddings-v5-text-small</code>et 15 grandes langues mondiales lors de celui de <code>jina-embeddings-v5-text-nano</code>. Pour les médias audio, le modèle <code>Whisper-large-v3</code> a été entraîné sur environ 100 langues, et les modèles de vision SigLip2 modifiés par Qwen, intégrés dans <code>jina-embeddings-v5-omni-small</code> et <code>-nano</code>, ont été entraînés à partir de données issues de 201 langues et dialectes distincts.</p><h2>Performance des benchmarks</h2><h3>Texte</h3><p><code>jina-embeddings-v5-omni</code> Sont identiques aux modèles <code>jina-embeddings-v5-text</code> lorsqu’ils sont utilisés uniquement pour le texte. Ils sont les plus performants sur la suite <a href="https://huggingface.co/spaces/mteb/leaderboard">MMTEB benchmark</a> dans leurs catégories de taille respectives pour les embeddings textuels sémantiques.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt14d87596ca463c88/6a17e88dec0f89dfb65a664f/8687106cf82e6ec2b3f79f893cfe011e4a5b4a21-1095x1095.png" alt="Un graphique à barres et à lignes compare les scores MMTEB et les tailles de paramètres pour neuf modèles d’intégration, avec jina‑v3‑omni‑small obtenant le score le plus élevé et snowflake‑arctic‑embed‑l‑v2 ayant la taille la plus petite." /><p><strong>Illustration 5</strong> : Taille et performances de <code>jina-embeddings-v5-omni</code>sur des benchmarks de texte, comparées à celles des modèles concurrents. La taille citée ne tient pas compte du chargement des extensions pour les autres médias.</p><h3>Similarité sémantique visuelle</h3><p>Sur les benchmarks standard de similarité sémantique visuelle, <code>jina-embeddings-v5-omni</code> obtient les meilleurs scores parmi tous les modèles de taille comparable. Les modèles <code>jina-embeddings-v5-omni</code> affichent de loin les meilleures performances parmi les modèles publics open weights de taille comparable. <code>jina-embeddings-v5-omni-small</code> n'est battu que par un modèle trois fois plus grand sur les tâches de similarité sémantique visuelle, et <code>jina-embeddings-v5-omni-nano</code> n'est battu que par <code>jina-embeddings-v5-omni-small</code> et par des modèles de 10 à 25 fois plus grands.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt16ad3463d2aeefc5/6a17e88efaa9139b1493c8a9/f2ae56764865953bdf8c54747276189efd6d45e1-1496x877.png" alt="Un graphique à barres compare les scores de similarité sémantique visuelle et la taille des paramètres de sept modèles d’intégration, jina‑embeddings‑v5‑omni‑small obtenant le score de similarité le plus élevé et laion/CLIP‑ViT‑bigG‑14 ayant la plus grande taille de modèle." /><p><strong>Illustration 6</strong> : Scores moyens de similarité sémantique visuelle pour <code>jina-embeddings-v5-omni-small</code>, <code>jina-embeddings-v5-omni-nano</code>, et des modèles comparables, ainsi que leurs tailles incluant les extensions de vision.</p><h3>Récupération visuelle de documents</h3><p><code>jina-embeddings-v5-omni-small</code> est compétitif avec des modèles de trois et sept milliards de paramètres tout en restant sous un milliard de paramètres. <code>jina-embeddings-v5-omni-nano</code> se distingue également par sa taille, devançant les modèles dix à soixante fois plus grands.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltcbabd1477ec3459c/6a17e890e317912a242d5806/cde672f18de8f4a30dd81938b08bb06e08444be0-1223x905.png" alt="Un graphique à barres et à lignes compare les scores ViDoRe sélectionnés et les tailles de paramètres pour plusieurs modèles d’intégration, avec LCO‑Embedding‑Omni‑7B atteignant le score le plus élevé et laion/CLIP‑ViT‑bigG‑14 ayant la plus grande taille de modèle. L’accent est mis sur deux modèles d’intégration Jina." /><p><strong>Illustration 7</strong> : Scores moyens <a href="https://huggingface.co/spaces/vidore/vidore-leaderboard">de récupération de documents visuels ViDoRe</a> sur six benchmarks : <em>DocVQA</em>, <em>InfoVQA</em>, <em>ShiftProj</em>, <em>SynAI</em>, <em>Tabfquad</em> et <em>TatDQA</em>.</p><h3>Récupération audio</h3><p>Selon les critères de référence standard de la MAEB (Massive Audio Embedding Benchmark) en matière de récupération audio, <code>jina-embeddings-v5-omni-small</code> et <code>jina-embeddings-v5-omni-nano</code> se classent parmi les plus performants. Seuls les très grands modèles — plus de trois fois plus grands que <code>jina-embeddings-v5-omni-small</code> — ont battu son score.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt80f517c1c0230031/6a17e892dbb4ff8498fb56ee/a8c896bbbd710026c7b053e38af460194e7730a6-1650x912.png" alt="Un graphique à barres et à lignes compare les modèles d’embedding et audio selon l’axe des x, affichant des barres bleues pour le score MAEB sur l’axe des y de gauche et une ligne rouge pour la taille du modèle (en milliards de paramètres) sur l’axe des y de droite. Les barres vont de 20 à 55 environ et la ligne va de 0 à 10." /><p><strong>Illustration 8</strong> : Score moyen pour différents modèles sur les benchmarks de récupération audio MAEB.</p><p>Bien que le modèle <code>larger_clap_general</code> de LAION améliore le score de jina-embeddings-v5-omni-nano tout en ayant moins de paramètres, il s’agit d’un modèle uniquement audio sans aucune des fonctionnalités multimodales supplémentaires de la suite v5-omni.</p><h3>Vidéo</h3><p>Sur les vidéos, <code>jina-embeddings-v5-omni-small</code> excelle à repérer le passage dans une vidéo qui correspond à une requête textuelle. Les tests Charades-STA et MomentSeeker sont les études comparatives standard pour cette tâche, et comme le montrent les graphiques ci-dessous, <code>jina-embeddings-v5-omni-small</code> obtient le meilleur score parmi les modèles open-weight comparables, malgré une taille bien plus réduite.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltc8d7e7570b64d45a/6a17e8944b055d34e643221b/a2d7744d39fefb6b8b1f66e5b3f227828ef4ad4e-1350x672.png" alt="Un graphique à barres et à lignes montre les scores Charades‑STA et les tailles de modèle pour six modèles d’embedding. L’axe des x liste les modèles, l’axe des y gauche montre les scores Charades-STA de 20 à 60, et l’axe des y de droite montre la taille du modèle en milliards de paramètres de 0 à 10. Des barres bleues représentent les scores, et une ligne rouge avec des marqueurs représente les tailles des modèles." /><p><strong>Illustration 9</strong> : Scores Charades-STA pour différents modèles, ainsi que leurs tailles.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltfbce6716a3a33ca5/6a17e89525daab2e8a08a26d/cf7578863fd509edb62c15878816d39657abc715-1550x845.png" alt="Un graphique à barres et à courbes compare six modèles de plongement à l’aide des scores de MomentSeeker et de la taille du modèle. L’axe des x indique les modèles, l’axe des y à gauche montre les scores MomentSeeker d’environ 44 à 60, et l’axe des y à droite montre la taille du modèle en milliards de paramètres de 0 à 10. Les barres bleues représentent les scores, et une ligne rouge avec des marqueurs représente les tailles de modèle." /><p><strong>Illustration 10</strong> : Scores MomentSeeker pour différents modèles, ainsi que leurs tailles.</p><p>Nous avons également comparé <code>jina-embeddings-v5-omni-small</code> à <a href="https://seed.bytedance.com/en/blog/built-on-seed1-6-flash-seed-1-6-embedding-launched">Seed 1.6</a> de ByteDance, un modèle à poids fermé avec un nombre de paramètres non divulgué. Notre modèle beats largement la Seed 1.6 sur le benchmark Charades-STA et l’égale presque sur MomentSeeker.</p><p>Modèle</p><p>Score Charades-STA</p><p>Le score de MomentSeeker</p><p>seed-1,6-embedding</p><p>29,30</p><p>59,30</p><p>jina-embeddings-v5-omni-small</p><p>55,57</p><p>58,93</p><h2>Points forts et limites</h2><p><code>jina-embeddings-v5-omni</code> Les modèles améliorent la capacité des utilisateurs à indexer, rechercher et analyser des informations numérisées de plusieurs manières, notamment :</p><ul><li><p>Récupération de parole multilingue à partir de requêtes textuelles.</p></li><li><p>PDF, scans et recherche visuelle de documents.</p></li><li><p>Ancrage temporel de vidéos, c'est-à-dire l'identification des parties de vidéos correspondant à des descriptions en langage naturel.</p></li><li><p>Classification des genres audio, y compris les genres musicaux.</p></li><li><p>Classification d’images basée sur les informations de scène et l’identification d’objets.</p></li></ul><p>Les performances sont plus limitées dans certains autres domaines. Il est peut-être possible d’utiliser <code>jina-embeddings-v5-omni</code> pour effectuer ces tâches, mais nous n’avons pas effectué d’entraînement pour ces tâches et les résultats peuvent être médiocres.</p><p>Nous travaillons activement à l'amélioration de notre technologie dans ces domaines :</p><ul><li><p>Trouver des vidéos spécifiques à partir de descriptions en langage naturel.</p></li><li><p>Similarité sémantique et recherche d’images.</p></li><li><p>Classification des intentions dans le discours, comme la reconnaissance de commandes verbales.</p></li><li><p>Traitement des entrées multimédias mixtes, c’est-à-dire des images et du texte d’accompagnement, ou de l’audio, des images et des textes combinés.</p></li></ul><h2>Utilisation <strong>de jina-embeddings-v5-omni</strong></h2><p>Cette suite de modèles prend en charge trois types d’entrée : texte, audio, images et vidéos combinées. <code>jina-embeddings-v5-omni</code> fonctionne dans un framework qui convertit une large gamme de formats standards et effectue d’autres prétraitements.</p><p>Nous traitons les images en utilisant la même <a href="https://arxiv.org/abs/2502.14786">approche NaFlex</a> que celle fournie dans la version initiale de SigLip2 : si l’entrée est inférieure à 262 144 pixels (équivalent à 512x512), elle est mise à l’échelle jusqu’à ce qu’elle soit plus grande que ce minimum ; et si elle est supérieure à 3 072 000 pixels, elle est mise à l’échelle jusqu’à ce qu’elle soit plus petite que ce maximum. Le processus de conversion garantit que la hauteur et la largeur de l’image sont un multiple de 14 pixels, avec une distorsion du rapport hauteur/largeur aussi faible que possible pour atteindre cet objectif. Le résultat est divisé en carrés de 28x28 pixels, de sorte que le nombre total de carrés est égal au nombre de carrés de 28x28 nécessaires pour couvrir l’image. Chaque carré est traité comme un jeton unique au moment de l’inférence, et chaque entrée d’image est accompagnée de jetons spéciaux de début et de fin pour délimiter une image unique.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltf192cdba41155257/6a17e897abe0f2faaedfea2a/5ab7a8951780afdfe6eda9dca14add0375ae36bd-668x130.png" alt="Une fenêtre de notification rectangulaire sur fond bleu clair affiche une icône représentant un triangle d’avertissement jaune à côté d’un texte expliquant que jina‑embeddings‑v5‑omni est conçu pour trouver des fichiers audio, vidéo et des images à partir de requêtes textuelles, et que les requêtes non textuelles peuvent s’avérer moins efficaces." /><p>Les modèles <code>jina-embeddings-v5-omni</code> modifient la résolution vidéo de la même manière que les images (voir ci-dessus), et nous extrayons jusqu’à 32 images de la vidéo. Si la vidéo a plus de 32 images (ce qui est probable, puisque les formats standards sont généralement au moins 24 images par seconde), nous étalons uniformément les images extraites. Ensuite, pour chaque deux images, le préprocesseur vidéo génère un ensemble de jetons égal au nombre de 28x28 carrés nécessaires pour couvrir la vidéo.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt0acd4ddd95a66a53/6a17e898445de966214d0176/a38491c1cc47cfc65344c786e8ab57b9abf67e0b-1999x851.png" alt="Un collage de cadres vidéo séquentiels est disposé avec des flèches montrant la progression, dépeignant une série de scènes mettant en vedette Audrey Hepburn à différents moments, se terminant par un cadre affichant le carton-titre « Breakfast at Tiffany’s » (Diamants sur canapé). La disposition illustre que le modèle extrait 64 images équidistantes d’une vidéo, ce qui peut entraîner une perte importante de contenu lorsque la vidéo est longue." /><p><strong>Figure 11 :</strong> <code>jina-embeddings-v5-omni</code> extrait 32 images régulièrement espacées de la vidéo. Si votre vidéo est longue, cela signifie qu'une grande partie sera perdue.</p><p>Pour plus de détails sur le prétraitement vidéo, consultez la <a href="https://arxiv.org/abs/2502.14786">documentation technique de SigLip2</a>.</p><p>La tokenisation audio suit l’approche intégrée à Qwen-2.5-Omni : Les fichiers sonores sont découpés en segments de 30 secondes. S’ils sont plus longs, ils sont rééchantillonnés à 16 kHz, transformés en spectrogramme Mel à 128 canaux. Chaque 40 ms est traité comme un seul jeton, donc chaque segment de 30 secondes est géré comme 750 jetons, un jeton par 40 ms d’audio, plus des jetons spéciaux de début et de fin pour délimiter un échantillon unique.</p><p>Pour plus de détails sur le prétraitement audio, consultez le <a href="https://arxiv.org/abs/2503.20215">rapport technique Qwen-2.5-Omni</a>.</p><h2>Disponibilité</h2><p><code>jina-embeddings-v5-omni-small</code> et <code>jina-embeddings-v5-omni-nano</code> sont tous deux disponibles sur le <a href="https://www.elastic.co/docs/explore-analyze/elastic-inference/eis">service d’inférence Elastic</a> (EIS), via l’<a href="https://jina.ai/embeddings">API Jina</a>, et pour une installation locale via téléchargement (<a href="https://huggingface.co/jinaai/jina-embeddings-v5-omni-small"><code>small</code></a> et <a href="https://huggingface.co/jinaai/jina-embeddings-v5-omni-nano"><code>nano</code></a>). Les poids modèles sont distribués gratuitement à des fins d’essai dans le cadre d’une licence non commerciale. Contactez <a href="https://www.elastic.co/contact?pg=global&amp;plcmt=nav&amp;cta=205352">Elastic sales</a> pour un usage commercial.</p><h2>Premiers pas</h2><p>Pour utiliser <code>jina-embeddings-v5-omni</code> pour le texte, vous pouvez l'intégrer à l'aide du champ <code>semantic_text</code>, comme pour <code>jina-embeddings-v5-text</code>. Il suffit de remplacer <code>inference_id</code> par <code>.jina-embeddings-v5-omni-small</code> ou <code>.jina-embeddings-v5-omni-nano</code>. Consultez le <a href="https://www.elastic.co/docs/reference/elasticsearch/mapping-reference/semantic-text-how-tos">Guide de référence</a> pour les instructions.</p><p>Pour intégrer d'autres médias avec <code>jina-embeddings-v5-omni</code>, vous devez <a href="https://www.elastic.co/docs/api/doc/elasticsearch/operation/operation-inference-embedding">utiliser l'API d'inférence</a>. Par exemple :</p>POST _inference/embedding/.jina-embeddings-v5-omni-small
{
  "input": [
    {
      "content": { 
        "type": "image", 
        "format": "base64", 
        "value": "data:image/jpeg;base64,..." 
      } 
    }, 
    { 
      "content": { 
        "type": "text", 
        "value": "Some text to create an embedding" 
      } 
    } 
  ] 
}<p>Pour <code>jina-embeddings-v5-omni-nano</code>, remplacez l'URI <code>POST</code> par <code>_inference/embedding/.jina-embeddings-v5-omni-nano</code>.</p><p>Pour encoder des documents dans d’autres supports, ou générer des embeddings pour la classification ou le clustering, vous devez <a href="https://www.elastic.co/docs/api/doc/elasticsearch-serverless/operation/operation-inference-put-jinaai"><u>créer un point de terminaison d’inférence avec le </u></a><u><code>jinaai</code></u><a href="https://www.elastic.co/docs/api/doc/elasticsearch-serverless/operation/operation-inference-put-jinaai"><u> service</u></a>.</p><p>Pour les requêtes, utilisez le constructeur de requêtes comme dans l’exemple ci-dessous. Remplacez la valeur <code>inference_id</code> par <code>.jina-embeddings-v5-omni-nano</code> pour utiliser le modèle <code>nano</code> au lieu de <code>small</code>.</p>POST my-index/_search
{
  "knn": {
    "field": "dense-vector-field",
    "k": 10,
    "num_candidates": 100,
    "query_vector_builder": {
      "embedding": {
        "inference_id": ".jina-embeddings-v5-omni-small",
        "input": {
          "type": "image",
          "format": "base64",
          "value": "data:image/jpeg;base64,..."
        }
      }
    }
  }
}<p>Consultez la <a href="https://www.elastic.co/docs/reference/query-languages/query-dsl/query-dsl-knn-query#knn-query-builder-embedding">documentation du générateur de requêtes</a> pour plus d'informations.</p><p>Pour utiliser BBQ avec <code>jina-embeddings-v5-omni</code>, suivez les<a href="https://www.elastic.co/docs/reference/elasticsearch/mapping-reference/bbq"> instructions pour l’indexation de BBQ</a>.</p><h2>Plus d'informations</h2><p>Pour plus d’informations sur <code>jina-embeddings-v5-omni</code>, consultez le <a href="https://arxiv.org/html/2605.08384v2">rapport technique</a> et la page du modèle sur le <a href="https://jina.ai/models/">site web de Jina AI</a>. La <a href="https://huggingface.co/collections/jinaai/jina-embeddings-v5-omni">page de la collection</a> <code>jina-embeddings-v5-omni</code> sur Hugging Face contient également des informations techniques et des instructions pour télécharger et exécuter ces modèles localement. Les modèles <code>jina-embeddings-v5-omni</code> peuvent être téléchargés sous une <a href="https://creativecommons.org/licenses/by-nc/4.0/deed.en">licence CC-BY-NC-4.0</a>, vous êtes donc libre de les essayer, mais pour un usage commercial, veuillez contacter le service commercial d’Elastic.</p>]]></content:encoded>
    <link>https://www.elastic.co/search-labs/blog/jina-embeddings-v5-omni-all-media-one-index</link>
    <guid isPermaLink="true">https://www.elastic.co/search-labs/blog/jina-embeddings-v5-omni-all-media-one-index</guid>
    <category><![CDATA[Jina AI]]></category>
    <dc:creator><![CDATA[Scott Martens]]></dc:creator>
    <enclosure url="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt61bf5ce9de247ac5/6a17e89a7b54f9f4108b390f/b51e488ba5b90bec77f75af0b9cb4f0e25e20b91-1130x635.png" length="0" type="image/png"/>
    <pubDate>Mon, 11 May 2026 00:00:00 GMT</pubDate>
  </item>
  <item>
    <title><![CDATA[jina-embeddings-v5-text : modèles d’embeddings textuels compacts et de pointe pour la recherche et les applications intelligentes]]></title>
    <description><![CDATA[Présentation des modèles jina-embeddings-v5-text, dont jina-embeddings-v5-text-small et jina-embeddings-v5-text-nano, ainsi que de leur utilisation en tant que modèles d’embeddings multilingues via Elastic Inference Service (EIS).]]></description>
    <content:encoded><![CDATA[<p>Jina AI et Elastic lancent <code>jina-embeddings-v5-text</code>, une famille de modèles d’embeddings textuels compacts et hautes performances, offrant des performances de pointe pour des modèles de taille comparable sur l’ensemble des principaux types de tâches.</p><p>La famille comprend deux modèles :</p><ul><li><p><code>jina-embeddings-v5-text-small</code></p></li><li><p><code>jina-embeddings-v5-text-nano</code></p></li></ul><p>Ces modèles sont le fruit d’une nouvelle méthode d’entraînement innovante pour les modèles d’embeddings. Tous deux surpassent des modèles bien plus volumineux, tout en réduisant les besoins en mémoire et en ressources de calcul, et en accélérant les temps de réponse.</p><p>Le modèle <code>jina-embeddings-v5-text-small</code> compte 677 millions de paramètres, prend en charge une fenêtre de contexte d’entrée de 32 768 tokens et génère par défaut des embeddings de 1 024 dimensions.</p><p><code>jina-embeddings-v5-text-nano</code> pèse environ un tiers de la taille de son homologue, avec 239 millions de paramètres et une fenêtre de contexte d’entrée de 8 192 tokens, offrant des embeddings de 768 dimensions.</p><p>Nom du modèle</p><p>Taille totale</p><p>Taille de la fenêtre contextuelle d'entrée</p><p>Taille des embeddings</p><p>jina-v5-text-small</p><p>677M paramètres</p><p>32 768 tokens</p><p>1 024 dimensions</p><p>jina-v5-text-nano</p><p>239M paramètres</p><p>8 192 tokens</p><p>768 dimensions</p><p>Ces deux modèles se classent parmi les meilleurs pour les performances globales au benchmark MTEB (<a href="https://huggingface.co/spaces/mteb/leaderboard">Massive Text Embedding Benchmark</a>) et au benchmark multilingue MTEB. Parmi les modèles ayant moins de 500 millions de paramètres, <code>jina-embeddings-v5-text-nano</code> est le plus performant, malgré moins de 250 millions de paramètres, et <code>jina-embeddings-v5-text-small</code> est le leader parmi les modèles d’embeddings multilingues de moins de 750 millions de paramètres.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltb2f2be8618f5e240/6a17dbb83e9e45b7f3ba1344/d97126285fa196c3045b1913b7754e4b186c1e4c-1300x1100.png" alt="jina-embeddings-v5-text Scores MMTEB" /><p>Ces modèles sont disponibles via Elastic Inference Service (EIS), via une API en ligne, et peuvent également être déployés en local. Pour savoir comment accéder aux modèles <code>jina-embeddings-v5-text</code>, consultez la section « <strong>Commencer</strong> » ci-dessous.</p><p>Les modèles d’embeddings et l’indexation sémantique améliorent considérablement la précision des algorithmes de recherche, tout en répondant à de nombreux autres cas d’usage liés à la similarité sémantique et à l’extraction de sens, par exemple :</p><ul><li><p>Détection de textes en double.</p></li><li><p>Reconnaissance des paraphrases et des traductions.</p></li><li><p>Découverte de thématiques.</p></li><li><p>Moteurs de recommandation.</p></li><li><p>Analyse des sentiments et des intentions.</p></li><li><p>Filtrage des spams.</p></li><li><p>Et bien d'autres encore.</p></li></ul><h2><strong>Fonctionnalités</strong></h2><p>Cette nouvelle famille de modèles propose un ensemble de fonctionnalités conçues pour améliorer la pertinence et réduire les coûts.</p><h3>Optimisation des tâches</h3><p>Nous avons optimisé les modèles <code>jina-embeddings-v5-text</code> pour quatre grands types de tâches :</p><p>Tâche</p><p>Exemples de cas d'utilisation</p><p>Récupération</p><p>Recherche à l’aide de requêtes en langage naturel et récupération des correspondances les plus pertinentes au sein d’une collection de documents.</p><p>Correspondance de texte</p><p>Similarité sémantique, déduplication, alignement des paraphrases et des traductions, et plus encore.</p><p>Clustering</p><p>Découverte de thématiques, organisation automatique de collections de documents.</p><p>Classification</p><p>Catégorisation de documents, analyse des sentiments et détection des intentions, tâches similaires.</p><p>Optimiser un modèle pour une tâche implique généralement de faire des compromis sur une autre. La plupart des modèles d’embeddings n’offrent donc des performances compétitives que pour un seul type de tâche. En revanche, les modèles <code>jina-embeddings-v5-text</code> peuvent se spécialiser dans les quatre catégories sans compromettre l’entraînement, grâce à des <a href="https://arxiv.org/abs/2106.09685">adaptateurs Low-Rank Adaptation (LoRA)</a> spécifiques à chaque tâche.</p><p>Les adaptateurs LoRA sont une sorte de plugin pour un modèle d’IA, qui en modifie fortement le comportement tout en n’augmentant que légèrement sa taille totale. Au lieu d’avoir un modèle distinct pour chaque tâche, chacun comportant des centaines de millions de paramètres, la famille de modèles <code>jina-embeddings-v5-text</code> vous permet d’utiliser un seul modèle, associé à un adaptateur LoRA compact pour chaque tâche. Cela permet d’économiser de la mémoire, de l’espace de stockage et de réduire les coûts d’inférence.</p><h3>Troncature des embeddings</h3><p>Nous avons entraîné les modèles <code>jina-embeddings-v5-text</code> avec <a href="https://arxiv.org/abs/2205.13147">Matryoshka Representation Learning (MRL)</a>, ce qui vous permet de réduire la taille de vos embeddings tout en limitant l’impact sur leur qualité.</p><p>Par défaut, <code>jina-embeddings-v5-text-small</code> génère des vecteurs d’embeddings de 1 024 dimensions, chaque valeur étant représentée sur 16 bits, ce qui porte la taille de chaque embedding à 2 Ko. Pour une vaste collection de documents, cela peut représenter un volume de données important à stocker. La recherche dans une base de données vectorielle remplie d’embeddings est proportionnelle à la taille de la base et au nombre de dimensions de chaque vecteur stocké.</p><p>Vous pouvez toutefois réduire de moitié la taille des embeddings (en supprimant 512 des 1 024 dimensions), diminuer l’espace occupé de moitié et doubler la vitesse de recherche. Cela a un impact sur les performances. Supprimer des informations réduit la précision. Mais comme le montre le graphique ci-dessous, supprimer la moitié de l’embedding n’entraîne qu’une légère baisse des performances :</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt8deea6ee69a6b77d/6a17dbba0b0bed2217dd347e/f11969682c81bcf22b5b29a6204ba6ec40471b3d-900x700.png" alt="Taille des embeddings de jina-embeddings-v5-text-small et jina-embeddings-v5-text-nano" /><p>Tant que vos embeddings comportent au moins 256 dimensions, la perte de précision devrait rester relativement faible. En dessous de ce seuil, en revanche, la pertinence et la précision se dégradent rapidement.</p><p>La troncature des embeddings de cette manière vous permet de gérer vos arbitrages entre précision et coûts de calcul. Vous disposez ainsi des leviers nécessaires pour obtenir des gains d’efficacité significatifs et réduire sensiblement les coûts de votre Search AI.</p><h3>Quantification robuste</h3><p>La <em>quantification </em>constitue une autre méthode pour réduire la taille des embeddings. Au lieu de supprimer une partie de chaque embedding, la quantification diminue la précision des valeurs numériques qui le composent. Les modèles <code>jina-embeddings-v5-text</code> génèrent des embeddings avec des valeurs sur 16 bits, mais nous pouvons arrondir ces valeurs, ce qui réduit leur précision ainsi que le nombre de bits nécessaires pour les stocker. Dans le cas le plus extrême, il est possible de ramener chaque valeur à un seul bit (0 ou 1), ce qui compresse les embeddings par défaut de 1 024 dimensions de <code>jina-embeddings-v5-text</code>de 2 kilooctets à 128 octets, soit une réduction de 94 % grâce à la seule quantification binaire. Comme pour la troncature, cela permet de réaliser d’importantes économies de mémoire et de ressources de calcul. Cependant, à l’instar de la troncature, la quantification réduit la précision des embeddings.</p><p>Nous avons entraîné les modèles <code>jina-embeddings-v5-text</code> pour fonctionner avec la <a href="https://www.elastic.co/docs/reference/elasticsearch/mapping-reference/bbq">Better Binary Quantization (BBQ)</a> d’<a href="https://www.elastic.co/fr/elasticsearch">Elasticsearch</a>, en minimisant la perte de précision. Les tests comparatifs des embeddings binarisés issus de ces modèles montrent des performances presque équivalentes à celles de leurs versions non binarisées. Consultez <a href="https://arxiv.org/abs/2602.15547">le rapport technique</a> pour accéder à des études d’ablation détaillées sur les performances de la binarisation.</p><h3>Performance multilingue</h3><p>De nombreux modèles d’embeddings sont multilingues, car ils ont été entraînés sur des corpus couvrant un grand nombre de langues. Cela ne signifie pas pour autant qu’ils offrent des performances équivalentes dans toutes les langues prises en charge.</p><p>Nous avons identifié 211 langues dans le benchmark multilingue MTEB et les avons isolées afin de comparer nos modèles à des modèles similaires, langue par langue. L’image ci-dessous synthétise nos résultats sous la forme d’une carte thermique. Chaque zone correspond à une langue (identifiée par son code ISO-639) et plus la couleur est verte, meilleures sont les performances du modèle par rapport à la moyenne des modèles similaires :</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltee08033102f46c4f/6a17dbbc420229503229f4c8/852ac5d0f1977bb0c1124d87f8863a9bb94eb7da-1600x765.png" alt="Langues de jina-embeddings-v5-text-nano et jina-embeddings-v5-text-small dans le benchmark multilingue MTEB" /><p>Bien que la précision varie selon les langues, les modèles <code>jina-embeddings-v5-text</code> atteignent des performances de pointe, ou proches de l’état de l’art, dans la majorité des langues du monde.</p><p>Pour en savoir plus sur les performances multilingues, consultez le <a href="https://arxiv.org/abs/2602.15547">rapport technique</a><a href="https://arxiv.org/abs/2602.15547"><code>jina-embeddings-v5-text</code></a> .</p><h2><strong>Jina in Elastic : une IA native de pointe pour la recherche</strong></h2><p>Avec les modèles <code>jina-embeddings-v5-text</code> sur EIS, vous exécutez des modèles d’embeddings multilingues hautes performances de manière native dans <a href="https://www.elastic.co/fr/elasticsearch">Elasticsearch</a>, avec une inférence entièrement gérée, accélérée par GPU, et sans infrastructure à provisionner ni à faire évoluer. Les modèles <code>jina-embeddings-v5-text</code> enrichissent le catalogue de modèles EIS en proposant des modèles multilingues compacts, tirant parti des dernières avancées en matière d’IA. Ces modèles affichent des performances de pointe sur les benchmarks de recherche d’information et d’analyse de données standard, tout en offrant une prise en charge multilingue inégalée à l’échelle mondiale.</p><p>Avec deux modèles de tailles très différentes, vous pouvez déterminer celui qui convient le mieux à vos applications et à votre budget. De plus, grâce à des embeddings robustes qui restent performants lorsqu’ils sont tronqués à des tailles plus réduites ou quantifiés avec une précision moindre, les modèles <code>jina-embeddings-v5-text </code>offrent des opportunités supplémentaires d’économies concrètes en matière de stockage, de coûts de calcul et de latence de traitement.</p><p>Avec la famille <code>jina-embeddings-v5-text</code>, Jina Reranker et la recherche vectorielle rapide et BM25 d’Elastic, vous bénéficiez désormais d’une <a href="https://www.elastic.co/docs/solutions/search/hybrid-search">recherche hybride</a> de bout en bout, de pointe, proposée par Elastic. Lorsque vous avez besoin des résultats les plus pertinents, que ce soit pour des pipelines de génération augmentée par récupération (RAG), des applications de recherche ou des analyses de données, Elastic associé aux modèles Search AI de Jina vous garantit une qualité robuste et un excellent rapport coût-efficacité.</p><h2><strong>Premiers pas</strong></h2><p>Les modèles <code>jina-embeddings-v5-text</code> sont entièrement intégrés dans <a href="https://www.elastic.co/docs/explore-analyze/elastic-inference/eis">EIS</a>, et vous pouvez les utiliser en définissant lechamp <strong><code>type</code></strong>sur<strong><code>semantic_text</code></strong> lors de la création de votre index et en spécifiant le modèle (<code>jina-embeddings-v5-text-small</code> ou <code>jina-embeddings-v5-text-nano</code>) dans lechamp <code>inference_id</code>, comme dans cet exemple :</p>PUT multilingual-semantic-index
{
  "mappings": {
    "properties": {
      "content": {
        "type": "semantic_text",
        "inference_id": ".jina-embeddings-v5-text-small"
      }
    }
  }
}

# Ingest data about France
POST multilingual-semantic-index/_doc
{
  "content": "The capital of France is Paris"}

GET multilingual-semantic-index/_search
{
  "query": {
    "semantic": {
      "field": "content",
      "query": "What is the French capital?"
    }
  }
}<p><a href="https://www.elastic.co/fr/elasticsearch">Elasticsearch</a> sélectionne automatiquement l’adaptateur LoRA approprié lors de l’indexation et de la recherche. Les dimensions de l'intégration (voir la section « <strong>Troncature des intégrations »</strong> ci-dessus) peuvent être définies lors de la <a href="https://www.elastic.co/docs/api/doc/elasticsearch/operation/operation-inference-put">création d'un point de terminaison d'inférence personnalisé</a>.</p><p>Consultez la <a href="https://www.elastic.co/docs/reference/elasticsearch/mapping-reference/dense-vector">documentation Elasticsearch</a> pour plus d'informations sur l'utilisation des modèles <strong><code>jina-embeddings-v5-text</code></strong> .</p><h2><strong>Plus d'informations</strong></h2><p>Pour en savoir plus sur les modèles <code>jina-embeddings-v5-text</code>, lisez les <a href="https://jina.ai/news/jina-embeddings-v5-text-distilling-4b-quality-into-sub-1b-multilingual-embeddings/">notes de publication sur le blog de Jina AI</a> et le <a href="https://arxiv.org/abs/2602.15547">rapport technique</a>, qui contiennent des informations techniques détaillées sur les performances et la nouvelle procédure de formation innovante de Jina AI. Pour plus d'informations sur le téléchargement et l'exécution de ces modèles localement, consultez la <a href="https://huggingface.co/collections/jinaai/jina-embeddings-v5-text"><code>jina-embeddings-v5-text</code></a><a href="https://huggingface.co/collections/jinaai/jina-embeddings-v5-text"> page de la collection</a> sur Hugging Face.</p><p>Les modèles Jina AI sont disponibles sous <a href="https://spdx.org/licenses/CC-BY-NC-4.0">licence CC-BY-NC-4.0</a>, vous êtes donc libre de les télécharger et de les essayer, mais pour un usage commercial, veuillez contacter <a href="https://www.elastic.co/contact?pg=global&amp;plcmt=nav&amp;cta=205352">les ventes d’Elastic</a>.</p>]]></content:encoded>
    <link>https://www.elastic.co/search-labs/blog/jina-embeddings-v5-text</link>
    <guid isPermaLink="true">https://www.elastic.co/search-labs/blog/jina-embeddings-v5-text</guid>
    <category><![CDATA[Jina AI]]></category>
    <dc:creator><![CDATA[Scott Martens,Sofia Vasileva]]></dc:creator>
    <enclosure url="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltfd81be89ffe5b036/6a17dbbd445de9b55e4cffd1/e98dd30ab925b4bb32830228d71a1a51d02a0917-1600x840.png" length="0" type="image/png"/>
    <pubDate>Mon, 23 Feb 2026 00:00:00 GMT</pubDate>
  </item>
  <item>
    <title><![CDATA[Présentation des modèles Jina, de leurs fonctionnalités et de leurs cas d’usage dans Elasticsearch]]></title>
    <description><![CDATA[Explorez les embeddings multimodaux Jina, Reranker v3 et les modèles d'embedding sémantique, et découvrez comment les utiliser en mode natif dans Elasticsearch.]]></description>
    <content:encoded><![CDATA[<p>Jina, développé par Elastic, propose des modèles fondamentaux pour la recherche, adaptés aux applications et à l’automatisation des processus métier. Ces modèles fournissent des fonctionnalités essentielles pour intégrer l’IA dans des applications Elasticsearch ou des projets d’IA innovants.</p><p>Les modèles Jina se répartissent en trois grandes catégories, conçues pour faciliter le traitement, l’organisation et la recherche d’informations :</p><ul><li><p>Modèles d’embedding sémantique</p></li><li><p>Modèles de reclassification</p></li><li><p>Petits modèles de langage génératif</p></li></ul><h2>Modèles d’embedding sémantique</h2><p>L’idée derrière les embeddings sémantiques est qu’un modèle d’IA peut apprendre à représenter certains aspects du sens d’une entrée en s’appuyant sur la géométrie d’espaces à très grande dimension.</p><p>On peut considérer un embedding sémantique comme un point (techniquement un <em>vecteur</em>) dans un espace à plusieurs dimensions. Un modèle d’embedding est un réseau de neurones qui reçoit des données numériques en entrée (souvent du texte ou une image) et renvoie l’emplacement du point correspondant dans un espace multidimensionnel, sous forme de coordonnées numériques. Si le modèle est efficace, la distance entre deux embeddings sémantiques est proportionnelle à la similarité de sens des objets correspondants.</p><p>Pour comprendre l’intérêt de cette approche dans les applications de recherche, imaginez les embeddings des mots « chien » et « chat » comme des points dans l’espace :</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltbad74e5d8292a60e/6a17db73abe0f2114edfe8d2/802cf9bbcb82180d3fc91009f9f62027eee8f031-615x615.png" alt="" /><p>Un bon modèle d’embedding générera une représentation du mot « félin » bien plus proche de « chat » que de « chien », tandis que « canidé » sera plus proche de « chien » que de « chat », car ces mots partagent un sens très proche :</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltdb2b25691801a881/6a17db747b54f946d28b37a5/bce49daf9a31b8fb7ce1c6ef7ae4e8117a4e8b33-615x615.png" alt="" /><p>Si un modèle est multilingue, nous nous attendrions à la même chose pour les traductions de « chat » et « chien » :</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt976ba40be7776449/6a17db75be6086c2bd0045f2/ce4d030385324526cbd7539140e0e634d939371c-615x615.png" alt="" /><p>Les modèles d’embedding traduisent la similarité ou la différence de sens entre des éléments en relations spatiales entre leurs représentations vectorielles. Les illustrations ci-dessus sont en deux dimensions pour faciliter la visualisation, mais les modèles d’embedding produisent des vecteurs comportant des dizaines, voire des milliers de dimensions. Cela leur permet de capturer les subtilités du sens dans des textes entiers, en leur associant un point dans un espace comportant des centaines, voire des milliers de dimensions, pour des documents pouvant contenir des milliers de mots.</p><h2>Embeddings multimodaux</h2><p>Les modèles multimodaux étendent le principe des embeddings sémantiques à d’autres types de contenu que le texte – notamment les images. On s’attend donc à ce qu’un embedding d’image soit proche de celui d’une description fidèle de cette image :</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt66dc8895485734ec/6a17db77b1e11318d279f155/1ac6aef5b1423e5fe4853e8a547a74e66b0885c2-615x615.png" alt="" /><p>Les embeddings sémantiques offrent de nombreux cas d’usage. Ils peuvent notamment servir à créer des classificateurs efficaces, à regrouper les données (data clustering), ou encore à effectuer des tâches comme la déduplication ou l’analyse de la diversité des données – des fonctionnalités clés dans les environnements big data où les volumes à traiter sont trop importants pour être gérés manuellement.</p><p>L’usage principal des embeddings concerne la recherche d’informations. Elasticsearch peut stocker des objets de récupération avec des embeddings comme clés. Les requêtes sont converties en vecteurs d’embedding, et une recherche renvoie les objets stockés dont les clés sont les plus proches du vecteur d’embedding de la requête.</p><p>Là où la <em>recherche vectorielle</em> traditionnelle (par vecteur unique ou <em>vecteur clairsemé</em>) utilise des vecteurs basés sur les mots ou les métadonnées dans les documents et les requêtes, la <em>recherche par embeddings</em> (ou <em>vecteurs denses</em>) utilise des significations évaluées par l’IA plutôt que des mots. Cela les rend en général plus flexibles et plus précis que les méthodes de recherche classiques.</p><h2>Apprentissage par représentation de type matriochka</h2><p>Le nombre de dimensions d’un embedding et la précision des valeurs qu’il contient ont un impact significatif sur les performances. Les espaces très dimensionnels et les nombres de très grande précision permettent de représenter des informations très complexes et détaillées, mais nécessitent des modèles d’IA plus coûteux à entraîner et à exécuter. Les vecteurs générés occupent également plus d’espace de stockage et nécessitent davantage de ressources de calcul pour mesurer les distances entre eux. L’utilisation de modèles d’embedding sémantique implique donc un compromis important entre précision et consommation de ressources.</p><p>Pour maximiser la flexibilité côté utilisateur, les modèles Jina sont entraînés avec une technique appelée <a href="https://arxiv.org/abs/2205.13147">Matryoshka Representation Learning</a>. Cette méthode pousse le modèle à prioriser les distinctions sémantiques importantes dans les premières dimensions du vecteur, ce qui permet ensuite de tronquer les dimensions les plus élevées sans perte significative de performance.</p><p>Concrètement, cela signifie que les utilisateurs des modèles Jina peuvent choisir le nombre de dimensions qu’ils souhaitent attribuer à leurs embeddings. Réduire le nombre de dimensions entraîne une perte de précision, mais la dégradation des performances reste mineure. Pour la plupart des tâches, les performances des modèles Jina diminuent d’environ 1 à 2 % chaque fois que l’on réduit la taille des embeddings de 50 %, jusqu’à une réduction d’environ 95 %.</p><h2>Récupération asymétrique</h2><p>La similarité sémantique est généralement mesurée de façon symétrique. La valeur obtenue en comparant « chat » à « chien » est la même que celle obtenue en comparant « chien » à « chat ». Mais lorsqu’on utilise des embeddings pour la recherche d’informations, les résultats sont meilleurs si l’on casse cette symétrie et qu’on encode les requêtes différemment des objets à retrouver.</p><p>Cela tient à la façon dont les modèles d’embedding sont entraînés. Les données d’entraînement contiennent des éléments similaires, comme des mots, dans des contextes variés, et les modèles apprennent à en déduire le sens en comparant les similitudes et les différences contextuelles entre ces éléments.</p><p>Ainsi, il se peut par exemple que le mot « animal » apparaisse rarement dans les mêmes contextes que « chat » ou « chien », et que l’embedding du mot « animal » ne soit donc pas particulièrement proche de ceux de « chat » ou « chien ».</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltf219074e18a6290a/6a17db78be6086cf060045f6/9a33163405af6c71ee7f4ba8ebc86af39e295a69-615x615.png" alt="" /><p>Cela réduit la probabilité qu’une requête sur le mot « animal » retourne des documents traitant de chats et de chiens — ce qui est précisément l’effet inverse de l’objectif recherché. On encode donc le mot « animal » différemment selon qu’il s’agit d’une requête ou d’un objet cible à retrouver :</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt33438b4964001467/6a17db79b1e113101c79f159/363992d4f0affba7937c0c8a9f82c9a531fcd3ba-615x615.png" alt="" /><p>La <em>recherche asymétrique</em> consiste à utiliser un modèle différent pour les requêtes, ou à entraîner un modèle d’embedding de façon spécifique pour encoder différemment les éléments selon qu’ils sont stockés pour la recherche ou utilisés comme requêtes.</p><h2>Embeddings multi-vecteurs</h2><p>Les embeddings simples sont efficaces pour la recherche d’informations car ils s’intègrent bien au fonctionnement d’une base indexée : les objets à retrouver sont stockés avec un unique vecteur d’embedding utilisé comme clé de recherche. Lorsque les utilisateurs interrogent le magasin de documents, leurs requêtes sont converties en vecteurs d’embedding, et les documents dont la clé est la plus proche de celle de la requête (dans l’espace vectoriel de haute dimension) sont retournés comme correspondances candidates.</p><p>Les embeddings multi-vecteurs fonctionnent différemment. Au lieu de générer un vecteur de longueur fixe pour représenter une requête ou un objet stocké, ils produisent une séquence d’embeddings représentant des parties plus petites de ces éléments. Ces parties sont généralement des jetons ou mots pour les textes, ou des fragments d’image pour les données visuelles. Ces embeddings traduisent le sens de chaque élément dans son contexte.</p><p>Par exemple, prenons ces phrases:</p><ul><li><p>She had a heart of gold.</p></li><li><p>She had a change of heart.</p></li><li><p>She had a heart attack.</p></li></ul><p>En apparence, ces phrases sont très similaires, mais un modèle multi-vecteur générerait probablement des embeddings très différents pour chaque occurrence du mot « heart », car son sens varie dans le contexte de chaque phrase:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt5c81f089771e6029/6a17db7b7f6f157601c099ec/a33e60c8d8ee3d312bca8375ca2a8b0a0cd40ba9-615x615.png" alt="" /><p>Comparer deux objets à l’aide de leurs embeddings multi-vecteurs revient souvent à calculer leur distance de Chamfer : on compare chaque élément d’un embedding avec ceux de l’autre, puis on additionne les distances minimales. D’autres systèmes, y compris les modules de reclassification Jina présentés plus bas, transmettent ces données à un modèle d’IA spécifiquement entraîné à évaluer leur similarité. Ces deux approches offrent généralement une précision supérieure à la simple comparaison de vecteurs uniques, car les embeddings multi-vecteurs capturent beaucoup plus d’informations contextuelles.</p><p>Toutefois, les embeddings multivecteurs sont peu adaptés à l’indexation. Ils sont souvent utilisés dans les tâches de reclassification, comme illustré dans le modèle <code>jina-colbert-v2</code> présenté dans la section suivante.</p><h2>Modèles d’embedding Jina</h2><h3>Jina Embeddings v4</h3><p><a href="https://jina.ai/news/jina-embeddings-v4-universal-embeddings-for-multimodal-multilingual-retrieval/"><strong>jina-embeddings-v4</strong></a> est un modèle multilingue et multimodal de 3,8 milliards de paramètres (3,8 × 10⁹), compatible avec des textes dans une grande diversité de langues. Il repose sur une architecture innovante qui exploite les connaissances visuelles et linguistiques pour améliorer les performances dans les deux domaines, en particulier dans les tâches de recherche d’images — notamment la <a href="https://huggingface.co/tasks/visual-document-retrieval">recherche de documents visuels</a>. Cela signifie qu’il est capable de traiter des images comme des graphiques, des présentations, des captures d’écran, des pages scannées ou des schémas — des types d’images courants contenant souvent du texte embarqué, en dehors du champ des modèles de vision entraînés sur des scènes du monde réel.</p><p>Nous avons optimisé ce modèle pour différentes tâches à l’aide d’adaptateurs compacts LoRA (<a href="https://huggingface.co/docs/peft/en/package_reference/lora">Low-Rank Adaptation</a>). Cette approche nous permet d’entraîner un modèle unique capable de se spécialiser dans plusieurs tâches sans perte de performance, pour un coût mémoire ou calculatoire minimal.</p><p>Principales fonctionnalités :</p><ul><li><p>Des performances de pointe en recherche de documents visuels, avec en plus une excellente prise en charge du texte multilingue et des images classiques — surpassant des modèles bien plus volumineux.</p></li><li><p>Prise en charge de contextes d’entrée étendus : 32 768 jetons correspondent à environ 80 pages de texte en anglais double interligne, et 20 mégapixels équivalent à une image de 4 500 × 4 500 pixels.</p></li><li><p>Taille des embeddings sélectionnée par l’utilisateur, allant de 2048 dimensions au maximum jusqu’à 128 dimensions. Nous avons constaté empiriquement une forte dégradation des performances en dessous de ce seuil.</p></li><li><p>Compatibilité avec les embeddings simples et multi-vecteurs. Pour le texte, la sortie multivecteur se compose d’un embedding de 128 dimensions pour chaque jeton d’entrée. Pour les images, un embedding de 128 dimensions est généré pour chaque bloc de 28 × 28 pixels nécessaires à la couverture de l’image.</p></li><li><p>Optimisation pour la recherche asymétrique grâce à une paire d’adaptateurs LoRA spécialement entraînés à cet effet.</p></li><li><p>Un adaptateur LoRA optimisé pour le calcul de similarité sémantique.</p></li><li><p>Prise en charge spécifique des langages de programmation et des frameworks IT, également via un adaptateur LoRA.</p></li></ul><p>Nous avons développé <code>jina-embeddings-v4</code> comme outil polyvalent pour toute une gamme de tâches : recherche, compréhension du langage naturel et analyse basée sur l’IA. C’est un modèle relativement compact au vu de ses capacités, mais qui demande tout de même des ressources importantes pour être déployé, et convient mieux à une utilisation via une API cloud ou dans un environnement haute performance.</p><h3>Jina Embeddings v3</h3><p><a href="https://jina.ai/news/jina-embeddings-v3-a-frontier-multilingual-embedding-model/"><strong>jina-embeddings-v3</strong></a> est un modèle d’embedding multilingue, léger, performant, axé sur le texte, avec moins de 600 millions de paramètres. Il prend en charge jusqu’à 8 192 jetons de texte en entrée et génère des embeddings vectoriels simples, avec des tailles personnalisables (de 1 024 à 64 dimensions).</p><p>Nous avons entraîner<code>jina-embeddings-v3</code> non seulement pour la recherche d’informations et la similarité sémantique, mais aussi pour des tâches de classification, comme l’analyse de sentiments, la modération de contenu, le clustering, l’agrégation de nouvelles et la recommandation. Comme <code>jina-embeddings-v4</code>, ce modèle utilise des adaptateurs LoRA spécialisés pour les cas d’usage suivants :</p><ul><li><p>Récupération asymétrique</p></li><li><p>Similarité sémantique</p></li><li><p>Classification</p></li><li><p>Clustering</p></li></ul><p><code>jina-embeddings-v3</code> est un modèle beaucoup plus compact que <code>jina-embeddings-v4</code> , avec une taille de contexte en entrée considérablement réduite, mais qui est aussi moins coûteux à exécuter. Malgré cela, il offre des performances très compétitives (bien qu’uniquement sur du texte) et représente un choix pertinent pour de nombreux cas d’usage.</p><h3>Embeddings de code Jina</h3><p>Les modèles Jina spécialisés pour l’embedding de code — <a href="https://jina.ai/models/jina-code-embeddings-1.5b"><strong>jina-code-embeddings</strong></a> (0,5 Md et 1,5 Md de paramètres) — prennent en charge 15 langages de programmation ainsi que des textes en anglais dans le domaine de l’informatique et des technologies de l’information. Ce sont des modèles compacts, avec respectivement 500 millions et 1,5 milliard de paramètres. Les deux modèles acceptent jusqu’à 32 768 jetons en entrée et permettent à l’utilisateur de définir la taille des embeddings générés : de 896 à 64 dimensions pour le plus petit, et de 1 536 à 128 pour le plus grand.</p><p>Ces modèles prennent en charge la recherche asymétrique, pour cinq spécialisations par type de tâche, en utilisant une méthode de <a href="https://arxiv.org/abs/2101.00190">réglage par préfixe</a> plutôt que des adaptateurs LoRA :</p><ul><li><p><strong>Code vers code.</strong> Récupère du code similaire entre différents langages de programmation. Utilisé pour l’alignement de code, l’élimination des doublons, la migration et le refactoring.</p></li><li><p><strong>Langage naturel vers code.</strong> Permet de retrouver du code correspondant à une requête en langage naturel, un commentaire ou une description.</p></li><li><p><strong>Code vers langage naturel. </strong>Associe du code source à de la documentation ou à d’autres textes en langage naturel.</p></li><li><p><strong>Complétion de code à partir de code.</strong> Suggère du code pertinent pour compléter ou améliorer un extrait existant.</p></li><li><p><strong>Questions-réponses techniques.</strong> Fournit des réponses en langage naturel sur des sujets technologiques, idéal pour des cas d’usage liés à l’assistance technique.</p></li></ul><p>Ces modèles offrent des performances supérieures pour les tâches portant sur la documentation technique et les ressources de développement, à un coût computationnel relativement faible. Ils s’intègrent facilement dans les environnements de développement et les assistants de programmation.</p><h3>Jina ColBERT v2</h3><p><a href="https://jina.ai/models/jina-colbert-v2"><strong>jina-colbert-v2</strong></a> est un modèle d’embedding multivecteur de 560 millions de paramètres. Il est multilingue, entraîné à partir de données couvrant 89 langues, et prend en charge les tailles d’embedding variables et la recherche asymétrique.</p><p>Comme mentionné précédemment, les plongements multivecteurs sont peu adaptés à l’indexation mais sont très utiles pour augmenter la précision des résultats d’autres stratégies de recherche. En utilisant <code>jina-colbert-v2</code><strong>,</strong> vous pouvez calculer à l’avance les embeddings multivecteurs, puis les utiliser pour reclasser les candidats lors de la recherche, au moment de la requête. Cette méthode est moins précise que l’utilisation directe d’un modèle de reclassification, mais beaucoup plus efficace, car elle consiste uniquement à comparer les embeddings multivecteurs déjà stockés, sans faire appel au modèle d’IA à chaque requête ou comparaison de candidats. Elle est particulièrement adaptée aux cas d’usage où la latence et le coût de calcul d’un modèle de reclassification seraient trop élevés, ou lorsque le nombre de documents candidats est trop important.</p><p>Ce modèle produit une séquence d’embeddings, un par jeton d’entrée, et les utilisateurs peuvent choisir des embeddings de 128, 96 ou 64 dimensions. Les correspondances candidates sont limitées à 8 192 jetons. Les requêtes sont encodées de manière asymétrique, ce qui impose à l’utilisateur de spécifier si un texte est une requête ou une correspondance candidate, et de limiter la requête à 32 jetons.</p><h3>Jina CLIP v2</h3><p><a href="https://jina.ai/news/jina-clip-v2-multilingual-multimodal-embeddings-for-text-and-images/"><strong>jina-clip-v2</strong></a> est un modèle d’embedding multimodal de 900 millions de paramètres, entraîné pour produire des embeddings proches entre un texte et une image décrivant le même contenu. Son usage principal est la recherche d’images à partir de requêtes textuelles, mais c’est aussi un modèle textuel performant. Il permet de réduire les coûts liés à la gestion de modèles distincts pour la recherche texte-texte et texte-image.</p><p>Ce modèle prend en charge un contexte d’entrée textuel de 8 192 jetons, et les images sont redimensionnées à 512 × 512 pixels avant génération des embeddings.</p><p>Les architectures CLIP (Contrastive Language–Image Pretraining) sont simples à entraîner, produisent des modèles compacts, mais présentent des limites structurelles importantes. Elles ne permettent pas de transférer la connaissance d’un support à un autre pour améliorer les performances. Elles ne peuvent pas utiliser un support pour améliorer leurs performances sur un autre. Ainsi, même si le modèle sait que les mots « chien » et « chat » sont plus proches en sens que ne l’est « voiture », il ne saura pas forcément qu’une image de chien est plus proche d’une image de chat qu’elle ne l’est d’une image de voiture.</p><p>Cependant, ce modèle souffre également d’un problème connu sous le nom de <em>décalage de modalité</em> : par exemple, un texte sur les chiens pourrait être plus proche, en termes d’embedding, d’un texte sur les chats que d’une image de chien. À cause de cette limitation, nous recommandons d’utiliser CLIP soit pour la recherche texte-image, soit comme modèle textuel seul, mais pas pour combiner les deux dans une même requête.</p><h2>Modèles de reclassification</h2><p>Les modèles de reclassification prennent une ou plusieurs correspondances candidates, ainsi qu’une requête en entrée, et les comparent directement, produisant ainsi des correspondances beaucoup plus précises.</p><p>En théorie, on pourrait utiliser un reranker directement pour la recherche d’informations, en comparant chaque requête à chaque document stocké, mais cela serait extrêmement coûteux en calcul et peu réaliste, sauf pour de très petites collections. En pratique, les rerankers sont donc surtout utilisés pour réévaluer des listes restreintes de correspondances candidates identifiées par d’autres moyens, comme une recherche par embeddings ou d’autres algorithmes de recherche. Les modèles de reclassification conviennent parfaitement aux architectures de recherche hybrides ou fédérées, où une requête peut être envoyée à plusieurs systèmes de recherche distincts, chacun interrogeant ses propres ensembles de données et retournant des résultats différents. Ils sont très efficaces pour fusionner des résultats hétérogènes en une seule réponse de haute qualité.</p><p>La recherche basée sur des embeddings peut représenter un engagement important : elle implique de réindexer toutes vos données stockées et de revoir les attentes des utilisateurs sur les résultats. L’ajout d’un reranker à une solution de recherche existante permet de bénéficier des avantages de l’IA sans avoir à réarchitecturer toute la solution.</p><h2>Modèles de reclassification Jina</h2><h3>Jina Reranker m0</h3><p><a href="https://jina.ai/models/jina-reranker-m0/"><strong>jina-reranker-m0</strong></a> est un reclassificateur multimodal de 2,4 milliards de paramètres, qui prend en charge des requêtes textuelles et des candidats textuels et/ou visuels. C’est le modèle de référence pour la recherche documentaire visuelle, idéal pour interroger des bases contenant des PDF, captures d’écran, images modifiées ou documents semi-structurés, qu’ils soient textuels, visuels ou mixtes.</p><p>Ce modèle prend une requête et une correspondance candidate, et retourne un score. Lorsque la même requête est utilisée avec différents candidats, les scores sont comparables et peuvent être utilisés pour les classer. Il prend en charge une taille d’entrée totale allant jusqu’à 10 240 jetons, incluant la requête et le texte ou l’image candidat(e). Chaque bloc d’image de 28 × 28 pixels utilisé pour couvrir l’image compte comme un jeton pour le calcul de la taille d’entrée.</p><h3>Jina Reranker v3</h3><p><a href="https://jina.ai/models/jina-reranker-v3/"><strong>jina-reranker-v3</strong></a> est un reclassificateur textuel de 600 millions de paramètres avec des performances de pointe pour sa taille. Contrairement à <code>jina-reranker-m0</code>, il traite une requête unique et une liste pouvant aller jusqu’à 64 candidats, puis renvoie leur ordre de classement. Il prend en charge un contexte d’entrée de 131  000 jetons, incluant la requête et tous les candidats.</p><h3>Jina Reranker v2</h3><p><a href="https://jina.ai/models/jina-reranker-v2"><strong>jina-reranker-v2-base-multilingual</strong></a> est un modèle compact et polyvalent, intégrant des fonctionnalités supplémentaires comme le support de l’appel de fonction et des requêtes SQL. Pesant moins de 300 millions de paramètres, ce modèle offre un reclassement multilingue rapide, efficace et précis, avec un support supplémentaire pour la sélection de tables SQL et de fonctions externes associées aux requêtes textuelles, ce qui le rend adapté aux cas d’usage orientés agent.</p><h2>Petits modèles de langage génératif</h2><p>Les modèles de langage génératif sont des modèles comme ChatGPT d’OpenAI, Google Gemini et Claude d’Anthropic, qui acceptent des entrées textuelles ou multimédias et renvoient des sorties textuelles. Il n’existe pas de frontière claire entre les <em>grands</em> modèles de langage (LLM) et les <em>petits</em> modèles de langage (SLM), mais les difficultés pratiques liées au développement, à l’exploitation et à l’usage de LLM de pointe sont bien connues. Les modèles les plus connus ne sont pas distribués publiquement, donc nous ne pouvons qu’estimer leur taille : ChatGPT, Gemini et Claude seraient dans la fourchette des 1 à 3 milliards de milliards de paramètres (1–3×10¹²).</p><p>Exécuter ces modèles, même lorsqu’ils sont en accès libre, dépasse largement les capacités du matériel conventionnel et requiert les puces les plus avancées, organisées en réseaux massivement parallèles. Il est possible d’utiliser des LLM via des API payantes, mais cela implique des coûts importants, une forte latence, et pose des défis en matière de protection des données, de souveraineté numérique et de rapatriement hors du cloud. En outre, les coûts liés à l’entraînement et à la personnalisation de modèles de cette taille peuvent être conséquents.</p><p>C’est pourquoi de nombreuses recherches portent sur le développement de modèles plus petits qui, bien qu’ils n’offrent pas toutes les capacités des plus grands LLM, peuvent exécuter certaines tâches spécifiques avec une qualité équivalente et à moindre coût. Les entreprises déploient généralement des logiciels pour répondre à des besoins spécifiques, et les logiciels d’IA n’échappent pas à cette règle : les solutions basées sur des SLM sont souvent préférées aux LLM. Ils peuvent généralement être exécutés sur du matériel standard, sont plus rapides, consomment moins d’énergie et sont beaucoup plus faciles à personnaliser.</p><p>L’offre SLM de Jina se développe à mesure que nous cherchons à intégrer l’IA dans des solutions de recherche concrètes.</p><h2>Jina SLMs</h2><h3>ReaderLM v2</h3><p><a href="https://jina.ai/models/ReaderLM-v2"><strong>ReaderLM-v2</strong></a> est un modèle de langage génératif capable de convertir du HTML en Markdown ou en JSON, selon des schémas JSON fournis par l’utilisateur et des instructions en langage naturel.</p><p>Le prétraitement et la normalisation des données sont des étapes clés dans le développement de solutions de recherche performantes pour les données numériques, mais les données issues du web sont souvent désordonnées, et les stratégies simples de conversion montrent vite leurs limites. Au contraire, <code>ReaderLM-v2</code> propose une solution d’IA intelligente, capable de comprendre le chaos d’un arbre DOM brut issu d’une page web, et d’identifier avec robustesse les éléments utiles.</p><p>Avec 1,5 milliard de paramètres (1,5 × 10⁹), ils sont mille fois plus compacts que les LLM de dernière génération tout en offrant des performances comparables sur des tâches ciblées.</p><h3>Jina VLM</h3><p><a href="https://jina.ai/models/jina-vlm"><strong>jina-vlm</strong></a> est un modèle de langage génératif de 2,4 milliards de paramètres (2,4×10⁹), conçu pour répondre à des questions en langage naturel à propos d’images. Il offre un excellent support pour l’analyse de documents visuels, c’est-à-dire la réponse à des questions sur des captures d’écran, des présentations, des schémas ou d’autres images non naturelles.</p><p>Par exemple :</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt124b9932e01dcd40/6a17db7d4202291eca29f4bc/adfa1420d079ca4fd5582eef4349b1265b378e76-950x500.png" alt="" /><p>Ils sont également très performants pour la lecture de texte dans des images:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt1a862a9c9a0e42ce/6a17db7fb1e1133a2979f15d/ea3956e7ad86f8e171841cab2c28c8b3498da1d4-1002x500.png" alt="" /><p>Mais là où <code>jina-vlm</code> excelle vraiment, c'est dans la compréhension du contenu des images informatives et artificielles :</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt761cf621ea32e4ae/6a17db8163baff7730741b26/f68606f9d2d99e2cd616d4ff81db3574dc4e26a5-1020x700.png" alt="" /><p>Ou :</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt4df4d31e574df7e3/6a17db82e3179134e02d56e9/297e85e7e78f296388a02301e1e08fed70827423-1000x500.png" alt="" /><p><code>jina-vlm</code> Ils conviennent parfaitement pour la génération automatique de légendes, les descriptions de produits, les balises alt pour les images, et les applications d’accessibilité pour les personnes malvoyantes. Ils ouvrent aussi la voie à des systèmes RAG (retrieval-augmented generation) capables d’utiliser des données visuelles et de permettre à des agents d’IA de traiter des images sans intervention humaine.</p>]]></content:encoded>
    <link>https://www.elastic.co/search-labs/blog/jina-models-elasticsearch-guide</link>
    <guid isPermaLink="true">https://www.elastic.co/search-labs/blog/jina-models-elasticsearch-guide</guid>
    <category><![CDATA[Intégrations]]></category>
    <category><![CDATA[Jina AI]]></category>
    <dc:creator><![CDATA[Scott Martens]]></dc:creator>
    <enclosure url="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blta03919124faf767a/6a17db84ec0f89b8fe5a64d8/407b4c862b51ebdfc7f26db4e25950a65caf1673-656x442.png" length="0" type="image/png"/>
    <pubDate>Thu, 01 Jan 2026 00:00:00 GMT</pubDate>
  </item>
  </channel>
</rss>