<?xml version="1.0" encoding="UTF-8"?>
<rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0">
  <channel>
    <title><![CDATA[Jina AI - Elasticsearch Labs]]></title>
    <description><![CDATA[Articles and tutorials from the Search team at Elastic]]></description>
    <copyright><![CDATA[© 2026. Elasticsearch B.V. All Rights Reserved]]></copyright>
    <image>
      <title><![CDATA[Jina AI - Elasticsearch Labs]]></title>
      <url>https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt1121c0bf0e8a6e65/6a88da6340a1841030ef456f/search-labs-thumbnail.png</url>
      <link>https://www.elastic.co/de/search-labs/blog/category/jina-ai</link>
    </image>
    <link>https://www.elastic.co/de/search-labs/blog/category/jina-ai</link>
    <atom:link href="https://www.elastic.co/de/search-labs/rss/category/jina-ai.xml" rel="self" type="application/rss+xml"/>
    <language><![CDATA[de]]></language>
    <lastBuildDate>Mon, 28 Sep 2026 15:39:25 GMT</lastBuildDate>
  <item>
    <title><![CDATA[On-Prem in weniger als 5 Minuten: Jina-Einbettungsmodelle jetzt für On-Prem-Deployment verfügbar]]></title>
    <description><![CDATA[Alle 28 Jina AI-Modelle, einschließlich Rerankern, als sofort bereitstellbare Docker-Container, ohne Telemetrie und ohne Lizenzserver. Drop-in-kompatibel mit den APIs von OpenAI, Cohere, Voyage AI und Elastic Inference Service.]]></description>
    <content:encoded><![CDATA[<p>Alle 28 Einbettungs- und Reranking-Modelle von Jina AI werden nun als vollständig offline nutzbare Docker-Container für das On-Prem-Deployment bereitgestellt, darunter <a href="https://www.elastic.co/de/search-labs/blog/jina-embeddings-v5-omni-all-media-one-index">jina-embeddings-v5-omni</a><a href="https://www.elastic.co/de/search-labs/blog/jina-embeddings-v5-omni-all-media-one-index"> </a>sowie <a href="https://www.elastic.co/de/search-labs/tutorials/jina-tutorial/jina-reranker-v3">jina-reranker-v3</a>. Laden Sie ein Modell herunter, übertragen Sie es auf ein lokales Air-Gap- oder durch eine Firewall geschütztes System und schon wird die lokale Inferenz in weniger als fünf Minuten ausgeführt. Die Container sind komplett eigenständig und weisen keine externen Verbindungen auf. Es erfolgt kein Aufruf von Hugging Face oder einer anderen Modell-Registrierungsstelle. Zudem gibt es weder einen Lizenzserver noch Telemetrie- oder Logging-Endpoints. In regulierten Branchen, bei Anforderungen an die Datensouveränität oder in Umgebungen, in denen der Internetzugang unzuverlässig oder gar nicht verfügbar ist, entfällt dadurch die Abhängigkeit von KI-Diensten von Drittanbietern. Jina On-Prem unterstützt die Schemata von Elastic Inference Service (EIS), OpenAI, Cohere, Voyage AI und Gemini API, sodass bestehende Anwendungen ohne Codeänderungen funktionieren.</p><p>Die leistungsstärksten KI-Modelle werden auf externen Cloud-Installationen mit Zugriff über eine Web-API ausgeführt, was bedeutet, dass Sie Ihrem KI-Dienstanbieter in Bezug auf Sicherheit, Verfügbarkeit und stabile Preise vertrauen müssen. Sie können die berechtigten Anforderungen an Zuverlässigkeit, Datenschutz, überschaubare Kosten und eine gute Data Governance nicht ohne Weiteres mit dem Einsatz von KI in Einklang bringen, die immer leistungsfähiger, ausgefeilter und ressourcenintensiver wird.</p><p>Regierungsvorschriften, Gerichtsurteile und geschäftliche Erwägungen, die im Interesse Dritter getroffen wurden, haben in jüngster Zeit dazu geführt, dass der Zugang zu bestimmten Diensten eingeschränkt wurde. Und selbst wenn ein Wechsel zu anderen Diensten möglich ist, sind KI-Modelle keine Komponenten, die sich einfach nach Belieben austauschen lassen. Anwendungen, die semantische Einbettungen nutzen, sind darauf angewiesen, zum Zeitpunkt der Abfrage Zugriff auf dieselben Modelle wie zum Zeitpunkt der Daten-Ingestion zu erhalten. Den Zugriff auf das Einbettungsmodell zu verlieren bedeutet, dass Ihr Suchsystem zum Stillstand kommt.</p><p>KI-Preismodelle verstärken dieses Risiko noch. Die jüngsten Finanzberichte großer KI-Anbieter geben den Kunden guten Grund zur Sorge vor möglichen Preiserhöhungen. Die Abhängigkeit von Produkten mit unvorhersehbaren Kosten erhöht das Risiko kapitalintensiver KI-Investitionen, die möglicherweise keine eindeutigen Renditen erzielen.</p><p>Jina On-Prem ist die Antwort von Elastic auf diese Herausforderungen.</p><h2>Wer benötigt On-Prem-KI?</h2><p>Lokales Hosting und die direkte Kontrolle über Ihre KI-Modelle unterstützen eine Vielzahl technischer Anforderungen, Branchenvorgaben und geschäftlicher Interessen.</p><p>Durch eine lokale Installation sinken zwar die Kosten für Ihre KI-Dienstanbieter, allerdings fallen die Kosten für die Hardware und einen zuverlässigen Zugang nun zu Lasten Ihres Unternehmens. Je nach Nutzungsumfang kann es durchaus günstiger sein. Doch es gibt noch weitere dringende Gründe, die für den Betrieb einer eigenen KI sprechen. Sollte eines der unten beschriebenen Probleme auf Ihr Unternehmen zutreffen, sollten Sie eine lokale KI-Lösung wie Jina On-Prem in Betracht ziehen. Diese Liste erhebt keinen Anspruch auf Vollständigkeit.</p><p>Anwendungsfall</p><p>Warum On-Prem</p><p>Beispiel</p><p>Air-Gap/Hohe Sicherheit</p><p>Keine ausgehende Datenübertragung; vollständige Netzwerkisolierung</p><p>Verteidigung, Nachrichtendienste, geheime Forschung</p><p>Einhaltung gesetzlicher Vorschriften</p><p>Datensouveränität; keine grenzüberschreitende Übermittlung oder Weitergabe an Dritte</p><p>Gesundheitswesen (Health Insurance Portability and Accountability Act [HIPAA]), Finanzwesen, EU-Unternehmen (Datenschutz-Grundverordnung [DSGVO])</p><p>Latenzkritisch</p><p>Keine Netzwerkabhängigkeit; keine Toleranz gegenüber Verbindungsausfällen</p><p>Robotik, Edge Computing, Fahrzeuge, Schiffe</p><p>Planbarkeit der Kosten</p><p>Feste Infrastrukturkosten vs. Preise pro Token mit ungewissen zukünftigen Preisen</p><p>Kontinuierliche Inferenz-Workloads mit hohem Volumen</p><p>Haftungsbeschränkung</p><p>Keine Offenlegung von Daten Dritter; Wahrung des Anwaltsgeheimnisses und der Sorgfaltspflicht</p><p>Anwaltskanzleien, Behörden</p><h3>Warum Air-Gap- und firewallgeschützte Systeme On-Prem-KI benötigen</h3><p>Air-Gap- und durch eine Firewall geschützte Systeme können keine externen KI-APIs verwenden. Jina On-Prem wird vollständig innerhalb Ihrer Infrastruktur ohne ausgehende Verbindungen ausgeführt.</p><p>Für Unternehmen, die besonders sensible Daten verwalten, sind Sicherheits- und Datenschutzaspekte von größter Bedeutung. Es nützt wenig, in den Schutz Ihrer sensiblen Daten zu investieren, wenn Sie diese umgehend an einen externen Dritten weitergeben, der möglicherweise über unzureichende Sicherheitsvorkehrungen verfügt oder den Auflagen einer ausländischen Regierung unterliegt.</p><p>Mitarbeiter in Unternehmen, die mit sensiblen Daten umgehen, erhalten oft Schulungen zum sicheren Umgang mit Daten. Diese sind jedoch nicht sehr wirksam, wenn alle Mitarbeiter Webbrowser nutzen, die während der Bearbeitung dieser Daten möglicherweise auf beliebige Seiten im Internet zugreifen können. Die Isolierung ist die wirksamste verfügbare Sicherheitsmaßnahme, sei es durch ein Air Gap oder durch sehr restriktive Firewalls, doch dadurch wird die Nutzung externer Dienste jeglicher Art erschwert.</p><h3>On-Prem-KI für latenzempfindliche Systeme und Systeme mit hoher Verfügbarkeit</h3><p>Software as a Service und Cloud Computing stellen einen Kompromiss zwischen den Kosten für die Bereitstellung leicht zugänglicher, zuverlässiger Dienste auf den eigenen Computern und der Auslagerung dieser Problematik an Dritte dar. Allerdings sind sie mit schwankenden Latenzzeiten, Ausfällen und einem völligen Kontrollverlust verbunden, wenn etwas schiefgeht. KI-Dienste bilden da keine Ausnahme. Wenn Ihr Suchsystem offline geht, sobald Sie keinen Zugriff mehr auf Ihr Einbettungsmodell haben, scheint es möglicherweise kein guter Kompromiss mehr zu sein.</p><p>Darüber hinaus birgt der Einsatz externer KI stets Risiken, die sich nicht ohne Weiteres vorhersehen oder verwalten lassen. Der Internetzugang und die Netzwerklatenz können sich ohne Vorwarnung verschlechtern, beispielsweise aufgrund politischer Ereignisse, schlechten Wetters oder weil Schiffe mit ihren Ankern über Unterwasser-Glasfaserkabel schleifen. Regierungen können Exportverbote verhängen, um den Zugriff auf KI-Modelle schlagartig zu unterbinden – und das haben sie in jüngster Zeit auch getan. KI-Dienstanbieter nehmen Modelle gelegentlich aus dem Angebot, um Sie zu einem Wechsel auf neuere Modelle zu bewegen. Die Flexibilität und die kontrollierten Kosten externer Dienste müssen gegen die Risiken einer Abhängigkeit abgewogen werden.</p><h3>On-Prem-KI für die Compliance mit der DSGVO, HIPAA und Datensouveränität</h3><p>Unternehmen, die personenbezogene Daten erheben, unterliegen immer strengeren Vorschriften, die sich oft von Rechtsraum zu Rechtsraum unterscheiden und widersprüchliche Anforderungen enthalten können. Insbesondere sehen die <a href="https://www.hhs.gov/hipaa/for-professionals/privacy/laws-regulations/index.html">HIPAA-Vorschriften</a> sehr strenge Datenschutzbestimmungen für amerikanische Gesundheitsdienstleister vor. Zudem verlangen strenge allgemeine Datenschutzgesetze in <a href="https://laws-lois.justice.gc.ca/eng/acts/p-8.6/">Kanada</a>, der <a href="https://gdpr-info.eu/">Europäischen Union</a> sowie <a href="https://www.japaneselawtranslation.go.jp/en/laws/view/4241">vielen asiatischen Ländern</a> von allen Unternehmen, die personenbezogene Daten verarbeiten, einen sicheren Umgang mit diesen Daten sowie eine Beschränkung der Weitergabe dieser Daten an Dritte oder in andere Länder. Diese Vorschriften könnten sogar für ausländische Unternehmen Verpflichtungen mit sich bringen, sofern sie Kunden in diesen Ländern haben. Finanzinstitute unterliegen häufig noch strengeren Vorschriften und tragen dieselbe direkte Verantwortung für die Informationssicherheit wie beim Schutz vor anderen Formen krimineller Aktivitäten.</p><p>Die Einhaltung gesetzlicher Vorschriften kann mit KI-Diensten von Drittanbietern unvereinbar sein, insbesondere wenn ihre Nutzung eine grenzüberschreitende Datenübertragung beinhaltet.</p><p>Zudem zeigen die jüngsten Ereignisse, dass Vorschriften, die den physischen Standort von Datenspeichern einschränken, nicht unbedingt einen verlässlichen Schutz bieten, wenn internationale Cloud-Anbieter dem Druck ausländischer Regierungen ausgesetzt sind. Lokale Gesetze können sich je nach Rechtsraum widersprechen, was eine lokale Datenspeicherung und -verarbeitung erforderlich und die Nutzung von Diensten Dritter unmöglich macht. In einigen Fällen ist die einzige Lösung eine vollständige interne Abwicklung aller Prozesse, einschließlich Ihrer KI-Systeme.</p><h3>KI-Haftungsrisiken durch die Datenübertragung von Drittanbietern</h3><p>Datenschutzgesetze und anerkannte Sorgfaltspflichten im Umgang mit sensiblen Daten haben regelmäßig haftungsrechtliche Konsequenzen, die mitunter sehr schwerwiegend sein können. Sie können für den Umgang mit Ihren Daten durch Drittanbieter haftbar gemacht werden. Zwar bieten Gerichte und rechtliche Verfahren unter Umständen einen gewissen nachträglichen Schutz vor unsicheren Dienstanbietern, doch stehen diese Rechtsmittel gegenüber Akteuren der nationalen Sicherheit, Strafverfolgungsbehörden oder kriminellen Hackern weder zur Verfügung noch sind sie im Allgemeinen wirksam.</p><p>Bei Regierungen gab es bereits Fälle, in denen grenzüberschreitend tätige Cloud-Dienstanbieter sensible staatliche Informationen an ausländische Akteure weitergegeben haben.</p><p>Aber selbst wenn Sie sich keine Sorgen um ausländische Regierungen oder Hacker machen und Ihre externen KI-Dienstanbieter selbst sicher sind, kann allein die Tatsache, dass sie extern sind, Haftungsrisiken mit sich bringen.</p><p>So genießen beispielsweise in den meisten Ländern die Kommunikation zwischen Rechtsanwälten und ihren Mandanten einen besonderen rechtlichen Schutz, und Anwaltskanzleien unterliegen strengen Haftungsvorschriften bei der Aufzeichnung oder Speicherung dieser Informationen. In den Vereinigten Staaten ist dieses „Anwaltsgeheimnis“ so bekannt, dass es sogar eine zentrale Rolle in Film- und Fernsehhandlungen spielt. Eine Möglichkeit, diese Privilegien zu verlieren, besteht jedoch darin, Informationen an jemanden weiterzugeben, der diese Privilegien nicht besitzt, und die jüngsten Entwicklungen deuten darauf hin, dass externe KI-Dienstanbieter unter diese Kategorie fallen könnten.</p><p>Zumindest in den Vereinigten Staaten ist es möglich, dass bereits die bloße Nutzung von KI-Diensten von Drittanbietern über eine Internet-API – wie beispielsweise die Einbindung von Modellen, die Indizierungsdienste bereitstellen – gegen wichtige Vertraulichkeitsvorschriften verstoßen könnte. Eine Anwaltskanzlei könnte allein aufgrund der Nutzung extern gehosteter Software verklagt, disziplinarisch belangt oder aus der Anwaltskammer ausgeschlossen werden, selbst wenn keine Sicherheitsverletzung vorliegt.</p><h3>On-Prem-KI für Offline-, Edge- und physisch isolierte Systeme</h3><p>Computersysteme werden nicht nur aus Sicherheitsgründen isoliert. Beispielsweise dürfen sich fahrende Fahrzeuge bei keiner ihrer wesentlichen Funktionen auf einen Internetzugang verlassen. Schiffe und Flugzeuge verfügen über sehr umfangreiche Bordcomputersysteme, die ohne Internetverbindung funktionieren müssen und daher keine externen KI-Dienste nutzen können. Offshore-Plattformen, abgelegene Anlagen in unberührten Naturgebieten, Computerdienste in der Arktis, der Antarktis und auf kleinen Inseln ohne ausreichende physische Anbindung an globale Netzwerke sind allesamt Beispiele für Einrichtungen, die davon profitieren, alle benötigten Dienste lokal zu hosten. Da die Bedeutung der KI in der Unternehmens-IT zunimmt, wird es immer wichtiger, diese Einschränkungen anzugehen.</p><p>Neue Anwendungen der KI in physischen Systemen (Robotik und andere Anwendungsfälle, die räumlich begrenzt sind oder auf die Außenwelt ausgerichtet sind, wie Logistikmanagementsysteme oder sogar Supermarktkassen) sind zwar möglicherweise mit dem globalen Internet verbunden, tolerieren jedoch weder Verbindungsausfälle noch plötzliche Latenzspitzen. Wenn sie für ihren Betrieb auf ein KI-System angewiesen sind, muss dieses KI-System so lokal und zuverlässig wie möglich sein.</p><h2>Wer braucht keine On-Prem-KI?</h2><p>Remote-Softwaredienste und externe KI bieten durchaus Vorteile. Für den Betrieb von KI-Modellen sind unter Umständen teure, stromfressende Prozessoren erforderlich, die bekanntermaßen nur eine kurze Lebensdauer haben. Der Zugang zu hochwertiger Hardware ist derzeit aufgrund von Marktfaktoren und externen wirtschaftlichen Schocks besonders schwierig. Unter diesen Umständen kann es sinnvoll sein, für die Nutzung einer externen API pro Token zu bezahlen, anstatt die hohen Investitionskosten für eine lokale KI zu tragen.</p><p>Externe APIs sind für gelegentliche Nutzer am sinnvollsten. Wenn Sie KI-Modelle in erster Linie zur Batch-Verarbeitung von Daten für Analysezwecke nutzen und nicht zum Betreiben eines Suchsystems, das ständig online sein muss, macht es wenig Sinn, in kapitalintensive Hardware und lokale Installationen zu investieren.</p><p>Darüber hinaus kann die Nutzung von KI-Diensten, die sich in derselben Cloud-Infrastruktur befinden, ein besseres Preis-Leistungs-Verhältnis bieten als das Deployment eines eigenen lizenzierten KI-Modells, wenn Ihre Datenverarbeitung bereits cloudbasiert ist, beispielsweise bei einer E-Commerce-Website, die aus Gründen der Zuverlässigkeit und Erreichbarkeit in der Cloud gehostet wird. Sie sind ohnehin schon von Ihrem Cloud-Dienstanbieter abhängig, daher stellt die Abhängigkeit von seinen KI-Diensten kein großes zusätzliches Risiko dar.</p><p>Wenn Ihr Anwendungsfall dieser Beschreibung entspricht, stehen Ihnen Jina AI-Modelle auf <a href="https://www.elastic.co/docs/explore-analyze/elastic-inference/eis">EIS</a>, im <a href="https://aws.amazon.com/marketplace/seller-profile?id=seller-stch2ludm6vgy">AWS Marketplace</a> und auf der <a href="https://console.cloud.google.com/marketplace/browse?q=jina">Google Cloud Platform</a> speziell für Ihre Anforderungen zur Verfügung.</p><p>Die folgende Tabelle fasst die wichtigsten Faktoren zusammen. Ihre Antwort hängt von Ihren Daten, Ihrer Infrastruktur und Ihrem Nutzungsmuster ab.</p><p>Faktor</p><p>On-Prem bevorzugt</p><p>Cloud-API bevorzugt</p><p>Nutzungsmuster</p><p>Kontinuierliche oder Inferenz mit hohem Volumen</p><p>Intermittierende oder Batch-Verarbeitung</p><p>Datensensibilität</p><p>Reguliert, souverän oder klassifiziert</p><p>Keine grenzüberschreitenden oder durch Dritte auferlegten Einschränkungen</p><p>Netzwerkumgebung</p><p>Air-Gap, durch Firewall geschützt oder unzuverlässig</p><p>Stabiles, stets verfügbares Internet</p><p>Bestehende Infrastruktur</p><p>Im Besitz von GPU-Hardware oder Möglichkeit zur Beschaffung</p><p>Bereits in der Cloud mit KI-Colocation gehostet</p><p>Kostenmodell</p><p>Feste Hardware + Lizenz; vorhersehbare Kosten beim Skalieren</p><p>Pro Token; geringere Vorabkosten, variable langfristige Kosten</p><p>Latenztoleranz</p><p>Keine (Robotik, Edge, Echtzeit)</p><p>Netzwerkvariabilität ist akzeptabel</p><p>Operative Verantwortung</p><p>Ihr Team verwaltet die Hardware und Verfügbarkeit</p><p>Der Anbieter verwaltet die Hardware und die Updates; Sie verwalten die Integration</p><p>Sie müssen die Kosten und den Nutzen unter Berücksichtigung Ihrer individuellen Umstände und Anwendungsfälle abwägen und dabei die im vorigen Abschnitt hervorgehobenen Punkte berücksichtigen, die auf Sie zutreffen. Die Kosten-Nutzen-Analyse wird sich im Laufe der Zeit zweifellos ändern. Wir können die Zukunft der KI-Branche oder die Hardwarepreise nicht einmal kurzfristig vorhersagen.</p><h2>Einführung von Jina On-Prem</h2><p>Für Nutzer, die von lokalen KI-Diensten profitieren können, führen wir <a href="https://github.com/jina-ai/jina-on-prem/wiki/">Jina On-Prem</a> ein, ein vollständig eigenständiges Installationspaket für die leistungsstarken Modelle von Jina AI.</p><p>Die Modelle von Jina AI erreichen die gleiche Genauigkeit wie Einbettungsmodelle, die <a href="https://mteb-leaderboard.hf.space/benchmark/MTEB(Multilingual%2C%20v2)">ein Vielfaches ihrer Größe haben</a>, und senken dabei die Rechenkosten, den Speicherbedarf und die Hardwareanforderungen. Dadurch sind sie eine ideale Wahl für Nutzer, die ihre KI On-Prem betreiben möchten oder müssen. Kommerzielle Lizenzen sind mit skalierbaren, preislich gestaffelten Lösungen für Anwendungsfälle aller Größen verfügbar.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt190865fb3ebde472/6a6a33d0065b162508701ff9/02559ceca556a26c53eb703ae87d421452b27251-1374x1400.png" alt="MMTEB Multilingual v2 leaderboard showing Jina AI embedding model rankings: jina-embeddings-v5-omni-small and jina-embeddings-v5-text-small ranked 13th, jina-embeddings-v5-omni-nano and jina-embeddings-v5-text-nano ranked 19th, competing against models from Microsoft, Google, Tencent, NVIDIA and Qwen" /><h3>Welche API-Schemata unterstützt Jina On-Prem?</h3><ul><li><p>Erhältlich als vollständige Sammlung von Abhängigkeiten für die lokale Installation oder als <a href="https://www.docker.com/">Docker-Container</a>, den Sie innerhalb weniger Minuten installieren und ausführen können.</p></li><li><p>Jina-On-Prem-Installationen <em>rufen</em> keine externen Systeme auf.</p><ul><li><p>Es erfolgt kein Aufruf des Hugging Face Hub oder einer Modellregistrierung (HF_HUB_OFFLINE=1 und TRANSFORMERS_OFFLINE=1 sind fest integriert).</p></li><li><p>Es gibt keinen Lizenzserver.</p></li><li><p>Es gibt keine Telemetrie- oder Logging-Endpoints.</p></li></ul></li><li><p>Unterstützt sowohl CPU- als auch GPU-Hardware mit automatischer GPU-Erkennung.</p></li><li><p>Alle 28 verfügbaren Jina-AI-Modelle, einschließlich der neuesten multimodalen Einbettungsmodelle <a href="https://www.elastic.co/de/search-labs/blog/jina-embeddings-v5-omni-all-media-one-index">jina-embeddings-v5-omni</a> und <a href="https://www.elastic.co/de/search-labs/tutorials/jina-tutorial/jina-reranker-v3">jina-reranker-v3</a>.</p></li><li><p>Zugriff über gängige KI-API-Schemata: <a href="https://jina.ai/api-dashboard">Jina API</a>, OpenAI, Cohere, Voyage AI und Gemini. Jina On-Prem ist eine sofort einsatzbereite Lösung für Anwendungen, die auf diesen Schemata basieren.</p></li><li><p>Drop-in-Ersatz für Modelle, die über den <a href="https://www.elastic.co/docs/explore-analyze/elastic-inference/eis">EIS</a> bereitgestellt werden. Jina On-Prem lässt sich direkt in <a href="https://www.elastic.co/de/blog/deploy-elastic-air-gapped-disconnected-environments">Elastic-Deployments mit Air-Gap</a> integrieren.</p></li></ul><h2>Hardwareanforderungen für Jina AI-On-Prem-Modelle</h2><p>Die Hardwareanforderungen variieren je nach Jina-Modell. Die folgende Tabelle zeigt die Empfehlungen für die neuesten Modelle unter Verwendung von GPU-Einstellungen. Sie benötigen keine leistungsstärkere GPU als eine NVIDIA L4, allerdings wird für die v5-Einbettungsmodelle eine A100 empfohlen. Unser neuestes Einbettungsmodell erfordert derzeit mindestens 8 GB VRAM.</p><p>Modell</p><p>Mindest-VRAM</p><p>Empfohlene GPU</p><p>jina-embeddings-v5-text-nano</p><p>2 GB</p><p>T4 / L4</p><p>jina-embeddings-v5-text-small</p><p>3 GB</p><p>L4 / A10G</p><p>jina-embeddings-v5-omni-small</p><p>8 GB</p><p>L4 / A10G / A100</p><p>jina-reranker-v3</p><p>3 GB</p><p>L4</p><p>jina-clip-v2</p><p>4 GB</p><p>L4</p><p>jina-code-embeddings-1.5b</p><p>4 GB</p><p>L4</p><p>ReaderLM-v2</p><p>4 GB</p><p>L4</p><p>Wenn Sie mehr als ein Modell gleichzeitig verwenden, steigen die VRAM-Anforderungen. Weitere Informationen finden Sie auf der Seite <a href="https://github.com/jina-ai/jina-on-prem/wiki/Sizing-And-Hardware">Größen und Hardware</a>.</p><h2>So installieren Sie Jina On-Prem mit Docker</h2><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt20265d09e2d8d0f4/6a6a33d1065b162105701ffd/ada9881af407168298b1940f8537ad71a5411c89-1999x1200.png" alt="" /><p>Der schnellste Weg für den Einstieg ist die <a href="https://www.docker.com/get-started/">Installation von Docker</a> (sofern noch nicht geschehen) und das Befolgen der Anweisungen auf der Seite <a href="https://github.com/jina-ai/jina-on-prem/wiki/QuickStart">Jina On-Prem Quick Start</a>.</p><p>Für alle 28 Jina-Modelle stehen vorkonfigurierte Docker-Container zur Verfügung. Laden Sie ein Modell herunter und übertragen Sie es auf Ihr Installationsziel – schon können Sie Jina-AI-Modelle in weniger als fünf Minuten ausführen.</p><p>Für multimodale oder benutzerdefinierte Builds oder zum Herunterladen des vollständigen Abhängigkeitssatzes für die Installation außerhalb eines Containers befolgen Sie bitte die Schritte, die in der <a href="https://github.com/jina-ai/jina-on-prem/wiki/Bundling-Guide">Bundling-Anleitung</a> beschrieben sind.</p><p>Ihre Jina-On-Prem-Installation unterstützt alle Jina-API- und EIS-Funktionen sowie die Generierung von Einbettungen über die APIs von OpenAI, Cohere, Voyage AI und Gemini, sodass sie sich über Standardschnittstellen in bereits vorhandene Anwendungen integrieren lässt. Weitere Informationen finden Sie in der <a href="https://github.com/jina-ai/jina-on-prem/wiki/API-Reference">API-Dokumentation</a>.</p><p>Jina-Modelle, einschließlich der mit Jina On-Prem installierten Modelle, sind unter verschiedenen Lizenzbedingungen erhältlich, wobei die neuesten Modelle für die nichtkommerzielle Nutzung unter einer <a href="https://creativecommons.org/licenses/by-nc/4.0/deed.en">CC BY-NC 4.0</a>-Lizenz kostenlos zur Verfügung stehen. Für die Lizenzierung von Jina On-Prem für die kommerzielle Nutzung wenden Sie sich bitte an <a href="https://www.elastic.co/de/contact">Elastic Sales</a>.</p>]]></content:encoded>
    <link>https://www.elastic.co/search-labs/blog/on-prem-ai-jina-embedding-models</link>
    <guid isPermaLink="true">https://www.elastic.co/search-labs/blog/on-prem-ai-jina-embedding-models</guid>
    <category><![CDATA[Jina AI]]></category>
    <category><![CDATA[Integrationen]]></category>
    <dc:creator><![CDATA[Scott Martens]]></dc:creator>
    <enclosure url="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt17731ab0c6ec66f6/6a6a33d140a4941014ca5c9a/09bc6dac4e6a86c7877f8ed78d68f5d581aeffa9-1999x1200.png" length="0" type="image/png"/>
    <pubDate>Thu, 23 Jul 2026 00:00:00 GMT</pubDate>
  </item>
  <item>
    <title><![CDATA[Ein Index, alle Medien: Einführung von Jina-Embeddings-v5-Omni]]></title>
    <description><![CDATA[Mit jina-embeddings-v5-omni können Sie Text, Bilder, Videos und Audiodateien in einen einzigen Elasticsearch-Index einbetten und gleichzeitig abfragen.]]></description>
    <content:encoded><![CDATA[<p><code>jina-embeddings-v5-omni</code> vereint Text, Bilder, Video und Audio in einem einzigen Elasticsearch-Index. Die v5-omni-Suite erweitert die bestklassigen <a href="https://www.elastic.co/search-labs/blog/jina-embeddings-v5-text"><code>jina-embeddings-v5-text</code></a>-Modelle und fügt visuelle und akustische Codierung durch eine innovative Architektur hinzu, die das Text-Backbone identisch lässt und so eine erstklassige Leistung in einem sehr kompakten Einbettungsmodell bietet.</p><p>Sie können jetzt leistungsstarke semantische Einbettungen für <strong>Text</strong>, <strong>Bilder</strong>, <strong>Videos</strong> und <strong>Audioaufnahmen</strong> in <strong>fast 100 Sprachen</strong> erstellen und sie für Klassifikation, Clustering, semantische Ähnlichkeitsmessung und Indexierung für den Abruf verwenden. Wenn Ihre Daten neben Texten auch in PDFs, Aufnahmen und Videos vorliegen, benötigen Sie keine separaten Pipelines mehr für jedes Format.</p><p>Die <code>jina-embeddings-v5-omni</code>-Familie ist das <strong>derzeit kompakteste Einbettungsmodell auf dem Markt und unterstützt Bilder, Sprache, Print und Video</strong>. Es bietet:</p><ul><li><p><strong><code>jina-embeddings-v5-text</code></strong><strong>s erstklassige Texteinbettungen</strong> für Abruf-, Analyse- und KI-Agentenanwendungen.</p></li><li><p><strong>Erstklassige Einbettungen</strong> <strong>für visuelle semantische Ähnlichkeit, visuelles Verständnis und Bildabruf.</strong> <code>jina-embeddings-v5-omni-small</code> erzielt die beste Performance bei Bild-Benchmarks aller Modelle mit 1 Milliarde (10⁹) Parametern und ist unserem vorherigen Modell <a href="https://www.elastic.co/search-labs/blog/jina-models-elasticsearch-guide#jina-clip-v2"><code>jina-clip-v2</code></a> überlegen. Nur wenige Modelle mit drei- bis dreißigmal so vielen Parametern können da mithalten.</p></li><li><p><strong>Modernste Einbettungen für mehrsprachiges visuelles Verständnis und Abruf</strong>, die Modelle übertreffen, die bis zu 20-mal größer sind.</p></li><li><p><strong>Erstklassige Audioeinbettungen</strong>, wobei nur Modelle, die die doppelte oder mehr Anzahl von Parametern haben, bei Standard-Benchmarks besser abschneiden.</p></li><li><p><strong>Unterstützung für Video</strong>, insbesondere zur Lokalisierung von Objekten und Ereignissen in Aufnahmen.</p></li></ul><p>Dies findet Anwendung in allen Bereichen des Informationsabrufs, der Dokumentenverarbeitung und der Datenanalyse. <code>jina-embeddings-v5-omni</code> ermöglicht den Zugriff auf Informationen, die in verschiedenen Mediensilos eingeschlossen sind, und macht sie für den Abruf, die Analyse und die Nutzung durch KI-Agenten zugänglich. Informationen in Audio- und Videoaufnahmen, PDF-Dateien, gedruckten Seitenscans und Infografiken stehen auf einer Ebene mit digitalisierten Texten in Ihrem Datenökosystem.</p><p>Genau wie <code>jina-embeddings-v5-text</code> gibt es auch diese Modelle in zwei Größen: <code>small</code> und <code>nano</code>. Beide Modelle erweitern ihr jeweiliges Textäquivalent um zusätzliche Module, die Audio- und visuelle Eingaben unterstützen. Nutzer können Module beim Laden auswählen. Zusätzlich werden aufgabenspezifische Erweiterungen für semantische Ähnlichkeit, Klassifikation, Clustering und Informationsabruf als kompakte Low-Rank-Adapter (LoRAs) implementiert und so geladen, dass Nutzer sie zur Inferenzzeit auswählen können.</p><p>Beide Modelle sind sehr kompakt. <code>jina-embeddings-v5-omni-small</code> kann auf herkömmlichen GPU-fähigen Servern ausgeführt werden, und <code>jina-embeddings-v5-omni-nano</code> ist klein genug, um auf Standardhardware zu laufen. Dies birgt ein großes Einsparpotenzial bei den Rechenkosten und ermöglicht die lizenzierte lokale Installation und Edge-Verarbeitung, wodurch die Latenz reduziert und Ihre Kontrolle über Ihre eigenen Daten erhöht wird.</p><p>Die v5-omni-Suite nutzt innovative Modelldesign- und Machine-Learning-Techniken, um neue Einbettungsmodelle aus bereits trainierten Modellen zusammenzustellen, ohne sie neu trainieren zu müssen. Wir verwenden Encoder aus vortrainierten, sprachorientierten Einbettungsmodellen für Audio- und Videomedien als Eingabe-Präprozessoren für unsere bestehende <code>jina-embeddings-v5-text</code>-Modellsuite. Die resultierenden Modelle erzeugen Einbettungen für Bilder und Tonaufnahmen, die semantisch mit den Einbettungen für Texte kompatibel sind.</p><p>Die v5-omni-Modelle erzeugen Texteinbettungen, die identisch mit <code>jina-embeddings-v5-text</code> sind (also <code>jina-embeddings-v5-omni-small</code> mit <code>jina-embeddings-v5-text-small</code> und <code>jina-embeddings-v5-omni-nano</code> mit <code>jina-embeddings-v5-text-nano</code>), sodass Sie bestehende Textabruf-Repositories auf multimediale Anwendungen erweitern können, ohne Ihre Indizes neu aufbauen zu müssen.</p><p>Die integrierten Encoder stammen alle aus offenen Quellen. Für Bilder und Videos haben wir Encoder von <a href="https://qwen.ai/blog?id=qwen3.5">Qwen3.5-Modellen</a> verwendet:</p><ul><li><p>Für <code>jina-embeddings-v5-omni-nano</code>ist der fein abgestimmte <a href="https://huggingface.co/google/siglip2-base-patch16-224">SigLIP2-Basis-Encoder</a> von <a href="https://huggingface.co/Qwen/Qwen3.5-0.8B">Qwen3.5-0.8B</a>.</p></li><li><p>Für <code>jina-embeddings-v5-omni-small</code>der fein abgestimmte <a href="https://huggingface.co/google/siglip2-so400m-patch14-384">SigLIP2 So400m-Encoder</a> von <a href="https://huggingface.co/Qwen/Qwen3.5-2B">Qwen3.5-2B</a>.</p></li><li><p>Zur Audio-Unterstützung haben wir den Encoder von <a href="https://huggingface.co/openai/whisper-large-v3">Whisper-large-v3</a>, der aus <a href="https://huggingface.co/Qwen/Qwen2.5-Omni-7B">Qwen2.5-Omni-7B</a> extrahiert wurde, sowohl für die kleine als auch für die Nano-Version hinzugefügt.</p></li></ul><p>Wir haben diese medienspezifischen Encoder mithilfe trainierter cross-modaler Projektoren mit dem Backbone der Textverarbeitung verbunden. Diese Projektoren übersetzen ihre nativen Ausgänge in Eingangseinbettungen, die mit <code>jina-embeddings-v5-text</code> kompatibel sind. Die einzigen neu trainierten Teile der <code>jina-embeddings-v5-omni</code>-Modelle sind die Gewichte in diesen Projektoren.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt62dc05bfa3d054b6/6a17e86eb1e113340b79f29c/4cb834b7e5fd63cdd78600de313615feffabbb1f-1999x1000.jpg" alt="" /><p>Diese Architektur bedeutet, dass wir nur die modellübergreifenden Projektoren trainieren müssen, ungefähr 5,5 Millionen Parameter für <code>jina-embeddings-v5-omni-small</code> und unter 3,5 Millionen für <code>jina-embeddings-v5-omni-nano</code>, für jeden der vier LoRa-Adapter. Dieser Ansatz minimiert den zusätzlichen Trainingsaufwand, der für die Verbindung verschiedener Einbettungsmodelle erforderlich ist, und nutzt das spezialisierte Training der einzelnen Modelle, um eine extrem kompakte, leistungsstarke und modulare Einbettungssuite zu erstellen.</p><h2>Ausgewählte Modelleigenschaften</h2><h3>Eingang/Ausgang</h3><p>Modellname</p><p>Größe des Eingangskontextfensters</p><p>Einbettungsgröße</p><p>jina-embeddings-v5-omni-small</p><p>32.768 Token*</p><p>1024 Dimensionen (Minimum: 32)</p><p>jina-embeddings-v5-omni-nano</p><p>8.192 Token*</p><p>768 Dimensionen (Minimum: 32)</p><p>* Unter <strong>Using jina-embeddings-v5-omni</strong> unten erfahren Sie mehr darüber, wie nicht-textbezogene Medien tokenisiert werden.</p><h3>Größe</h3><p>Modellname</p><p>Gesamtgröße</p><p>jina-embeddings-v5-omni-small (nur Text, Basismodell + 4 LoRA-Adapter)</p><p>700 Mio. Parameter</p><p>Bild-/Video-Unterstützung (SigLIP2 So400m-Encoder extrahiert aus Qwen3.5-2B)</p><p>1.006B Parameter</p><p>Audiounterstützung (Whisper-large-v3-Encoder, extrahiert aus Qwen2.5-Omni-7B)</p><p>1,354 Mrd. Parameter</p><p>beide</p><p>1,660 Mrd. Parameter</p><p>LoRA-Adapter (jeweils)</p><p>20 Mio.</p><p>jina-embeddings-v5-omni-nano (nur textbasiertes Basismodell + 4 LoRA-Adapter)</p><p>266 Mio. Parameter</p><p>Bild-/Videounterstützung (SigLIP2-Basis-Encoder, extrahiert aus Qwen3.5-0.8B)</p><p>354 Mio. Parameter</p><p>Audiounterstützung (Whisper-large-v3-Encoder, extrahiert aus Qwen2.5-Omni-7B)</p><p>916 Mio. Parameter</p><p>beide</p><p>1.004B Parameter</p><p>LoRA-Adapter (jeweils)</p><p>7 Mio.</p><p>* Unter <strong>Using jina-embeddings-v5-omni</strong> unten erfahren Sie mehr darüber, wie nicht-textbezogene Medien tokenisiert werden.</p><h2>Aufgabenspezifisches Training</h2><p>Die <code>jina-embeddings-v5-omni</code>-Familie unterstützt die gleichen aufgabenspezifischen LoRA-Adapter wie <code>jina-embeddings-v5-text</code>:</p><p>Aufgabe</p><p>Anwendungsbeispiele</p><p>Abruf</p><p>Informationsabruf, allein oder in Verbindung mit anderen Abruf- und Kandidatenbewertungstechniken. Mit den v5-omni-Modellen können Sie Audio, Video und Bilder in einer einzigen Abfrage aus einem Index abrufen.</p><p>Clustering</p><p>Themenfindung und automatische Themenorganisation in allen Medien.</p><p>Klassifizierung</p><p>Kategorisierung, Stimmungsanalyse und ähnliche Aufgaben.</p><p>Semantische Ähnlichkeit</p><p>Deduplizierung von Daten in verschiedenen Medien, Empfehlungssystemen, verwandten Medien, Suchen nach Texten, die zur Sprache passen, Identifizierung von Übersetzungen und ähnlichen Aufgaben.</p><p>Ausgangseinbettungen hängen von der ausgewählten Aufgabenkategorie ab. Zum Beispiel sollte man keine abruforientierten Einbettungen für Clustering oder semantische Ähnlichkeitseinbettungen für die Klassifikation verwenden.</p><h2>Multimedia, multimodal, mehrsprachig, multifunktional</h2><p>Um zu zeigen, was <code>jina-embeddings-v5-omni</code> kann, nehmen wir die berühmten Anfangspassagen zweier Romane und messen ihre semantische Ähnlichkeit:</p><p><em><strong>A Tale of Two Cities</strong></em><strong> (Charles Dickens)</strong></p>It was the best of times, it was the worst of times, it was the
age of wisdom, it was the age of foolishness, 
it was the epoch of belief, it was the epoch of incredulity,
it was the season of Light, it was the season of Darkness,
it was the spring of hope, it was the winter of despair,
we had everything before us, we had nothing before us,
we were all going direct to Heaven, we were all going
direct the other way—in short, the period was so far like
the present period, that some of its noisiest authorities
insisted on its being received, for good or for evil, in 
the superlative degree of comparison only.<p><em><strong>Pride and Prejudice</strong></em><strong> (Jane Austen)</strong></p>It is a truth universally acknowledged, that a 
single man in possession of a good fortune must
be in want of a wife. However little known the
feelings or views of such a man may be on his first
entering a neighbourhood, this truth is so well
fixed in the minds of the surrounding families,
that he is considered as the rightful property of
some one or other of their daughters.<p>Mit <code>jina-embeddings-v5-omni-small</code> und seinem semantischen Ähnlichkeitsadapter haben diese Texte eine Ähnlichkeit von <strong>0,5329</strong>.</p><p>Diese Zahl ist ohne Vergleichswert wenig aussagekräftig. Vergleichen wir daher diese beiden Texte mit ihren französischen Übersetzungen unter Verwendung desselben Modells und Adapters:</p><p><strong>Semantische Ähnlichkeitswerte für Texte in verschiedenen Sprachen</strong></p><p></p><p>A Tale of Two Cities (Englisch)</p><p>Pride and Prejudice (Englisch)</p><p>Tale of Two Cities (Französisch) (Paris et Londres en 1783, tr. H. Loreau)</p><p>0,9095</p><p>0,5074</p><p>Pride and Prejudice (Französisch) (Orgueil et Préjugés, tr. Leconte et Pressoir)</p><p>0,4826</p><p>0,8784</p><p>Die beiden Texte zeigen eine viel größere Ähnlichkeit zu ihren Übersetzungen als zu anderen Texten in derselben Sprache oder in einer anderen. Dies spiegelt die sehr leistungsstarken mehrsprachigen semantischen Einbettungen von <code>jina-embeddings-v5-text-small</code> wider, die unverändert in <code>jina-embeddings-v5-omni-small</code> enthalten sind.</p><p>Die Hinzufügung von Multimedia-Unterstützung zu <code>jina-embeddings-v5-omni</code> bedeutet, dass wir dieses Experiment auf ganz andere Datentypen ausweiten können. Wir haben z. B. Scans der ersten Seiten beider Romane aus alten Druckausgaben angefertigt:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt95d451adb5680e20/6a17e871445de9e88a4d016c/e92d928a4813ccecc7d02639eea699e3a71c66e3-1999x1692.png" alt="Zwei alte Buchseiten zeigen die ersten Passagen von „A Tale of Two Cities“ und „Pride and Prejudice“, wobei die linke Seite den Anfang des ersten Kapitels einer undatierten Ausgabe von „A Tale of Two Cities“ aus dem 19. Jahrhundert zeigt und die rechte Seite den Beginn des ersten Kapitels der Macmillan-Ausgabe von 1903 von „Pride and Prejudice“." /><p><strong>Abbildung 2:</strong> <em>Tale of Two Cities</em>, undatierte Ausgabe aus dem 19. Jahrhundert, und <em>Pride and Prejudice</em>, Macmillan-Ausgabe von 1903.</p><p>Vergleichen wir nun beide Texte mit den Scans, wiederum unter Verwendung des semantischen Ähnlichkeitsadapters:</p><p><strong>Semantische Ähnlichkeitswerte zwischen Texten und Bildern</strong></p><p></p><p>A Tale of Two Cities (Scan)</p><p>Pride and Prejudice (Scan)</p><p>Tale of Two Cities (Text)</p><p>0,7336</p><p>0,4891</p><p>Pride and Prejudice (Text)</p><p>0,4804</p><p>0,7213</p><p>Man sieht, dass semantische Ähnlichkeitswerte Texte, die mit Bildinhalten übereinstimmen, stark bevorzugen.</p><p>Wir können die Texte auch mit einem Screenshot eines Beitrags in den sozialen Medien und einem Meme, das sich auf diese Texte bezieht, vergleichen, indem wir dasselbe Setup verwenden:</p><p><strong>Abbildung 3:</strong> Ein Tweet von Elon Musk, der <em>A Tale of Two Cities</em> referenziert, und ein Meme, das auf den berühmten Anfang von <em>Pride and Prejudice</em> anspielt.</p><p><strong>Semantische Ähnlichkeitswerte zwischen Texten und Bildern</strong></p><p></p><p>A Tale of Two Cities</p><p>Stolz und Vorurteil</p><p>Musk-Tweet (Bild)</p><p>0,7156</p><p>0,4912</p><p>Meme „Keep calm“ (Bild)</p><p>0,4555</p><p>0,6244</p><p>Dasselbe können wir auch für die Sprache tun. Uns liegen Aufnahmen von Lesungen beider Texte vor, sowohl in Englisch als auch in Französisch:</p><ul><li><p><a href="https://drive.google.com/file/d/1IK_bR6L47TSrnESdXLEpHCX6o-FzPmOx/view?usp=sharing"><em>A Tale of Two Cities</em></a><a href="https://drive.google.com/file/d/1IK_bR6L47TSrnESdXLEpHCX6o-FzPmOx/view?usp=sharing"> (englische Audioausgabe von Librivox).</a></p></li><li><p><a href="https://drive.google.com/file/d/1KurbhD6INc6oZlq_SJcWq7MBVfJQ3pof/view?usp=sharing"><em>A Tale of Two Cities</em></a><a href="https://drive.google.com/file/d/1KurbhD6INc6oZlq_SJcWq7MBVfJQ3pof/view?usp=sharing"> (französisches Audio erzeugt von OmniVoice KI).</a></p></li><li><p><a href="https://drive.google.com/file/d/1D_G2FOCb7ct-FBVY1fyivXlY2e_yGZw1/view?usp=sharing"><em>Pride and Prejudice</em></a><a href="https://drive.google.com/file/d/1D_G2FOCb7ct-FBVY1fyivXlY2e_yGZw1/view?usp=sharing"> (englische Audioausgabe von Librivox).</a></p></li><li><p><a href="https://drive.google.com/file/d/1jutY61YSFGBIyE8m-ltEJx-8dEXNJJ5N/view?usp=sharing"><em>Pride and Prejudice</em></a><a href="https://drive.google.com/file/d/1jutY61YSFGBIyE8m-ltEJx-8dEXNJJ5N/view?usp=sharing"> (französisches Audio generiert von OmniVoice KI)</a>.</p></li></ul><p><strong>Semantische Ähnlichkeitswerte zwischen Texten und Audiodateien in verschiedenen Sprachen</strong></p><p></p><p>A Tale of Two Cities (englisches Audio)</p><p>A Tale of Two Cities (Französisches Audio)</p><p>Pride and Prejudice (englisches Audio)</p><p>Pride and Prejudice (Französisches Audio)</p><p>A Tale of Two Cities (englischer Text)</p><p>0,3816</p><p>0,3106</p><p>0,1607</p><p>0,1774</p><p>A Tale of Two Cities (französischer Text)</p><p>0,3528</p><p>0,3253</p><p>0,1598</p><p>0,1721</p><p>Pride and Prejudice (englischer Text)</p><p>0,1910</p><p>0,1682</p><p>0,3511</p><p>0,3398</p><p>Pride and Prejudice (französischer Text)</p><p>0,1667</p><p>0,1474</p><p>0,3018</p><p>0,3702</p><p>Diese mehrsprachige und multimediale Fähigkeit erstreckt sich auch auf das Abrufen von Informationen.</p><p>Die Abrufsadapter für die <code>jina-embeddings-v5-omni</code>-Modelle implementieren einen asymmetrischen Abruf. Das bedeutet, dass Abfragen anders eingebettet werden als bei den Abruf-Zieldokumenten, sodass cross-modale Abfragen immer in eine Richtung gehen, mit Abfragen in einem Medium und Dokumenten in einem anderen, was andere Werte als beim Umkehren ergibt.</p><p>Die untenstehenden Tabellen zeigen die Abrufwerte für Text-, Audio- und Seiten-Scans von <em>A Tale of Two Cities</em> und <em>Pride and Prejudice</em>, wenn der Text aus <em>A Tale of Two Cities</em> (auf Englisch) als Abfrage codiert wird:</p><p><strong>Text zu Text</strong></p><p>Dokument</p><p>Abrufbewertung</p><p>A Tale of Two Cities (französischer Textauszug)</p><p>0,7597</p><p>Stolz und Vorurteil (englischer Textauszug)</p><p>0,1482</p><p>Pride and Prejudice (französischer Textauszug)</p><p>0,0523</p><p><strong>Text zu Bild</strong></p><p>Dokument</p><p>Abrufbewertung</p><p>A Tale of Two Cities (englischer Seitenscan)</p><p>0,5517</p><p>A Tale of Two Cities (Französischer Seitenscan)</p><p>0,3576</p><p>Pride and Prejudice (englischer Seitenscan)</p><p>0,1917</p><p><strong>Text zu Audio</strong></p><p>Dokument</p><p>Abrufbewertung</p><p>A Tale of Two Cities (englisches Audio)</p><p>0,3277</p><p>A Tale of Two Cities (Französisches Audio)</p><p>0,1980</p><p>Pride and Prejudice (englisches Audio)</p><p>0,1419</p><p>Pride and Prejudice (Französisches Audio)</p><p>0,1759</p><p>Nutzer können die Abfrage auch umgekehrt ausführen, indem sie Audio-zu-Text und Bild-zu-Text-Abfragen durchführen.</p><p>Nachfolgend sind die Bewertungen unter Verwendung des englischen Audios von <em>A Tale of Two Cities</em> als Abfrage und verschiedener Texte als Dokumente aufgeführt.</p><p><strong>Bild zu Text</strong></p><p>Dokument</p><p>Abrufbewertung</p><p>A Tale of Two Cities (englischer Textauszug)</p><p>0,3352</p><p>A Tale of Two Cities (französischer Textauszug)</p><p>0,2650</p><p>Stolz und Vorurteil (englischer Textauszug)</p><p>0,1626</p><p>Pride and Prejudice (französischer Textauszug)</p><p>0,1385</p><p>Und die Scores unter Verwendung eines Scans der ersten Seite von <em>A Tale of Two Cities</em> (auf Englisch) als Abfrage:</p><p><strong>Audio zu Text</strong></p><p>Dokument</p><p>Abrufbewertung</p><p>A Tale of Two Cities (englischer Textauszug)</p><p>0,5304</p><p>A Tale of Two Cities (französischer Textauszug)</p><p>0,4845</p><p>Stolz und Vorurteil (englischer Textauszug)</p><p>0,1467</p><p>Pride and Prejudice (französischer Textauszug)</p><p>0,0761</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt501b2c594f45f2e3/6a17e877a292992e3ad02c9a/673f5116c1d7a5a6f9adfbb2f48b9e6920e3229b-668x130.png" alt="In einem rechteckigen Benachrichtigungsfeld mit hellblauem Hintergrund wird ein gelbes Warndreieck-Symbol neben einem Text angezeigt, der erklärt, dass jina‐embeddings‐v5‐omni darauf trainiert ist, Audio-, Video- und Bilddateien anhand von Textabfragen zu finden, und dass Abfragen, die nicht auf Text basieren, möglicherweise weniger effektiv sind." /><h2>Videosuche</h2><p>Die Funktionen des <code>jina-embeddings-v5-omni</code>für Video-Indexierung und -Suche integrieren neue Funktionen in Elasticsearch-Datenbanken, unterliegen jedoch vielen der gleichen Warnungen, die auch für Texte gelten. Die Generierung einer einzelnen Einbettung für einen langen Film ist wie die Einbettung eines sehr langen Romans: Detaillierte Informationen gehen unter, und die resultierende Einbettung wird für viele sehr unpassende Abfragen eine gute Übereinstimmung sein.</p><p>Wenn Sie den gesamten Text von <em>Lord of the Rings</em> (~500.000 Wörter) einbetten, ist das wahrscheinlich ein guter Treffer für die meisten Suchanfragen, egal, wonach Sie suchen. Ebenso erhalten Sie bei der Indizierung eines zweistündigen Hollywood-Films viele sporadische Übereinstimmungen und völlig übersehene Details. <code>jina-embeddings-v5-omni</code> ist optimal für kurze Clips.</p><p>Für dieses Beispiel haben wir den Trailer zum 1961 erschienenen Film <em>Breakfast At Tiffany’s</em> heruntergeladen, der nur 158 Sekunden lang und gemeinfrei ist. Den Trailer können Sie <a href="https://archive.org/details/turner_video_311/311.mp4">im Internet Archive</a> ansehen.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt06633fdd1c8334dd/6a17e8790b0bed7d9add35b2/1948f585027d1342528c0dd93fe99e3ec7ba17f9-800x1200.png" alt="Ein Vintage-Filmplakat von „Breakfast at Tiffany's“ zeigt ein illustriertes Ganzkörperbild von Audrey Hepburn in einem langen schwarzen Kleid mit schwarzen Handschuhen, einer Perlenkette und einem Zigarettenhalter, mit einer Katze auf der Schulter. Eine kleinere Hintergrundillustration zeigt ein sich umarmendes Paar vor einer Stadtkulisse, und das Poster enthält farbige Ränder sowie Angaben zu Besetzung und Produktion." /><p><strong>Abbildung 4: </strong>Das Kinoplakat für <em>Breakfast at Tiffany’s</em>.</p><p>Wir haben <a href="https://www.scenedetect.com/">PySceneDetect </a>verwendet, um den Trailer in 28 einzelne Szenen aufzuteilen, mit Längen von 1,877 Sekunden (45 Frames) bis 18,393 Sekunden (441 Frames). Die Szenenerkennung ist zwar nicht perfekt, bietet aber einen ausreichenden Mechanismus, um Videos in überschaubare Abschnitte für die spätere Wiedergabe zu unterteilen. Dann haben wir Dokument-Einbettungen für jedes der 28 Segmente mit <code>jina-embeddings-v5-omni-small</code> erstellt, um die Wirksamkeit von Textabfragen beim Finden bestimmter Elemente im Video testen zu können.</p><p>Zum Beispiel lieferte die Suche nach „Katze“ die folgenden Clips als die drei besten Ergebnisse. Die eine Szene mit einer Katze darin ist ganz oben, mit einem Score von <strong>0,1634</strong>:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt6dca953a4afd5c1b/6a17e87baf47b65bf6cddfbc/82bd1759ebb65202f01a1e290447619af39f9a3d-735x426.png" alt=" Ein Video-Vorschaubild zeigt eine Person, die auf dem Küchenboden kniend in einen offenen Kühlschrank greift, während eine Katze in der Nähe steht (Score 0,1634)." /><p><a href="https://drive.google.com/file/d/1O3r-97rQJE7HAlUHsLygmFLwlZihRF26/view?usp=drive_link">Sehen Sie sich den ersten Clip an</a>.</p><p>Das nächsthöchste Match, mit einem Score von <strong>0,1237</strong>, ist deutlich niedriger:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltcc2cc1ef9ff9ce4b/6a17e87d7c026e725cf146b3/de4eb704ef751cc4df2bead7faa177decd20b1b3-735x426.png" alt="Ein Video-Vorschaubild zeigt eine Person, die eine bunte Maske nahe an ihr Gesicht hält. Der Name „GEORGE PEPPARD“ ist über das Bild gelegt (Score 0,1237)." /><p><a href="https://drive.google.com/file/d/1DEK2H4bCpLVzyipJri9NSqE2jkeZ5jLm/view?usp=drive_link">Sehen Sie sich den zweiten Clip an</a>.</p><p>Sie können auch nach Aktionen abfragen. Bei einer Suchanfrage mit der Zeichenfolge „Kuss“ enthalten die ersten vier Treffer alle das Wort „Küsse“:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt85bf55536faf5156/6a17e87f25daab4bb608a269/18efdcbbb31954dfab8eafe5055773b6b8e3de72-735x426.png" alt="Ein Video-Vorschaubild zeigt drei Personen in einem Raum, wobei eine Person links von der Kamera abgewandt steht und sich zwei Personen rechts scheinbar nahe einem Vorhang und einer Tür umarmen (Score 0,2864)." /><p><a href="https://drive.google.com/file/d/1Pmr_D4wKjUCCiq_Dzy5PQeWldJLjZ8kI/view?usp=drive_link">Sehen Sie sich den dritten Clip an.</a> Sein Score liegt bei 0,2864.</p><p>Scores: Jeweils für den <a href="https://drive.google.com/file/d/1sS_4qTnmHU2uOwbN1fmdXeS3IvZAI_IN/view?usp=drive_link">zweiten Treffer</a> (0,2494), den <a href="https://drive.google.com/file/d/1ofsrZHTUb3huwQ0JB6Hs5dOw4myTj-sk/view?usp=drive_link">dritten Treffer</a> (0,2099) und den <a href="https://drive.google.com/file/d/1qaS4eueUCcQWdHLEjfEfneXsaWsx6P_5/view?usp=drive_link">vierten Treffer</a> (0,2068)</p><p>Und Sie können nach Texten suchen, die in Videos angezeigt werden, wie zum Beispiel nach „Buddy Ebsen“, der nur einmal vorkommt. <code>jina-embeddings-v5-omni-small</code> identifiziert es sofort als das beste Match mit einem Score von <strong>0,3885</strong>, deutlich höher als das nächstbeste Match:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt4c3fd86052f17ce8/6a17e886e9ea8795d8a9c601/dabcae9f44b9d4a671f88717aa21a2c6cf685f6b-735x426.png" alt="Ein Video-Vorschaubild, das einen Mann im Anzug zeigt, der neben einer Treppe mit weißen Balustern und einem dunklen Handlauf steht, mit dem überlagerten Text „Buddy Ebsen“ (Score 0,3885)." /><p><a href="https://drive.google.com/file/d/1rdQ1OqtPBD-3iGG8A900jU5DpC-muye4/view?usp=sharing">Buddy Ebsen Clip</a>.</p><h2>Visuelles Abrufen von Dokumenten</h2><p>Die multimodalen Einbettungsmodelle von Jina AI sind führend in der visuellen Dokumentenverarbeitung und auf dem neuesten Stand der Technik in der mehrsprachigen visuellen Dokumentenverarbeitung. Dies bedeutet die Verarbeitung von Bilddaten, die Text, Abbildungen und strukturierte Informationen enthalten. Wichtige Daten liegen oft in Form von Ausdrucken, Scans, PDF-Dateien, Diagrammen, technischen Zeichnungen, Screenshots, Bildern, Infografiken und Ähnlichem vor. Solche Bilder sind oft mechanisch zusammengestellt oder computergeneriert. Sie können in der Regel nicht ohne Bedeutungsverlust auf Text reduziert werden und eignen sich schlecht für Computer-Vision-Modelle, die für die Fotografie natürlicher Szenen entwickelt wurden.</p><p><code>jina-embeddings-v5-omni</code>Die Einbettungen umfassen Informationen über die Dinge im Bild, den darauf gedruckten Text und die Beziehungen zwischen den beiden. Die visuelle Dokumentensuche ermöglicht es, reichhaltige Bilder zu indizieren, die sowohl Objekte als auch relevanten Text in verschiedenen Sprachen enthalten.</p><p>Als Beispiel verwenden wir vier Produktbilder von verschiedenen E-Commerce-Websites:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt620568521e2a3057/6a17e888f7018418c89a68a8/639481349aed78d4139f0d388d44f79b6ba29f88-1297x650.png" alt="" /><p>Schauen wir uns nun an, wie gut <code>jina-embeddings-v5-omni-small</code> diese vier Bilder für die Abfrage „Ramen-Nudeln“ bewertet:</p><p>Campbell’s Chunky Chicken Noodle (kanadische Verpackung)</p><p>Kraft Dinner (kanadische Verpackung)</p><p>Maruchan Miso Flavour Fresh Ramen (japanische Verpackung)</p><p>Birkel Spaghetti (Deutsche Verpackung)</p><p>0,0872</p><p>0,0711</p><p>0,1123</p><p>0,0886</p><p>Es findet problemlos das japanische Gegenstück.</p><p>Versuchen wir nun eine Abfrage nach „マカロニチーズ“ (japanisch für <em>Makkaroni und Käse</em>):</p><p>Campbell’s Chunky Chicken Noodle (kanadische Verpackung)</p><p>Kraft Dinner (kanadische Verpackung)</p><p>Maruchan Miso Flavour Fresh Ramen (japanische Verpackung)</p><p>Birkel Spaghetti (Deutsche Verpackung)</p><p>0,2207</p><p>0,3487</p><p>0,2760</p><p>0,2674</p><p>Es findet die korrekte Übereinstimmung mit der gleichen Leichtigkeit wie eine englische Abfrage.</p><p><code>jina-embeddings-v5-omni</code> zeichnet sich auch durch das Verständnis von informativen Bildern wie Diagrammen aus. Um dies in Aktion zu erleben, schauen Sie sich diese beiden Balkendiagramme an:</p><p>Zwei Diagramme, <strong>Diagramm 1</strong> links über die globale Krankheitslast, und <strong>Diagramm 2</strong> rechts über die Lebensdauer von Hunderassen.</p><p>Mal sehen, wie gut sie zwei mögliche Textfragen abgleichen, die jeweils für eines, aber nicht für beide Diagramme relevant sind, wobei <code>jina-embeddings-v5-omni-small</code> für den Abruf verwendet wird:</p><p>Textfrage</p><p>Diagramm 1</p><p>Diagramm 2</p><p>„Was sind häufige medizinische Probleme bei älteren Menschen?“</p><p>0,2787</p><p>0,1099</p><p>„Wie lange leben Hunde?“</p><p>0,1350</p><p>0,3564</p><p>Sie können die Suche auch umkehren und Bilder als Suchbegriffe verwenden, um Texte zu finden. Die folgende Tabelle zeigt die aus den Abstracts thematisch verwandter wissenschaftlicher Arbeiten extrahierten Zieldokumente und ihre Abrufergebnisse, wobei die Diagrammbilder als Abfragen verwendet wurden:</p><p></p><p>Text 1</p><p>Text 2</p><p></p><p>Die Gesundheit von Menschen, die in extremer Armut leben, steht seit Langem im Mittelpunkt der globalen Entwicklungsbemühungen und hat auch in der Ära der nachhaltigen Entwicklungsziele weiterhin Priorität. Allerdings gab es seit fast zwei Jahrzehnten keinen systematischen Versuch, das Ausmaß und die Ursachen der Belastung in dieser speziellen Bevölkerungsgruppe zu quantifizieren. Wir haben die Krankheitsraten nach Ursachen für die ärmste Milliarde Menschen der Welt geschätzt und diese Raten mit denen in Bevölkerungsgruppen mit hohem Einkommen verglichen.</p><p>Der Begleithund zählt zu den phänotypisch vielfältigsten Arten. Die Variabilität zwischen Rassen erstreckt sich nicht nur auf die Morphologie und Verhaltensaspekte, sondern auch auf die Langlebigkeit. Trotz dieser Tatsache wurde bisher wenig Forschung betrieben, um die Unterschiede in der Lebenserwartung zwischen verschiedenen Rassen zu untersuchen oder das Potenzial für eine phylogenetische Charakterisierung der Langlebigkeit zu bewerten.</p><p>Diagramm 1</p><p>0,2377</p><p>0,1357</p><p>Diagramm 2</p><p>0,0673</p><p>0,3576</p><h2>Features</h2><h3>Kürzbare Einbettungen</h3><p>Wir haben die Backbone- <code>jina-embeddings-v5-text</code>-Modelle, die <code>jina-embeddings-v5-omni</code> untermauern, mit <a href="https://arxiv.org/abs/2205.13147">Matryoshka Representation Learning</a> trainiert, sodass Sie sowohl Text- als auch Multimedia-Einbettungen aus diesen Modellen kürzen können.</p><p>Standardmäßig erzeugt <code>jina-embeddings-v5-omni-small</code> Einbettungen mit 1.024 Dimensionen und benötigt 2 KB zur Speicherung mit 16-Bit-Präzision. Die Einbettungen von <code>jina-embeddings-v5-omni-nano</code>haben 768 Dimensionen und nehmen etwa 1,5 KB ein. Sie können die Größe dieser Einbettungen auf 32 Dimensionen (64 Bytes) reduzieren, was zwar zu Lasten der Genauigkeit geht, aber einen großen Gewinn an Verarbeitungsgeschwindigkeit und geringere Ressourcenkosten mit sich bringt. Im Allgemeinen führt eine Halbierung der Einbettungsgröße zu einer Verringerung der Genauigkeit um etwa 2 %, bis hin zu 128 Dimensionen, unterhalb derer die Genauigkeit viel schneller abnimmt.</p><p>Durch kürzbare Einbettungen können Nutzer den optimalen Kompromiss zwischen Genauigkeit, Geschwindigkeit und Kosten für ihre jeweiligen Anwendungsfälle festlegen.</p><h3>Quantisierung</h3><p>Die <code>jina-embeddings-v5-omni</code>-Familie erbt auch eine robuste Leistung unter Quantisierung von ihrem <code>jina-embeddings-v5-text</code>-Backbone. Dies erhöht die Geschwindigkeit weiter und senkt die Rechen- und Speicherkosten, indem weniger präzise Zahlen gespeichert werden. Wir haben sie darauf trainiert, mit <a href="https://elastic.co/elasticsearch">Elasticsearchs</a> <a href="https://www.elastic.co/docs/reference/elasticsearch/mapping-reference/bbq">Better Binary Quantization</a> (BBQ) zu arbeiten, um eine nahezu identische Leistung wie bei unquantisierten Einbettungen zu erzielen. Bei der Massive Text Embedding Benchmark (MTEB) Retrieval-Benchmark-Suite reduziert die Binarisierung die Leistung um weniger als 3 % im Vergleich zu vollständigen 16-Bit-Werten, spart jedoch 93 % Speicherplatz und erhöht die Verarbeitungs- und Abrufgeschwindigkeit drastisch.</p><h3>Sprachübergreifende Leistung</h3><p><code>jina-embeddings-v5-text</code>Die umfangreiche mehrsprachige Schulung überträgt sich auf <code>jina-embeddings-v5-omni</code>, mit fast 100 Sprachen im Vortraining von <code>jina-embeddings-v5-text-small</code>und 15 wichtigen globalen Sprachen in <code>jina-embeddings-v5-text-nano</code>. Für Audiomedien umfasst das <code>Whisper-large-v3</code>-Modell ungefähr 100 Sprachen in seinem Training, und die Qwen-modifizierten SigLip2-Vision-Modelle, die in <code>jina-embeddings-v5-omni-small</code> und <code>-nano</code> integriert sind, wurden mit Daten aus 201 verschiedenen Sprachen und Dialekten trainiert.</p><h2>Benchmark-Leistung</h2><h3>Text</h3><p><code>jina-embeddings-v5-omni</code> Modelle sind identisch mit <code>jina-embeddings-v5-text</code>-Modellen, wenn sie nur für Text verwendet werden. Sie sind die Leistungsträger in der <a href="https://huggingface.co/spaces/mteb/leaderboard">MMTEB-Benchmark-Suite</a> in ihren jeweiligen Größenkategorien für semantische Texteinbettungen.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt14d87596ca463c88/6a17e88dec0f89dfb65a664f/8687106cf82e6ec2b3f79f893cfe011e4a5b4a21-1095x1095.png" alt="Ein Balken- und Liniendiagramm vergleicht MMTEB-Werte und Parametergrößen für neun Einbettungsmodelle, wobei jina‑v3‑omni‑small die höchste Punktzahl und snowflake‑arctic‑embed‑l‑v2 die kleinste Größe hat." /><p><strong>Abbildung 5</strong>: Größe und Leistung <code>jina-embeddings-v5-omni</code>auf Textbenchmarks im Vergleich zu konkurrierenden Modellen. Die angegebene Größe ist ohne Ladeerweiterungen für andere Medien.</p><h3>Visuelle semantische Ähnlichkeit</h3><p>Bei Standard-Benchmarks für visuelle semantische Ähnlichkeit liefert <code>jina-embeddings-v5-omni</code> die besten Bewertungen aller Modelle in seiner Größe. <code>jina-embeddings-v5-omni</code>-Modelle zeigen bei weitem die beste Leistung für öffentliche Modelle mit offenen Gewichten vergleichbarer Größe. <code>jina-embeddings-v5-omni-small</code> wird bei visuellen semantischen Ähnlichkeitsaufgaben nur von einem Modell übertroffen, das dreimal so groß ist, und <code>jina-embeddings-v5-omni-nano</code> wird nur von <code>jina-embeddings-v5-omni-small</code> und von Modellen übertroffen, die 10- bis 25-mal größer sind.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt16ad3463d2aeefc5/6a17e88efaa9139b1493c8a9/f2ae56764865953bdf8c54747276189efd6d45e1-1496x877.png" alt="Ein Balken- und Liniendiagramm vergleicht visuelle semantische Ähnlichkeitswerte und Parametergrößen für sieben Einbettungsmodelle, wobei jina‑embeddings‑v5‑omni‑small den höchsten Ähnlichkeitswert und Laion/CLIP‑ViT‑bigG‑14 die größte Modellgröße hat." /><p><strong>Abbildung 6</strong>: Benchmark-Mittelwerte für visuelle semantische Ähnlichkeit für <code>jina-embeddings-v5-omni-small</code>, <code>jina-embeddings-v5-omni-nano</code> und vergleichbare Modelle sowie deren Größen einschließlich Visionserweiterungen.</p><h3>Visuelles Abrufen von Dokumenten</h3><p><code>jina-embeddings-v5-omni-small</code> ist wettbewerbsfähig mit Modellen mit drei und sieben Milliarden Parametern, bleibt aber unter einer Milliarde Parametern. <code>jina-embeddings-v5-omni-nano</code> sticht ebenfalls durch seine Größe hervor und übertrifft Modelle, die zehn bis sechzig Mal größer sind.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltcbabd1477ec3459c/6a17e890e317912a242d5806/cde672f18de8f4a30dd81938b08bb06e08444be0-1223x905.png" alt="Ein Balken-und-Linien-Diagramm vergleicht ausgewählte ViDoRe-Werte und Parametergrößen für mehrere Einbettungsmodelle, wobei LCO-Embedding-Omni-7B den höchsten Wert erreicht und laion/CLIP-ViT-bigG-14 die größte Modellgröße hat. Der Fokus liegt auf zwei Jina-Embeddings-Modellen." /><p><strong>Abbildung 7</strong>: Mittlere <a href="https://huggingface.co/spaces/vidore/vidore-leaderboard">ViDoRe-Ergebnisse bei der visuellen Dokumentensuche</a> in sechs Benchmarks: <em>DocVQA</em>, <em>InfoVQA</em>, <em>ShiftProj</em>, <em>SynAI</em>, <em>Tabfquad</em> und <em>TatDQA</em>.</p><h3>Audio-Abruf</h3><p>Bei den Standard-MAEB-Benchmarks (Massive Audio Embedding Benchmark) für den Audioabruf gehören sowohl <code>jina-embeddings-v5-omni-small</code> als auch <code>jina-embeddings-v5-omni-nano</code> zu den Leistungsträgern. Nur sehr große Modelle – mehr als dreimal so groß wie <code>jina-embeddings-v5-omni-small</code> – übertreffen seinen Punktestand.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt80f517c1c0230031/6a17e892dbb4ff8498fb56ee/a8c896bbbd710026c7b053e38af460194e7730a6-1650x912.png" alt="Ein Balken- und Liniendiagramm vergleicht Einbettungs- und Audiomodelle entlang der x-Achse, zeigt blaue Balken für den MAEB-Wert auf der linken y-Achse und eine rote Linie für die Modellgröße in Milliarden von Parametern auf der rechten y-Achse. Die Balken reichen von ungefähr 20 bis 55, und die Linie reicht von 0 bis 10." /><p><strong>Abbildung 8</strong>: Mittlerer Score verschiedener Modelle auf den MAEB-Audio-Retrieval-Benchmarks.</p><p>Obwohl das <code>larger_clap_general</code>-Modell von LAION den Score von jina-embeddings-v5-omni-nano verbessert und dabei weniger Parameter hat, handelt es sich um ein reines Audiomodell ohne die zusätzlichen multimodalen Features der v5-omni-Suite.</p><h3>Video</h3><p>Auf Video ist <code>jina-embeddings-v5-omni-small</code> hervorragend darin, den Ort in einem Video zu finden, der zu einer Textabfrage passt. Die Charades-STA- und MomentSeeker-Tests sind die Standardmaßstäbe für diese Aufgabe, und man sieht in den untenstehenden Diagrammen, dass <code>jina-embeddings-v5-omni-small</code> trotz seiner deutlich kleineren Größe der Top-Scorer unter vergleichbaren Open-Weight-Modellen ist.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltc8d7e7570b64d45a/6a17e8944b055d34e643221b/a2d7744d39fefb6b8b1f66e5b3f227828ef4ad4e-1350x672.png" alt="Ein Balken- und Liniendiagramm zeigt die Charades‐STA-Werte und die Modellgrößen für sechs Einbettungsmodelle. Die x-Achse listet die Modelle auf, die linke y-Achse zeigt Charades-STA-Werte von 20 bis 60, und die rechte y-Achse zeigt die Modellgröße in Milliarden von Parametern von 0 bis 10. Blaue Balken stehen für die Punkte, und eine rote Linie mit Markern steht für die Modellgrößen." /><p><strong>Abbildung 9</strong>: Charades-STA-Bewertungen für verschiedene Modelle sowie deren Größen.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltfbce6716a3a33ca5/6a17e89525daab2e8a08a26d/cf7578863fd509edb62c15878816d39657abc715-1550x845.png" alt="Ein Balken- und Liniendiagramm vergleicht sechs Einbettungsmodelle anhand von MomentSeeker-Scores und Modellgröße. Die x-Achse listet die Modelle auf, die linke y-Achse zeigt MomentSeeker-Werte von etwa 44 bis 60, und die rechte y-Achse zeigt die Modellgröße in Milliarden von Parametern von 0 bis 10. Blaue Balken stehen für die Punkte, und eine rote Linie mit Markern steht für die Modellgrößen." /><p><strong>Abbildung 10</strong>: MomentSeeker-Bewertungen für verschiedene Modelle sowie deren Größen.</p><p>Wir verglichen <code>jina-embeddings-v5-omni-small</code> auch mit ByteDances <a href="https://seed.bytedance.com/en/blog/built-on-seed1-6-flash-seed-1-6-embedding-launched">Seed 1.6</a>, einem Closed-Weight-Modell mit nicht veröffentlichter Parameteranzahl. Unser Modell übertrifft Seed 1.6 beim Charades-STA-Benchmark mit großem Abstand und ist mit ihm bei MomentSeeker nahezu gleichauf.</p><p>Modell</p><p>Charades-STA-Score</p><p>MomentSeeker-Score</p><p>seed-1.6-embedding</p><p>29,30</p><p>59,30</p><p>jina-embeddings-v5-omni-small</p><p>55,57</p><p>58,93</p><h2>Stärken und Schwächen</h2><p><code>jina-embeddings-v5-omni</code> Modelle erweitern die Fähigkeit der Nutzer, digitalisierte Informationen auf verschiedene Weise zu indexieren, zu suchen und zu analysieren, insbesondere:</p><ul><li><p>Mehrsprachiger Sprachabruf aus Textabfragen.</p></li><li><p>PDF, Scans und visuelle Dokumentensuche.</p></li><li><p>Zeitliche Verankerung von Videos, d. h. die Identifizierung von Teilen von Videos, die mit natürlichsprachlichen Textbeschreibungen übereinstimmen.</p></li><li><p>Klassifizierung von Audiogenres, einschließlich Musikgenres.</p></li><li><p>Bildklassifizierung basierend auf Szeneninformationen und Objekterkennung.</p></li></ul><p>Die Leistungsfähigkeit ist in einigen anderen Bereichen eingeschränkt. Es könnte möglich sein, <code>jina-embeddings-v5-omni</code> für diese Aufgaben zu verwenden, aber wir haben dafür nicht trainiert und die Ergebnisse könnten schlecht sein.</p><p>Wir arbeiten aktiv daran, unsere Technologie in folgenden Bereichen zu verbessern:</p><ul><li><p>Das Auffinden spezifischer Videos anhand von Beschreibungen in natürlicher Sprache.</p></li><li><p>Bild-zu-Bild-Semantikvergleich und -Abruf.</p></li><li><p>Absichtsklassifizierung in der Sprache, wie beispielsweise das Erkennen verbaler Befehle.</p></li><li><p>Verarbeitung gemischter Medieneingaben, d. h. Bilder und begleitender Text oder eine Kombination aus Audio, Bildern und Texten.</p></li></ul><h2>Verwendung von <strong>jina-embeddings-v5-omni</strong></h2><p>Diese Modellsuite unterstützt Eingaben über drei Einstiegspunkte: Text, Audio sowie Bilder und Videos zusammen. <code>jina-embeddings-v5-omni</code> läuft in einem Framework, das eine breite Palette von Standardformaten konvertiert und andere Vorverarbeitungsschritte durchführt.</p><p>Wir verarbeiten Bilder mit dem gleichen <a href="https://arxiv.org/abs/2502.14786">NaFlex-Ansatz</a> wie in der ersten SigLip2-Version: Ist das Eingabebild kleiner als 262.144 Pixel (entspricht 512×512), wird es hochskaliert, bis es größer als dieses Minimum ist. Ist es größer als 3.072.000 Pixel, wird es herunterskaliert, bis es kleiner als dieses Maximum ist. Der Konvertierungsprozess stellt sicher, dass sowohl die Höhe als auch die Breite des Bildes ein Vielfaches von 14 Pixeln betragen, wobei die Verzerrung des Seitenverhältnisses so gering wie möglich gehalten wird, um dieses Ziel zu erreichen. Das Ergebnis wird in Patches von 28×28 Pixeln aufgeteilt, sodass die Gesamtzahl der Patches der Anzahl der 28×28-Quadrate entspricht, die benötigt werden, um das Bild abzudecken. Jeder Patch wird zur Inferenzzeit wie ein einzelnes Token behandelt, und jeder Bildeingang wird von speziellen Start- und End-Token begleitet, um ein einzelnes Bild abzugrenzen.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltf192cdba41155257/6a17e897abe0f2faaedfea2a/5ab7a8951780afdfe6eda9dca14add0375ae36bd-668x130.png" alt="In einem rechteckigen Benachrichtigungsfeld mit hellblauem Hintergrund wird ein gelbes Warndreieck-Symbol neben einem Text angezeigt, der erklärt, dass jina‐embeddings‐v5‐omni darauf trainiert ist, Audio-, Video- und Bilddateien anhand von Textabfragen zu finden, und dass Abfragen, die nicht auf Text basieren, möglicherweise weniger effektiv sind." /><p>Die <code>jina-embeddings-v5-omni</code>-Modelle verändern die Videoauflösung auf die gleiche Weise wie Bilder (siehe oben), und wir extrahieren bis zu 32 Frames aus dem Video. Wenn das Video mehr als 32 Bilder hat (was wahrscheinlich ist, da Standardformate in der Regel mindestens 24 Bilder pro Sekunde haben), werden die Bilder, die wir extrahieren, gleichmäßig verteilt. Dann generiert der Video-Präprozessor für alle zwei Frames einen Satz von Token, der der Anzahl von 28x28 Quadraten entspricht, die benötigt werden, um das Video abzudecken.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt0acd4ddd95a66a53/6a17e898445de966214d0176/a38491c1cc47cfc65344c786e8ab57b9abf67e0b-1999x851.png" alt="Eine Collage aus aufeinanderfolgenden Videobildern ist mit Pfeilen angeordnet, die den Ablauf anzeigen und eine Reihe von Szenen mit Audrey Hepburn in verschiedenen Momenten darstellen. Sie endet mit einem Bild, das die Titelkarte „Breakfast at Tiffany’s“ zeigt. Das Layout veranschaulicht, dass das Modell 64 gleichmäßig verteilte Frames aus einem Video extrahiert, was bei langen Videos zu erheblichen Inhaltsverlusten führen kann." /><p><strong>Abbildung 11:</strong> <code>jina-embeddings-v5-omni</code> extrahiert 32 gleichmäßig verteilte Bilder aus dem Video. Wenn Sie ein langes Video haben, bedeutet das, dass viel verloren geht.</p><p>Weitere Details zur Videovorverarbeitung finden Sie in der <a href="https://arxiv.org/abs/2502.14786">technischen Dokumentation von SigLip2</a>.</p><p>Die Audio-Tokenisierung folgt dem in Qwen-2.5-Omni integrierten Ansatz: Die Tondateien werden in 30-Sekunden-Segmente geschnitten. Wenn sie länger als 30 Sekunden sind, werden sie auf 16 kHz neu abgetastet und in ein 128-Kanal-Mel-Spektrogramm umgewandelt. Jede 40 ms wird als einzelnes Token behandelt, so dass jedes 30-Sekunden-Segment als 750 Token behandelt wird, ein Token pro 40 ms Audio, plus spezielle Start- und End-Token zur Abgrenzung eines einzelnen Samples.</p><p>Weitere Details zur Audiovorverarbeitung finden Sie im <a href="https://arxiv.org/abs/2503.20215">Technischen Bericht Qwen-2.5-Omni</a>.</p><h2>Verfügbarkeit</h2><p>Sowohl <code>jina-embeddings-v5-omni-small</code> als auch <code>jina-embeddings-v5-omni-nano</code> sind über den <a href="https://www.elastic.co/docs/explore-analyze/elastic-inference/eis">Elastic Inference Service</a> (EIS), über die <a href="https://jina.ai/embeddings">Jina API</a> und für die lokale Installation per Download verfügbar (<a href="https://huggingface.co/jinaai/jina-embeddings-v5-omni-small"><code>small</code></a> und <a href="https://huggingface.co/jinaai/jina-embeddings-v5-omni-nano"><code>nano</code></a>). Die Modellgewichte stehen unter einer nichtkommerziellen Lizenz kostenlos zum Ausprobieren zur Verfügung. Kontaktieren Sie <a href="https://www.elastic.co/contact?pg=global&amp;plcmt=nav&amp;cta=205352">Elastic Sales</a> für die kommerzielle Nutzung.</p><h2>Erste Schritte</h2><p>Um <code>jina-embeddings-v5-omni</code> für Text zu verwenden, können Sie dies über das Feld <code>semantic_text</code> integrieren, so wie bei <code>jina-embeddings-v5-text</code>. Setzen Sie einfach <code>inference_id</code> auf <code>.jina-embeddings-v5-omni-small</code> oder <code>.jina-embeddings-v5-omni-nano</code>. Anweisungen finden Sie im <a href="https://www.elastic.co/docs/reference/elasticsearch/mapping-reference/semantic-text-how-tos">Referenzleitfaden</a>.</p><p>Um andere Medien mit <code>jina-embeddings-v5-omni</code> einzubetten, müssen Sie <a href="https://www.elastic.co/docs/api/doc/elasticsearch/operation/operation-inference-embedding">die Inferenz-API verwenden</a>. Zum Beispiel:</p>POST _inference/embedding/.jina-embeddings-v5-omni-small
{
  "input": [
    {
      "content": { 
        "type": "image", 
        "format": "base64", 
        "value": "data:image/jpeg;base64,..." 
      } 
    }, 
    { 
      "content": { 
        "type": "text", 
        "value": "Some text to create an embedding" 
      } 
    } 
  ] 
}<p>Ändern Sie für <code>jina-embeddings-v5-omni-nano</code> die URI <code>POST</code> in <code>_inference/embedding/.jina-embeddings-v5-omni-nano</code>.</p><p>Um Dokumente in anderen Medien zu kodieren oder Einbettungen für Klassifikationen oder Clustering zu generieren, müssen Sie <a href="https://www.elastic.co/docs/api/doc/elasticsearch-serverless/operation/operation-inference-put-jinaai"><u>einen Inferenz-Endpoint </u></a>mit dem<u><code>jinaai</code></u><a href="https://www.elastic.co/docs/api/doc/elasticsearch-serverless/operation/operation-inference-put-jinaai"><u> Service</u></a> erstellen.</p><p>Für Abfragen verwenden Sie den Abfragegenerator wie im untenstehenden Beispiel. Ersetzen Sie den Wert <code>inference_id</code> durch <code>.jina-embeddings-v5-omni-nano</code>, um das Modell <code>nano</code> anstelle von <code>small</code> zu verwenden.</p>POST my-index/_search
{
  "knn": {
    "field": "dense-vector-field",
    "k": 10,
    "num_candidates": 100,
    "query_vector_builder": {
      "embedding": {
        "inference_id": ".jina-embeddings-v5-omni-small",
        "input": {
          "type": "image",
          "format": "base64",
          "value": "data:image/jpeg;base64,..."
        }
      }
    }
  }
}<p>Weitere Informationen finden Sie in der <a href="https://www.elastic.co/docs/reference/query-languages/query-dsl/query-dsl-knn-query#knn-query-builder-embedding">Dokumentation des Query Builders</a>.</p><p>Um BBQ mit <code>jina-embeddings-v5-omni</code> zu verwenden, folgen Sie<a href="https://www.elastic.co/docs/reference/elasticsearch/mapping-reference/bbq"> den Anweisungen zum BBQ-Indexieren</a>.</p><h2>Weitere Informationen</h2><p>Weitere Informationen zu <code>jina-embeddings-v5-omni</code> finden Sie im <a href="https://arxiv.org/html/2605.08384v2">technischen Bericht</a> des Modells und auf der <a href="https://jina.ai/models/">Jina AI-Website</a>. Die <code>jina-embeddings-v5-omni</code> <a href="https://huggingface.co/collections/jinaai/jina-embeddings-v5-omni">Kollektionsseite auf Hugging Face</a> enthält auch technische Informationen und Anweisungen zum Herunterladen und lokalen Ausführen dieser Modelle. Die <code>jina-embeddings-v5-omni</code>-Modelle stehen unter einer <a href="https://creativecommons.org/licenses/by-nc/4.0/deed.en">CC-BY-NC-4.0-Lizenz</a> zur Verfügung. Sie können sie also kostenlos herunterladen und ausprobieren. Für die kommerzielle Nutzung wenden Sie sich bitte an den Elastic-Vertrieb.</p>]]></content:encoded>
    <link>https://www.elastic.co/search-labs/blog/jina-embeddings-v5-omni-all-media-one-index</link>
    <guid isPermaLink="true">https://www.elastic.co/search-labs/blog/jina-embeddings-v5-omni-all-media-one-index</guid>
    <category><![CDATA[Jina AI]]></category>
    <dc:creator><![CDATA[Scott Martens]]></dc:creator>
    <enclosure url="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt61bf5ce9de247ac5/6a17e89a7b54f9f4108b390f/b51e488ba5b90bec77f75af0b9cb4f0e25e20b91-1130x635.png" length="0" type="image/png"/>
    <pubDate>Mon, 11 May 2026 00:00:00 GMT</pubDate>
  </item>
  <item>
    <title><![CDATA[Jina-Einbettungen v3 sind jetzt im Model Garden der Gemini Enterprise Agent Platform verfügbar]]></title>
    <description><![CDATA[Das Search Foundation Model in Jina, „jina-embeddings-v3“, kann nun eigenständig im Model Garden der Gemini Enterprise Agent Platform bereitgestellt werden und wird bald um weitere Modelle ergänzt. Führen Sie „jina-embeddings-v3“ auf einer einzelnen L4-GPU in Ihrer eigenen VPC aus.]]></description>
    <content:encoded><![CDATA[<p>Heute stellen wir <code>jina-embeddings-v3</code> vor, das erste Search Foundation Model von Jina vor, das im <a href="https://console.cloud.google.com/vertex-ai/publishers/jinaai/model-garden/jina-embeddings-v3">Model Garden der Gemini Enterprise Agent</a><a href="https://console.cloud.google.com/vertex-ai/publishers/jinaai/model-garden/jina-embeddings-v3"> Platform</a> als Self-Deployment-Modell verfügbar ist. <em>Self-Deployment</em> bedeutet, dass das Modell auf GPU-Instanzen innerhalb Ihres Google Cloud-Projekts und Ihrer Virtual Private Cloud (VPC) ausgeführt wird. Keine externen API-Aufrufe, keine Abrechnung pro Token, keine Ratenbegrenzungen.</p><p>Mit dieser Integration erhalten Elasticsearch-Nutzer eine neue Deployment-Option, bei der die Daten innerhalb ihres Sicherheitsperimeters verbleiben, die Infrastrukturkosten vorhersehbar sind und die nativ auf Google Cloud ausgeführt wird. Gleichzeitig erhält das gesamte Google Cloud-Ökosystem Zugriff auf die speziell entwickelten, fortschrittlichen Such- und Abrufmodelle von Jina.</p><p>Es handelt sich hierbei um die erste Phase einer umfassenderen Einführung. Zusammen mit den kommenden Modellen wird das Angebot einen vollständigen Retrieval-Stack bilden: Betten Sie Ihre Daten und Abfragen ein, rufen Sie Kandidaten ab und ordnen Sie sie neu, und erweitern Sie die Suche mithilfe multimodaler Einbettungen auf Bilder – alles auf einer von Ihnen kontrollierten Infrastruktur. Sie können noch heute mit <code>jina-embeddings-v3</code> loslegen – dem Modell, das über den Elastic Inference Service (EIS) bereits Produktions-Suchpipelines im gesamten Elasticsearch-Ökosystem unterstützt.</p><p>Modell</p><p>Typ</p><p>Parameter</p><p>Wichtige Funktion</p><p>Status im Model Garden</p><p>„jina-embeddings-v3“</p><p>Texteinbettungen</p><p>572 Mio.</p><p>Bewährtes mehrsprachiges Tool, Kontextlänge von 8.000, Ausgabedimension von 1.024, auf 32 kürzbar</p><p>Jetzt verfügbar</p><p>„jina-embeddings-v5-text-small“</p><p>Texteinbettungen</p><p>677 Mio.</p><p>Fortschrittliches mehrsprachiges Tool mit weniger als 1 Mrd. Parametern, Kontextlänge von 32.000, Ausgabedimension von 1.024, auf 32 kürzbar</p><p>Demnächst verfügbar</p><p>„jina-embeddings-v5-text-nano“</p><p>Texteinbettungen</p><p>239 Mio.</p><p>Branchenführend unter 500 Mio. Parametern, Kontextlänge von 8.000, Ausgabedimension von 768, auf 32 kürzbar</p><p>Demnächst verfügbar</p><p>„jina-reranker-v3“</p><p>Reranker</p><p>600M</p><p>Listwise-Reranker, Kontextlänge von 131.000, bis zu 64 Dokumente</p><p>Demnächst verfügbar</p><p>„jina-clip-v2“</p><p>Multimodale Einbettung</p><p>900M</p><p>Text und Bild im gemeinsamen Bereich, 89 Sprachen und Textkontextlänge von 8.000, Bilder mit einer Größe von 512 × 512</p><p>Demnächst verfügbar</p><p>Jedes Modell wird auf einem einzelnen NVIDIA L4 (24 GB) ausgeführt, der kostengünstigsten GPU-Stufe in Google Cloud. Die meisten anderen Einbettungsmodelle im Google Cloud Model Garden erfordern einen A100 80 GB oder einen H100, was etwa dem Dreifachen der Instanzkosten pro Stunde entspricht, noch bevor Token berücksichtigt werden.</p><p>Beim Deployment über Vertex AI ist keine zusätzliche kommerzielle Lizenz erforderlich.</p><h2><strong>Warum Model Garden?</strong></h2><p>Warum das Deployment über Model Garden statt über eine API? Letztendlich kommt es auf drei Faktoren an: Kontrolle, Kosten und Kontext.</p><h3>Ihre Daten verlassen niemals das Gebäude</h3><p>Der größte Anreiz für die meisten Entwickler ist die Self-Deployment-Architektur. Beim Deployment eines Jina-Modells über Model Garden werden die Gewichte auf GPU-Instanzen innerhalb Ihres eigenen Google Cloud-Projekts und Ihrer eigenen VPC ausgeführt. Dieser entscheidende Vorteil kommt allen zugute, die in Branchen mit hohen Anforderungen an die Datensicherheit tätig sind, wie beispielsweise im Finanzwesen oder im Gesundheitswesen. Da keine externen API-Aufrufe erfolgen, verbleiben Ihre sensiblen Daten innerhalb Ihres Sicherheitsperimeters.</p><h3>Skalierung mit Prognose</h3><p>Anstatt jedes Mal zu zahlen, wenn Sie einen Satz einbetten oder ein Dokument neu anordnen, zahlen Sie eine pauschale stündliche Instanzgebühr. Und da jedes Jina-Modell auf einer einzigen NVIDIA L4, der günstigsten GPU-Stufe in der Google Cloud, ausgeführt werden kann, ist die Einstiegshürde niedrig. Ganz gleich, ob Sie tausend oder eine Milliarde Anfragen bearbeiten – Ihre Infrastrukturkosten bleiben kalkulierbar. Bei diesem Modell werden Sie für die Steigerung Ihres Traffics belohnt, anstatt dafür zur Kasse gebeten zu werden.</p><h3>Alles unter einem Dach</h3><p>Wenn Ihre Daten bereits in Elasticsearch auf Google Cloud, in BigQuery oder in Cloud Storage gespeichert sind, ist es sinnvoll, Ihre Inferenz-Engines in der Nähe zu belassen. Durch das Deployment über Model Garden profitieren die Search Foundation Models von Jina von allen Unternehmensfunktionen, die Sie bereits nutzen: Identitäts- und Zugriffsverwaltung (IAM) für die Zugriffskontrolle, eine einheitliche Abrechnung über Ihre bestehende Google Cloud-Rechnung sowie die Möglichkeit zur Integration in Vertex AI Pipelines für MLOps-Workflows (Machine Learning Operations).</p><p>Während die Jina AI Cloud API und Elastic Cloud den schnellsten Weg für Spitzenauslastungen oder bestehende Such-Workflows bieten, eignet sich Model Garden insbesondere für Unternehmensanwendungen, die strenge Datensicherheit und vorhersehbare Kosten im großen Maßstab erfordern. Elastic möchte Sie dort abholen, wo Sie gerade stehen.</p><h2><strong>Jina AI-Modelle</strong></h2><h3><strong>jina-embeddings-v3</strong></h3><p>Unser bewährtes mehrsprachiges Einbettungsmodell mit 572 Mio. Parametern und einem Kontext von 8.000 Tokens. Erzielt 65,5 Punkte beim Massive Text Embedding Benchmark (MTEB) für Englisch. Unterstützt fünf aufgabenspezifische LoRA-Adapter (Abfrage/Passage, Textvergleich, Klassifizierung, Clustering) und Matrjoschka-Kürzungen von 1.024 auf 64 Dimensionen. Wird im gesamten Elasticsearch-Ökosystem über EIS bereits umfassend eingesetzt.</p><p>Wir setzen auf v3, da viele Produktionssysteme bereits davon abhängig sind. Wenn Sie eine v3-basierte Pipeline zu Google Cloud migrieren, können Sie dasselbe Modell jetzt nativ ausführen, ohne Ihre Einbettungsdimensionen zu ändern oder neu zu indizieren.</p><h3><strong>jina-embeddings-v5-text (Small und Nano)</strong></h3><p>Unsere im Februar 2026 veröffentlichten Texteinbettungsmodelle der fünften Generation erzielen Spitzenleistungen und können mit Modellen mithalten, die um ein Vielfaches größer sind.</p><p><code>v5-text-small</code> (677 Mio.) erzielt 67,0 Punkte in der Multilingual MTEB (MMTEB) Benchmark-Suite, die 131 Aufgaben aus neun Aufgabentypen umfasst, und 71,7 Punkte im MTEB-Benchmark für Englisch. Es handelt sich um das leistungsstärkste mehrsprachige Einbettungsmodell mit weniger als 1 Mrd. Parametern auf dem MTEB-Leaderboard.</p><p><code>v5-text-nano</code> (239 Mio.) erzielt 65,5 Punkte im MMTEB. Kein anderes Modell mit weniger als 500 Mio. Parametern erreicht diesen Wert. Da es weniger als halb so groß ist wie die meisten vergleichbaren Modelle, ist es die naheliegende Wahl für Edge-Anwendungen und latenzkritische Deployments.</p><p>Beide Modelle unterstützen:</p><ul><li><p><strong>Vier aufgabenspezifische LoRA-Adapter:</strong> Abruf, Textabgleich, Klassifikation, Clustering. Auswahl eines geeigneten Adapters über den Parameter <code>task</code> zum Zeitpunkt der Inferenz.</p></li><li><p><strong>Kürzungen von Matrjoschka-Dimensionen:</strong> Reduziert die Einbettungsdimensionen von 1.024 (bzw. 768 bei Nano) auf 32. Bei moderater Kürzung (zum Beispiel 256 Dimensionen) ist der Qualitätsverlust minimal. Eine Halbierung der Dimensionen reduziert den Speicherbedarf in etwa um die Hälfte.</p></li><li><p><strong>Binäre Quantisierung:</strong> Komprimiert Einbettungen mit 1.024 Dimensionen durch Binarisierung von 2 KB auf 128 Byte. Durch spezielles Training sind die Verluste bei dieser Komprimierung minimal.</p></li><li><p><strong>Mehrsprachig: </strong>119 Sprachen (Small) und 93 (Nano).</p></li></ul><h3><strong>jina-reranker-v3</strong></h3><p>Ein mehrsprachiger Listwise-Reranker mit 0,6 Mrd. Parametern, der auf einer <em>„Last but not late“-Interaktionsarchitektur</em> basiert. Die Abfrage und bis zu 64 mögliche Kandidaten werden in ein einziges Kontextfenster mit 131.000 Token eingegeben, und das Modell führt vor der Bewertung einen dokumentenübergreifenden Vergleich durch. Jina Reranker v3 erreicht auf BEIR einen nDCG@10-Wert von 61,94 und übertrifft damit bei einer sechsmal geringeren Größe das Modell. Damit unterscheidet es sich grundlegend von punktuellen Rerankern, die jedes Dokument isoliert bewerten, und liefert insbesondere beim Abrufen von Passagen aus einzelnen Dokumenten bessere Ergebnisse.</p><h3><strong>jina-clip-v2</strong></h3><p>Ein multimodales, mehrsprachiges Einbettungsmodell mit 0,9 Mrd. Parametern, das Text und Bilder in einen gemeinsamen Bereich mit 1.024 Dimensionen abbildet. Es unterstützt:</p><ul><li><p><strong>89 Sprachen</strong> für den Abruf von Texten und Bildern.</p></li><li><p><strong>512 × 512 Bildauflösung.</strong></p></li><li><p><strong>Texteingabe für 8.000 Token.</strong></p></li><li><p><strong>Matroschka-Kürzung</strong> von 1.024 auf 64 Dimensionen für beide Modalitäten.</p></li></ul><p>Sehr wettbewerbsfähig bei Bild-zu-Text-Benchmarks, einschließlich mehrsprachiger Aufgaben.</p><h2><strong>Erste Schritte</strong></h2><p>Jina Embeddings v3 ist ab heute auf Model Garden verfügbar. Hier erfahren Sie, wie es funktioniert.</p><p>Sie benötigen ein Google Cloud-Projekt, in dem die Vertex AI-API aktiviert ist und das über genügend GPU-Kontingent für mindestens eine g2-standard-8-Instanz (NVIDIA L4) verfügt. Wenn Sie noch keine Erfahrung mit Google Cloud haben, <a href="https://cloud.google.com/vertex-ai/docs/start/cloud-environment">beginnen Sie mit dem Einrichtungsleitfaden.</a></p><p><a href="https://console.cloud.google.com/vertex-ai/publishers/jinaai/model-garden/jina-embeddings-v3">Die Model Garden-Seite für Jina Embeddings v3</a> führt Sie durch den gesamten Ablauf: Laden Sie das Modell hoch, erstellen Sie einen Endpoint, wählen Sie Ihren Maschinentyp aus und führen Sie das Deployment durch. Öffnen Sie es in Ihrem eigenen Projekt und folgen Sie den Anweisungen. A100- und H100-Maschinen sind ebenfalls verfügbar, sofern Region und Kontingent dies zulassen, aber für den Anfang reicht L4 völlig aus.</p><p>Vom Klicken bis zur ersten Einbettung dauert der gesamte Vorgang nur wenige Minuten.</p><h2><strong>Was als Nächstes kommt</strong></h2><p>Jina Embeddings v3 ist der Ausgangspunkt. In den kommenden Wochen werden wir den Rest des Jina-Retrieval-Stacks in Model Garden integrieren: v5-Text-Embeddings (Small und Nano), jina-reranker-v3 sowie jina-clip-v2 für die multimodale Suche. Alle Modelle laufen auf einer einzigen L4-GPU mit demselben Self-Deployment-Modell.</p>]]></content:encoded>
    <link>https://www.elastic.co/search-labs/blog/jina-embeddings-v3-gemini-enterprise-model-garden</link>
    <guid isPermaLink="true">https://www.elastic.co/search-labs/blog/jina-embeddings-v3-gemini-enterprise-model-garden</guid>
    <category><![CDATA[Jina AI]]></category>
    <dc:creator><![CDATA[Sa Zhang]]></dc:creator>
    <enclosure url="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt1d9669e8c7a62bf6/6a170ee7a929cf0371ae0a87/42f72633f1e5453dbfd47730b5f776429f9f633e-721x420.png" length="0" type="image/png"/>
    <pubDate>Wed, 22 Apr 2026 00:00:00 GMT</pubDate>
  </item>
  <item>
    <title><![CDATA[jina-embeddings-v5-text: Kompakte, hochmoderne Texteinbettungen für Suchen und intelligente Anwendungen]]></title>
    <description><![CDATA[Einführung der jina-embeddings-v5-text-Modelle, darunter jina-embeddings-v5-text-small und jina-embeddings-v5-text-nano, sowie eine Erklärung zur Nutzung dieser mehrsprachigen Einbettungsmodelle über den Elastic Inference Service (EIS).]]></description>
    <content:encoded><![CDATA[<p>Jina AI und Elastic bringen <code>jina-embeddings-v5-text</code> heraus, eine Familie neuer, leistungsstarker, kompakter Texteinbettungsmodelle mit modernster Leistung für Modelle vergleichbarer Größe über alle wichtigen Aufgabentypen hinweg.</p><p>Die Familie umfasst zwei Modelle:</p><ul><li><p><code>jina-embeddings-v5-text-small</code></p></li><li><p><code>jina-embeddings-v5-text-nano</code></p></li></ul><p>Diese Modelle sind das erfolgreiche Ergebnis eines innovativen neuen Trainingsverfahrens zum Einbetten von Modellen. Beide übertreffen um ein Vielfaches größere Modelle. Sie sparen Speicherplatz und Rechenressourcen und reagieren schneller auf Anfragen.</p><p>Das <code>jina-embeddings-v5-text-small</code>-Modell verfügt über 677 Millionen Parameter, unterstützt ein 32.768-Token-Eingangskontextfenster und erzeugt standardmäßig 1.024-Dimensionseinbettungen.</p><p><code>jina-embeddings-v5-text-nano</code> ist nur etwa ein Drittel so groß wie sein Pendant, mit 239 Mio. Parametern und einem Eingangskontextfenster mit 8192 Token, was schlanke Einbettungen mit 768 Dimensionen ergibt.</p><p>Modellname</p><p>Gesamtgröße</p><p>Größe des Eingangskontextfensters</p><p>Einbettungsgröße</p><p>jina-v5-text-small</p><p>677 Mio. Parameter</p><p>32.768 Token</p><p>1024 Dimensionen</p><p>jina-v5-text-nano</p><p>239 Mio. Parameter</p><p>8192 Tokens</p><p>768 Dimensionen</p><p>Diese beiden Modelle sind hinsichtlich der Gesamtleistung des MMTEB (<a href="https://huggingface.co/spaces/mteb/leaderboard">Multilingual MTEB</a>)-Benchmarks die besten verfügbaren. Unter den Modellen mit weniger als 500 Millionen Parametern ist <code>jina-embeddings-v5-text-nano</code> trotz weniger als 250 Millionen Parametern der beste Performer, und das <code>jina-embeddings-v5-text-small</code>-Modell ist führend unter mehrsprachigen Einbettungsmodellen mit weniger als 750 Millionen Parametern.</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltb2f2be8618f5e240/6a17dbb83e9e45b7f3ba1344/d97126285fa196c3045b1913b7754e4b186c1e4c-1300x1100.png" alt="jina-embeddings-v5-text MMTEB-Werte" /><p>Diese Modelle sind über den Elastic Inference Service (EIS), über eine Online-API und für lokales Hosting verfügbar. Anweisungen zum Zugriff auf <code>jina-embeddings-v5-text</code>-Modelle finden Sie im Abschnitt „<strong>Erste Schritte</strong>“ weiter unten.</p><p>Einbettungsmodelle und semantisches Indexieren erhöhen die Genauigkeit von Suchalgorithmen drastisch, haben aber auch eine Vielzahl anderer Einsatzmöglichkeiten für Aufgaben, die semantische Ähnlichkeit und Bedeutungsextraktion betreffen, zum Beispiel:</p><ul><li><p>Doppelte Texte finden.</p></li><li><p>Paraphrasen und Übersetzungen erkennen.</p></li><li><p>Themenfindung.</p></li><li><p>Empfehlungssysteme.</p></li><li><p>Stimmungs- und Absichtsanalyse.</p></li><li><p>Spamfilterung.</p></li><li><p>Und vieles mehr.</p></li></ul><h2><strong>Features</strong></h2><p>Diese neue Modellfamilie verfügt über eine Reihe von Features zur Verbesserung der Relevanz und Kostensenkung.</p><h3>Aufgabenoptimierung</h3><p>Wir haben die <code>jina-embeddings-v5-text</code>-Modelle für vier breitgefächerte Aufgabentypen optimiert:</p><p>Aufgabe</p><p>Beispiel-Anwendungsfälle</p><p>Abruf</p><p>Suche mit natürlichsprachlichen Abfragen und Abrufen der relevantesten Treffer in einer Sammlung von Dokumenten.</p><p>Textabgleich</p><p>Semantische Ähnlichkeiten, Deduplizierung, Paraphrasierungs- und Übersetzungsabgleich und mehr.</p><p>Clustering</p><p>Themenfindung und automatische Organisation von Dokumentensammlungen.</p><p>Klassifizierung</p><p>Kategorisierung von Dokumenten, Stimmungs- und Absichtsanalysen, ähnliche Aufgaben.</p><p>Die Optimierung für eine Aufgabe bedeutet in der Regel, dass man bei einer anderen Aufgabe Kompromisse eingehen muss. Daher bieten die meisten Einbettungsmodelle nur für eine Art von Aufgabe eine wettbewerbsfähige Leistung. <code>jina-embeddings-v5-text</code>-Modelle können sich hingegen auf alle vier Bereiche spezialisieren, ohne Kompromisse einzugehen, indem sie aufgabenspezifische <a href="https://arxiv.org/abs/2106.09685">Low-Rank Adaptation (LoRA)-Adapter</a> trainieren.</p><p>LoRA-Adapter sind gewissermaßen Plugins für KI-Modelle, die ihr Verhalten drastisch ändern, während sie die Gesamtgröße nur geringfügig erhöhen. Anstatt für jede Aufgabe ein komplettes Modell mit Hunderten Millionen Parametern zu verwenden, ermöglicht die <code>jina-embeddings-v5-text</code>-Modellfamilie die Nutzung eines einzigen Modells mit einem kompakten LoRA-Adapter für jede Aufgabe. Dadurch werden Speicher, Speicherplatz und Inferenzkosten gespart.</p><h3>Kürzen von Einbettungen</h3><p>Wir haben die <code>jina-embeddings-v5-text</code>-Modelle mit <a href="https://arxiv.org/abs/2205.13147">Matryoshka Representation Learning</a> trainiert, das es Ihnen ermöglicht, Ihre Einbettungen auf kleinere Größen zu reduzieren, ohne die Qualität wesentlich zu beeinträchtigen.</p><p>Standardmäßig erzeugt <code>jina-embeddings-v5-text-small</code> Einbettungsvektoren in 1.024 Dimensionen, die jeweils durch eine 16-Bit-Zahl dargestellt werden, sodass jede Einbettung 2 KB groß ist. Für eine große Sammlung von Dokumenten kann dies eine Menge Daten zum Speichern bedeuten, und die Suche in einer Vektordatenbank voller Einbettungen fällt proportional zur Größe der Datenbank sowie zur Anzahl der Dimensionen aus, die jeder gespeicherte Vektor enthält.</p><p>Man kann aber einfach die Größe der Einbettungen halbieren (512 der 1.024 Dimensionen weglassen) und so den Speicherplatz halbieren und gleichzeitig die Suchgeschwindigkeit verdoppeln. Dies hat Auswirkungen auf die Leistung. Das Entfernen von Informationen verringert die Präzision. Aber wie der Graph unten zeigt, verringert sich die Leistung selbst dann nur geringfügig, wenn Sie die Hälfte der Einbettung weglassen:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt8deea6ee69a6b77d/6a17dbba0b0bed2217dd347e/f11969682c81bcf22b5b29a6204ba6ec40471b3d-900x700.png" alt="jina-embeddings-v5-text-small &amp; jina-embeddings-v5-text-nano Einbettungsgröße" /><p>Solange Ihre Einbettungen mindestens 256 Dimensionen haben, sollte der Präzisionsverlust relativ gering bleiben. Unterhalb dieses Niveaus nehmen Relevanz und Genauigkeit jedoch schnell ab.</p><p>Das Kürzen von Einbettungen auf diese Weise ermöglicht es Nutzern, ihre eigenen Kompromisse zwischen Genauigkeit und Rechenkosten zu bestimmen. Es bietet Ihnen die nötigen Tools, um große Effizienzgewinne und erhebliche Kosteneinsparungen aus Ihrer Such-KI zu erzielen.</p><h3>Robuste Quantisierung</h3><p><em>Quantisierung </em>ist eine weitere Möglichkeit, um die Größe von Einbettungen zu reduzieren. Anstatt einen Teil jeder Einbettung zu entfernen, reduziert die Quantisierung die Präzision der Zahlen in der Einbettung. Die <code>jina-embeddings-v5-text</code>-Modelle generieren Einbettungen mit 16-Bit-Zahlen, doch diese Zahlen können abgerundet werden, wodurch ihre Präzision und die Anzahl der Bits, die zu ihrer Speicherung nötig sind, reduziert werden. Im Extremfall können wir jede Zahl auf ein Bit (0 oder 1) reduzieren und die standardmäßigen 1.024-dimensionalen Einbettungen von <code>jina-embeddings-v5-text</code>von 2 Kilobyte auf 128 Byte komprimieren, was einer Reduzierung um 94 % durch alleinige binäre Quantisierung entspricht. Genau wie bei der Kürzung führt dies zu großen Einsparungen bei Speicherplatz und Rechenkosten. Jedoch sorgt die Quantisierung, ähnlich wie eine Kürzung, dafür, dass Einbettungen weniger genau ausfallen.</p><p>Wir haben die <code>jina-embeddings-v5-text</code> -Modelle darauf trainiert, mit <a href="https://www.elastic.co/docs/reference/elasticsearch/mapping-reference/bbq">Elasticsearchs Better Binary Quantization</a> zu arbeiten, indem wir diesen Genauigkeitsverlust minimieren. Benchmark-Tests binarisierter Einbettungen aus diesen Modellen zeigen eine Leistung, die fast der ihrer nicht-binarisierten Äquivalente entspricht. Im <a href="https://arxiv.org/abs/2602.15547">technischen Bericht</a> finden Sie detaillierte Ablationsstudien zur Binarisierungsleistung.</p><h3>Mehrsprachige Leistung</h3><p>Viele Einbettungsmodelle sind mehrsprachig, weil sie auf Materialien trainiert wurden, die eine große Anzahl von Sprachen enthalten. Das bedeutet jedoch nicht, dass sie in allen unterstützten Sprachen gleich gut funktionieren.</p><p>Wir haben 211 Sprachen im MMTEB-Mehrsprachen-Benchmark identifiziert und sie getrennt, um unsere Modelle mit ähnlichen Modellen auf Sprachbasis vergleichen zu können. Die folgende Abbildung fasst unsere Ergebnisse als Heatmap zusammen. Jedes Feld stellt eine Sprache dar (identifiziert durch ihren ISO-639-Code). Je grüner es ist, desto besser hat das Modell im Vergleich zum Durchschnitt ähnlicher Modelle abgeschnitten:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltee08033102f46c4f/6a17dbbc420229503229f4c8/852ac5d0f1977bb0c1124d87f8863a9bb94eb7da-1600x765.png" alt="jina-embeddings-v5-text-nano &amp; jina-embeddings-v5-text-small-Sprachen im MMTEB-Mehrsprachen-Benchmark" /><p>Obwohl die Genauigkeit zwischen Sprachen variiert, sind die <code>jina-embeddings-v5-text</code>-Modelle in den meisten Sprachen weltweit auf dem neuesten Stand der Technik oder nahezu so weit.</p><p>Details zur mehrsprachigen Leistung finden Sie im<a href="https://arxiv.org/abs/2602.15547"> technischen Bericht</a> <a href="https://arxiv.org/abs/2602.15547"><code>jina-embeddings-v5-text</code></a>.</p><h2><strong>Jina in Elastic: Hochmoderne native KI für die Suche</strong></h2><p>Mit <code>jina-embeddings-v5-text</code>-Modellen auf EIS können Sie leistungsstarke, mehrsprachige Einbettungsmodelle nativ in <a href="https://www.elastic.co/de/elasticsearch">Elasticsearch</a> ausführen, mit vollständig verwalteter, GPU-beschleunigter Inferenz und ohne Infrastruktur zur Bereitstellung oder Skalierung. <code>jina-embeddings-v5-text</code>-Modelle erweitern den wachsenden EIS-Modellkatalog mit kompakten, mehrsprachigen Modellen, die von den neuesten Entwicklungen im Bereich der KI angetrieben werden. Diese Modelle weisen eine herausragende Leistung bei der Informationswiedergewinnung und Standard-Datenanalyse-Benchmarks auf und bieten eine unübertroffene, weltweite Unterstützung in mehreren Sprachen.</p><p>Mit zwei Modellen in deutlich unterschiedlichen Größen können die Nutzer entscheiden, welches am besten zu ihren Anwendungsbereichen und ihrem Budget passt. Darüber hinaus bieten <code>jina-embeddings-v5-text </code>-Modelle mit robusten Einbettungen, die auch bei Verkleinerung der Größe oder Quantisierung auf eine geringere Genauigkeit leistungsfähig bleiben, Möglichkeiten für weitere konkrete Einsparungen bei Speicher- und Rechenkosten sowie bei der Verarbeitungslatenz.</p><p>Mit der <code>jina-embeddings-v5-text</code>-Familie, Jina Reranker und Elastics schneller Vektor- und BM25-Suche haben Nutzer nun Zugang zu einer <a href="https://www.elastic.co/docs/solutions/search/hybrid-search">End-to-End-Hybridsuche</a> von Elastic. Wenn Sie die relevantesten Ergebnisse benötigen – sei es für Retrieval Augmented Generation (RAG) Pipelines, Suchanwendungen oder Datenanalysen – bietet Elastic mit den Such-KI-Modellen von Jina solide und kosteneffiziente Qualität.</p><h2><strong>Erste Schritte</strong></h2><p>Die <code>jina-embeddings-v5-text</code>-Modelle sind vollständig in <a href="https://www.elastic.co/docs/explore-analyze/elastic-inference/eis">EIS</a> integriert und können durch Einstellen des <strong><code>type</code></strong>Felds für<strong><code>semantic_text</code></strong> verwendet werden, um Ihren Index zu erstellen und das Modell (<code>jina-embeddings-v5-text-small</code> oder <code>jina-embeddings-v5-text-nano</code>) im <code>inference_id</code>Feld zu spezifizieren, wie an diesem Beispiel zu sehen ist:</p>PUT multilingual-semantic-index
{
  "mappings": {
    "properties": {
      "content": {
        "type": "semantic_text",
        "inference_id": ".jina-embeddings-v5-text-small"
      }
    }
  }
}

# Ingest data about France
POST multilingual-semantic-index/_doc
{
  "content": "The capital of France is Paris"}

GET multilingual-semantic-index/_search
{
  "query": {
    "semantic": {
      "field": "content",
      "query": "What is the French capital?"
    }
  }
}<p><a href="https://www.elastic.co/de/elasticsearch">Elasticsearch</a> wählt während des Indexierens und des Abrufs automatisch den entsprechenden LoRA-Adapter aus. Die Einbettungsdimensionen (siehe Abschnitt <strong>„Kürzen von Einbettungen“</strong> oben) können festgelegt werden, wenn <a href="https://www.elastic.co/docs/api/doc/elasticsearch/operation/operation-inference-put">ein benutzerdefinierter Inferenz-Endpoint erstellt wird</a>.</p><p>In der <a href="https://www.elastic.co/docs/reference/elasticsearch/mapping-reference/dense-vector">Elasticsearch-Dokumentation</a> finden Sie weitere Informationen zur Nutzung von<strong><code>jina-embeddings-v5-text</code></strong>Modellen.</p><h2><strong>Weitere Informationen</strong></h2><p>Um mehr über <code>jina-embeddings-v5-text</code>-Modelle zu erfahren, lesen Sie die <a href="https://jina.ai/news/jina-embeddings-v5-text-distilling-4b-quality-into-sub-1b-multilingual-embeddings/">Versionshinweise im Jina AI-Blog</a> und den <a href="https://arxiv.org/abs/2602.15547">technischen Bericht</a> mit detaillierteren technischen Informationen zur Leistung und zum innovativen neuen Trainingsverfahren von Jina AI. Informationen zum lokalen Herunterladen und Betrieb dieser Modelle finden Sie auf der Seite der <a href="https://huggingface.co/collections/jinaai/jina-embeddings-v5-text"><code>jina-embeddings-v5-text</code></a>-<a href="https://huggingface.co/collections/jinaai/jina-embeddings-v5-text">Sammlung</a> auf Hugging Face.</p><p>Die Jina AI-Modelle stehen unter einer <a href="https://spdx.org/licenses/CC-BY-NC-4.0">CC-BY-NC-4.0-Lizenz</a> zur Verfügung. Sie können sie also kostenlos herunterladen und ausprobieren. Für die kommerzielle Nutzung wenden Sie sich bitte an den <a href="https://www.elastic.co/contact?pg=global&amp;plcmt=nav&amp;cta=205352">Elastic-Vertrieb</a>.</p>]]></content:encoded>
    <link>https://www.elastic.co/search-labs/blog/jina-embeddings-v5-text</link>
    <guid isPermaLink="true">https://www.elastic.co/search-labs/blog/jina-embeddings-v5-text</guid>
    <category><![CDATA[Jina AI]]></category>
    <dc:creator><![CDATA[Scott Martens]]></dc:creator>
    <pubDate>Mon, 23 Feb 2026 00:00:00 GMT</pubDate>
  </item>
  <item>
    <title><![CDATA[Eine Einführung in Jina-Modelle, ihre Funktionalität und ihre Einsatzmöglichkeiten in Elasticsearch]]></title>
    <description><![CDATA[Entdecken Sie multimodale Einbettungen von Jina, Reranker v3 und semantische Einbettungsmodelle und erfahren Sie, wie Sie diese nativ in Elasticsearch verwenden können.]]></description>
    <content:encoded><![CDATA[<p>Jina by Elastic bietet Suchgrundlagenmodelle für Anwendungen und die Automatisierung von Geschäftsprozessen. Diese Modelle bieten Kernfunktionen für den Einsatz von KI in Elasticsearch-Anwendungen und innovativen KI-Projekten.</p><p>Jina-Modelle lassen sich in drei Hauptkategorien einteilen, die zur Unterstützung der Informationsverarbeitung, Organisation und den Informationsabruf entwickelt wurden:</p><ul><li><p>Semantische Einbettungsmodelle</p></li><li><p>Reranking-Modelle</p></li><li><p>Kleine generative Sprachmodelle</p></li></ul><h2>Semantische Einbettungsmodelle</h2><p>Die Idee hinter semantischen Einbettungen ist, dass ein KI-Modell lernen kann, Aspekte der Bedeutung seiner Eingaben in Bezug auf die Geometrie hochdimensionaler Räume darzustellen.</p><p>Sie können sich eine semantische Einbettung als einen Punkt (technisch gesehen einen <em>Vektor</em>) in einem hochdimensionalen Raum vorstellen. Ein Einbettungsmodell ist ein neuronales Netz, das digitale Daten als Eingabe aufnimmt (potenziell alles, aber meist Text oder Bild) und die Position eines entsprechenden hochdimensionalen Punktes als numerische Koordinaten ausgibt. Wenn das Modell seine Aufgabe gut erfüllt, ist der Abstand zwischen zwei semantischen Einbettungen proportional dazu, wie sehr ihre entsprechenden digitalen Objekte dieselbe Bedeutung haben.</p><p>Um zu verstehen, wie wichtig das für Suchanwendungen ist, stellen Sie sich eine Einbettung für das Wort „dog“ und eine für das Wort „cat“ als Punkte im Raum vor:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltbad74e5d8292a60e/6a17db73abe0f2114edfe8d2/802cf9bbcb82180d3fc91009f9f62027eee8f031-615x615.png" alt="" /><p>Ein gutes Einbettungsmodell sollte eine Einbettung für das Wort „feline“ generieren, die viel näher an „cat“ als an „dog“ liegt, und „canine“ sollte eine Einbettung haben, die viel näher an „dog“ als an „cat“ liegt, weil diese Wörter fast dasselbe bedeuten:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltdb2b25691801a881/6a17db747b54f946d28b37a5/bce49daf9a31b8fb7ce1c6ef7ae4e8117a4e8b33-615x615.png" alt="" /><p>Wenn ein Modell mehrsprachig ist, würden wir dasselbe für Übersetzungen von „cat“ und „dog“ erwarten:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt976ba40be7776449/6a17db75be6086c2bd0045f2/ce4d030385324526cbd7539140e0e634d939371c-615x615.png" alt="" /><p>Einbettungsmodelle übersetzen Ähnlichkeiten oder Unterschiede in der Bedeutung zwischen Dingen in räumliche Beziehungen zwischen Einbettungen. Die Bilder oben haben nur zwei Dimensionen, sodass Sie sie auf einem Bildschirm sehen können, aber das Einbetten von Modellen erzeugt Vektoren mit Dutzenden bis Tausenden von Dimensionen. Dies ermöglicht es ihnen, die Feinheiten der Bedeutung ganzer Texte zu kodieren, indem sie einen Punkt in einem Raum mit Hunderten oder Tausenden von Dimensionen für Dokumente mit Tausenden von Wörtern oder mehr zuweisen.</p><h2>Multimodale Einbettungen</h2><p>Multimodale Modelle erweitern das Konzept der semantischen Einbettung auf andere Dinge als Texte, insbesondere auf Bilder. Wir würden erwarten, dass eine Einbettung für ein Bild nahe an einer Einbettung einer getreuen Beschreibung des Bildes liegt:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt66dc8895485734ec/6a17db77b1e11318d279f155/1ac6aef5b1423e5fe4853e8a547a74e66b0885c2-615x615.png" alt="" /><p>Semantische Einbettungen haben viele Einsatzmöglichkeiten. Unter anderem können Sie sie verwenden, um effiziente Klassifikatoren zu erstellen, Clustering durchzuführen und eine Vielzahl von Aufgaben zu erledigen, wie z. B. die Deduplizierung von Daten und die Untersuchung der Datendiversität. Beides ist wichtig für Big-Data-Anwendungen, bei denen mit zu vielen Daten gearbeitet wird, um sie manuell zu verwalten.</p><p>Die größte direkte Anwendung von Einbettungen ist der Informationsabruf. Elasticsearch kann Abrufobjekte mit Einbettungen als Schlüssel speichern. Abfragen werden in Einbettungsvektoren umgewandelt, und eine Suche gibt die gespeicherten Objekte zurück, deren Schlüssel den Abfrage-Einbettungen am nächsten sind.</p><p>Bei der traditionellen <em>vektorbasierten Suche</em> (manchmal auch als <em>Sparse Vector Retrieval</em> bezeichnet) werden Vektoren verwendet, die auf Wörtern oder Metadaten in Dokumenten und Anfragen basieren. <em>Die einbettungsbasierte Suche</em> (auch bekannt als <em>Dense Vector Retrieval</em>) verwendet hingegen KI-bewertete Bedeutungen anstelle von Wörtern. Dadurch sind sie im Allgemeinen wesentlich flexibler und genauer als herkömmliche Suchmethoden.</p><h2>Matryoshka-Darstellungslernen</h2><p>Die Anzahl der Dimensionen, die eine Einbettung hat, und die Präzision der darin enthaltenen Zahlen haben erhebliche Auswirkungen auf die Leistung. Äußerst hochdimensionale Räume und extrem hochpräzise Zahlen können sehr detaillierte und komplexe Informationen darstellen, erfordern aber größere KI-Modelle, deren Training und Nutzung teurer sind. Die erzeugten Vektoren benötigen mehr Speicherplatz, und es braucht mehr Rechenzyklen, um die Abstände zwischen ihnen zu berechnen. Bei der Verwendung semantischer Einbettungsmodelle müssen wichtige Kompromisse zwischen Präzision und Ressourcenverbrauch eingegangen werden.</p><p>Um die Flexibilität für die Nutzer zu maximieren, werden Jina-Modelle mit einer Technik namens <a href="https://arxiv.org/abs/2205.13147">Matryoshka Representation Learning</a> trainiert. Dies führt dazu, dass die Modelle die wichtigsten semantischen Unterscheidungen in die ersten Dimensionen des Einbettungsvektors vorladen, sodass man die höheren Dimensionen einfach abschneiden und trotzdem eine gute Leistung erzielen kann.</p><p>In der Praxis bedeutet das, dass Nutzer von Jina-Modellen wählen können, wie viele Dimensionen ihre Einbettungen haben sollen. Die Wahl von weniger Dimensionen verringert die Präzision, der Leistungsverlust ist jedoch gering. Bei den meisten Aufgaben sinken die Leistungskennzahlen für Jina-Modelle um 1 bis 2 %, wenn man die Einbettungsgröße um 50 % reduziert, bis hin zu einer Reduzierung um etwa 95 %.</p><h2>Asymmetrischer Informationsabruf</h2><p>Semantische Ähnlichkeit wird normalerweise symmetrisch gemessen. Der Wert, den man beim Vergleich von „cat“ mit „dog“ erhält, ist derselbe wie der Wert, den man beim Vergleich von „dog“ mit „cat“ erhält. Bei der Verwendung von Einbettungen für den Informationsabruf funktionieren diese jedoch besser, wenn man die Symmetrie aufhebt und Anfragen anders kodiert als die zu kodierenden Objekte.</p><p>Das liegt an der Art, wie wir Einbettungsmodelle trainieren. Die Trainingsdaten enthalten Instanzen der gleichen Elemente, wie z. B. Wörter, in vielen verschiedenen Kontexten. Die Modelle lernen die Semantik, indem sie die kontextuellen Ähnlichkeiten und Unterschiede zwischen den Elementen vergleichen.</p><p>So könnten wir beispielsweise feststellen, dass das Wort „animal“ nicht in sehr vielen der gleichen Kontexte wie „cat“ oder „dog“ vorkommt, und daher ist die Einbettung für „animal“ möglicherweise nicht besonders nahe an der von „cat“ oder „dog“:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/bltf219074e18a6290a/6a17db78be6086cf060045f6/9a33163405af6c71ee7f4ba8ebc86af39e295a69-615x615.png" alt="" /><p>Dies macht es unwahrscheinlicher, dass eine Abfrage nach „animal“ Dokumente über Katzen und Hunde zurückgibt – das Gegenteil unseres Ziels. Deshalb kodieren wir „Tier“ anders, wenn es sich um eine Suchanfrage handelt, als wenn es ein Ziel für den Informationsabruf ist:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt33438b4964001467/6a17db79b1e113101c79f159/363992d4f0affba7937c0c8a9f82c9a531fcd3ba-615x615.png" alt="" /><p><em>Asymmetrischer Informationsabruf</em> bedeutet, ein anderes Modell für Abfragen zu verwenden oder ein Einbettungsmodell speziell zu trainieren, um Dinge auf eine bestimmte Weise zu kodieren, wenn sie für den Abruf gespeichert sind, und Abfragen auf eine andere Weise zu kodieren.</p><h2>Multivektor-Einbettungen</h2><p>Einzelne Einbettungen sind gut für die Informationsabfrage, da sie in das grundlegende Framework einer indizierten Datenbank passen: Wir speichern Objekte für die Abfrage mit einem einzelnen Einbettungsvektor als deren Abfrageschlüssel. Wenn Nutzer den Dokumentenspeicher abfragen, werden ihre Abfragen in Einbettungsvektoren übersetzt und die Dokumente, deren Schlüssel der Abfrage-Einbettung am nächsten sind (im hochdimensionalen Einbettungsraum), werden als Kandidatenmatches abgerufen.</p><p>Multivektor-Einbettungen funktionieren etwas anders. Anstatt einen Vektor mit fester Länge zu erzeugen, um eine Abfrage und ein ganzes gespeichertes Objekt darzustellen, erzeugen sie eine Folge von Einbettungen, die kleinere Teile davon repräsentieren. Die einzelnen Teile sind typischerweise Tokens oder Wörter für Texte und Bildkacheln für visuelle Daten. Diese Einbettungen spiegeln die Bedeutung des Teils in seinem Kontext wider.</p><p>Betrachten wir zum Beispiel die folgenden Sätze:</p><ul><li><p>Sie hatte ein Herz aus Gold.</p></li><li><p>Sie hatte einen Herzenswandel.</p></li><li><p>Sie hatte einen Herzinfarkt.</p></li></ul><p>Oberflächlich betrachtet sehen sie sehr ähnlich aus, aber ein Multivektor-Modell würde wahrscheinlich sehr unterschiedliche Einbettungen für jede Instanz von „Herz“ generieren, was darstellt, wie jede im Kontext des gesamten Satzes etwas anderes bedeutet:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt5c81f089771e6029/6a17db7b7f6f157601c099ec/a33e60c8d8ee3d312bca8375ca2a8b0a0cd40ba9-615x615.png" alt="" /><p>Der Vergleich zweier Objekte anhand ihrer Multivektor-Einbettungen beinhaltet oft die Messung ihres Chamfer-Abstands: der Vergleich jedes Teils einer Multivektor-Einbettung mit jedem Teil einer anderen und die Summierung der minimalen Abstände zwischen ihnen. Andere Systeme, einschließlich des unten beschriebenen Jina Rerankers, geben sie in ein KI-Modell ein, das speziell für die Bewertung ihrer Ähnlichkeit trainiert wurde. Beide Ansätze haben in der Regel eine höhere Präzision als der Vergleich von Einzeleinbettungen, da Einbettungen mit mehreren Vektoren viel detailliertere Informationen enthalten als solche mit einem Vektor.</p><p>Allerdings eignen sich Multivektor-Einbettungen nicht gut zum Indexieren. Sie werden häufig bei Neubewertungsaufgaben verwendet, wie im nächsten Abschnitt für das Modell <code>jina-colbert-v2</code> beschrieben.</p><h2>Jina-Einbettungsmodelle</h2><h3>Jina-Einbettungen – v4</h3><p><a href="https://jina.ai/news/jina-embeddings-v4-universal-embeddings-for-multimodal-multilingual-retrieval/"><strong>jina-embeddings-v4</strong></a> ist ein 3,8 Milliarden (3,8x10⁹) Parameter umfassendes mehrsprachiges und multimodales Einbettungsmodell, das Bilder und Texte in einer Vielzahl weit verbreiteter Sprachen unterstützt. Es verwendet eine neuartige Architektur, um visuelle Kenntnisse und Sprachkenntnisse zu nutzen, um die Leistung bei beiden Aufgaben zu verbessern, sodass es beim Abrufen von Bildern und insbesondere beim <a href="https://huggingface.co/tasks/visual-document-retrieval">visuellen Abrufen von Dokumenten</a> hervorragende Leistungen erbringt. Das bedeutet, dass es Bilder wie Diagramme, Dias, Karten, Screenshots, Seitenscans und Diagramme verarbeitet – gängige Bildtypen, oft mit wichtigem eingebettetem Text, die außerhalb des Bereichs von Computer-Vision-Modellen fallen, die auf Bildern realer Szenen trainiert sind.</p><p>Wir haben dieses Modell mithilfe kompakter <a href="https://huggingface.co/docs/peft/en/package_reference/lora">Low-Rank Adaptation (LoRA)-Adapter</a> für verschiedene Aufgaben optimiert. Dadurch können wir ein einzelnes Modell trainieren, um sich auf mehrere Aufgaben zu spezialisieren, ohne bei einer davon die Leistung zu beeinträchtigen – mit minimalen zusätzlichen Kosten für Speicher oder Verarbeitung.</p><p>Zu den wichtigsten Funktionen gehören:</p><ul><li><p>Spitzenleistung beim visuellen Dokumentenabruf sowie eine mehrsprachige Text- und Bildverarbeitungsleistung, die deutlich größere Modelle übertrifft.</p></li><li><p>Unterstützung für große Eingabekontextgrößen: 32.768 Tokens entsprechen ungefähr 80 Seiten doppeltzeiligem englischen Text, und 20 Megapixel entsprechen einem Bild von 4.500 x 4.500 Pixeln.</p></li><li><p>Vom Nutzer ausgewählte Einbettungsgrößen, von maximal 2048 Dimensionen bis zu 128 Dimensionen. Wir haben empirisch festgestellt, dass die Leistung unterhalb dieser Schwelle dramatisch abnimmt.</p></li><li><p>Unterstützung für sowohl einzelne Einbettungen als auch Multivektor-Einbettungen. Für Texte besteht die Multivektor-Ausgabe aus einer 128-dimensionalen Einbettung für jedes Eingabetoken. Für Bilder erzeugt es eine 128-dimensionale Einbettung für jede 28x28 Pixel große Kachel, die zur Abdeckung des Bildes benötigt wird.</p></li><li><p>Optimierung für asymmetrischen Datenabruf mittels eines Paares von LoRA-Adaptern, die speziell für diesen Zweck trainiert wurden.</p></li><li><p>Ein LoRA-Adapter, optimiert für die Berechnung semantischer Ähnlichkeit.</p></li><li><p>Spezielle Unterstützung für Programmiersprachen und IT-Frameworks, ebenfalls über einen LoRA-Adapter.</p></li></ul><p>Wir haben <code>jina-embeddings-v4</code> als allgemeines Mehrzweckwerkzeug für eine breite Palette gängiger Such-, Sprachverarbeitungs- und KI-Analyseaufgaben entwickelt. Es handelt sich im Verhältnis zu seinen Fähigkeiten um ein relativ kleines Modell, dessen Bereitstellung jedoch erhebliche Ressourcen erfordert und das sich am besten für die Nutzung über eine Cloud-API oder in einer Umgebung mit hohem Datenaufkommen eignet.</p><h3>Jina-Einbettungen – v3</h3><p><a href="https://jina.ai/news/jina-embeddings-v3-a-frontier-multilingual-embedding-model/"><strong>jina-embeddings-v3</strong></a> ist ein kompaktes, leistungsstarkes, mehrsprachiges, ausschließlich textbasiertes Einbettungsmodell mit weniger als 600 Millionen Parametern. Es unterstützt bis zu 8192 Texteingabetoken und liefert Einzelvektor-Einbettungen mit vom Nutzer gewählten Größen von einem Standard von 1024 Dimensionen bis zu 64 als Ausgabe.</p><p>Wir haben <code>jina-embeddings-v3</code> für eine Vielzahl von Textaufgaben trainiert – nicht nur für den Informationsabruf und die semantische Ähnlichkeit, sondern auch für Klassifikationsaufgaben wie die Sentiment-Analyse und Inhaltsmoderation sowie für Clustering-Aufgaben wie die Nachrichtenaggregation und -empfehlung. Wie <code>jina-embeddings-v4</code> bietet auch dieses Modell LoRA-Adapter, die auf die folgenden Nutzungskategorien spezialisiert sind:</p><ul><li><p>Asymmetrischer Informationsabruf</p></li><li><p>Semantische Ähnlichkeit</p></li><li><p>Klassifizierung</p></li><li><p>Clustering</p></li></ul><p><code>jina-embeddings-v3</code> ist ein deutlich kleineres Modell als <code>jina-embeddings-v4</code> mit einer deutlich reduzierten Eingabekontextgröße, aber es ist günstiger in der Nutzung. Dennoch bietet es eine sehr wettbewerbsfähige Leistung, wenn auch nur für Texte, und ist für viele Anwendungsfälle eine bessere Wahl.</p><h3>Jina Code-Einbettungen</h3><p>Die spezialisierten Code-Einbettungsmodelle von Jina – <a href="https://jina.ai/models/jina-code-embeddings-1.5b"><strong>jina-code-embeddings (0.5b und 1.5b)</strong></a> – unterstützen 15 Programmierschemata und Frameworks sowie englischsprachige Texte aus dem Bereich Informatik und Informationstechnologie. Es handelt sich um kompakte Modelle mit einer halben Milliarde (0,5x10⁹) bzw. eineinhalb Milliarden (1,5x10⁹) Parametern. Beide Modelle unterstützen Eingabekontextgrößen von bis zu 32.768 Token und ermöglichen es den Nutzern, ihre Ausgabe-Einbettungsgrößen auszuwählen, von 896 bis 64 Dimensionen für das kleinere Modell und 1536 bis 128 für das größere.</p><p>Diese Modelle unterstützen asymmetrische Abrufe für fünf aufgabenspezifische Spezialisierungen, wobei <a href="https://arxiv.org/abs/2101.00190">Präfixabstimmung</a> statt LoRA-Adapter verwendet wird:</p><ul><li><p><strong>Code zu Code.</strong> Ähnlichen Code in verschiedenen Programmiersprachen abrufen. Dies wird für die Code-Ausrichtung, Code-Deduplizierung sowie die Unterstützung von Portierung und Refactoring verwendet.</p></li><li><p><strong>Natürliche Sprache zu Code.</strong> Abrufen von Code, um Abfragen, Kommentare, Beschreibungen und Dokumentation in natürlicher Sprache abzugleichen.</p></li><li><p><strong>Code zu natürlicher Sprache. </strong>Vergleichen des Codes mit der Dokumentation oder anderen Texten in natürlicher Sprache.</p></li><li><p><strong>Code-zu-Code-Vervollständigung.</strong> Vorschlag von relevantem Code, um bestehenden Code zu ergänzen oder zu verbessern.</p></li><li><p><strong>Technische Fragen und Antworten.</strong> Identifizierung von Antworten in natürlicher Sprache auf Fragen zu Informationstechnologien, ideal geeignet für Anwendungsfälle im technischen Support.</p></li></ul><p>Diese Modelle bieten eine überlegene Leistung für Aufgaben, die Computerdokumentation und Programmiermaterialien erfordern, bei relativ geringen Rechenkosten. Sie eignen sich hervorragend für die Integration in Entwicklungsumgebungen und Code-Assistenten.</p><h3>Jina ColBERT v2</h3><p><a href="https://jina.ai/models/jina-colbert-v2"><strong>jina-colbert-v2</strong></a> ist ein Multivektor-Texteinbettungsmodell mit 560 Millionen Parametern. Es ist mehrsprachig, mit Materialien in 89 Sprachen trainiert und unterstützt variable Einbettungsgrößen sowie asymmetrischen Informationsabruf.</p><p>Wie bereits erwähnt, sind Multivektor-Einbettungen schlecht für das Indexieren geeignet, aber sehr nützlich, um die Genauigkeit von Ergebnissen anderer Suchstrategien zu erhöhen. <strong>Mit jina-colbert-v2können Sie Multivektor-Einbettungen im Voraus berechnen und sie dann verwenden, um Abrufkandidaten zur Abfragezeit neu zu ordnen.</strong> Dieser Ansatz ist weniger präzise als die Verwendung eines der Reranking-Modelle im nächsten Abschnitt, aber viel effizienter, da er nur den Vergleich gespeicherter Multivektor-Einbettungen beinhaltet, anstatt das gesamte KI-Modell für jede Abfrage und jedes Kandidatenmatch aufzurufen. Es eignet sich ideal für Anwendungsfälle, in denen die Latenz und der Rechenaufwand durch die Nutzung von Reranking-Modellen zu groß sind oder die Anzahl der Kandidaten zum Vergleich zu groß für das Reranking von Modellen ist.</p><p>Dieses Modell gibt eine Folge von Einbettungen aus – eine pro Eingabetoken – und Nutzer können Token-Einbettungen aus 128-, 96- oder 64-dimensionalen Einbettungen auswählen. Kandidaten-Textmatches sind auf 8.192 Token begrenzt. Abfragen werden asymmetrisch kodiert, daher müssen Nutzer angeben, ob ein Text eine Abfrage oder ein Kandidatenmatch ist, und die Abfragen auf 32 Token begrenzen.</p><h3>Jina CLIP v2</h3><p><a href="https://jina.ai/news/jina-clip-v2-multilingual-multimodal-embeddings-for-text-and-images/"><strong>jina-clip-v2</strong></a> ist ein multimodales Einbettungsmodell mit 900 Millionen Parametern, das so trainiert wurde, dass Texte und Bilder Einbettungen erzeugen, die nahe beieinander liegen, wenn der Text den Inhalt des Bildes beschreibt. Es dient in erster Linie zum Abrufen von Bildern auf der Grundlage von Textabfragen, ist aber auch ein leistungsstarkes reines Textmodell, das die Nutzerkosten senkt, da Sie keine separaten Modelle für Text-zu-Text- und Text-zu-Bild-Abfragen benötigen.</p><p>Dieses Modell unterstützt einen Texteingabekontext von 8.192 Tokens, und Bilder werden vor der Einbettung auf 512x512 Pixel skaliert.</p><p>CLIP-Architekturen („Contrastive Language-Image Pretraining“) sind einfach zu trainieren und zu bedienen und können sehr kompakte Modelle erzeugen, aber sie haben einige grundlegende Einschränkungen. Sie können ihr Wissen aus einem Medium nicht nutzen, um ihre Leistung in einem anderen zu verbessern. Sie können nicht ein Medium nutzen, um ihre Leistung in einem anderen zu verbessern. Obwohl das System also wissen mag, dass die Wörter „dog“ und „cat“ in ihrer Bedeutung näher beieinander liegen als jedes von ihnen bei „car“, weiß es nicht unbedingt, dass ein Bild von einem Hund und ein Bild von einer Katze enger miteinander verwandt sind als jedes von ihnen bei einem Bild von einem Auto.</p><p>Sie leiden auch unter der sogenannten <em>Modalitätslücke</em>: Die Einbettung eines Textes über Hunde ist wahrscheinlich näher an der Einbettung eines Textes über Katzen als an der Einbettung eines Bildes von Hunden. Aufgrund dieser Einschränkung empfehlen wir, CLIP entweder als Text-zu-Bild-Abfragemodell oder als reines Textmodell zu verwenden, jedoch nicht beide in einer einzigen Abfrage zu vermischen.</p><h2>Reranking-Modelle</h2><p>Reranking-Modelle nehmen ein oder mehrere Kandidatenmatches zusammen mit einer Abfrage als Eingabe für das Modell und vergleichen sie direkt, wodurch deutlich präzisere Übereinstimmungen entstehen.</p><p>Grundsätzlich könnte man einen Reranker direkt für die Informationsabfrage verwenden, indem man jede Abfrage mit jedem gespeicherten Dokument vergleicht, dies wäre jedoch sehr rechenintensiv und für alle außer den kleinsten Sammlungen unpraktisch. Daher werden Reranker tendenziell zur Bewertung relativ kurzer Listen von Kandidatenmatches verwendet, die mit anderen Mitteln gefunden wurden, wie z. B. durch einbettungsbasierte Suche oder andere Algorithmen für den Informationsabruf. Reranking-Modelle eignen sich ideal für hybride und föderierte Suchverfahren, bei denen eine Suche bedeuten kann, dass Anfragen an separate Suchsysteme mit unterschiedlichen Datensätzen gesendet werden, die jeweils unterschiedliche Ergebnisse liefern. Sie sind sehr gut darin, vielfältige Ergebnisse zu einem einzigen, hochwertigen Ergebnis zu vereinen.</p><p>Die auf Einbettungen basierende Suche kann eine große Herausforderung darstellen, da sie eine Neuindizierung aller gespeicherten Daten erfordert und die Erwartungen der Nutzer an die Ergebnisse verändert. Wenn Sie einen Reranker zu einem bestehenden Suchschema hinzufügen, können Sie viele der Vorteile von KI nutzen, ohne Ihre gesamte Suchlösung neu zu entwickeln.</p><h2>Jina-Reranker-Modelle</h2><h3>Jina Reranker m0</h3><p><a href="https://jina.ai/models/jina-reranker-m0/"><strong>jina-reranker-m0</strong></a> ist ein multimodaler Reranker mit 2,4 Milliarden (2,4x10⁹) Parametern, der Textanfragen und Kandidatenmatches aus Texten und/oder Bildern unterstützt. Es ist das führende Modell für die visuelle Dokumentensuche und somit eine ideale Lösung für Sammlungen von PDFs, Scans von Texten, Screenshots und anderen computergenerierten oder modifizierten Bildern, die Text oder andere semistrukturierte Informationen enthalten, sowie für gemischte Daten, die aus Textdokumenten und Bildern bestehen.</p><p>Dieses Modell nimmt eine einzelne Abfrage und einen Kandidatenmatch entgegen und gibt einen Score zurück. Wenn dieselbe Abfrage mit verschiedenen Kandidaten verwendet wird, sind die Scores vergleichbar und können zur Rangfolge herangezogen werden. Es unterstützt eine gesamte Eingabegröße von bis zu 10.240 Tokens, einschließlich des Anfragetextes und des Kandidatentextes oder -bildes. Jede 28x28 Pixel große Kachel, die zum Abdecken eines Bildes benötigt wird, zählt als Token zur Berechnung der Eingabegröße.</p><h3>Jina Reranker v3</h3><p><a href="https://jina.ai/models/jina-reranker-v3/"><strong>jina-reranker-v3</strong></a> ist ein Text-Reranker mit 600 Millionen Parametern und modernster Leistung für Modelle vergleichbarer Größe. Im Gegensatz zu <code>jina-reranker-m0</code> nimmt er eine einzelne Abfrage und eine Liste von bis zu 64 Kandidatenübereinstimmungen und gibt die Rangfolge zurück. Es hat einen Eingabekontext von 131.000 Token, einschließlich der Abfrage und aller Textkandidaten.</p><h3>Jina Reranker v2</h3><p><a href="https://jina.ai/models/jina-reranker-v2"><strong>jina-reranker-v2-base-multilingual</strong></a> ist ein äußerst kompakter, universeller Reranker mit zusätzlichen Features, die Funktionsaufrufe und SQL-Abfragen unterstützen. Mit weniger als 300 Millionen Parametern bietet er ein schnelles, effizientes und genaues mehrsprachiges Text-Reranking mit zusätzlicher Unterstützung für die Auswahl von SQL-Tabellen und externen Funktionen, die Textabfragen entsprechen, wodurch es sich für agentenbasierte Anwendungsfälle eignet.</p><h2>Kleine generative Sprachmodelle</h2><p>Generative Sprachmodelle sind Modelle wie ChatGPT von OpenAI, Google Gemini und Claude von Anthropic, die Text- oder Multimedia-Eingaben aufnehmen und mit Textausgaben antworten. Es gibt keine klar definierte Grenze, die <em>große</em> Sprachmodelle (LLMs) von <em>kleinen</em> Sprachmodellen (SLMs) unterscheidet, aber die praktischen Probleme bei der Entwicklung, dem Betrieb und der Nutzung von Top-LLMs sind wohlbekannt. Die bekanntesten werden nicht öffentlich verbreitet, daher können wir ihre Größe nur schätzen, aber es wird erwartet, dass ChatGPT, Gemini und Claude im Bereich von 1 bis 3 Billionen (1–3x10¹²) Parametern liegen.</p><p>Das Ausführen dieser Modelle – selbst wenn sie öffentlich verfügbar sind – geht weit über den Umfang herkömmlicher Hardware hinaus und erfordert die fortschrittlichsten Chips, die in riesigen parallelen Arrays angeordnet sind. Der Zugriff auf LLMs ist über kostenpflichtige APIs möglich, dies verursacht jedoch erhebliche Kosten, führt zu einer hohen Latenz und lässt sich nur schwer mit den Anforderungen an Datenschutz, digitale Souveränität und Cloud-Repatriierung vereinbaren. Außerdem können die Kosten für das Training und die Anpassung von Modellen dieser Größe beträchtlich sein.</p><p>Aus diesem Grund wurde viel Forschung in die Entwicklung kleinerer Modelle gesteckt, die vielleicht nicht alle Fähigkeiten der größten LLMs haben, aber bestimmte Aufgaben genauso gut erledigen können, und das zu geringeren Kosten. Unternehmen setzen Software in der Regel ein, um spezifische Probleme zu lösen, und KI-Software bildet da keine Ausnahme. Daher sind SLM-basierte Lösungen oft LLM-basierten Lösungen vorzuziehen. Sie können üblicherweise auf Standardhardware laufen, sind schneller, verbrauchen weniger Energie und lassen sich viel leichter anpassen.</p><p>Das SLM-Angebot von Jina wächst, da wir uns darauf konzentrieren, wie wir KI am besten in praktische Suchlösungen integrieren können.</p><h2>Jina SLMs</h2><h3>ReaderLM v2</h3><p><a href="https://jina.ai/models/ReaderLM-v2"><strong>ReaderLM-v2</strong></a> ist ein generatives Sprachmodell, das HTML gemäß benutzerdefinierten JSON-Schemata und natürlichen Sprachanweisungen in Markdown oder JSON umwandelt.</p><p>Datenvorverarbeitung und -normalisierung sind ein wesentlicher Bestandteil der Entwicklung guter Suchlösungen für digitale Daten, aber reale Daten, insbesondere webbasierte Informationen, sind oft chaotisch, und einfache Umwandlungsstrategien erweisen sich häufig als sehr zerbrechlich. Stattdessen bietet <code>ReaderLM-v2</code> eine intelligente KI-Modelllösung, die das Chaos eines DOM-Tree-Dumps einer Webseite verstehen und nützliche Elemente robust identifizieren kann.</p><p>Mit 1,5 Milliarden (1,5x10⁹) Parametern ist es drei Größenordnungen kompakter als modernste LLMs, leistet aber bei dieser einen engen Aufgabe auf Augenhöhe.</p><h3>Jina VLM</h3><p><a href="https://jina.ai/models/jina-vlm"><strong>jina-vlm</strong></a> ist ein generatives Sprachmodell mit 2,4 Milliarden (2,4x10⁹) Parametern, das darauf trainiert wurde, natürlichsprachliche Fragen zu Bildern zu beantworten. Es bietet eine sehr starke Unterstützung für die visuelle Dokumentenanalyse, d. h. für die Beantwortung von Fragen zu Scans, Screenshots, Folien, Diagrammen und ähnlichen nicht natürlichen Bilddaten.</p><p>Zum Beispiel:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt124b9932e01dcd40/6a17db7d4202291eca29f4bc/adfa1420d079ca4fd5582eef4349b1265b378e76-950x500.png" alt="" /><p>Es ist auch sehr gut darin, Text in Bildern zu lesen:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt1a862a9c9a0e42ce/6a17db7fb1e1133a2979f15d/ea3956e7ad86f8e171841cab2c28c8b3498da1d4-1002x500.png" alt="" /><p>Die wahre Stärke von <code>jina-vlm</code> liegt jedoch im Verständnis des Inhalts von informativen und von Menschen erstellten Bildern:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt761cf621ea32e4ae/6a17db8163baff7730741b26/f68606f9d2d99e2cd616d4ff81db3574dc4e26a5-1020x700.png" alt="" /><p>Oder:</p><img src="https://static-www.elastic.co/v3/assets/bltefdd0b53724fa2ce/blt4df4d31e574df7e3/6a17db82e3179134e02d56e9/297e85e7e78f296388a02301e1e08fed70827423-1000x500.png" alt="" /><p><code>jina-vlm</code> ist gut geeignet für die automatische Generierung von Bildunterschriften, Produktbeschreibungen, Alternativtexten für Bilder und Barrierefreiheitsanwendungen für Sehbehinderte. Es schafft zudem Möglichkeiten für RAG-Systeme („Retrieval-Augmented-Generation“), visuelle Informationen zu verwenden, und für KI-Agenten, Bilder ohne menschliche Unterstützung zu verarbeiten.</p>]]></content:encoded>
    <link>https://www.elastic.co/search-labs/blog/jina-models-elasticsearch-guide</link>
    <guid isPermaLink="true">https://www.elastic.co/search-labs/blog/jina-models-elasticsearch-guide</guid>
    <category><![CDATA[Integrationen]]></category>
    <category><![CDATA[Jina AI]]></category>
    <dc:creator><![CDATA[Scott Martens]]></dc:creator>
    <pubDate>Thu, 01 Jan 2026 00:00:00 GMT</pubDate>
  </item>
  </channel>
</rss>