Heim
Google erweitert die Dateisuche der Gemini-API um fortschrittliche multimodale RAG-Funktionen
Google hat ein bedeutendes Upgrade der Dateisuchfunktion seiner Gemini-API eingeführt und bietet Entwicklern damit erweiterte Funktionen im Bereich der multimodalen „Retrieval-Augmented Generation“ (RAG). Dieses Update geht über die herkömmliche reine Textsuche hinaus und ermöglicht es der KI, Bilder zu interpretieren und sich tief in komplexe Dokumente zu integrieren – ein entscheidender Fortschritt für die Genauigkeit der KI bei der Informationsgewinnung auf Unternehmensebene.
Technisch gesehen nutzt die neue Dateisuchfunktion das „Gemini Embedding2“-Modell. Im Gegensatz zu früheren Systemen, die auf die Suche nach Textvektoren beschränkt waren, verfügt das aktualisierte System über ein einheitliches multimodales Embedding, wodurch es visuelle Inhalte in PDFs, Dokumenten und verschiedenen Bildformaten erkennen und verarbeiten kann. Das bedeutet, dass Entwickler keine komplexen Vektordatenbanken oder Dokumentensegmentierungssysteme mehr aufbauen müssen; sie können einen vollständigen RAG-Workflow – vom Daten-Upload bis zur Informationsabfrage – direkt innerhalb der Gemini-API realisieren.

In der Praxis löst dieser Fortschritt ein häufiges Problem: Herkömmliche RAG-Systeme sind oft nicht in der Lage, nicht-textuelle Inhalte zu verarbeiten. Bislang waren Diagramme, Konstruktionszeichnungen oder Produkt-Screenshots in Dokumenten „blinde Flecken“ für die KI, wodurch wichtige Kontextinformationen übersehen wurden. Nun versteht die Gemini-API diese visuellen Elemente von Haus aus. Wenn ein Unternehmen beispielsweise ein PDF mit technischen Architekturdiagrammen oder Verkaufstrenddiagrammen hochlädt, kann die KI die Diagrammdaten mit Textbeschreibungen kombinieren, um präzise Erkenntnisse zu liefern, was den Nutzen von Kundenservice-Bots und Dokumentenanalysesystemen erheblich steigert.
Um die Verwaltung großer Wissensdatenbanken zu verbessern, hat Google eine Filterfunktion für benutzerdefinierte Metadaten hinzugefügt. Entwickler können Dateien nach Abteilung, Zeitpunkt oder Kategorie kennzeichnen und beim Abruf irrelevante Informationen anhand vordefinierter Bedingungen herausfiltern, wodurch sichergestellt wird, dass die von der KI generierten Antworten zielgerichteter sind.
Um zudem Bedenken hinsichtlich der Rückverfolgbarkeit von Informationen auszuräumen, unterstützt die Gemini-API nun Zitate auf Seitenebene. Bei der Generierung von Antworten gibt die KI für jede Information die konkrete Seitenzahl an, anstatt nur auf die gesamte Datei zu verweisen. Diese Transparenz hilft Nutzern, die Richtigkeit schnell zu überprüfen, und erleichtert ein vertieftes Lesen.
Die erweiterte Dateisuchfunktion steht Entwicklern weltweit zur Verfügung. Nutzer können über Google AI Studio oder die Google Cloud-Plattform darauf zugreifen, um die Entwicklungsvorteile und Effizienzsteigerungen zu nutzen, die multimodales RAG bietet.
Verwandter Artikel
Inside Details Exposed About Next-Gen Gemini: Strained Computing Power, Internal Teams Disagreed on Development Priorities and Resource Allocation
Berichten zufolge wurde der Start des hocherwarteten Next-Generation-Gemini-Modells von Google verschoben. Interne Uneinigkeiten über Entwicklungsprioritäten und Ressourcenallokation, kombiniert mit begrenzter Rechenkapazität und komplexen Genehmigun
OpenAI entkräftet Bedenken bezüglich des verlangsamen Wachstums und erklärt, dass mehrere Geschäftsbereiche ihre Expansion beschleunigen
Als Reaktion auf externe Kritik bezüglich des nachlassenden Umsatzwachstums und verpasster interner Zielvorgaben gab der KI-Pionier OpenAI am Dienstag, den 28. April, eine selbstbewusste Erklärung ab. Das Unternehmen präzisierte, dass seine Verbrauch
Alibaba Super Cup: Qwen3.8-Max debütiert mit verbesserten Coding- und Bürotools
Alibaba hat offiziell Qwen3.8-Max vorgestellt, ein hochmodernes Foundation-Modell mit 2,4 Billionen Parametern. Diese bedeutende KI-Entwicklung bietet erhebliche Leistungssteigerungen in Kernbereichen wie Programmierung und professionelle Büroaufgabe
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)
Google hat ein bedeutendes Upgrade der Dateisuchfunktion seiner Gemini-API eingeführt und bietet Entwicklern damit erweiterte Funktionen im Bereich der multimodalen „Retrieval-Augmented Generation“ (RAG). Dieses Update geht über die herkömmliche reine Textsuche hinaus und ermöglicht es der KI, Bilder zu interpretieren und sich tief in komplexe Dokumente zu integrieren – ein entscheidender Fortschritt für die Genauigkeit der KI bei der Informationsgewinnung auf Unternehmensebene.
Technisch gesehen nutzt die neue Dateisuchfunktion das „Gemini Embedding2“-Modell. Im Gegensatz zu früheren Systemen, die auf die Suche nach Textvektoren beschränkt waren, verfügt das aktualisierte System über ein einheitliches multimodales Embedding, wodurch es visuelle Inhalte in PDFs, Dokumenten und verschiedenen Bildformaten erkennen und verarbeiten kann. Das bedeutet, dass Entwickler keine komplexen Vektordatenbanken oder Dokumentensegmentierungssysteme mehr aufbauen müssen; sie können einen vollständigen RAG-Workflow – vom Daten-Upload bis zur Informationsabfrage – direkt innerhalb der Gemini-API realisieren.

In der Praxis löst dieser Fortschritt ein häufiges Problem: Herkömmliche RAG-Systeme sind oft nicht in der Lage, nicht-textuelle Inhalte zu verarbeiten. Bislang waren Diagramme, Konstruktionszeichnungen oder Produkt-Screenshots in Dokumenten „blinde Flecken“ für die KI, wodurch wichtige Kontextinformationen übersehen wurden. Nun versteht die Gemini-API diese visuellen Elemente von Haus aus. Wenn ein Unternehmen beispielsweise ein PDF mit technischen Architekturdiagrammen oder Verkaufstrenddiagrammen hochlädt, kann die KI die Diagrammdaten mit Textbeschreibungen kombinieren, um präzise Erkenntnisse zu liefern, was den Nutzen von Kundenservice-Bots und Dokumentenanalysesystemen erheblich steigert.
Um die Verwaltung großer Wissensdatenbanken zu verbessern, hat Google eine Filterfunktion für benutzerdefinierte Metadaten hinzugefügt. Entwickler können Dateien nach Abteilung, Zeitpunkt oder Kategorie kennzeichnen und beim Abruf irrelevante Informationen anhand vordefinierter Bedingungen herausfiltern, wodurch sichergestellt wird, dass die von der KI generierten Antworten zielgerichteter sind.
Um zudem Bedenken hinsichtlich der Rückverfolgbarkeit von Informationen auszuräumen, unterstützt die Gemini-API nun Zitate auf Seitenebene. Bei der Generierung von Antworten gibt die KI für jede Information die konkrete Seitenzahl an, anstatt nur auf die gesamte Datei zu verweisen. Diese Transparenz hilft Nutzern, die Richtigkeit schnell zu überprüfen, und erleichtert ein vertieftes Lesen.
Die erweiterte Dateisuchfunktion steht Entwicklern weltweit zur Verfügung. Nutzer können über Google AI Studio oder die Google Cloud-Plattform darauf zugreifen, um die Entwicklungsvorteile und Effizienzsteigerungen zu nutzen, die multimodales RAG bietet.
Inside Details Exposed About Next-Gen Gemini: Strained Computing Power, Internal Teams Disagreed on Development Priorities and Resource Allocation
Berichten zufolge wurde der Start des hocherwarteten Next-Generation-Gemini-Modells von Google verschoben. Interne Uneinigkeiten über Entwicklungsprioritäten und Ressourcenallokation, kombiniert mit begrenzter Rechenkapazität und komplexen Genehmigun
OpenAI entkräftet Bedenken bezüglich des verlangsamen Wachstums und erklärt, dass mehrere Geschäftsbereiche ihre Expansion beschleunigen
Als Reaktion auf externe Kritik bezüglich des nachlassenden Umsatzwachstums und verpasster interner Zielvorgaben gab der KI-Pionier OpenAI am Dienstag, den 28. April, eine selbstbewusste Erklärung ab. Das Unternehmen präzisierte, dass seine Verbrauch
Alibaba Super Cup: Qwen3.8-Max debütiert mit verbesserten Coding- und Bürotools
Alibaba hat offiziell Qwen3.8-Max vorgestellt, ein hochmodernes Foundation-Modell mit 2,4 Billionen Parametern. Diese bedeutende KI-Entwicklung bietet erhebliche Leistungssteigerungen in Kernbereichen wie Programmierung und professionelle Büroaufgabe











