Tealium: Warum die RAG-Qualität von Echtzeitdaten abhängt
![]()
Freddy Berlanti, Principal Product Manager für angewandte KI bei Tealium, befasst sich mit dem Thema „Retrieval-Augmented Generation“ (RAG). Bild: Getty Images
Freddy Berlanti, Principal Product Manager für Angewandte KI bei Tealium, erläutert den entscheidenden Unterschied zwischen RAG-Systemen, die einen Mehrwert bieten, und solchen, die das Vertrauen der Nutzer stillschweigend untergraben
Die meisten RAG-Systeme (Retrieval-Augmented Generation) in Unternehmen liefern nur eine Momentaufnahme des Kunden: einen am vergangenen Dienstag indizierten Vektorspeicher, eine über Nacht synchronisierte Wissensdatenbank oder ein Profil, das widerspiegelt, wer der Nutzer vor 12 Stunden war. Diese Lücke trennt funktionierende RAG-Systeme von solchen, die das Vertrauen still und leise untergraben.
Es ist Donnerstag, 20:47 Uhr. Ein Kunde legt einen weiteren Artikel in den Warenkorb, wodurch der Gesamtbetrag die Schwelle für kostenlosen Versand überschreitet, öffnet dann den Support-Chat und fragt, ob der Versand inbegriffen ist.
Der Mitarbeiter antwortet innerhalb von Millisekunden. Die Antwort ist flüssig, höflich, fundiert – und falsch –, denn das abgerufene Profil wurde erstellt, bevor sich der Warenkorb geändert hat. Bis die im Batch-Verfahren indizierten Daten nachholen, ist der Moment, für den sie eigentlich bestimmt waren, bereits vorbei.
Zwei unterschiedliche Größen bestimmen diesen Austausch, doch die meisten Produktionssysteme messen nur eine davon. Die Antwortlatenz ist die Zeit zwischen der Frage und der Antwort, und Teams messen sie mit großer Sorgfalt. Das „Alter der Informationen“, eine von Kaul, Yates und Gruteser formalisierte Kennzahl, misst, wie alt eine Information ist, wenn das System darauf reagiert. Einfach ausgedrückt: Wie veraltet war der Kontext, als Sie ihn genutzt haben?

In diesem Beispiel betrug die Antwortlatenz weniger als eine Sekunde, doch die Informationen waren bereits mehrere Stunden alt. Das System war schnell, ohne aktuell zu sein. Und nur einer dieser Werte wurde auf dem Dashboard angezeigt.
Diese Unterscheidung ist wichtig, denn eine schnelle Antwort, die auf veralteten Kundendaten basiert, ist immer noch die falsche Antwort. Bei kundenorientiertem RAG sind Geschwindigkeit und Aktualität zwei unterschiedliche Probleme, und die Optimierung des einen garantiert nicht das andere.
Beide sind voneinander unabhängig und können unter Last in entgegengesetzte Richtungen tendieren. Häufigere Aktualisierungen bedeuten nicht immer aktuellere Informationen. Ab einem bestimmten Punkt stauen sich die Aktualisierungen, wodurch die neueste verfügbare Information älter und nicht neuer wird. Der nächtliche Batch-Lauf ist lediglich der Extremfall: ein System, das auf der Grundlage einer einen Tag alten Sicht auf die Welt arbeitet. Die Lösung besteht nicht darin, mehr Daten nach demselben Zeitplan zu übertragen. Es geht darum, die relevanten Änderungen sofort zu übertragen, sobald sie eintreten – was eine andere Architektur erfordert, nicht nur eine schnellere.
RAG hat sich seinen Platz verdient, indem es das „Closed-Book“-Problem gelöst hat. Anstatt allein aus dem Gedächtnis zu antworten, sucht das System zunächst das relevante Material und antwortet dann auf der Grundlage dessen, was es gefunden hat. Dieses Material ist der Korpus. Wenn der Korpus stimmt, hört das Modell auf zu improvisieren.
Für einen internen Wissensassistenten ist ein Korpus, der über Nacht synchronisiert wird, völlig ausreichend. Ein Kunde mitten in einer Sitzung ist jedoch ein anderes Problem. Der Warenkorb hat gerade eine Schwelle überschritten, und ein Mitarbeiter muss sofort entscheiden, ob er kostenlosen Versand anbietet oder den Kunden in der Warteschleife hält. Ein vor Tagesanbruch erstellter Snapshot ist keine Einschränkung, die später wegoptimiert werden kann; es ist die falsche Architektur, denn bis die im Batch-Verfahren indizierten Daten auf den neuesten Stand gebracht sind, ist die Gelegenheit, für die sie eigentlich gedacht waren, bereits verpasst.
Batch-RAG ruft eine Erinnerung ab; Live-RAG ruft den Kunden ab
Die Fehler sind klein, plausibel und schleichend. Sie lösen selten Warnmeldungen oder Fehlerberichte aus; die Nutzer lernen einfach, dem System nicht zu vertrauen, und nutzen es nicht mehr. Wenn dies schließlich auf einem Dashboard sichtbar wird, sieht es wie ein Akzeptanzproblem ohne offensichtliche Ursache aus.
Die Lösung beginnt noch vor jeder Entscheidung über die Tools. Es handelt sich um eine Service-Level-Vereinbarung, die für jeden Anwendungsfall individuell formuliert wird und drei Fragen beantwortet: Wie aktuell muss der Kontext sein? Wie schnell muss die Antwort eintreffen? Wann sollte das System aufhören und die Konversation an einen Menschen übergeben?
Der Warenkorbstatus benötigt Sekunden. Produktinhalte kommen mit Minuten aus. Richtlinien kommen mit einer täglichen Aktualisierung aus. Diese Zahlen sind keine Präferenz mehr, sondern werden zu einer Designvorgabe: Sie bestimmen die Architektur und sie bestimmen die Kosten. Der häufige Fehler besteht darin, die Aktualität als eine einzige globale Einstellung zu behandeln, die einheitlich auf alles angewendet wird. Aktualität ist ein Budget. Setzen Sie es dort ein, wo es eine Entscheidung beeinflusst, und zahlen Sie nicht dafür, wo dies nicht der Fall ist.
Für Mitarbeiter mit Kundenkontakt ist der Korpus der Kunde.
Das bedeutet, dass die Identität geräte- und kanalübergreifend aufgelöst wird, sodass alle Kontaktpunkte als eine Person verstanden werden. Es bedeutet, dass die Einwilligung an das Profil selbst gebunden ist, sodass jede nachgelagerte Abfrage konstruktionsbedingt autorisiert ist und nicht durch ein Richtliniendokument, von dem jemand hofft, dass es gelesen wurde.
Es bedeutet auch, auf den nächtlichen Neuaufbau zu verzichten. Change Data Capture – die Praxis, nur die geänderten Daten zu streamen, anstatt alles neu zu laden – bindet ein einzelnes Profil innerhalb von Sekunden neu ein, anstatt Millionen von Profilen neu zu verarbeiten. Die Abfrage erfolgt dann hybrid: eine dichte Vektorsuche nach Bedeutung, eine Stichwortsuche nach den exakten Zeichenfolgen, auf die es ankommt – wie SKUs und Bestellnummern –, wobei beide nach Rang zusammengefügt werden und die Finalisten einem erneuten Ranking unterzogen werden. „Hot“- und „Cold“-Ebenen sorgen für faire Kosten, sodass man für die wenigen Attribute, die tatsächlich eine Entscheidung beeinflussen, Aktualität der zweiten Stufe kauft und für alles andere tägliche Aktualität.
Der stets aktuelle Stack, von links nach rechts gelesen, mit der Messschleife darunter
Die manuelle Anbindung jedes Agenten an jede Datenquelle schafft ein Netz aus Integrationen, von denen jede ihre eigene Authentifizierung, Schemaänderungen und Fehlerquellen mit sich bringt. Diese Komplexität ist der Grund, warum so viele vielversprechende Pilotprojekte Schwierigkeiten haben, zu skalieren.
Das Model Context Protocol (MCP), ein offener Standard für die Verbindung von Agenten mit Tools und Daten, verwandelt diese Nahtstelle in einen Port. Verbinden Sie eine Quelle einmal, und jeder kompatible Agent kann sie erkennen – einschließlich der zugehörigen Schemata und Berechtigungen. Davor befindet sich ein Gateway: Es validiert eingehende Aufrufe, redigiert Daten nach Einwilligung und schreibt den Prüfpfad. Die unscheinbare Hälfte ist das, was Sie in die Produktion bringt.
Nichts davon funktioniert ohne Messung, und eine einzige Zahl reicht dafür nicht aus. Ein Zufriedenheitswert sagt dir, dass etwas nicht stimmt. Drei separate Dashboards sagen dir, was genau.
Die Abfragequalität fragt, ob Sie überhaupt den richtigen Kontext abgerufen haben: Kontextgenauigkeit, Kontext-Recall, Veralterungsverzögerung. Um das zu beantworten, ist kein Modell erforderlich. Die Generierungsqualität fragt, ob das Modell das, was ihm übergeben wurde, originalgetreu verwendet hat: Antwortrelevanz und Zitierabdeckung, bewertet von einem Gutachter, der anhand menschlicher Überprüfung kalibriert wurde. Geschäftsergebnisse zeigen, ob all das überhaupt eine Rolle gespielt hat: Lösungszeit, Eindämmung, Kosten, CSAT. Getrennt betrachtet weist eine sich verschlechternde Kennzahl direkt auf die Ebene hin, an der gearbeitet werden muss – sei es bei den Daten, dem Modell oder dem Workflow.
Drei Dashboards: Ein Rückgang zeigt Ihnen, welche Ebene Sie beheben müssen
Dann in kleinen Schritten bereitstellen. Testen Sie einen abgegrenzten Anwendungsfall mit echtem Datenverkehr, optimieren Sie ihn, bis er die von Ihnen festgelegte SLA einhält, stellen Sie ihn mit aktivierter Eskalation bereit und erweitern Sie erst dann den Umfang. Das „Stall“-Muster ist genau das Gegenteil und derzeit die häufigste Projektform in der Branche: erst das Tool, dann die Daten, Metriken gar nicht.
Modelle verbessern sich für alle am selben Tag. Welchen Vorsprung Ihnen eine Pionierversion in diesem Quartal auch verschafft – Ihr Konkurrent holt ihn im nächsten Quartal zum Listenpreis auf. Was er nicht kaufen kann, sind die Währung, die Governance und die Identität des Kontexts, den Ihre Agenten in dem Moment abrufen, in dem sie antworten.
Das Modell ist das Gehirn. Der Kontext ist das Gedächtnis. Nur eines davon gehört Ihnen. Lesen Sie das vollständige E-Book.
Verwandter Artikel
Wie Unitree die Zukunft der humanoiden Robotik gestaltet
Unitrees neue „Creature“ mit verkörperter KI und ultrabreitem 4D-LiDAR-System für fortschrittliche Navigation in der realen Welt. Bildquelle: UnitreeWang Xingxing, CEO von Unitree, strebt Durchbrüche
Warum Cognition Poke übernommen hat: KI-Persönlichkeit wird zum Wettbewerbsvorteil
Poke, der KI-Assistent, der so chatten soll wie ein Freund, macht seinen nächsten großen Schritt. The Interaction Company of California, das Start-up hinter Poke, wurde vom KI-Entwicklungsunternehmen
Google testet den Remy AI Agent für Gemini, da der Fokus auf die Benutzerkontrolle verlagert wird
Laut Business Insider testet Google Remy, einen neuen KI-Personalagenten für Gemini. Dieses Tool soll Aufgaben im Auftrag von Nutzern ausführen und sowohl professionelle Arbeitsabläufe als auch tägliche Routinen optimieren.Derzeit wird Remy in einer
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)
Freddy Berlanti, Principal Product Manager für angewandte KI bei Tealium, befasst sich mit dem Thema „Retrieval-Augmented Generation“ (RAG). Bild: Getty Images
Freddy Berlanti, Principal Product Manager für Angewandte KI bei Tealium, erläutert den entscheidenden Unterschied zwischen RAG-Systemen, die einen Mehrwert bieten, und solchen, die das Vertrauen der Nutzer stillschweigend untergraben
Die meisten RAG-Systeme (Retrieval-Augmented Generation) in Unternehmen liefern nur eine Momentaufnahme des Kunden: einen am vergangenen Dienstag indizierten Vektorspeicher, eine über Nacht synchronisierte Wissensdatenbank oder ein Profil, das widerspiegelt, wer der Nutzer vor 12 Stunden war. Diese Lücke trennt funktionierende RAG-Systeme von solchen, die das Vertrauen still und leise untergraben.
Es ist Donnerstag, 20:47 Uhr. Ein Kunde legt einen weiteren Artikel in den Warenkorb, wodurch der Gesamtbetrag die Schwelle für kostenlosen Versand überschreitet, öffnet dann den Support-Chat und fragt, ob der Versand inbegriffen ist.
Der Mitarbeiter antwortet innerhalb von Millisekunden. Die Antwort ist flüssig, höflich, fundiert – und falsch –, denn das abgerufene Profil wurde erstellt, bevor sich der Warenkorb geändert hat. Bis die im Batch-Verfahren indizierten Daten nachholen, ist der Moment, für den sie eigentlich bestimmt waren, bereits vorbei.
Zwei unterschiedliche Größen bestimmen diesen Austausch, doch die meisten Produktionssysteme messen nur eine davon. Die Antwortlatenz ist die Zeit zwischen der Frage und der Antwort, und Teams messen sie mit großer Sorgfalt. Das „Alter der Informationen“, eine von Kaul, Yates und Gruteser formalisierte Kennzahl, misst, wie alt eine Information ist, wenn das System darauf reagiert. Einfach ausgedrückt: Wie veraltet war der Kontext, als Sie ihn genutzt haben?

In diesem Beispiel betrug die Antwortlatenz weniger als eine Sekunde, doch die Informationen waren bereits mehrere Stunden alt. Das System war schnell, ohne aktuell zu sein. Und nur einer dieser Werte wurde auf dem Dashboard angezeigt.
Diese Unterscheidung ist wichtig, denn eine schnelle Antwort, die auf veralteten Kundendaten basiert, ist immer noch die falsche Antwort. Bei kundenorientiertem RAG sind Geschwindigkeit und Aktualität zwei unterschiedliche Probleme, und die Optimierung des einen garantiert nicht das andere.
Beide sind voneinander unabhängig und können unter Last in entgegengesetzte Richtungen tendieren. Häufigere Aktualisierungen bedeuten nicht immer aktuellere Informationen. Ab einem bestimmten Punkt stauen sich die Aktualisierungen, wodurch die neueste verfügbare Information älter und nicht neuer wird. Der nächtliche Batch-Lauf ist lediglich der Extremfall: ein System, das auf der Grundlage einer einen Tag alten Sicht auf die Welt arbeitet. Die Lösung besteht nicht darin, mehr Daten nach demselben Zeitplan zu übertragen. Es geht darum, die relevanten Änderungen sofort zu übertragen, sobald sie eintreten – was eine andere Architektur erfordert, nicht nur eine schnellere.
RAG hat sich seinen Platz verdient, indem es das „Closed-Book“-Problem gelöst hat. Anstatt allein aus dem Gedächtnis zu antworten, sucht das System zunächst das relevante Material und antwortet dann auf der Grundlage dessen, was es gefunden hat. Dieses Material ist der Korpus. Wenn der Korpus stimmt, hört das Modell auf zu improvisieren.
Für einen internen Wissensassistenten ist ein Korpus, der über Nacht synchronisiert wird, völlig ausreichend. Ein Kunde mitten in einer Sitzung ist jedoch ein anderes Problem. Der Warenkorb hat gerade eine Schwelle überschritten, und ein Mitarbeiter muss sofort entscheiden, ob er kostenlosen Versand anbietet oder den Kunden in der Warteschleife hält. Ein vor Tagesanbruch erstellter Snapshot ist keine Einschränkung, die später wegoptimiert werden kann; es ist die falsche Architektur, denn bis die im Batch-Verfahren indizierten Daten auf den neuesten Stand gebracht sind, ist die Gelegenheit, für die sie eigentlich gedacht waren, bereits verpasst.
Batch-RAG ruft eine Erinnerung ab; Live-RAG ruft den Kunden ab
Die Fehler sind klein, plausibel und schleichend. Sie lösen selten Warnmeldungen oder Fehlerberichte aus; die Nutzer lernen einfach, dem System nicht zu vertrauen, und nutzen es nicht mehr. Wenn dies schließlich auf einem Dashboard sichtbar wird, sieht es wie ein Akzeptanzproblem ohne offensichtliche Ursache aus.
Die Lösung beginnt noch vor jeder Entscheidung über die Tools. Es handelt sich um eine Service-Level-Vereinbarung, die für jeden Anwendungsfall individuell formuliert wird und drei Fragen beantwortet: Wie aktuell muss der Kontext sein? Wie schnell muss die Antwort eintreffen? Wann sollte das System aufhören und die Konversation an einen Menschen übergeben?
Der Warenkorbstatus benötigt Sekunden. Produktinhalte kommen mit Minuten aus. Richtlinien kommen mit einer täglichen Aktualisierung aus. Diese Zahlen sind keine Präferenz mehr, sondern werden zu einer Designvorgabe: Sie bestimmen die Architektur und sie bestimmen die Kosten. Der häufige Fehler besteht darin, die Aktualität als eine einzige globale Einstellung zu behandeln, die einheitlich auf alles angewendet wird. Aktualität ist ein Budget. Setzen Sie es dort ein, wo es eine Entscheidung beeinflusst, und zahlen Sie nicht dafür, wo dies nicht der Fall ist.
Für Mitarbeiter mit Kundenkontakt ist der Korpus der Kunde.
Das bedeutet, dass die Identität geräte- und kanalübergreifend aufgelöst wird, sodass alle Kontaktpunkte als eine Person verstanden werden. Es bedeutet, dass die Einwilligung an das Profil selbst gebunden ist, sodass jede nachgelagerte Abfrage konstruktionsbedingt autorisiert ist und nicht durch ein Richtliniendokument, von dem jemand hofft, dass es gelesen wurde.
Es bedeutet auch, auf den nächtlichen Neuaufbau zu verzichten. Change Data Capture – die Praxis, nur die geänderten Daten zu streamen, anstatt alles neu zu laden – bindet ein einzelnes Profil innerhalb von Sekunden neu ein, anstatt Millionen von Profilen neu zu verarbeiten. Die Abfrage erfolgt dann hybrid: eine dichte Vektorsuche nach Bedeutung, eine Stichwortsuche nach den exakten Zeichenfolgen, auf die es ankommt – wie SKUs und Bestellnummern –, wobei beide nach Rang zusammengefügt werden und die Finalisten einem erneuten Ranking unterzogen werden. „Hot“- und „Cold“-Ebenen sorgen für faire Kosten, sodass man für die wenigen Attribute, die tatsächlich eine Entscheidung beeinflussen, Aktualität der zweiten Stufe kauft und für alles andere tägliche Aktualität.
Der stets aktuelle Stack, von links nach rechts gelesen, mit der Messschleife darunter
Die manuelle Anbindung jedes Agenten an jede Datenquelle schafft ein Netz aus Integrationen, von denen jede ihre eigene Authentifizierung, Schemaänderungen und Fehlerquellen mit sich bringt. Diese Komplexität ist der Grund, warum so viele vielversprechende Pilotprojekte Schwierigkeiten haben, zu skalieren.
Das Model Context Protocol (MCP), ein offener Standard für die Verbindung von Agenten mit Tools und Daten, verwandelt diese Nahtstelle in einen Port. Verbinden Sie eine Quelle einmal, und jeder kompatible Agent kann sie erkennen – einschließlich der zugehörigen Schemata und Berechtigungen. Davor befindet sich ein Gateway: Es validiert eingehende Aufrufe, redigiert Daten nach Einwilligung und schreibt den Prüfpfad. Die unscheinbare Hälfte ist das, was Sie in die Produktion bringt.
Nichts davon funktioniert ohne Messung, und eine einzige Zahl reicht dafür nicht aus. Ein Zufriedenheitswert sagt dir, dass etwas nicht stimmt. Drei separate Dashboards sagen dir, was genau.
Die Abfragequalität fragt, ob Sie überhaupt den richtigen Kontext abgerufen haben: Kontextgenauigkeit, Kontext-Recall, Veralterungsverzögerung. Um das zu beantworten, ist kein Modell erforderlich. Die Generierungsqualität fragt, ob das Modell das, was ihm übergeben wurde, originalgetreu verwendet hat: Antwortrelevanz und Zitierabdeckung, bewertet von einem Gutachter, der anhand menschlicher Überprüfung kalibriert wurde. Geschäftsergebnisse zeigen, ob all das überhaupt eine Rolle gespielt hat: Lösungszeit, Eindämmung, Kosten, CSAT. Getrennt betrachtet weist eine sich verschlechternde Kennzahl direkt auf die Ebene hin, an der gearbeitet werden muss – sei es bei den Daten, dem Modell oder dem Workflow.
Drei Dashboards: Ein Rückgang zeigt Ihnen, welche Ebene Sie beheben müssen
Dann in kleinen Schritten bereitstellen. Testen Sie einen abgegrenzten Anwendungsfall mit echtem Datenverkehr, optimieren Sie ihn, bis er die von Ihnen festgelegte SLA einhält, stellen Sie ihn mit aktivierter Eskalation bereit und erweitern Sie erst dann den Umfang. Das „Stall“-Muster ist genau das Gegenteil und derzeit die häufigste Projektform in der Branche: erst das Tool, dann die Daten, Metriken gar nicht.
Modelle verbessern sich für alle am selben Tag. Welchen Vorsprung Ihnen eine Pionierversion in diesem Quartal auch verschafft – Ihr Konkurrent holt ihn im nächsten Quartal zum Listenpreis auf. Was er nicht kaufen kann, sind die Währung, die Governance und die Identität des Kontexts, den Ihre Agenten in dem Moment abrufen, in dem sie antworten.
Das Modell ist das Gehirn. Der Kontext ist das Gedächtnis. Nur eines davon gehört Ihnen. Lesen Sie das vollständige E-Book.
Wie Unitree die Zukunft der humanoiden Robotik gestaltet
Unitrees neue „Creature“ mit verkörperter KI und ultrabreitem 4D-LiDAR-System für fortschrittliche Navigation in der realen Welt. Bildquelle: UnitreeWang Xingxing, CEO von Unitree, strebt Durchbrüche
Warum Cognition Poke übernommen hat: KI-Persönlichkeit wird zum Wettbewerbsvorteil
Poke, der KI-Assistent, der so chatten soll wie ein Freund, macht seinen nächsten großen Schritt. The Interaction Company of California, das Start-up hinter Poke, wurde vom KI-Entwicklungsunternehmen





Heim






