Tealium: Por qué la calidad de RAG depende de los datos en tiempo real
![]()
Freddy Berlanti, director de producto de IA aplicada en Tealium, analiza la generación aumentada por recuperación (RAG). Imagen: Getty Images
Freddy Berlanti, director de producto de IA aplicada en Tealium, analiza la diferencia fundamental entre los sistemas RAG que aportan valor y aquellos que socavan silenciosamente la confianza de los usuarios
La mayoría de los sistemas empresariales de generación aumentada por recuperación (RAG) solo recuperan una instantánea del cliente: un almacén vectorial indexado el martes pasado, una base de conocimientos que se sincroniza durante la noche o un perfil que refleja quién era el usuario hace 12 horas. Esa brecha separa a los sistemas RAG que funcionan de aquellos que erosionan silenciosamente la confianza.
Son las 20:47 de un jueves. Un cliente añade otro artículo al carrito, con lo que el total supera el umbral de envío gratuito, y a continuación abre el chat de atención al cliente y pregunta si el envío está incluido.
El agente responde en milisegundos. Su respuesta es fluida, educada, bien documentada… y errónea, porque el perfil que ha recuperado se creó antes de que cambiara el contenido del carrito. Para cuando los datos indexados por lotes se actualizan, el momento en el que debían servir de información ya ha pasado.
Hay dos magnitudes distintas que rigen ese intercambio, pero la mayoría de los sistemas de producción solo miden una. La latencia de respuesta es el tiempo que transcurre entre la pregunta y la respuesta, y los equipos la miden obsesivamente. La antigüedad de la información, una métrica formalizada por Kaul, Yates y Gruteser, mide cuánto tiempo ha pasado desde que se produjo un hecho hasta que el sistema actúa en función de él. En pocas palabras: ¿hasta qué punto estaba desactualizado el contexto cuando lo utilizaste?

En este ejemplo, la latencia de respuesta fue inferior a un segundo, pero la información tenía varias horas de antigüedad. El sistema fue rápido, pero no estaba actualizado. Y solo una de esas cifras aparecía en el panel de control.
Esa distinción es importante porque una respuesta rápida basada en datos de clientes obsoletos sigue siendo una respuesta errónea. Para el RAG orientado al cliente, la velocidad y la actualidad son dos problemas distintos, y optimizar uno no garantiza el otro.
Ambos aspectos son independientes y, bajo carga, pueden evolucionar en direcciones opuestas. Unas actualizaciones más frecuentes no siempre significan información más reciente. A partir de cierto punto, las actualizaciones se acumulan en cola, lo que hace que el dato más reciente disponible sea más antiguo, no más reciente. El procesamiento por lotes nocturno es simplemente el caso extremo: un sistema que opera con una visión del mundo de hace un día. La solución no consiste en mover más datos siguiendo el mismo calendario. Consiste en trasladar los cambios que importan a medida que se producen, lo que requiere una arquitectura diferente, no solo una más rápida.
RAG se ha ganado su lugar al resolver el problema del «libro cerrado». En lugar de responder basándose únicamente en la memoria, el sistema consulta primero el material relevante y, a continuación, responde a partir de lo que ha encontrado. Ese material es el corpus. Si el corpus es el adecuado, el modelo deja de improvisar.
Para un asistente de conocimiento interno, un corpus que se sincroniza durante la noche está bien. Un cliente en plena sesión es un problema diferente. El carrito acaba de superar un umbral y un agente tiene que decidir en ese mismo instante si ofrece envío gratuito o mantiene la línea. Una instantánea tomada antes del amanecer no es una limitación que se pueda solucionar más tarde; es una arquitectura errónea, porque para cuando los datos indexados por lotes se pongan al día, la oportunidad a la que debían dar respuesta ya habrá pasado.
El RAG por lotes recupera un recuerdo; el RAG en tiempo real recupera al cliente
Los fallos son pequeños, plausibles y corrosivos. Rara vez desencadenan alertas o informes de errores; los usuarios simplemente aprenden a no confiar en el sistema y dejan de utilizarlo. Para cuando eso aparece en un panel de control, parece un problema de adopción sin causa aparente.
La solución comienza antes de cualquier decisión sobre las herramientas. Se trata de un acuerdo de nivel de servicio, redactado para cada caso de uso, que responde a tres preguntas: ¿Qué grado de actualidad debe tener el contexto? ¿Con qué rapidez debe llegar la respuesta? ¿Cuándo debe el sistema detenerse y pasar la conversación a una persona?
El estado del carrito requiere segundos. El contenido del producto tolera minutos. Las políticas pueden conformarse con actualizaciones diarias. Esas cifras dejan de ser una preferencia y se convierten en una restricción de diseño: determinan la arquitectura y determinan el coste. El error habitual es tratar la actualidad como un único parámetro global que se aplica de manera uniforme a todo. La actualidad es un presupuesto. Gástalo donde influya en una decisión y deja de pagarlo donde no lo haga.
Para los agentes que tratan directamente con los clientes, el corpus es el cliente.
Eso significa que la identidad se resuelve en todos los dispositivos y canales, de modo que todos los puntos de contacto se interpretan como una sola persona. Significa que el consentimiento está vinculado al propio perfil, de modo que cada consulta posterior está autorizada por diseño, en lugar de depender de un documento de política que alguien espera que se haya leído.
También implica renunciar a la reconstrucción nocturna. La captura de datos de cambio —la práctica de transmitir solo lo que ha cambiado en lugar de recargar todo— vuelve a integrar un único perfil en segundos, en lugar de volver a procesar millones de ellos. La recuperación se lleva a cabo entonces de forma híbrida: búsqueda vectorial densa para el significado, búsqueda por palabras clave para las cadenas exactas que importan, como los SKU y los números de pedido, ambas fusionadas por rango, con una pasada de reordenación sobre los resultados finales. Los niveles «calientes» y «fríos» mantienen los costes bajo control, de modo que se adquiere actualidad de segundo nivel para el puñado de atributos que realmente influyen en una decisión y actualidad diaria para todo lo demás.
La pila siempre actualizada, leída de izquierda a derecha, con el bucle de medición en la parte inferior
Conectar manualmente cada agente con cada fuente de datos crea una red de integraciones, cada una con su propia autenticación, cambios de esquema y puntos de fallo. Esa complejidad es la razón por la que tantos proyectos piloto prometedores tienen dificultades para escalar.
El Protocolo de Contexto de Modelos (MCP), un estándar abierto para conectar agentes con herramientas y datos, convierte esa costura en un puerto. Conecta una fuente una sola vez y cualquier agente compatible podrá detectarla, con los esquemas y permisos adjuntos. Delante de ella se sitúa una pasarela: valida las llamadas entrantes, oculta información con consentimiento y registra el rastro de auditoría. La parte menos glamurosa es la que te permite llegar a la producción.
Nada de esto funciona sin mediciones, y una sola cifra no basta. Una puntuación de satisfacción te indica que algo va mal. Tres paneles de control independientes te dicen qué es.
La calidad de la recuperación pregunta si se ha obtenido el contexto correcto: precisión del contexto, recuperación del contexto, retraso por obsolescencia. No se necesita ningún modelo para responder a eso. La calidad de la generación pregunta si el modelo utilizó fielmente lo que se le proporcionó: relevancia de la respuesta y cobertura de las citas, puntuadas por un evaluador calibrado según la revisión humana. Los resultados empresariales indican si todo ello ha tenido importancia: tiempo de resolución, contención, coste, satisfacción del cliente (CSAT). Si se analizan por separado, una métrica que empeora señala directamente la capa que requiere atención, ya sean los datos, el modelo o el flujo de trabajo.
Tres paneles de control: un descenso te indica qué capa debes corregir
A continuación, lánzalo de forma limitada. Realiza una prueba de un caso de uso delimitado con tráfico real, ajústalo hasta que cumpla el SLA que has establecido, ponlo en producción con la escalación activada y, solo entonces, amplía el alcance. El patrón de estancamiento es exactamente lo contrario, y es la forma más común de proyecto en el sector en este momento: primero la herramienta, luego los datos y las métricas, nunca.
Los modelos mejoran para todos el mismo día. Cualquiera que sea la ventaja que te proporcione un lanzamiento pionero este trimestre, tu competidor la obtendrá el próximo trimestre a precio de catálogo. Lo que no pueden comprar es la moneda, la gobernanza y la identidad del contexto que tus agentes recuperan en el momento en que responden.
El modelo es el cerebro. El contexto es la memoria. Solo uno de ellos es tuyo. Echa un vistazo al libro electrónico completo.
Artículo relacionado
Cómo Unitree está dando forma al futuro de la robótica humanoide
La nueva criatura de IA incorporada de Unitree, con tecnología LiDAR 4D de campo de visión ultraamplio para una navegación avanzada en el mundo real. Crédito: UnitreeWang Xingxing, director ejecutivo
Por qué Cognition compró Poke: la personalidad de la IA se está convirtiendo en una ventaja competitiva
Poke, el asistente de IA diseñado para chatear como un amigo, da su siguiente gran paso. The Interaction Company of California, la startup creadora de Poke, ha sido adquirida por la empresa de program
Google prueba el agente Remy AI para Gemini a medida que el enfoque se desplaza hacia el control del usuario
Según Business Insider, Google está probando Remy, un nuevo agente personal de IA para Gemini. Esta herramienta tiene como objetivo ejecutar tareas en nombre de los usuarios, optimizando tanto los flujos de trabajo profesionales como las rutinas diar
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
Freddy Berlanti, director de producto de IA aplicada en Tealium, analiza la generación aumentada por recuperación (RAG). Imagen: Getty Images
Freddy Berlanti, director de producto de IA aplicada en Tealium, analiza la diferencia fundamental entre los sistemas RAG que aportan valor y aquellos que socavan silenciosamente la confianza de los usuarios
La mayoría de los sistemas empresariales de generación aumentada por recuperación (RAG) solo recuperan una instantánea del cliente: un almacén vectorial indexado el martes pasado, una base de conocimientos que se sincroniza durante la noche o un perfil que refleja quién era el usuario hace 12 horas. Esa brecha separa a los sistemas RAG que funcionan de aquellos que erosionan silenciosamente la confianza.
Son las 20:47 de un jueves. Un cliente añade otro artículo al carrito, con lo que el total supera el umbral de envío gratuito, y a continuación abre el chat de atención al cliente y pregunta si el envío está incluido.
El agente responde en milisegundos. Su respuesta es fluida, educada, bien documentada… y errónea, porque el perfil que ha recuperado se creó antes de que cambiara el contenido del carrito. Para cuando los datos indexados por lotes se actualizan, el momento en el que debían servir de información ya ha pasado.
Hay dos magnitudes distintas que rigen ese intercambio, pero la mayoría de los sistemas de producción solo miden una. La latencia de respuesta es el tiempo que transcurre entre la pregunta y la respuesta, y los equipos la miden obsesivamente. La antigüedad de la información, una métrica formalizada por Kaul, Yates y Gruteser, mide cuánto tiempo ha pasado desde que se produjo un hecho hasta que el sistema actúa en función de él. En pocas palabras: ¿hasta qué punto estaba desactualizado el contexto cuando lo utilizaste?

En este ejemplo, la latencia de respuesta fue inferior a un segundo, pero la información tenía varias horas de antigüedad. El sistema fue rápido, pero no estaba actualizado. Y solo una de esas cifras aparecía en el panel de control.
Esa distinción es importante porque una respuesta rápida basada en datos de clientes obsoletos sigue siendo una respuesta errónea. Para el RAG orientado al cliente, la velocidad y la actualidad son dos problemas distintos, y optimizar uno no garantiza el otro.
Ambos aspectos son independientes y, bajo carga, pueden evolucionar en direcciones opuestas. Unas actualizaciones más frecuentes no siempre significan información más reciente. A partir de cierto punto, las actualizaciones se acumulan en cola, lo que hace que el dato más reciente disponible sea más antiguo, no más reciente. El procesamiento por lotes nocturno es simplemente el caso extremo: un sistema que opera con una visión del mundo de hace un día. La solución no consiste en mover más datos siguiendo el mismo calendario. Consiste en trasladar los cambios que importan a medida que se producen, lo que requiere una arquitectura diferente, no solo una más rápida.
RAG se ha ganado su lugar al resolver el problema del «libro cerrado». En lugar de responder basándose únicamente en la memoria, el sistema consulta primero el material relevante y, a continuación, responde a partir de lo que ha encontrado. Ese material es el corpus. Si el corpus es el adecuado, el modelo deja de improvisar.
Para un asistente de conocimiento interno, un corpus que se sincroniza durante la noche está bien. Un cliente en plena sesión es un problema diferente. El carrito acaba de superar un umbral y un agente tiene que decidir en ese mismo instante si ofrece envío gratuito o mantiene la línea. Una instantánea tomada antes del amanecer no es una limitación que se pueda solucionar más tarde; es una arquitectura errónea, porque para cuando los datos indexados por lotes se pongan al día, la oportunidad a la que debían dar respuesta ya habrá pasado.
El RAG por lotes recupera un recuerdo; el RAG en tiempo real recupera al cliente
Los fallos son pequeños, plausibles y corrosivos. Rara vez desencadenan alertas o informes de errores; los usuarios simplemente aprenden a no confiar en el sistema y dejan de utilizarlo. Para cuando eso aparece en un panel de control, parece un problema de adopción sin causa aparente.
La solución comienza antes de cualquier decisión sobre las herramientas. Se trata de un acuerdo de nivel de servicio, redactado para cada caso de uso, que responde a tres preguntas: ¿Qué grado de actualidad debe tener el contexto? ¿Con qué rapidez debe llegar la respuesta? ¿Cuándo debe el sistema detenerse y pasar la conversación a una persona?
El estado del carrito requiere segundos. El contenido del producto tolera minutos. Las políticas pueden conformarse con actualizaciones diarias. Esas cifras dejan de ser una preferencia y se convierten en una restricción de diseño: determinan la arquitectura y determinan el coste. El error habitual es tratar la actualidad como un único parámetro global que se aplica de manera uniforme a todo. La actualidad es un presupuesto. Gástalo donde influya en una decisión y deja de pagarlo donde no lo haga.
Para los agentes que tratan directamente con los clientes, el corpus es el cliente.
Eso significa que la identidad se resuelve en todos los dispositivos y canales, de modo que todos los puntos de contacto se interpretan como una sola persona. Significa que el consentimiento está vinculado al propio perfil, de modo que cada consulta posterior está autorizada por diseño, en lugar de depender de un documento de política que alguien espera que se haya leído.
También implica renunciar a la reconstrucción nocturna. La captura de datos de cambio —la práctica de transmitir solo lo que ha cambiado en lugar de recargar todo— vuelve a integrar un único perfil en segundos, en lugar de volver a procesar millones de ellos. La recuperación se lleva a cabo entonces de forma híbrida: búsqueda vectorial densa para el significado, búsqueda por palabras clave para las cadenas exactas que importan, como los SKU y los números de pedido, ambas fusionadas por rango, con una pasada de reordenación sobre los resultados finales. Los niveles «calientes» y «fríos» mantienen los costes bajo control, de modo que se adquiere actualidad de segundo nivel para el puñado de atributos que realmente influyen en una decisión y actualidad diaria para todo lo demás.
La pila siempre actualizada, leída de izquierda a derecha, con el bucle de medición en la parte inferior
Conectar manualmente cada agente con cada fuente de datos crea una red de integraciones, cada una con su propia autenticación, cambios de esquema y puntos de fallo. Esa complejidad es la razón por la que tantos proyectos piloto prometedores tienen dificultades para escalar.
El Protocolo de Contexto de Modelos (MCP), un estándar abierto para conectar agentes con herramientas y datos, convierte esa costura en un puerto. Conecta una fuente una sola vez y cualquier agente compatible podrá detectarla, con los esquemas y permisos adjuntos. Delante de ella se sitúa una pasarela: valida las llamadas entrantes, oculta información con consentimiento y registra el rastro de auditoría. La parte menos glamurosa es la que te permite llegar a la producción.
Nada de esto funciona sin mediciones, y una sola cifra no basta. Una puntuación de satisfacción te indica que algo va mal. Tres paneles de control independientes te dicen qué es.
La calidad de la recuperación pregunta si se ha obtenido el contexto correcto: precisión del contexto, recuperación del contexto, retraso por obsolescencia. No se necesita ningún modelo para responder a eso. La calidad de la generación pregunta si el modelo utilizó fielmente lo que se le proporcionó: relevancia de la respuesta y cobertura de las citas, puntuadas por un evaluador calibrado según la revisión humana. Los resultados empresariales indican si todo ello ha tenido importancia: tiempo de resolución, contención, coste, satisfacción del cliente (CSAT). Si se analizan por separado, una métrica que empeora señala directamente la capa que requiere atención, ya sean los datos, el modelo o el flujo de trabajo.
Tres paneles de control: un descenso te indica qué capa debes corregir
A continuación, lánzalo de forma limitada. Realiza una prueba de un caso de uso delimitado con tráfico real, ajústalo hasta que cumpla el SLA que has establecido, ponlo en producción con la escalación activada y, solo entonces, amplía el alcance. El patrón de estancamiento es exactamente lo contrario, y es la forma más común de proyecto en el sector en este momento: primero la herramienta, luego los datos y las métricas, nunca.
Los modelos mejoran para todos el mismo día. Cualquiera que sea la ventaja que te proporcione un lanzamiento pionero este trimestre, tu competidor la obtendrá el próximo trimestre a precio de catálogo. Lo que no pueden comprar es la moneda, la gobernanza y la identidad del contexto que tus agentes recuperan en el momento en que responden.
El modelo es el cerebro. El contexto es la memoria. Solo uno de ellos es tuyo. Echa un vistazo al libro electrónico completo.
Cómo Unitree está dando forma al futuro de la robótica humanoide
La nueva criatura de IA incorporada de Unitree, con tecnología LiDAR 4D de campo de visión ultraamplio para una navegación avanzada en el mundo real. Crédito: UnitreeWang Xingxing, director ejecutivo
Por qué Cognition compró Poke: la personalidad de la IA se está convirtiendo en una ventaja competitiva
Poke, el asistente de IA diseñado para chatear como un amigo, da su siguiente gran paso. The Interaction Company of California, la startup creadora de Poke, ha sido adquirida por la empresa de program





Hogar






