Tealium: Почему качество RAG зависит от данных в режиме реального времени
![]()
Фредди Берланти, главный менеджер по продуктам в области прикладного ИИ в компании Tealium, рассказывает о технологии генерации с использованием данных из внешних источников (RAG). Изображение: Getty Images
Фредди Берланти, главный менеджер по продуктам в области прикладного искусственного интеллекта в компании Tealium, анализирует ключевое различие между системами RAG, которые приносят пользу, и теми, которые незаметно подрывают доверие пользователей
Большинство корпоративных систем генерации с поддержкой поиска (RAG) получают лишь моментальный снимок клиента: векторное хранилище, индексированное в прошлый вторник, база знаний, синхронизируемая ночью, или профиль, отражающий то, кем пользователь был 12 часов назад. Именно этот разрыв отделяет работающие системы RAG от тех, которые незаметно подрывают доверие.
Четверг, 20:47. Клиент добавляет в корзину еще один товар, в результате чего общая сумма превышает порог бесплатной доставки, а затем открывает чат службы поддержки и спрашивает, включена ли доставка в стоимость.
Оператор отвечает за миллисекунды. Ответ звучит бегло, вежливо, с точными ссылками — но неверно, — потому что профиль, который система извлекла, был сформирован до того, как содержимое корзины изменилось. К тому моменту, когда данные, индексируемые пакетно, успевают обновиться, момент, для которого они были предназначены, уже прошел.
Этот обмен определяют две разные величины, но большинство производственных систем измеряют только одну. Задержка ответа — это время между вопросом и ответом, и команды измеряют её с маниакальной тщательностью. «Возраст информации» — показатель, формализованный Каулом, Йейтсом и Грутесером, — измеряет, насколько устаревшим является факт к моменту, когда система действует на его основе. Проще говоря: насколько устаревшим был контекст, когда вы его использовали?

В этом примере задержка ответа составила менее секунды, но информация была устаревшей на несколько часов. Система работала быстро, но не оперативно. И на информационной панели отображалось только одно из этих значений.
Это различие имеет значение, потому что быстрый ответ, основанный на устаревших данных о клиенте, по-прежнему остается неправильным ответом. Для RAG, ориентированного на клиента, скорость и актуальность — это две разные проблемы, и оптимизация одной из них не гарантирует другой.
Эти два фактора независимы друг от друга, и при высокой нагрузке они могут развиваться в противоположных направлениях. Более частые обновления не всегда означают более свежую информацию. После определенного момента обновления накапливаются в очереди, в результате чего самая новая доступная информация становится не более новой, а более старой. Ночная пакетная обработка — это просто крайний случай: система, работающая на основе данных, устаревших на сутки. Решение заключается не в том, чтобы переносить больше данных по тому же графику. Оно заключается в том, чтобы переносить важные изменения по мере их появления, что требует не просто более быстрой, а другой архитектуры.
RAG заслужил своё место, решив проблему «закрытой книги». Вместо того чтобы отвечать, опираясь исключительно на память, система сначала ищет соответствующий материал, а затем отвечает на основе найденного. Этот материал и есть корпус. Сделайте корпус правильным, и модель перестанет импровизировать.
Для внутреннего помощника по знаниям вполне подойдет корпус, синхронизируемый ночью. А вот ситуация с клиентом в середине сеанса — это совсем другая проблема. Корзина только что превысила порог, и оператору нужно прямо сейчас решить: предложить бесплатную доставку или удержать клиента на линии. Снимок, сделанный до рассвета, — это не ограничение, которое можно устранить позже; это неправильная архитектура, потому что к тому моменту, когда пакетно проиндексированные данные наверстают отставание, возможность, для которой они были предназначены, уже упущена.
Пакетный RAG извлекает информацию из памяти; RAG в режиме реального времени извлекает информацию о клиенте
Эти сбои незначительны, правдоподобны и разрушительны. Они редко вызывают оповещения или отчеты об ошибках; пользователи просто учатся не доверять системе и перестают ею пользоваться. К тому моменту, когда это отображается на панели инструментов, это выглядит как проблема с принятием системы, не имеющая очевидной причины.
Исправление начинается ещё до принятия каких-либо решений о выборе инструментов. Это соглашение об уровне обслуживания, составленное для каждого конкретного случая использования, которое отвечает на три вопроса: насколько актуальным должен быть контекст? Как быстро должен поступать ответ? Когда система должна остановиться и передать общение человеку?
Для состояния корзины требуются секунды. Содержание продукта допускает задержку в минутах. Политика может обходиться ежедневным обновлением. Эти цифры перестают быть просто предпочтением и становятся ограничением при проектировании: они определяют архитектуру и стоимость. Распространённая ошибка — рассматривать актуальность как единый глобальный параметр, одинаково применяемый ко всему. Актуальность — это бюджет. Тратьте его там, где это влияет на принятие решения, и перестаньте за это платить там, где это не имеет значения.
Для операторов, работающих с клиентами, корпус — это сам клиент.
Это означает, что идентичность определяется на всех устройствах и по всем каналам, поэтому все точки взаимодействия рассматриваются как относящиеся к одному человеку. Это означает, что согласие привязано к самому профилю, поэтому каждый последующий запрос разрешен по конструкции, а не по документу с правилами, который, как кто-то надеется, был прочитан.
Это также означает отказ от ночной перекомпиляции. Захват изменений — практика потоковой передачи только того, что изменилось, вместо перезагрузки всего — позволяет заново встроить один профиль за секунды, вместо повторной обработки миллионов профилей. Поиск затем выполняется гибридным способом: плотный векторный поиск по смыслу, поиск по ключевым словам для точных строк, имеющих значение, таких как SKU и номера заказов, причем эти два метода объединяются по ранжированию с последующим переранжированием финалистов. «Горячие» и «холодные» уровни позволяют сэкономить на расходах: вы покупаете актуальность второго уровня для тех немногих атрибутов, которые действительно влияют на принятие решения, а ежедневную актуальность — для всего остального.
Всегда актуальный стек, читаемый слева направо, с циклом измерения внизу
Ручное подключение каждого агента к каждому источнику данных создает сеть интеграций, каждая из которых имеет собственную аутентификацию, изменения схемы и точки отказа. Именно эта сложность является причиной того, что так много многообещающих пилотных проектов сталкиваются с трудностями при масштабировании.
Протокол Model Context Protocol (MCP) — открытый стандарт для подключения агентов к инструментам и данным — превращает этот шов в порт. Достаточно подключить источник один раз, и любой совместимый агент сможет его обнаружить, включая прилагаемые схемы и разрешения. Перед ним расположена шлюзовая система: она проверяет входящие запросы, редактирует данные с согласия пользователя и ведет журнал аудита. Именно эта неприглядная часть позволяет запустить систему в производственную эксплуатацию.
Ничто из этого не выживет без измерений, и одного числа для этого недостаточно. Один показатель удовлетворённости говорит о том, что что-то не так. Три отдельных информационных панели показывают, что именно.
Качество извлечения показывает, удалось ли вам вообще получить нужный контекст: точность контекста, полнота контекста, задержка обновления. Для ответа на этот вопрос не требуется никакой модели. Качество генерации показывает, точно ли модель использовала то, что ей было предоставлено: релевантность ответа и охват цитирований, оцениваемые экспертом, калиброванным на основе человеческой экспертизы. Бизнес-результаты показывают, имело ли всё это значение: время решения проблемы, сдерживание, затраты, CSAT. Если рассматривать их отдельно, ухудшение показателя прямо указывает на тот уровень, над которым нужно работать — будь то данные, модель или рабочий процесс.
Три информационные панели: ухудшение показателей указывает, какой уровень нужно исправить
Затем запускайте в ограниченном масштабе. Протестируйте один четко очерченный вариант использования на реальном трафике, настройте его до тех пор, пока он не будет соблюдать зафиксированное вами SLA, запустите его с включенной эскалацией, и только потом расширяйте масштаб. Схема «застоя» — это полная противоположность, и именно она в настоящее время является наиболее распространенной моделью проектов в отрасли: сначала инструменты, потом данные, а показатели — никогда.
Модели совершенствуются для всех в один и тот же день. Какое бы преимущество ни давал вам передовой релиз в этом квартале, ваш конкурент приобретёт его в следующем квартале по полной цене. Чего они не могут купить, так это «валюту», систему управления и идентичность контекста, который ваши агенты получают в момент ответа.
Модель — это мозг. Контекст — это память. Только одно из них принадлежит вам. Ознакомьтесь с полной версией электронной книги.
Связанная статья
Как компания Unitree формирует будущее гуманоидной робототехники
Новое устройство Unitree с встроенным ИИ и технологией сверхширокоугольного 4D-ЛиДАР для усовершенствованной навигации в реальных условиях. Источник: UnitreeВан Синсин, генеральный директор Unitree, с
Почему Cognition приобрела Poke: личность ИИ становится конкурентным преимуществом
Poke — ИИ-помощник, разработанный для общения как с другом, — делает следующий важный шаг. Калифорнийская компания The Interaction Company, стоящая за проектом Poke, была приобретена компанией Cogniti
Google тестирует агента Remy AI для Gemini по мере смещения фокуса на управление пользователями
Согласно Business Insider, Google тестирует Remy, нового ИИ-персонального агента для Gemini. Этот инструмент предназначен для выполнения задач от имени пользователей, упрощая как профессиональные рабочие процессы, так и повседневные рутины.В настоящ
Рекомендации по связанным специальным темам
Комментарии (0)
Фредди Берланти, главный менеджер по продуктам в области прикладного ИИ в компании Tealium, рассказывает о технологии генерации с использованием данных из внешних источников (RAG). Изображение: Getty Images
Фредди Берланти, главный менеджер по продуктам в области прикладного искусственного интеллекта в компании Tealium, анализирует ключевое различие между системами RAG, которые приносят пользу, и теми, которые незаметно подрывают доверие пользователей
Большинство корпоративных систем генерации с поддержкой поиска (RAG) получают лишь моментальный снимок клиента: векторное хранилище, индексированное в прошлый вторник, база знаний, синхронизируемая ночью, или профиль, отражающий то, кем пользователь был 12 часов назад. Именно этот разрыв отделяет работающие системы RAG от тех, которые незаметно подрывают доверие.
Четверг, 20:47. Клиент добавляет в корзину еще один товар, в результате чего общая сумма превышает порог бесплатной доставки, а затем открывает чат службы поддержки и спрашивает, включена ли доставка в стоимость.
Оператор отвечает за миллисекунды. Ответ звучит бегло, вежливо, с точными ссылками — но неверно, — потому что профиль, который система извлекла, был сформирован до того, как содержимое корзины изменилось. К тому моменту, когда данные, индексируемые пакетно, успевают обновиться, момент, для которого они были предназначены, уже прошел.
Этот обмен определяют две разные величины, но большинство производственных систем измеряют только одну. Задержка ответа — это время между вопросом и ответом, и команды измеряют её с маниакальной тщательностью. «Возраст информации» — показатель, формализованный Каулом, Йейтсом и Грутесером, — измеряет, насколько устаревшим является факт к моменту, когда система действует на его основе. Проще говоря: насколько устаревшим был контекст, когда вы его использовали?

В этом примере задержка ответа составила менее секунды, но информация была устаревшей на несколько часов. Система работала быстро, но не оперативно. И на информационной панели отображалось только одно из этих значений.
Это различие имеет значение, потому что быстрый ответ, основанный на устаревших данных о клиенте, по-прежнему остается неправильным ответом. Для RAG, ориентированного на клиента, скорость и актуальность — это две разные проблемы, и оптимизация одной из них не гарантирует другой.
Эти два фактора независимы друг от друга, и при высокой нагрузке они могут развиваться в противоположных направлениях. Более частые обновления не всегда означают более свежую информацию. После определенного момента обновления накапливаются в очереди, в результате чего самая новая доступная информация становится не более новой, а более старой. Ночная пакетная обработка — это просто крайний случай: система, работающая на основе данных, устаревших на сутки. Решение заключается не в том, чтобы переносить больше данных по тому же графику. Оно заключается в том, чтобы переносить важные изменения по мере их появления, что требует не просто более быстрой, а другой архитектуры.
RAG заслужил своё место, решив проблему «закрытой книги». Вместо того чтобы отвечать, опираясь исключительно на память, система сначала ищет соответствующий материал, а затем отвечает на основе найденного. Этот материал и есть корпус. Сделайте корпус правильным, и модель перестанет импровизировать.
Для внутреннего помощника по знаниям вполне подойдет корпус, синхронизируемый ночью. А вот ситуация с клиентом в середине сеанса — это совсем другая проблема. Корзина только что превысила порог, и оператору нужно прямо сейчас решить: предложить бесплатную доставку или удержать клиента на линии. Снимок, сделанный до рассвета, — это не ограничение, которое можно устранить позже; это неправильная архитектура, потому что к тому моменту, когда пакетно проиндексированные данные наверстают отставание, возможность, для которой они были предназначены, уже упущена.
Пакетный RAG извлекает информацию из памяти; RAG в режиме реального времени извлекает информацию о клиенте
Эти сбои незначительны, правдоподобны и разрушительны. Они редко вызывают оповещения или отчеты об ошибках; пользователи просто учатся не доверять системе и перестают ею пользоваться. К тому моменту, когда это отображается на панели инструментов, это выглядит как проблема с принятием системы, не имеющая очевидной причины.
Исправление начинается ещё до принятия каких-либо решений о выборе инструментов. Это соглашение об уровне обслуживания, составленное для каждого конкретного случая использования, которое отвечает на три вопроса: насколько актуальным должен быть контекст? Как быстро должен поступать ответ? Когда система должна остановиться и передать общение человеку?
Для состояния корзины требуются секунды. Содержание продукта допускает задержку в минутах. Политика может обходиться ежедневным обновлением. Эти цифры перестают быть просто предпочтением и становятся ограничением при проектировании: они определяют архитектуру и стоимость. Распространённая ошибка — рассматривать актуальность как единый глобальный параметр, одинаково применяемый ко всему. Актуальность — это бюджет. Тратьте его там, где это влияет на принятие решения, и перестаньте за это платить там, где это не имеет значения.
Для операторов, работающих с клиентами, корпус — это сам клиент.
Это означает, что идентичность определяется на всех устройствах и по всем каналам, поэтому все точки взаимодействия рассматриваются как относящиеся к одному человеку. Это означает, что согласие привязано к самому профилю, поэтому каждый последующий запрос разрешен по конструкции, а не по документу с правилами, который, как кто-то надеется, был прочитан.
Это также означает отказ от ночной перекомпиляции. Захват изменений — практика потоковой передачи только того, что изменилось, вместо перезагрузки всего — позволяет заново встроить один профиль за секунды, вместо повторной обработки миллионов профилей. Поиск затем выполняется гибридным способом: плотный векторный поиск по смыслу, поиск по ключевым словам для точных строк, имеющих значение, таких как SKU и номера заказов, причем эти два метода объединяются по ранжированию с последующим переранжированием финалистов. «Горячие» и «холодные» уровни позволяют сэкономить на расходах: вы покупаете актуальность второго уровня для тех немногих атрибутов, которые действительно влияют на принятие решения, а ежедневную актуальность — для всего остального.
Всегда актуальный стек, читаемый слева направо, с циклом измерения внизу
Ручное подключение каждого агента к каждому источнику данных создает сеть интеграций, каждая из которых имеет собственную аутентификацию, изменения схемы и точки отказа. Именно эта сложность является причиной того, что так много многообещающих пилотных проектов сталкиваются с трудностями при масштабировании.
Протокол Model Context Protocol (MCP) — открытый стандарт для подключения агентов к инструментам и данным — превращает этот шов в порт. Достаточно подключить источник один раз, и любой совместимый агент сможет его обнаружить, включая прилагаемые схемы и разрешения. Перед ним расположена шлюзовая система: она проверяет входящие запросы, редактирует данные с согласия пользователя и ведет журнал аудита. Именно эта неприглядная часть позволяет запустить систему в производственную эксплуатацию.
Ничто из этого не выживет без измерений, и одного числа для этого недостаточно. Один показатель удовлетворённости говорит о том, что что-то не так. Три отдельных информационных панели показывают, что именно.
Качество извлечения показывает, удалось ли вам вообще получить нужный контекст: точность контекста, полнота контекста, задержка обновления. Для ответа на этот вопрос не требуется никакой модели. Качество генерации показывает, точно ли модель использовала то, что ей было предоставлено: релевантность ответа и охват цитирований, оцениваемые экспертом, калиброванным на основе человеческой экспертизы. Бизнес-результаты показывают, имело ли всё это значение: время решения проблемы, сдерживание, затраты, CSAT. Если рассматривать их отдельно, ухудшение показателя прямо указывает на тот уровень, над которым нужно работать — будь то данные, модель или рабочий процесс.
Три информационные панели: ухудшение показателей указывает, какой уровень нужно исправить
Затем запускайте в ограниченном масштабе. Протестируйте один четко очерченный вариант использования на реальном трафике, настройте его до тех пор, пока он не будет соблюдать зафиксированное вами SLA, запустите его с включенной эскалацией, и только потом расширяйте масштаб. Схема «застоя» — это полная противоположность, и именно она в настоящее время является наиболее распространенной моделью проектов в отрасли: сначала инструменты, потом данные, а показатели — никогда.
Модели совершенствуются для всех в один и тот же день. Какое бы преимущество ни давал вам передовой релиз в этом квартале, ваш конкурент приобретёт его в следующем квартале по полной цене. Чего они не могут купить, так это «валюту», систему управления и идентичность контекста, который ваши агенты получают в момент ответа.
Модель — это мозг. Контекст — это память. Только одно из них принадлежит вам. Ознакомьтесь с полной версией электронной книги.
Как компания Unitree формирует будущее гуманоидной робототехники
Новое устройство Unitree с встроенным ИИ и технологией сверхширокоугольного 4D-ЛиДАР для усовершенствованной навигации в реальных условиях. Источник: UnitreeВан Синсин, генеральный директор Unitree, с
Почему Cognition приобрела Poke: личность ИИ становится конкурентным преимуществом
Poke — ИИ-помощник, разработанный для общения как с другом, — делает следующий важный шаг. Калифорнийская компания The Interaction Company, стоящая за проектом Poke, была приобретена компанией Cogniti





Дом






