Tealium:RAGの品質がリアルタイムデータに左右される理由
![]()
Tealiumの応用AI部門プリンシパル・プロダクト・マネージャー、フレディ・ベルランティ氏が、検索強化生成(RAG)について解説する。画像:Getty Images
Tealiumの応用AI担当プリンシパル・プロダクト・マネージャー、フレディ・ベルランティ氏が、価値を提供するRAGシステムと、知らぬ間にユーザーの信頼を損なうRAGシステムとの決定的な違いを解説する
多くの企業向け検索強化生成(RAG)システムは、顧客に関する「スナップショット」しか取得していません。例えば、先週火曜日にインデックス化されたベクトルストア、夜間に同期されるナレッジベース、あるいは12時間前のユーザーの状態を反映したプロフィールなどです。このギャップこそが、機能するRAGシステムと、知らぬ間に信頼を蝕んでいくシステムとを分けるのです。
木曜日の午後8時47分。ある顧客がカートに別の商品を追加し、合計金額が送料無料の基準額を超えたところで、サポートチャットを開き、「送料は含まれていますか」と尋ねた。
エージェントは数ミリ秒以内に回答します。その回答は流暢で、礼儀正しく、適切な引用も含まれていますが――間違っています。なぜなら、取得されたプロファイルは、カートの内容が変更される前に作成されたものだからです。バッチ処理されたデータが追いつく頃には、その情報を伝えるべき瞬間はすでに過ぎ去ってしまっています。
このやり取りには2つの異なる指標が関わっていますが、ほとんどの運用システムではそのうちの1つしか測定されていません。応答遅延とは、質問から回答までの時間を指し、チームはこれを執拗に測定しています。一方、「情報の鮮度(Age of information)」は、Kaul、Yates、Gruteserによって定式化された指標であり、システムがそれに基づいて動作した時点で、その情報がどれほど古いものだったかを測定するものです。 簡単に言えば、「その情報を活用した時点で、そのコンテキストはどれほど古くなっていたか」ということです。

この例では、応答レイテンシは1秒未満でしたが、情報は数時間前のものだったのです。システムは高速でしたが、最新ではありませんでした。そして、ダッシュボードに表示されていたのは、その数値のうちの1つだけでした。
この区別が重要なのは、古くなった顧客データに基づいた迅速な回答であっても、それは依然として誤った回答だからです。顧客向けのRAGにおいて、速度と情報の鮮度は別々の問題であり、一方を最適化しても他方が保証されるわけではありません。
この2つは独立しており、負荷がかかると相反する方向に進む可能性があります。更新頻度が高いからといって、必ずしも情報が新鮮になるわけではありません。ある一定点を超えると、更新が蓄積され、利用可能な最新情報が「新しい」ものではなく「古い」ものになってしまいます。毎晩のバッチ処理は、単にその極端な例に過ぎません。つまり、1日前の世界の状況に基づいて動作するシステムなのです。 解決策は、同じスケジュールでより多くのデータを移動させることではありません。重要な変更が発生したその場で反映させることであり、そのためには単に高速なアーキテクチャではなく、異なるアーキテクチャが必要となります。
RAGは、「クローズドブック問題」を解決したことでその地位を確立しました。システムは記憶のみに基づいて回答するのではなく、まず関連資料を検索し、見つけた情報に基づいて回答します。その資料こそがコーパスです。コーパスを適切に構築すれば、モデルは即興的な対応をしなくなります。
社内向けナレッジアシスタントであれば、夜間に同期されるコーパスで十分です。しかし、セッション中の顧客対応は別の問題です。ショッピングカートの金額が閾値を超えたばかりであり、エージェントは今すぐ、送料無料を提案するか、それとも保留にするかを判断しなければなりません。 夜明け前に取得されたスナップショットは、後で調整して解消できる制限ではありません。それは間違ったアーキテクチャなのです。なぜなら、バッチ処理されたインデックスデータが追いつく頃には、そのデータが判断材料となるはずだった機会はすでに過ぎ去っているからです。
バッチ型RAGは「記憶」を呼び出すが、ライブ型RAGは「顧客」を呼び出す
こうした不具合は、些細で、もっともらしいものであり、かつ徐々にシステムを蝕んでいきます。アラートやバグ報告を引き起こすことはめったにありません。ユーザーは単に、そのシステムを信用しないことを学び、使用をやめてしまうのです。それがダッシュボードに表示される頃には、明らかな原因のない「導入率の問題」のように見えてしまいます。
解決策は、ツール選定の前に始まります。それはユースケースごとに策定されるサービスレベル契約(SLA)であり、次の3つの問いに答えるものです。「コンテキストはどれほど最新でなければならないか?」「回答はどれほど速く届く必要があるか?」「システムはいつ停止し、会話を人間に引き継ぐべきか?」
カート内の状態には数秒が必要です。製品コンテンツなら数分でも許容されます。ポリシーに関しては、1日単位でも問題ありません。これらの数値は単なる好みではなく、設計上の制約となります。それらがアーキテクチャを決定し、コストを決定するのです。よくある間違いは、情報の鮮度を、すべてに均一に適用される単一のグローバル設定として扱ってしまうことです。 鮮度は予算のようなものです。意思決定に影響を与える場所では予算を使い、そうでない場所では支出を控えるべきです。
顧客対応担当者の場合、その「コーパス」とは顧客そのものです。
つまり、デバイスやチャネルをまたいで身元が特定されるため、すべてのタッチポイントが1人の人物として認識されます。また、同意がプロファイル自体に紐付けられているため、下流でのすべての照会は、誰かが「読んでくれただろう」と期待するポリシー文書ではなく、構造上当然の権限として許可されます。
また、毎晩の再構築を廃止することも意味します。変更データキャプチャ(変更された部分のみをストリーミングし、すべてを再読み込みしない手法)により、何百万ものプロファイルを再処理する代わりに、単一のプロファイルを数秒で再埋め込みできます。 検索はハイブリッド方式で実行されます。意味を抽出するための高密度ベクトル検索と、SKUや注文番号など重要な正確な文字列を検索するためのキーワード検索を行い、これらをランク順に融合させ、最終候補に対して再ランク付けの処理を行います。 ホット層とコールド層の区分により、コストを適正に抑えることができます。つまり、意思決定に実際に影響を与えるごく少数の属性については「セカンドレベルの最新性」を、それ以外のすべてについては「毎日の更新頻度」を購入する形になります。
常に最新の状態が保たれたスタック(左から右へ読み進める)と、その下にある測定ループ
すべてのエージェントをすべてのデータソースに手作業で接続すると、統合の網が形成され、それぞれに独自の認証、スキーマの変更、障害点が存在することになります。この複雑さこそが、多くの有望なパイロットプロジェクトがスケールアップに苦戦する理由です。
エージェントをツールやデータに接続するためのオープンスタンダードである「モデルコンテキストプロトコル(MCP)」は、その継ぎ目をポートに変えます。 データソースを一度接続すれば、準拠したエージェントなら誰でも、スキーマや権限情報付きでそれを検出できます。その前にはゲートウェイが配置され、着信コールの検証、同意に基づく情報のマスキング、監査証跡の記録を行います。華やかさのないこの部分が、本番環境への移行を可能にするのです。
測定なしではこれらはいずれも成り立たず、単一の数値だけでは不十分です。満足度スコアが1つあれば、何かが間違っていることは分かります。3つの別々のダッシュボードがあれば、何が問題なのかが分かります。
検索品質は、そもそも正しいコンテキストを取得できたかどうかを問うものです。コンテキストの精度、コンテキストの再現率、情報の鮮度遅れなどが含まれます。これに応えるのにモデルは必要ありません。生成品質は、モデルが与えられた情報を忠実に活用したかどうかを問うものです。回答の関連性や引用範囲などが、人間のレビューに基づいて調整された審査員によって評価されます。 ビジネス成果は、これらすべてが意味を持っていたかを問うものです。解決時間、問題の封じ込め率、コスト、顧客満足度(CSAT)などがこれにあたります。これらを個別に管理しておけば、指標の低下は、データ、モデル、ワークフローのいずれであれ、改善が必要なレイヤーを明確に指し示します。
3つのダッシュボード:指標の低下が、どの層を修正すべきかを教えてくれる
次に、範囲を狭くしてリリースします。実際のトラフィックに対して範囲を限定したユースケースをテストし、策定したSLAを満たすまで微調整を行い、エスカレーション機能を有効にして提供し、その後にのみ範囲を広げます。停滞パターンはこれと正反対であり、現在業界で最も一般的なプロジェクトの形態です。つまり、「ツール優先、データは後回し、指標は無視」というものです。
モデルの改善効果は、その日のうちに全員に及ぶ。今四半期に最先端のリリースで得た優位性など、競合他社は翌四半期には定価で手に入れてしまう。しかし、競合他社が手に入れられないものがある。それは、エージェントが回答する瞬間に取得するコンテキストの「通貨」「ガバナンス」「アイデンティティ」である。
モデルは脳であり、コンテキストは記憶です。そのうちの1つだけが、あなたのものであるのです。電子書籍の全文をご覧ください。
関連記事
ユニツリーがヒューマノイドロボットの未来をどのように切り拓いているか
Unitreeが発表した、高度な実世界ナビゲーションを実現する超広角4D LiDAR技術を搭載した新たな「具現化AI」ロボット。画像提供:UnitreeUnitreeのCEO、王星星氏は、世界モデルの飛躍的進歩を目指し、ヒューマノイドロボットが慣れない家庭に置かれた際、タスクの80%を遂行できるよう支援することを目指しているロボット業界がスクリプト化された動作の段階を脱する中、中国のヒューマノイド
コグニションがPokeを買収した理由:AIによるパーソナリティが競争優位性となりつつある
友人のように会話できるAIアシスタント「Poke」が、次の大きな一歩を踏み出そうとしている。Pokeを開発したカリフォルニア州のスタートアップ企業「The Interaction Company」は、AIコーディング企業Cognitionに買収された。この取引により、同社の企業価値は9桁台前半と評価された。この合意に基づき、Pokeの対話モデルと独自の個性は、Cognitionのコーディングアシス
Google、Geminiへの焦点がユーザー制御へシフトする中で、Remy AIエージェントをテスト
『Business Insider』によると、GoogleはGemini向けの新しいAIパーソナルエージェント「Remy」をテスト中である。このツールはユーザーに代わってタスクを実行することを目的としており、業務フローと日常のルーチンの両方を効率化する。現在、RemyはGeminiアプリケーションの社内限定版においてテストが行われている。この報道は社内文書と、プロジェクトに精通した2人の人物へのインタビューを引用している。社内資料では、Remyを「24時間365日のパーソナルエージェント」と位
関連特集おすすめ
コメント (0)
0/500
Tealiumの応用AI部門プリンシパル・プロダクト・マネージャー、フレディ・ベルランティ氏が、検索強化生成(RAG)について解説する。画像:Getty Images
Tealiumの応用AI担当プリンシパル・プロダクト・マネージャー、フレディ・ベルランティ氏が、価値を提供するRAGシステムと、知らぬ間にユーザーの信頼を損なうRAGシステムとの決定的な違いを解説する
多くの企業向け検索強化生成(RAG)システムは、顧客に関する「スナップショット」しか取得していません。例えば、先週火曜日にインデックス化されたベクトルストア、夜間に同期されるナレッジベース、あるいは12時間前のユーザーの状態を反映したプロフィールなどです。このギャップこそが、機能するRAGシステムと、知らぬ間に信頼を蝕んでいくシステムとを分けるのです。
木曜日の午後8時47分。ある顧客がカートに別の商品を追加し、合計金額が送料無料の基準額を超えたところで、サポートチャットを開き、「送料は含まれていますか」と尋ねた。
エージェントは数ミリ秒以内に回答します。その回答は流暢で、礼儀正しく、適切な引用も含まれていますが――間違っています。なぜなら、取得されたプロファイルは、カートの内容が変更される前に作成されたものだからです。バッチ処理されたデータが追いつく頃には、その情報を伝えるべき瞬間はすでに過ぎ去ってしまっています。
このやり取りには2つの異なる指標が関わっていますが、ほとんどの運用システムではそのうちの1つしか測定されていません。応答遅延とは、質問から回答までの時間を指し、チームはこれを執拗に測定しています。一方、「情報の鮮度(Age of information)」は、Kaul、Yates、Gruteserによって定式化された指標であり、システムがそれに基づいて動作した時点で、その情報がどれほど古いものだったかを測定するものです。 簡単に言えば、「その情報を活用した時点で、そのコンテキストはどれほど古くなっていたか」ということです。

この例では、応答レイテンシは1秒未満でしたが、情報は数時間前のものだったのです。システムは高速でしたが、最新ではありませんでした。そして、ダッシュボードに表示されていたのは、その数値のうちの1つだけでした。
この区別が重要なのは、古くなった顧客データに基づいた迅速な回答であっても、それは依然として誤った回答だからです。顧客向けのRAGにおいて、速度と情報の鮮度は別々の問題であり、一方を最適化しても他方が保証されるわけではありません。
この2つは独立しており、負荷がかかると相反する方向に進む可能性があります。更新頻度が高いからといって、必ずしも情報が新鮮になるわけではありません。ある一定点を超えると、更新が蓄積され、利用可能な最新情報が「新しい」ものではなく「古い」ものになってしまいます。毎晩のバッチ処理は、単にその極端な例に過ぎません。つまり、1日前の世界の状況に基づいて動作するシステムなのです。 解決策は、同じスケジュールでより多くのデータを移動させることではありません。重要な変更が発生したその場で反映させることであり、そのためには単に高速なアーキテクチャではなく、異なるアーキテクチャが必要となります。
RAGは、「クローズドブック問題」を解決したことでその地位を確立しました。システムは記憶のみに基づいて回答するのではなく、まず関連資料を検索し、見つけた情報に基づいて回答します。その資料こそがコーパスです。コーパスを適切に構築すれば、モデルは即興的な対応をしなくなります。
社内向けナレッジアシスタントであれば、夜間に同期されるコーパスで十分です。しかし、セッション中の顧客対応は別の問題です。ショッピングカートの金額が閾値を超えたばかりであり、エージェントは今すぐ、送料無料を提案するか、それとも保留にするかを判断しなければなりません。 夜明け前に取得されたスナップショットは、後で調整して解消できる制限ではありません。それは間違ったアーキテクチャなのです。なぜなら、バッチ処理されたインデックスデータが追いつく頃には、そのデータが判断材料となるはずだった機会はすでに過ぎ去っているからです。
バッチ型RAGは「記憶」を呼び出すが、ライブ型RAGは「顧客」を呼び出す
こうした不具合は、些細で、もっともらしいものであり、かつ徐々にシステムを蝕んでいきます。アラートやバグ報告を引き起こすことはめったにありません。ユーザーは単に、そのシステムを信用しないことを学び、使用をやめてしまうのです。それがダッシュボードに表示される頃には、明らかな原因のない「導入率の問題」のように見えてしまいます。
解決策は、ツール選定の前に始まります。それはユースケースごとに策定されるサービスレベル契約(SLA)であり、次の3つの問いに答えるものです。「コンテキストはどれほど最新でなければならないか?」「回答はどれほど速く届く必要があるか?」「システムはいつ停止し、会話を人間に引き継ぐべきか?」
カート内の状態には数秒が必要です。製品コンテンツなら数分でも許容されます。ポリシーに関しては、1日単位でも問題ありません。これらの数値は単なる好みではなく、設計上の制約となります。それらがアーキテクチャを決定し、コストを決定するのです。よくある間違いは、情報の鮮度を、すべてに均一に適用される単一のグローバル設定として扱ってしまうことです。 鮮度は予算のようなものです。意思決定に影響を与える場所では予算を使い、そうでない場所では支出を控えるべきです。
顧客対応担当者の場合、その「コーパス」とは顧客そのものです。
つまり、デバイスやチャネルをまたいで身元が特定されるため、すべてのタッチポイントが1人の人物として認識されます。また、同意がプロファイル自体に紐付けられているため、下流でのすべての照会は、誰かが「読んでくれただろう」と期待するポリシー文書ではなく、構造上当然の権限として許可されます。
また、毎晩の再構築を廃止することも意味します。変更データキャプチャ(変更された部分のみをストリーミングし、すべてを再読み込みしない手法)により、何百万ものプロファイルを再処理する代わりに、単一のプロファイルを数秒で再埋め込みできます。 検索はハイブリッド方式で実行されます。意味を抽出するための高密度ベクトル検索と、SKUや注文番号など重要な正確な文字列を検索するためのキーワード検索を行い、これらをランク順に融合させ、最終候補に対して再ランク付けの処理を行います。 ホット層とコールド層の区分により、コストを適正に抑えることができます。つまり、意思決定に実際に影響を与えるごく少数の属性については「セカンドレベルの最新性」を、それ以外のすべてについては「毎日の更新頻度」を購入する形になります。
常に最新の状態が保たれたスタック(左から右へ読み進める)と、その下にある測定ループ
すべてのエージェントをすべてのデータソースに手作業で接続すると、統合の網が形成され、それぞれに独自の認証、スキーマの変更、障害点が存在することになります。この複雑さこそが、多くの有望なパイロットプロジェクトがスケールアップに苦戦する理由です。
エージェントをツールやデータに接続するためのオープンスタンダードである「モデルコンテキストプロトコル(MCP)」は、その継ぎ目をポートに変えます。 データソースを一度接続すれば、準拠したエージェントなら誰でも、スキーマや権限情報付きでそれを検出できます。その前にはゲートウェイが配置され、着信コールの検証、同意に基づく情報のマスキング、監査証跡の記録を行います。華やかさのないこの部分が、本番環境への移行を可能にするのです。
測定なしではこれらはいずれも成り立たず、単一の数値だけでは不十分です。満足度スコアが1つあれば、何かが間違っていることは分かります。3つの別々のダッシュボードがあれば、何が問題なのかが分かります。
検索品質は、そもそも正しいコンテキストを取得できたかどうかを問うものです。コンテキストの精度、コンテキストの再現率、情報の鮮度遅れなどが含まれます。これに応えるのにモデルは必要ありません。生成品質は、モデルが与えられた情報を忠実に活用したかどうかを問うものです。回答の関連性や引用範囲などが、人間のレビューに基づいて調整された審査員によって評価されます。 ビジネス成果は、これらすべてが意味を持っていたかを問うものです。解決時間、問題の封じ込め率、コスト、顧客満足度(CSAT)などがこれにあたります。これらを個別に管理しておけば、指標の低下は、データ、モデル、ワークフローのいずれであれ、改善が必要なレイヤーを明確に指し示します。
3つのダッシュボード:指標の低下が、どの層を修正すべきかを教えてくれる
次に、範囲を狭くしてリリースします。実際のトラフィックに対して範囲を限定したユースケースをテストし、策定したSLAを満たすまで微調整を行い、エスカレーション機能を有効にして提供し、その後にのみ範囲を広げます。停滞パターンはこれと正反対であり、現在業界で最も一般的なプロジェクトの形態です。つまり、「ツール優先、データは後回し、指標は無視」というものです。
モデルの改善効果は、その日のうちに全員に及ぶ。今四半期に最先端のリリースで得た優位性など、競合他社は翌四半期には定価で手に入れてしまう。しかし、競合他社が手に入れられないものがある。それは、エージェントが回答する瞬間に取得するコンテキストの「通貨」「ガバナンス」「アイデンティティ」である。
モデルは脳であり、コンテキストは記憶です。そのうちの1つだけが、あなたのものであるのです。電子書籍の全文をご覧ください。
ユニツリーがヒューマノイドロボットの未来をどのように切り拓いているか
Unitreeが発表した、高度な実世界ナビゲーションを実現する超広角4D LiDAR技術を搭載した新たな「具現化AI」ロボット。画像提供:UnitreeUnitreeのCEO、王星星氏は、世界モデルの飛躍的進歩を目指し、ヒューマノイドロボットが慣れない家庭に置かれた際、タスクの80%を遂行できるよう支援することを目指しているロボット業界がスクリプト化された動作の段階を脱する中、中国のヒューマノイド
コグニションがPokeを買収した理由:AIによるパーソナリティが競争優位性となりつつある
友人のように会話できるAIアシスタント「Poke」が、次の大きな一歩を踏み出そうとしている。Pokeを開発したカリフォルニア州のスタートアップ企業「The Interaction Company」は、AIコーディング企業Cognitionに買収された。この取引により、同社の企業価値は9桁台前半と評価された。この合意に基づき、Pokeの対話モデルと独自の個性は、Cognitionのコーディングアシス





家






