ウェブ体験を変える自己学習型AIエージェント:準備ガイド

著名なAI研究者であるデイヴィッド・シルバーとリチャード・サットンは、新しい論文の中で、人工知能は変革的な "経験の時代 "を迎えつつあると提唱している。彼らは、AIシステムはますます人間が提供するデータへの依存を超え、代わりに世界との直接的な相互作用や世界からのデータ収集を通じて進歩することを示唆している。
この論文は概念的で将来を見据えたものであるが、その洞察は将来のAIエージェントやシステムの開発・統合を計画している企業にとって直接的な関連性を持つものである。
シルバーとサットンの両氏は、AIの軌跡について正確な予測を行ってきた尊敬すべき科学者である。彼らの先見の明は、今日の最先端のAIシステムにも表れている。強化学習のパイオニアであるサットンは、2019年の影響力のあるエッセイ「苦い教訓」の中で、最も重要な長期的なAIのブレークスルーは一貫して、複雑な人間の知識を埋め込むことではなく、大規模な計算で汎用的な検索と学習をスケーリングすることから生まれると主張した。
ディープマインドのプリンシパル・サイエンティストであるデビッド・シルバーは、AlphaGo、AlphaZero、AlphaStarの開発に主導的な役割を果たした。彼はまた、強化学習とうまく設計された報酬信号を組み合わせることで、最終的に高度なAIを生み出すことができると主張する2021年の論文を共著している。
今日の最も洗練された大規模言語モデル(LLM)は、これら2つの概念を例証している。GPT-3以降の強力なLLMの波は、膨大な知識を吸収するための計算能力とデータのスケーリングに大きく依存している。DeepSeek-R1のような最近の推論モデルは、複雑な推論能力を獲得するには、単純な報酬信号による強化学習で十分であることを示している。
経験の時代」とは?
経験の時代」とは、サットンとシルバーが提唱してきた概念を、最近のAIの進歩に合わせて文脈化したものである。著者は、「人間のデータからの教師あり学習のみによる進歩のペースは明らかに減速しており、新たなアプローチの必要性を示している」と指摘する。
この新しいアプローチは、エージェントがより有能になるにつれて継続的に改善される方法で生成された、新鮮なデータソースを必要とする。「これは、エージェントが自身の経験、つまりエージェントが環境と相互作用することで生成されるデータから継続的に学習することで達成できる」とサットンとシルバーは説明する。最終的には、"経験が改善の主要な媒体となり、最終的には今日のシステムで使用されている人間のデータの規模を凌駕する "と彼らは主張している。
著者らによれば、未来のAIシステムは、経験データから学習するだけでなく、4つの重要な次元にわたって学習することで、「人間中心のAIシステムの限界を突破」することになるという:
- ストリーム:ストリーム:AIエージェントは、孤立したエピソードで動作するのではなく、「人間のように、長い時間スケールで進行する独自の経験のストリームを持つ」ようになる。これにより、長期的なプランニングと行動の段階的な適応が可能になる。この初期の兆候は、ユーザーとの対話を通じて継続的に更新される広範なコンテキスト・ウィンドウとメモリ・アーキテクチャを備えたAIシステムに現れている。
- 行動と観察:人間の特権的な行動や観察を超えて、経験の時代のエージェントは、実世界で自律的に行動するようになる。これは、コンピュータ制御やモデルコンテキストプロトコル(MCP)のようなツールを使って、外部のアプリケーションやリソースとインターフェースするエージェントシステムにおいて見られる。
- 報酬現在の強化学習システムは、人間が設計した報酬関数に大きく依存しているが、将来のAIエージェントは、独自の動的報酬関数を作成する必要がある。これらの報酬関数は、エージェントの行動や観察から得られる実世界のフィードバックとユーザーの嗜好を一致させながら、時間とともに進化していくだろう。NvidiaのDrEurekaのような初期の自己設計報酬システムは、このような未来を垣間見せてくれる。
- プランニングと推論:現在の推論モデルは、人間の思考を模倣するように設計されていることが多い。著者らは、「より効率的な思考メカニズムが存在することは確かで、例えば、記号的、分散的、連続的、微分可能な計算を利用した、人間以外の言語を使用することができる」と提案している。AIエージェントは、観察されたデータを使って推論をテストし、改良し、更新しながら、内部世界モデルを構築しながら、世界と関わっていくべきである。
AIエージェントが強化学習によって適応するという概念は新しいものではないが、歴史的には、そのようなエージェントはボードゲームのような厳しく制御された環境に限られていた。現在では、強化学習の進歩と相まって、コンピュータを操作するような複雑な設定をナビゲートできるエージェントが、こうした制約を克服し、経験の時代へのシフトを加速させる態勢が整っている。
それは企業にとって何を意味するのか?
SuttonとSilverの論文には、実世界での応用に関する重要な見解が述べられている:エージェントは、ユーザーとのコミュニケーションやコラボレーションを自然に促進するような、ユーザーインターフェースのような "人間に優しい "アクションや観察を使用することができる。エージェントはまた、コードを実行したりAPIを呼び出したりする "機械に優しい "アクションをとることもあり、それによってエージェントはその目標のために自律的に行動することができる。
経験の時代は、開発者が人間のユーザーとAIエージェントの両方のためにアプリケーションを設計しなければならないことを意味する。マシンフレンドリーなアクションには、安全でアクセス可能なAPIが必要であり、直接、あるいはMCPのようなインターフェースを通じて利用できる。また、GoogleのAgent2Agentのようなプロトコルを介して発見可能なエージェントを作成する必要がある。アクションとオブザベーションの両方にアクセスできるようにAPIとエージェントのインターフェースを設計することで、エージェントはソフトウェアとのインタラクションから徐々に推論し、学習することができるようになる。
もしSuttonとSilverのビジョンが実現すれば、何十億ものエージェントが最終的にはウェブ上で、そして後には物理的な世界でタスクを実行するようになるだろう。彼らの行動や要求は、人間のユーザーとは根本的に異なるだろう。エージェントフレンドリーなインタラクション手法を確立することは、将来のAIシステムを効果的に活用し、潜在的なリスクを軽減するために極めて重要である。
「RLの基礎を構築し、その基本原理をこの新しい時代の課題に適応させることで、自律学習の可能性を最大限に引き出し、真に超人的な知性への道を開くことができる」とサットンとシルバーは結論付けている。
ディープマインドは本記事へのコメントを拒否した。
関連記事
ワーナーミュージックがAI帰属分析スタートアップのSureel AIを買収
ワーナー・ミュージック・グループ(WMG)は水曜日、人工知能(AI)の帰属情報スタートアップであるSureel AIを買収すると発表した。Sureelの独自技術は、楽曲に対して「AI DNA」を生成し、構成要素に分解して、AIモデルがこれらの要素をどのように利用するかを追跡する。今回の買収を通じて、WMGは、アーティストやソングライターの作品がAI生成コンテンツで利用されたり、AIモデルの学習に使用されたりする状況を監視する能力を強化する目的である。「SureelをWMGに統合することで、保
Amazonは、Alexa for Shoppingを導入しつつ、Rufusを後回しにしている
Amazonは、RufusショッピングチャットボットとAlexa+をアプリ、ウェブサイト、Echo Showデバイス全体で統合した「Alexa for Shopping」をリリースした。このアシスタントは商品の問い合わせに応じ、アイテムの比較、価格追跡、ショッピングリマインダーをサポートする。また、スケジュールされたショッピングアクションや対象となる自動購入も処理する。同社によると、「Alexa for Shopping」はRufusの商品専門知識とAlexa+のパーソナライズされたアシスタ
マイクロソフト、Azure、AI技術がカリフォルニアの山火事リスク対策に貢献
マイクロソフトはAIを活用した山火事検知技術に投資しており、CVP兼チーフデータサイエンティストのフアン・ラビスタ・フェレス氏が、環境被害を軽減するための戦略について語っている。NASAによると、気候変動は地球上のすべての人々に影響を及ぼしており、気温の上昇、降雨パターンの変化、海面上昇といった形で現れている。NASAは、地球がかつてない速度で温暖化しており、その主な要因は人間の活動であるという明
関連特集おすすめ
コメント (1)
0/500

著名なAI研究者であるデイヴィッド・シルバーとリチャード・サットンは、新しい論文の中で、人工知能は変革的な "経験の時代 "を迎えつつあると提唱している。彼らは、AIシステムはますます人間が提供するデータへの依存を超え、代わりに世界との直接的な相互作用や世界からのデータ収集を通じて進歩することを示唆している。
この論文は概念的で将来を見据えたものであるが、その洞察は将来のAIエージェントやシステムの開発・統合を計画している企業にとって直接的な関連性を持つものである。
シルバーとサットンの両氏は、AIの軌跡について正確な予測を行ってきた尊敬すべき科学者である。彼らの先見の明は、今日の最先端のAIシステムにも表れている。強化学習のパイオニアであるサットンは、2019年の影響力のあるエッセイ「苦い教訓」の中で、最も重要な長期的なAIのブレークスルーは一貫して、複雑な人間の知識を埋め込むことではなく、大規模な計算で汎用的な検索と学習をスケーリングすることから生まれると主張した。
ディープマインドのプリンシパル・サイエンティストであるデビッド・シルバーは、AlphaGo、AlphaZero、AlphaStarの開発に主導的な役割を果たした。彼はまた、強化学習とうまく設計された報酬信号を組み合わせることで、最終的に高度なAIを生み出すことができると主張する2021年の論文を共著している。
今日の最も洗練された大規模言語モデル(LLM)は、これら2つの概念を例証している。GPT-3以降の強力なLLMの波は、膨大な知識を吸収するための計算能力とデータのスケーリングに大きく依存している。DeepSeek-R1のような最近の推論モデルは、複雑な推論能力を獲得するには、単純な報酬信号による強化学習で十分であることを示している。
経験の時代」とは?
経験の時代」とは、サットンとシルバーが提唱してきた概念を、最近のAIの進歩に合わせて文脈化したものである。著者は、「人間のデータからの教師あり学習のみによる進歩のペースは明らかに減速しており、新たなアプローチの必要性を示している」と指摘する。
この新しいアプローチは、エージェントがより有能になるにつれて継続的に改善される方法で生成された、新鮮なデータソースを必要とする。「これは、エージェントが自身の経験、つまりエージェントが環境と相互作用することで生成されるデータから継続的に学習することで達成できる」とサットンとシルバーは説明する。最終的には、"経験が改善の主要な媒体となり、最終的には今日のシステムで使用されている人間のデータの規模を凌駕する "と彼らは主張している。
著者らによれば、未来のAIシステムは、経験データから学習するだけでなく、4つの重要な次元にわたって学習することで、「人間中心のAIシステムの限界を突破」することになるという:
- ストリーム:ストリーム:AIエージェントは、孤立したエピソードで動作するのではなく、「人間のように、長い時間スケールで進行する独自の経験のストリームを持つ」ようになる。これにより、長期的なプランニングと行動の段階的な適応が可能になる。この初期の兆候は、ユーザーとの対話を通じて継続的に更新される広範なコンテキスト・ウィンドウとメモリ・アーキテクチャを備えたAIシステムに現れている。
- 行動と観察:人間の特権的な行動や観察を超えて、経験の時代のエージェントは、実世界で自律的に行動するようになる。これは、コンピュータ制御やモデルコンテキストプロトコル(MCP)のようなツールを使って、外部のアプリケーションやリソースとインターフェースするエージェントシステムにおいて見られる。
- 報酬現在の強化学習システムは、人間が設計した報酬関数に大きく依存しているが、将来のAIエージェントは、独自の動的報酬関数を作成する必要がある。これらの報酬関数は、エージェントの行動や観察から得られる実世界のフィードバックとユーザーの嗜好を一致させながら、時間とともに進化していくだろう。NvidiaのDrEurekaのような初期の自己設計報酬システムは、このような未来を垣間見せてくれる。
- プランニングと推論:現在の推論モデルは、人間の思考を模倣するように設計されていることが多い。著者らは、「より効率的な思考メカニズムが存在することは確かで、例えば、記号的、分散的、連続的、微分可能な計算を利用した、人間以外の言語を使用することができる」と提案している。AIエージェントは、観察されたデータを使って推論をテストし、改良し、更新しながら、内部世界モデルを構築しながら、世界と関わっていくべきである。
AIエージェントが強化学習によって適応するという概念は新しいものではないが、歴史的には、そのようなエージェントはボードゲームのような厳しく制御された環境に限られていた。現在では、強化学習の進歩と相まって、コンピュータを操作するような複雑な設定をナビゲートできるエージェントが、こうした制約を克服し、経験の時代へのシフトを加速させる態勢が整っている。
それは企業にとって何を意味するのか?
SuttonとSilverの論文には、実世界での応用に関する重要な見解が述べられている:エージェントは、ユーザーとのコミュニケーションやコラボレーションを自然に促進するような、ユーザーインターフェースのような "人間に優しい "アクションや観察を使用することができる。エージェントはまた、コードを実行したりAPIを呼び出したりする "機械に優しい "アクションをとることもあり、それによってエージェントはその目標のために自律的に行動することができる。
経験の時代は、開発者が人間のユーザーとAIエージェントの両方のためにアプリケーションを設計しなければならないことを意味する。マシンフレンドリーなアクションには、安全でアクセス可能なAPIが必要であり、直接、あるいはMCPのようなインターフェースを通じて利用できる。また、GoogleのAgent2Agentのようなプロトコルを介して発見可能なエージェントを作成する必要がある。アクションとオブザベーションの両方にアクセスできるようにAPIとエージェントのインターフェースを設計することで、エージェントはソフトウェアとのインタラクションから徐々に推論し、学習することができるようになる。
もしSuttonとSilverのビジョンが実現すれば、何十億ものエージェントが最終的にはウェブ上で、そして後には物理的な世界でタスクを実行するようになるだろう。彼らの行動や要求は、人間のユーザーとは根本的に異なるだろう。エージェントフレンドリーなインタラクション手法を確立することは、将来のAIシステムを効果的に活用し、潜在的なリスクを軽減するために極めて重要である。
「RLの基礎を構築し、その基本原理をこの新しい時代の課題に適応させることで、自律学習の可能性を最大限に引き出し、真に超人的な知性への道を開くことができる」とサットンとシルバーは結論付けている。
ディープマインドは本記事へのコメントを拒否した。
ワーナーミュージックがAI帰属分析スタートアップのSureel AIを買収
ワーナー・ミュージック・グループ(WMG)は水曜日、人工知能(AI)の帰属情報スタートアップであるSureel AIを買収すると発表した。Sureelの独自技術は、楽曲に対して「AI DNA」を生成し、構成要素に分解して、AIモデルがこれらの要素をどのように利用するかを追跡する。今回の買収を通じて、WMGは、アーティストやソングライターの作品がAI生成コンテンツで利用されたり、AIモデルの学習に使用されたりする状況を監視する能力を強化する目的である。「SureelをWMGに統合することで、保
マイクロソフト、Azure、AI技術がカリフォルニアの山火事リスク対策に貢献
マイクロソフトはAIを活用した山火事検知技術に投資しており、CVP兼チーフデータサイエンティストのフアン・ラビスタ・フェレス氏が、環境被害を軽減するための戦略について語っている。NASAによると、気候変動は地球上のすべての人々に影響を及ぼしており、気温の上昇、降雨パターンの変化、海面上昇といった形で現れている。NASAは、地球がかつてない速度で温暖化しており、その主な要因は人間の活動であるという明





家






