OpenClawの「AReaL v1.0」フレームワークにより、AIエージェントの並列トレーニングが可能に
3月4日、アント・グループは清華大学と共同で、オープンソースの強化学習トレーニングフレームワーク「AReal v1.0」の安定版をリリースしました。今回のリリースは、「エージェントのためのワンクリック強化学習トレーニング」の実現に重点を置いています。コードの修正を必要とせず、多様なエージェントフレームワークと互換性があり、インテリジェントエージェントが直ちに強化学習トレーニングを開始できるようになります。
2026年初頭以来、エージェントは力強い成長の勢いを維持している。LangChain、Claude Code、OpenClawといったフレームワークは急速に進化しているが、そこには2つの大きなボトルネックが存在する。第一に、トレーニングへの参入障壁が高いことだ。既存のエージェントフレームワークはインターフェースが様々であり、統合には多くの場合、大規模な適応コードが必要となる。 第二に、エージェントには継続的な進化が欠けています。その多くは初期トレーニング段階で設定された固定のモデル重みに依存しています。一度デプロイされると、特定のシナリオに向けてさらに最適化することはできず、その能力はリリース時点で頭打ちになってしまいます。
AReaLは、トレーニングと推論を完全に分離した、初の完全非同期型大規模強化学習システムです。これにより、エージェントはフィードバックを受け取り、実世界のタスクとの相互作用を通じて意思決定を継続的に改善することが可能になります。v1.0のリリースにより、どのエージェントも変更を加えることなくRLトレーニングに接続できるようになりました。エージェントとトレーニングシステムの間にプロキシワーカー層を挿入することで、開発者は単一のリクエスト先をリダイレクトするだけでトレーニングを有効化できます。

(図:エージェントにシームレスに統合されたAReaLの非同期トレーニングアーキテクチャ)
広く利用されているOpenClawフレームワークを例に挙げましょう。開発者は、OpenClawの設定内の`base_url`と`api_key`をAReaLゲートウェイに向けるだけで済みます。これにより、OpenClawエージェントは強化学習トレーニングに接続されます。エージェントは通常通りタスクを実行し続け、ユーザーは定期的にそのパフォーマンスを評価します。AReaLはこれらのトレーニングデータを自動的に収集し、バックグラウンドでモデルを更新するため、エージェントは継続的な使用を通じて自律的に進化することができます。
AReaL v1.0のリリースでは、ネイティブトレーニングエンジン「Archon」も導入されました。PyTorchのネイティブ機能に基づいて構築されており、データ、パイプライン、テンソル、コンテキスト、エキスパートの5つの側面における完全な並列化を実現することで、導入やデバッグのハードルを下げます。また、トレーニングと推論のための複数のバックエンドオプションを提供し、異なる環境での柔軟な展開を容易にします。 驚くべきことに、この複雑な分散システムはわずか1人月でゼロから開発・検証されました。32日間で、100万行近くのコードが修正され、10億パラメータ規模のMixture-of-Experts(MoE)モデルを学習可能なArchonエンジンが完全に実装されました。
この効率化の飛躍を支えた秘密は、極めて複雑なエンジニアリングタスクを自動化する、AReaLの統合型AI支援開発システムにあります。

AReaL v1.0は、計画・コーディングから検証・プルリクエスト(PR)作成に至るまで、エンドツーエンドのサポートを提供するAI支援開発ワークフローを備えています。MoEの並列化、メモリ最適化、アルゴリズム実装といったコアモジュールの開発においては、専用のAIプログラミングアシスタントが上級エキスパートとして機能します。コード変更時にタイムリーかつ的確なガイダンスを提供し、あらゆる修正の正確性を保証します。 AReaLのAI支援プログラミングは、単なる生産性向上ツールにとどまりません。複雑なインフラプロジェクトにおいて「成果物」となる研究開発業務を担うことができ、AIインフラエンジニアリングの新たなパラダイムを切り拓きます。
AReaLチームは、トレーニングエンジン、ユーザビリティ、およびマルチモーダルエージェントのトレーニングについて、今後も改良を続けていくとしています。AReaL v1.0のコードとドキュメントは、inclusionAIコミュニティにてオープンソース化されました。
・GitHubリポジトリ: https://github.com/inclusionAI/AReaL
・関連論文: https://arxiv.org/abs/2505.24298
関連記事
DeepMindのCEOハサビス氏:1日6時間睡眠し、通常午前1時頃に活力を感じます。
フォーチュンは最近、Google DeepMindのCEOであるデミス・ハサビスへのインタビューを掲載し、彼の休息と生産性に対する非伝統的なアプローチを明らかにした。ハサビスは、睡眠時間が非常に短いことを明かし、覚醒時間を2つの明確な作業ブロックに構造化していると語った。彼の睡眠習慣について、ハサビスは「6時間の睡眠を目標としているが、私の習慣は典型的ではない。一日中効果的に機能できる」と述べた。彼は、6時間未満の睡眠は脳の健康に悪影響を及ぼすことを強調した。2010年にDeepMindを共
OpenAIとAnthropic、収益の伸び悩みにもかかわらず市場シェア争いを繰り広げる
OpenAIが収益目標を達成できなかったとする最近の報道を受け、今週火曜日にハイテク株に売り圧力が生じたにもかかわらず、AI研究機関への民間投資家は依然として堅調だ。経験豊富な出資者たちは、メディアによる否定的な報道にもかかわらず、投資額を減らすつもりはないことを明らかにしている。アナリストらは、現在のAI競争はまだ初期段階にあると見ており、「勝者総取り」という結末はあり得ないと見ている。高いコン
カリフォルニア州の自動運転車規制:違反切符、ジオフェンス、そして100万マイルという新たな時代
Guident社は南フロリダでAuveTechのシャトルを運行しており、同社の遠隔監視技術を活用して、ウェストパームビーチでの4マイルのルートとボカラトンでの1マイルのルートを管理している。 | 提供:Guidentカリフォルニア州は、自動運転車の規制環境を再定義しつつあり、テクノロジー業界の「迅速に動き、失敗を恐れない」という考え方から、厳格な説明責任と厳しい走行距離要件へと移行している。Gui
関連特集おすすめ
コメント (1)
0/500
3月4日、アント・グループは清華大学と共同で、オープンソースの強化学習トレーニングフレームワーク「AReal v1.0」の安定版をリリースしました。今回のリリースは、「エージェントのためのワンクリック強化学習トレーニング」の実現に重点を置いています。コードの修正を必要とせず、多様なエージェントフレームワークと互換性があり、インテリジェントエージェントが直ちに強化学習トレーニングを開始できるようになります。
2026年初頭以来、エージェントは力強い成長の勢いを維持している。LangChain、Claude Code、OpenClawといったフレームワークは急速に進化しているが、そこには2つの大きなボトルネックが存在する。第一に、トレーニングへの参入障壁が高いことだ。既存のエージェントフレームワークはインターフェースが様々であり、統合には多くの場合、大規模な適応コードが必要となる。 第二に、エージェントには継続的な進化が欠けています。その多くは初期トレーニング段階で設定された固定のモデル重みに依存しています。一度デプロイされると、特定のシナリオに向けてさらに最適化することはできず、その能力はリリース時点で頭打ちになってしまいます。
AReaLは、トレーニングと推論を完全に分離した、初の完全非同期型大規模強化学習システムです。これにより、エージェントはフィードバックを受け取り、実世界のタスクとの相互作用を通じて意思決定を継続的に改善することが可能になります。v1.0のリリースにより、どのエージェントも変更を加えることなくRLトレーニングに接続できるようになりました。エージェントとトレーニングシステムの間にプロキシワーカー層を挿入することで、開発者は単一のリクエスト先をリダイレクトするだけでトレーニングを有効化できます。

(図:エージェントにシームレスに統合されたAReaLの非同期トレーニングアーキテクチャ)
広く利用されているOpenClawフレームワークを例に挙げましょう。開発者は、OpenClawの設定内の`base_url`と`api_key`をAReaLゲートウェイに向けるだけで済みます。これにより、OpenClawエージェントは強化学習トレーニングに接続されます。エージェントは通常通りタスクを実行し続け、ユーザーは定期的にそのパフォーマンスを評価します。AReaLはこれらのトレーニングデータを自動的に収集し、バックグラウンドでモデルを更新するため、エージェントは継続的な使用を通じて自律的に進化することができます。
AReaL v1.0のリリースでは、ネイティブトレーニングエンジン「Archon」も導入されました。PyTorchのネイティブ機能に基づいて構築されており、データ、パイプライン、テンソル、コンテキスト、エキスパートの5つの側面における完全な並列化を実現することで、導入やデバッグのハードルを下げます。また、トレーニングと推論のための複数のバックエンドオプションを提供し、異なる環境での柔軟な展開を容易にします。 驚くべきことに、この複雑な分散システムはわずか1人月でゼロから開発・検証されました。32日間で、100万行近くのコードが修正され、10億パラメータ規模のMixture-of-Experts(MoE)モデルを学習可能なArchonエンジンが完全に実装されました。
この効率化の飛躍を支えた秘密は、極めて複雑なエンジニアリングタスクを自動化する、AReaLの統合型AI支援開発システムにあります。

AReaL v1.0は、計画・コーディングから検証・プルリクエスト(PR)作成に至るまで、エンドツーエンドのサポートを提供するAI支援開発ワークフローを備えています。MoEの並列化、メモリ最適化、アルゴリズム実装といったコアモジュールの開発においては、専用のAIプログラミングアシスタントが上級エキスパートとして機能します。コード変更時にタイムリーかつ的確なガイダンスを提供し、あらゆる修正の正確性を保証します。 AReaLのAI支援プログラミングは、単なる生産性向上ツールにとどまりません。複雑なインフラプロジェクトにおいて「成果物」となる研究開発業務を担うことができ、AIインフラエンジニアリングの新たなパラダイムを切り拓きます。
AReaLチームは、トレーニングエンジン、ユーザビリティ、およびマルチモーダルエージェントのトレーニングについて、今後も改良を続けていくとしています。AReaL v1.0のコードとドキュメントは、inclusionAIコミュニティにてオープンソース化されました。
・GitHubリポジトリ: https://github.com/inclusionAI/AReaL
・関連論文: https://arxiv.org/abs/2505.24298
DeepMindのCEOハサビス氏:1日6時間睡眠し、通常午前1時頃に活力を感じます。
フォーチュンは最近、Google DeepMindのCEOであるデミス・ハサビスへのインタビューを掲載し、彼の休息と生産性に対する非伝統的なアプローチを明らかにした。ハサビスは、睡眠時間が非常に短いことを明かし、覚醒時間を2つの明確な作業ブロックに構造化していると語った。彼の睡眠習慣について、ハサビスは「6時間の睡眠を目標としているが、私の習慣は典型的ではない。一日中効果的に機能できる」と述べた。彼は、6時間未満の睡眠は脳の健康に悪影響を及ぼすことを強調した。2010年にDeepMindを共
OpenAIとAnthropic、収益の伸び悩みにもかかわらず市場シェア争いを繰り広げる
OpenAIが収益目標を達成できなかったとする最近の報道を受け、今週火曜日にハイテク株に売り圧力が生じたにもかかわらず、AI研究機関への民間投資家は依然として堅調だ。経験豊富な出資者たちは、メディアによる否定的な報道にもかかわらず、投資額を減らすつもりはないことを明らかにしている。アナリストらは、現在のAI競争はまだ初期段階にあると見ており、「勝者総取り」という結末はあり得ないと見ている。高いコン





家






