NVIDIA、強化学習による障壁のないAIコーディングエージェントの進化を実現する「Polar」フレームワークをオープンソース化
5月28日、NVIDIAの研究チームは、強化学習トレーニングフレームワーク「Polar」をオープンソース化しました。その中核となる革新性は、Codex、Claude Code、Qwen Codeといった既存の主流なコードエージェントを、元のコードに変更を加えることなく、GRPO(Generalized Relative Policy Optimization)強化学習トレーニングにシームレスに統合できる点にあります。

I. 業界の課題:エージェント強化学習の障壁
コードエージェントが、単純な単一ステップのタスクから、倉庫レベルのコード変更やOSとの連携といった複雑で長時間実行されるプロセスへと進化するにつれ、開発者は成熟した実行フレームワーク(Harness)への依存度を高めています。しかし、これらの複雑なフレームワークを従来の強化学習インフラに統合するには、大きな課題が伴います:
高い統合コスト:従来の方法では、コードロジックを env.init() や env.step() といった標準的な環境インターフェースに書き換える必要があり、このプロセスは極めて煩雑です。
情報の喪失:リファクタリングの際、ツール呼び出し、複数ターンにわたる対話コンテキスト、サブエージェント間の協調ロジックといった重要な詳細が失われることが多く、その結果、モデルが高品質なトレーニング信号を受け取れなくなります。

II. 核心となる解決策:「境界」をトレーニングのエントリポイントとして活用
Polarは、実行フレームワークの書き換えを不要にします。その代わりに、モデルAPIの境界をトレーニングのエントリポイントとして扱います。
ブラックボックス処理:Polarは、コード実行フレームワークとモデル推論サーバーの間に透過的なプロキシ(Gateway)を配置します。エージェントがAnthropic、OpenAI、GoogleのいずれのAPIを使用しているかに関わらず、Polarはリクエストをシームレスにインターセプトして転送します。
トレースの再構築:転送中に、Polarはプロンプト、サンプリングされたトークン、ログ確率などの主要なデータをリアルタイムで記録し、強化学習トレーナーが必要とする「トレース」データとして再構築します。
効率的な非同期アーキテクチャ:システムはスケジューリングと永続化にロールアウトサーバーを採用し、ゲートウェイノードがライフサイクルとリソースのリサイクルを管理します。プリヒートされたバッファ(READYバッファ)と並列タスク処理を活用することで、GPUトレーニングをブロックする可能性のあるロングテールタスクを効果的に排除します。
III. 性能の飛躍:コードエージェントの変革
実験データによると、PolarをGRPOトレーニングと組み合わせることで、大幅な性能向上が得られることが示されています:
SWE-Benchによる検証済みベンチマークテスト:同じQwen3.5-4Bベースモデルを使用した場合、パフォーマンスはコードフレームワークによって異なります:
Codexフレームワーク:pass@1スコアが3.8%から26.4%へと跳ね上がり、594.74%の急増を記録しました。
Claude Code Framework:29.8%から34.6%へ。
Pi Framework:34.2%から40.4%へ。
極めて高い効率性:prefix_merging戦略を導入した結果、従来のリクエストごとのモードと比較してトレーニングの実行時間が約5.39倍短縮され、GPU利用率は20.4%から87.7%に上昇しました。
業界のコメント
NVIDIAのPolarのオープンソース化は、本質的にAIエージェントが強化学習のトレーニングに参入するための「高速道路」を構築するものです。これにより、研究者は大規模なオープンソースコードフレームワークを活用して効率的にトレーニングを行えるようになるだけでなく、システムレベルの最適化を通じてGPUコンピューティングの参入障壁も低減されます。
Polarの人気が高まるにつれ、開発者はもはや「モデルをトレーニングフレームワークにどう適応させるか」を心配する必要がなくなります。将来的には、AIコーディングエージェントの進化はより標準化され、効率的になるでしょう。これは、AIエージェントのトレーニングが、手作業によるラボでのチューニングから、大規模かつ体系的なエンジニアリング生産へと移行することを意味します。
論文URL: https://arxiv.org/pdf/2605.24220
関連記事
AppleのスマートグラスはWWDC27でデビューする可能性があり、プライバシー保護を強調している
Bloombergのマーク・ガーマン氏によると、Appleのスマートグラス(コードネームN50)は2027年6月のWWDC27で初公開され、2027年秋に小売店での発売が予定されている。当初は今年後半から2027年初頭にかけての発売が目標だったが、製品のさらなる洗練とプライバシー保護プロトコルの強化を可能にするため、発売時期が延期された。プライバシーはAppleのスマートグラス戦略の中核的な柱である。Metaなどの競合他社をめぐるプライバシー論争から教訓を得て、Appleは堅牢な機能とポリシー
内部詳細が明かされた次世代ジェミニ:計算リソースの逼迫、開発チーム間で優先順位とリソース配分を巡り意見が割れた
報告によると、Googleの次世代Geminiモデルの発売は延期された。開発の優先順位とリソース配分をめぐる社内での意見の相違、限られた計算能力、複雑な承認手続きが重なり、2ヶ月の延期を余儀なくされた。独自開発のTPUチップを所有しているものの、モデルのトレーニング、Google Cloudサービス、多数の消費者向けおよび企業向けAIアプリケーションからの競合する需要により、Googleは計算資源の不足に直面している。上層部は現在、組織再編成を通じてこれらの部門間の対立に対処している。同時に、リ
OpenAI、成長鈍化への懸念を退け、複数の事業部門が加速していると表明
外部からの販売成長の鈍化や社内目標の未達に関する scrutiny に対応し、AI リーダーである OpenAI は 4 月 28 日(火曜日)、自信に満ちた声明を発表した。同社は、消費者向け製品とエンタープライズサービスが急速に進展しており、最近のビジネス減速に関する憶測を直接否定していると明らかにした。同社が「複数の社内目標を逸脱した」とする主張に対し、OpenAI はこれらの報道を「典型的なクリックベイト」と一蹴した。同社は、AI 統合に対する堅調なエンタープライズ需要を強調し、広告施策
関連特集おすすめ
コメント (1)
0/500
5月28日、NVIDIAの研究チームは、強化学習トレーニングフレームワーク「Polar」をオープンソース化しました。その中核となる革新性は、Codex、Claude Code、Qwen Codeといった既存の主流なコードエージェントを、元のコードに変更を加えることなく、GRPO(Generalized Relative Policy Optimization)強化学習トレーニングにシームレスに統合できる点にあります。

I. 業界の課題:エージェント強化学習の障壁
コードエージェントが、単純な単一ステップのタスクから、倉庫レベルのコード変更やOSとの連携といった複雑で長時間実行されるプロセスへと進化するにつれ、開発者は成熟した実行フレームワーク(Harness)への依存度を高めています。しかし、これらの複雑なフレームワークを従来の強化学習インフラに統合するには、大きな課題が伴います:
高い統合コスト:従来の方法では、コードロジックを env.init() や env.step() といった標準的な環境インターフェースに書き換える必要があり、このプロセスは極めて煩雑です。
情報の喪失:リファクタリングの際、ツール呼び出し、複数ターンにわたる対話コンテキスト、サブエージェント間の協調ロジックといった重要な詳細が失われることが多く、その結果、モデルが高品質なトレーニング信号を受け取れなくなります。

II. 核心となる解決策:「境界」をトレーニングのエントリポイントとして活用
Polarは、実行フレームワークの書き換えを不要にします。その代わりに、モデルAPIの境界をトレーニングのエントリポイントとして扱います。
ブラックボックス処理:Polarは、コード実行フレームワークとモデル推論サーバーの間に透過的なプロキシ(Gateway)を配置します。エージェントがAnthropic、OpenAI、GoogleのいずれのAPIを使用しているかに関わらず、Polarはリクエストをシームレスにインターセプトして転送します。
トレースの再構築:転送中に、Polarはプロンプト、サンプリングされたトークン、ログ確率などの主要なデータをリアルタイムで記録し、強化学習トレーナーが必要とする「トレース」データとして再構築します。
効率的な非同期アーキテクチャ:システムはスケジューリングと永続化にロールアウトサーバーを採用し、ゲートウェイノードがライフサイクルとリソースのリサイクルを管理します。プリヒートされたバッファ(READYバッファ)と並列タスク処理を活用することで、GPUトレーニングをブロックする可能性のあるロングテールタスクを効果的に排除します。
III. 性能の飛躍:コードエージェントの変革
実験データによると、PolarをGRPOトレーニングと組み合わせることで、大幅な性能向上が得られることが示されています:
SWE-Benchによる検証済みベンチマークテスト:同じQwen3.5-4Bベースモデルを使用した場合、パフォーマンスはコードフレームワークによって異なります:
Codexフレームワーク:pass@1スコアが3.8%から26.4%へと跳ね上がり、594.74%の急増を記録しました。
Claude Code Framework:29.8%から34.6%へ。
Pi Framework:34.2%から40.4%へ。
極めて高い効率性:prefix_merging戦略を導入した結果、従来のリクエストごとのモードと比較してトレーニングの実行時間が約5.39倍短縮され、GPU利用率は20.4%から87.7%に上昇しました。
業界のコメント
NVIDIAのPolarのオープンソース化は、本質的にAIエージェントが強化学習のトレーニングに参入するための「高速道路」を構築するものです。これにより、研究者は大規模なオープンソースコードフレームワークを活用して効率的にトレーニングを行えるようになるだけでなく、システムレベルの最適化を通じてGPUコンピューティングの参入障壁も低減されます。
Polarの人気が高まるにつれ、開発者はもはや「モデルをトレーニングフレームワークにどう適応させるか」を心配する必要がなくなります。将来的には、AIコーディングエージェントの進化はより標準化され、効率的になるでしょう。これは、AIエージェントのトレーニングが、手作業によるラボでのチューニングから、大規模かつ体系的なエンジニアリング生産へと移行することを意味します。
論文URL: https://arxiv.org/pdf/2605.24220
AppleのスマートグラスはWWDC27でデビューする可能性があり、プライバシー保護を強調している
Bloombergのマーク・ガーマン氏によると、Appleのスマートグラス(コードネームN50)は2027年6月のWWDC27で初公開され、2027年秋に小売店での発売が予定されている。当初は今年後半から2027年初頭にかけての発売が目標だったが、製品のさらなる洗練とプライバシー保護プロトコルの強化を可能にするため、発売時期が延期された。プライバシーはAppleのスマートグラス戦略の中核的な柱である。Metaなどの競合他社をめぐるプライバシー論争から教訓を得て、Appleは堅牢な機能とポリシー
内部詳細が明かされた次世代ジェミニ:計算リソースの逼迫、開発チーム間で優先順位とリソース配分を巡り意見が割れた
報告によると、Googleの次世代Geminiモデルの発売は延期された。開発の優先順位とリソース配分をめぐる社内での意見の相違、限られた計算能力、複雑な承認手続きが重なり、2ヶ月の延期を余儀なくされた。独自開発のTPUチップを所有しているものの、モデルのトレーニング、Google Cloudサービス、多数の消費者向けおよび企業向けAIアプリケーションからの競合する需要により、Googleは計算資源の不足に直面している。上層部は現在、組織再編成を通じてこれらの部門間の対立に対処している。同時に、リ
OpenAI、成長鈍化への懸念を退け、複数の事業部門が加速していると表明
外部からの販売成長の鈍化や社内目標の未達に関する scrutiny に対応し、AI リーダーである OpenAI は 4 月 28 日(火曜日)、自信に満ちた声明を発表した。同社は、消費者向け製品とエンタープライズサービスが急速に進展しており、最近のビジネス減速に関する憶測を直接否定していると明らかにした。同社が「複数の社内目標を逸脱した」とする主張に対し、OpenAI はこれらの報道を「典型的なクリックベイト」と一蹴した。同社は、AI 統合に対する堅調なエンタープライズ需要を強調し、広告施策





家






