NVIDIAがオープンソースで公開したPolarは、Codex、Claude Code、Qwen Codeといった既存のコードエージェントをGRPOトレーニングに統合する強化学習用フレームワークです。元のコードを変更することなくこれらを利用できます。このフレームワークでは、モデルのAPI境界をトレーニングのエントリポイントとして扱い、ブラックボックス型のインターセプションやトレース再構築が可能になります。SWE-Benchのテストでは、Codexのパス率が3.8%から26.4%に大幅に向上しました。また、GPUの利用率が20.4%から87.7%に上昇したことで、トレーニングにかかる時間も5.39倍短縮されました。





家
