Tencent Huan Yuan チームは、大規模モデルの強化学習におけるバッチサイズを再定義し、効率性を向上させた。重要なバッチサイズを再調整し、学習率を最適化することで、PPO や GRPO などのオンライン強化学習アルゴリズムを最適化する。この手法は、ロールアウト生成とトレーニングスケールの間の不一致を解消し、データ希釈化を防ぎながら各応答が効果的に学習することを保証する。実環境でのテストでは、固定ハードウェア上で PPO のスループットが 2.29 倍に増加し、GRPO の所要時間が 29% 短縮された。この戦略により、トレーニングチームは GPU の利用率を最大化でき、より大規模なクラスターや厚いデータセットを必要とせずに、コストを大幅に削減し、モデル開発を加速できる。