選項
首頁
快訊
內容
MatthewScott
MatthewScott
2026-09-24

騰訊幻元團隊重新定義了大模型強化學習中的批次大小,以提升效率。透過重新校準關鍵批次大小並調整學習率,他們的方法最佳化了線上強化學習演算法,如 PPO 和 GRPO。該方法解決了 rollout 生成與訓練規模之間的不匹配問題,確保每個響應都能有效學習,而不會導致資料稀釋。實際測試表明,在固定硬體上,PPO 的吞吐量提高了 2.29 倍,GRPO 的訓練時間減少了 29%。這一策略使訓練團隊能夠最大化 GPU 利用率,顯著降低成本並加速模型開發,而無需更大的叢集或更厚的資料。

評論 (0)
0/300
OR