选项
首页
快讯
内容
MatthewScott
MatthewScott
2026-09-24

腾讯幻元团队重新定义了大模型强化学习中的批量大小,以提升效率。通过重新校准关键批量大小并调整学习率,他们的方法优化了在线强化学习算法,如 PPO 和 GRPO。该方法解决了 rollout 生成与训练规模之间的不匹配问题,确保每个响应都能有效学习,而不会导致数据稀释。实际测试表明,在固定硬件上,PPO 的吞吐量提高了 2.29 倍,GRPO 的训练时间减少了 29%。这一策略使训练团队能够最大化 GPU 利用率,显著降低成本并加速模型开发,而无需更大的集群或更厚的数据。

评论 (0)
0/300
OR