텐센트 환위안 팀은 대규모 모델 강화학습을 위한 배치 크기를 재정의하여 효율성을 높였습니다. 핵심 배치 크기를 재조정하고 학습률을 조정함으로써, 그들의 접근 방식은 PPO와 GRPO와 같은 온라인 RL 알고리즘을 최적화합니다. 이 방법은 롤아웃 생성과 학습 규모 간의 불일치를 해결하여, 각 응답이 데이터 희석 없이 효과적으로 학습할 수 있도록 보장합니다. 실제 테스트 결과, 고정된 하드웨어에서 PPO의 처리량이 2.29배 증가하고 GRPO의 소요 시간이 29% 단축되었습니다. 이 전략은 학습 팀이 GPU 활용을 극대화하여 더 큰 클러스터나 더 많은 데이터 없이도 비용을 크게 절감하고 모델 개발을 가속화할 수 있도록 합니다.





집
