option
Maison
Flash info
Contenu
MatthewScott
MatthewScott
24 septembre 2026

L’équipe Tencent Huan Yuan redéfinit la taille de lot pour l’apprentissage par renforcement des grands modèles afin d’en améliorer l’efficacité. En recalibrant la taille critique de lot et en ajustant les taux d’apprentissage, leur approche optimise les algorithmes RL en ligne tels que PPO et GRPO. Cette méthode résout les incohérences entre les échelles de génération des rollouts et d’entraînement, garantissant que chaque réponse apprend efficacement sans dilution des données. Des tests en conditions réelles montrent une augmentation du débit de 2,29 fois pour PPO et une réduction de 29 % du temps pour GRPO sur un matériel fixe. Cette stratégie permet aux équipes d’entraînement de maximiser l’utilisation des GPU, réduisant significativement les coûts et accélérant le développement des modèles sans nécessiter de grappes plus importantes ni de données plus denses.

commentaires (0)
0/300
OR