Maison
Tencent Hunyuan intègre la théorie de la taille des points clés dans l'apprentissage par renforcement PPO, augmentant le débit de 2,29 fois et réduisant le temps d'entraînement GRPO de 29 %.

À mesure que l’apprentissage par renforcement pour les grands modèles s’étend à des clusters GPU plus importants et à des ensembles d’entraînement plus denses, l’efficacité de l’entraînement est devenue une priorité critique. Des recherches récentes de l’équipe Tencent Huan Yuan abordent un défi souvent négligé : lorsque les modèles génèrent leurs propres données d’entraînement, comment les tailles de lot doivent-elles être redéfinies compte tenu des rythmes différents de génération des rollouts et d’entraînement ?
S’appuyant sur la théorie classique de la taille critique de lot, l’étude redéfinit ce concept pour l’apprentissage par renforcement en ligne des grands modèles de langage. Les résultats offrent une solution pratique : en ajustant le taux d’apprentissage dans une plage spécifique à mesure que la taille du lot augmente, les algorithmes GRPO et PPO peuvent garantir que chaque réponse apprend efficacement sans être diluée. Cela indique que la taille du lot n’est pas simplement « plus grande est mieux » ni une valeur fixe ; elle existe plutôt dans une plage optimale qui peut être affinée pour une efficacité maximale.
L’impact sur les coûts matériels réels est substantiel. Avec des configurations matérielles fixes, l’augmentation de la taille du lot peut améliorer le débit de génération PPO jusqu’à 2,29 fois. Parallèlement, la configuration GRPO optimale atteint les mêmes objectifs de validation en 29 % de temps en moins. Pour les équipes fortement investies dans les ressources GPU, cela se traduit soit par l’achèvement plus rapide des tâches avec le même cluster, soit par le traitement de davantage de données dans le même laps de temps, réduisant ainsi efficacement les coûts dans la phase la plus coûteuse de l’apprentissage par renforcement.
Cette recherche fournit un levier pratique pour l’échelle de l’apprentissage par renforcement en ligne, où le modèle sert à la fois d’élève et de concepteur de questions. L’écart d’efficacité provient du décalage entre les échelles de génération et d’entraînement, que cette étude comble en combinant la théorie de la taille critique de lot avec des ajustements du taux d’apprentissage. Alors que l’industrie se dispute la construction des modèles les plus grands, Tencent Huan Yuan se concentre sur l’optimisation du matériel existant pour une meilleure rentabilité.
Article connexe
Les startups de l'IA accélèrent leur croissance des revenus
Comme les entreprises établies et les nouvelles startups s’efforcent de tirer parti de l’intelligence artificielle, de nombreuses startups IA signalent que leurs revenus ne se contentent pas de croître, mais accélèrent rapidement, atteignant des jalo
Amjad Masad de Replit sur l’affaire Cursor, la lutte contre Apple et pourquoi il préfère ne pas vendre
Amjad Masad a passé la dernière décennie à construire Replit, mais les 18 derniers mois ont été une période transformatrice. La plateforme de codage par IA est passée de 2,8 millions de dollars de revenus annuels en 2024 à une trajectoire visant ce q
Les agents d'IA améliorent l'aquaculture des crevettes alors que le MIIT émet un avertissement et que Rockchip répond
La conversation au sein de la communauté de l'IA a évolué des « entraînements de grands modèles » vers l'« élevage de homards ». Si vous voyez des personnes sur les réseaux sociaux discuter de l'alimentation en données et du réglage des paramètres d'
Recommandations de sujets spéciaux liés
commentaires (0)

À mesure que l’apprentissage par renforcement pour les grands modèles s’étend à des clusters GPU plus importants et à des ensembles d’entraînement plus denses, l’efficacité de l’entraînement est devenue une priorité critique. Des recherches récentes de l’équipe Tencent Huan Yuan abordent un défi souvent négligé : lorsque les modèles génèrent leurs propres données d’entraînement, comment les tailles de lot doivent-elles être redéfinies compte tenu des rythmes différents de génération des rollouts et d’entraînement ?
S’appuyant sur la théorie classique de la taille critique de lot, l’étude redéfinit ce concept pour l’apprentissage par renforcement en ligne des grands modèles de langage. Les résultats offrent une solution pratique : en ajustant le taux d’apprentissage dans une plage spécifique à mesure que la taille du lot augmente, les algorithmes GRPO et PPO peuvent garantir que chaque réponse apprend efficacement sans être diluée. Cela indique que la taille du lot n’est pas simplement « plus grande est mieux » ni une valeur fixe ; elle existe plutôt dans une plage optimale qui peut être affinée pour une efficacité maximale.
L’impact sur les coûts matériels réels est substantiel. Avec des configurations matérielles fixes, l’augmentation de la taille du lot peut améliorer le débit de génération PPO jusqu’à 2,29 fois. Parallèlement, la configuration GRPO optimale atteint les mêmes objectifs de validation en 29 % de temps en moins. Pour les équipes fortement investies dans les ressources GPU, cela se traduit soit par l’achèvement plus rapide des tâches avec le même cluster, soit par le traitement de davantage de données dans le même laps de temps, réduisant ainsi efficacement les coûts dans la phase la plus coûteuse de l’apprentissage par renforcement.
Cette recherche fournit un levier pratique pour l’échelle de l’apprentissage par renforcement en ligne, où le modèle sert à la fois d’élève et de concepteur de questions. L’écart d’efficacité provient du décalage entre les échelles de génération et d’entraînement, que cette étude comble en combinant la théorie de la taille critique de lot avec des ajustements du taux d’apprentissage. Alors que l’industrie se dispute la construction des modèles les plus grands, Tencent Huan Yuan se concentre sur l’optimisation du matériel existant pour une meilleure rentabilité.
Les startups de l'IA accélèrent leur croissance des revenus
Comme les entreprises établies et les nouvelles startups s’efforcent de tirer parti de l’intelligence artificielle, de nombreuses startups IA signalent que leurs revenus ne se contentent pas de croître, mais accélèrent rapidement, atteignant des jalo
Amjad Masad de Replit sur l’affaire Cursor, la lutte contre Apple et pourquoi il préfère ne pas vendre
Amjad Masad a passé la dernière décennie à construire Replit, mais les 18 derniers mois ont été une période transformatrice. La plateforme de codage par IA est passée de 2,8 millions de dollars de revenus annuels en 2024 à une trajectoire visant ce q
Les agents d'IA améliorent l'aquaculture des crevettes alors que le MIIT émet un avertissement et que Rockchip répond
La conversation au sein de la communauté de l'IA a évolué des « entraînements de grands modèles » vers l'« élevage de homards ». Si vous voyez des personnes sur les réseaux sociaux discuter de l'alimentation en données et du réglage des paramètres d'











