Lar
O Tencent Hunyuan integra a teoria do tamanho de pontos críticos no aprendizado por reforço PPO, aumentando o throughput em 2,29 vezes e reduzindo o tempo de treinamento do GRPO em 29 por cento

À medida que o aprendizado por reforço para grandes modelos escala para clusters de GPU maiores e conjuntos de dados de treinamento mais densos, a eficiência do treinamento tornou-se uma prioridade crítica. Pesquisas recentes da equipe Tencent Huan Yuan abordam um desafio frequentemente negligenciado: quando os modelos geram seus próprios dados de treinamento, como os tamanhos de lote devem ser redefinidos considerando os ritmos diferentes da geração de rollout e do treinamento?
Com base na teoria clássica do tamanho crítico de lote, o estudo re-deriva este conceito para o aprendizado por reforço de grandes modelos de linguagem online. Os resultados oferecem uma solução prática: ao ajustar a taxa de aprendizado dentro de uma faixa específica à medida que o tamanho do lote aumenta, tanto os algoritmos GRPO quanto PPO podem garantir que cada resposta aprenda de forma eficaz sem ser diluída. Isso indica que o tamanho do lote não é simplesmente "quanto maior, melhor" nem um valor fixo; em vez disso, ele existe dentro de uma faixa ótima que pode ser ajustada para máxima eficiência.
O impacto nos custos reais de hardware é substancial. Com configurações de hardware fixas, o aumento do tamanho do lote pode aumentar a taxa de geração do PPO em até 2,29 vezes. Enquanto isso, a configuração GRPO ideal alcança os mesmos objetivos de validação em 29% menos tempo. Para equipes que investem pesadamente em recursos de GPU, isso se traduz em concluir tarefas mais rapidamente com o mesmo cluster ou processar mais dados dentro do mesmo período, reduzindo efetivamente os custos na fase mais cara do aprendizado por reforço.
Esta pesquisa fornece uma alavanca prática para escalar o RL online, onde o modelo serve tanto como aluno quanto como criador de perguntas. A lacuna de eficiência surge do descompasso entre as escalas de geração e treinamento, que este estudo supera combinando a teoria do tamanho crítico de lote com ajustes na taxa de aprendizado. Enquanto a indústria compete para construir os maiores modelos, a Tencent Huan Yuan está focada em otimizar o hardware existente para maior custo-benefício.
Artigo relacionado
As startups de IA aceleram o crescimento da receita
Conforme as empresas estabelecidas e as novas startups se esforçam para aproveitar a inteligência artificial, inúmeras startups de IA relatam que sua receita não está apenas crescendo, mas acelerando rapidamente, alcançando marcos subsequentes em per
Amjad Masad, da Replit, sobre o acordo com a Cursor, a disputa com a Apple e por que ele prefere não vender
Amjad Masad dedicou a última década a construir a Replit, mas os últimos 18 meses foram um período transformador. A plataforma de codificação por IA cresceu de US$ 2,8 milhões em receita anual em 2024 para uma trajetória rumo ao que Masad descreve co
Agentes de IA Aumentam a Produção de Camarão enquanto o MIIT Emite Alerta e a Rockchip Responde
A conversa na comunidade de IA mudou de "treinar grandes modelos" para "criar lagostas". Se você ver alguém nas redes sociais discutindo como alimentar dados e ajustar parâmetros para uma "lagosta", não se confunda — eles não estão criando criaturas
Recomendações de tópicos especiais relacionados
Comentários (0)

À medida que o aprendizado por reforço para grandes modelos escala para clusters de GPU maiores e conjuntos de dados de treinamento mais densos, a eficiência do treinamento tornou-se uma prioridade crítica. Pesquisas recentes da equipe Tencent Huan Yuan abordam um desafio frequentemente negligenciado: quando os modelos geram seus próprios dados de treinamento, como os tamanhos de lote devem ser redefinidos considerando os ritmos diferentes da geração de rollout e do treinamento?
Com base na teoria clássica do tamanho crítico de lote, o estudo re-deriva este conceito para o aprendizado por reforço de grandes modelos de linguagem online. Os resultados oferecem uma solução prática: ao ajustar a taxa de aprendizado dentro de uma faixa específica à medida que o tamanho do lote aumenta, tanto os algoritmos GRPO quanto PPO podem garantir que cada resposta aprenda de forma eficaz sem ser diluída. Isso indica que o tamanho do lote não é simplesmente "quanto maior, melhor" nem um valor fixo; em vez disso, ele existe dentro de uma faixa ótima que pode ser ajustada para máxima eficiência.
O impacto nos custos reais de hardware é substancial. Com configurações de hardware fixas, o aumento do tamanho do lote pode aumentar a taxa de geração do PPO em até 2,29 vezes. Enquanto isso, a configuração GRPO ideal alcança os mesmos objetivos de validação em 29% menos tempo. Para equipes que investem pesadamente em recursos de GPU, isso se traduz em concluir tarefas mais rapidamente com o mesmo cluster ou processar mais dados dentro do mesmo período, reduzindo efetivamente os custos na fase mais cara do aprendizado por reforço.
Esta pesquisa fornece uma alavanca prática para escalar o RL online, onde o modelo serve tanto como aluno quanto como criador de perguntas. A lacuna de eficiência surge do descompasso entre as escalas de geração e treinamento, que este estudo supera combinando a teoria do tamanho crítico de lote com ajustes na taxa de aprendizado. Enquanto a indústria compete para construir os maiores modelos, a Tencent Huan Yuan está focada em otimizar o hardware existente para maior custo-benefício.
As startups de IA aceleram o crescimento da receita
Conforme as empresas estabelecidas e as novas startups se esforçam para aproveitar a inteligência artificial, inúmeras startups de IA relatam que sua receita não está apenas crescendo, mas acelerando rapidamente, alcançando marcos subsequentes em per
Amjad Masad, da Replit, sobre o acordo com a Cursor, a disputa com a Apple e por que ele prefere não vender
Amjad Masad dedicou a última década a construir a Replit, mas os últimos 18 meses foram um período transformador. A plataforma de codificação por IA cresceu de US$ 2,8 milhões em receita anual em 2024 para uma trajetória rumo ao que Masad descreve co
Agentes de IA Aumentam a Produção de Camarão enquanto o MIIT Emite Alerta e a Rockchip Responde
A conversa na comunidade de IA mudou de "treinar grandes modelos" para "criar lagostas". Se você ver alguém nas redes sociais discutindo como alimentar dados e ajustar parâmetros para uma "lagosta", não se confunda — eles não estão criando criaturas











