opção
RoyLopez
RoyLopez
17 de Setembro de 2026

A equipe Xiaomi MiMo revelou publicamente o progresso do aprendizado por reforço em tempo real para seu novo grande modelo MiMo-V2.6 por meio de uma página de treinamento ao vivo. Liderado pelo ex-pesquisador do DeepSeek, Luo Fuli, o projeto apresenta experimentos de agentes multi-tarefa em larga escala com paralelismo totalmente assíncrono. O custo de treinamento para as duas versões ultrapassou US$ 1,28 milhão, levando aproximadamente 30 horas combinadas. Esta abordagem transparente marca uma mudança de testes de caixa preta para engenharia de código aberto, destacando os avanços da Xiaomi nas leis de escalonamento de RL e na exploração de AGI.

Comentários (0)
0/300
OR