opción
Hogar
Última hora
Contenido
RoyLopez
RoyLopez
17 de septiembre de 2026

El equipo de Xiaomi MiMo revela públicamente el progreso del aprendizaje por refuerzo en tiempo real para su nuevo modelo grande MiMo-V2.6 a través de una página de entrenamiento en vivo. Liderado por el ex investigador de DeepSeek Luo Fuli, el proyecto presenta experimentos a gran escala con agentes de múltiples tareas y paralelismo completamente asíncrono. El costo de entrenamiento para dos versiones superó los 1,28 millones de dólares, tomando aproximadamente 30 horas en total. Este enfoque transparente marca un cambio desde los ensayos de caja negra hacia la ingeniería de código abierto, destacando los avances de Xiaomi en las leyes de escalado del aprendizaje por refuerzo y la exploración de la inteligencia artificial general (AGI).

comentario (0)
0/300
OR