option
Maison
Flash info
Contenu
RoyLopez
RoyLopez
17 septembre 2026

L’équipe Xiaomi MiMo a rendu public les progrès en temps réel de l’apprentissage par renforcement pour son nouveau grand modèle MiMo-V2.6 via une page d’entraînement en direct. Dirigé par l’ancien chercheur de DeepSeek Luo Fuli, le projet comprend des expériences à grande échelle sur des agents multi-tâches avec une parallélisation entièrement asynchrone. Le coût d’entraînement pour les deux versions a dépassé 1,28 million de dollars, prenant environ 30 heures au total. Cette approche transparente marque un changement des essais en boîte noire vers l’ingénierie open-source, mettant en avant les avancées de Xiaomi dans les lois d’échelle de l’apprentissage par renforcement et l’exploration de l’AGI.

commentaires (0)
0/300
OR