選項
首頁
快訊
內容
RoyLopez
RoyLopez
2026-09-17

小米 MiMo 團隊透過實時訓練頁面公開披露了新大模型 MiMo-V2.6 的實時強化學習進展。該專案由前 DeepSeek 研究員羅福利領導,具備大規模多智慧體實驗與完全非同步並行特性。兩個版本的訓練成本超過 128 萬美元,總計耗時約 30 小時。這種透明化方式標誌著從黑盒試驗向開源工程的轉變,凸顯了小米在強化學習擴充套件定律和 AGI 探索方面的進展。

評論 (0)
0/300
OR