选项
首页
快讯
内容
RoyLopez
RoyLopez
2026-09-17

小米 MiMo 团队通过实时训练页面公开披露了新大模型 MiMo-V2.6 的实时强化学习进展。该项目由前 DeepSeek 研究员罗福利领导,具备大规模多智能体实验与完全异步并行特性。两个版本的训练成本超过 128 万美元,总计耗时约 30 小时。这种透明化方式标志着从黑盒试验向开源工程的转变,凸显了小米在强化学习扩展定律和 AGI 探索方面的进展。

评论 (0)
0/300
OR