샤오미 MiMo 팀은 새로운 대형 모델 MiMo-V2.6에 대한 실시간 강화학습 진행 상황을 라이브 학습 페이지를 통해 공개했습니다. 전 DeepSeek 연구원인 Luo Fuli가 이끄는 이 프로젝트는 대규모 다작업 에이전트 실험과 완전한 비동기 병렬 처리를 특징으로 합니다. 두 버전의 학습 비용은 128만 달러를 초과했으며, 총 학습 시간도 약 30시간이 소요되었습니다. 이러한 투명한 접근 방식은 블랙박스 실험에서 오픈소스 엔지니어링으로의 전환을 의미하며, 샤오미의 RL 스케일링 법칙과 AGI 탐구에서의 진전을 강조합니다.





집
