根據東查比定的監測, 小米大型模型團隊負責人羅福麗在她的首次深入訪談中透露,MiMo-V2-Pro模型基礎具有總參數量為1T,利用數千個GPU進行訓練。她認為1T的規模是實現接近Claude Opus 4.6性能並進入下一階段代理競爭的基線。在技術層面上,Pro版本將全局注意力與滑動窗口注意力的比例推向極端稀疏比例7:1,控制長文本推理成本,同時擴大參數數量,並繼續使用MTP (多標記預測)架構,利用過剩的計算能力加速推理。在管理方面,只有約30到40名MiMo團隊成員直接參與核心迭代,沒有建立明確的職級、團隊劃分或交付截止日期。遇到訓練損失突變等不穩定數值問題時,團隊選擇停止訓練進行排查,即使意味著停工一兩週並產生數百萬的計算成本。
小米揭示1T模型MiMo-V2-Pro的訓練細節:使用數千個GPU,無工作層級或截止日期