Xiaomi MiMo,是小米首個推理大模型,聯動預訓練到後訓練,全面提升推理能力,於2025年4月30日開源。
MiMo來自全新成立不久的小米大模型Core團隊的初步嘗試。在數學推理(AIME 24-25)和代碼競賽(LiveCodeBench v5)公開測評集上,MiMo僅用7B的參數規模,超越了OpenAI的閉源推理模型o1-mini和阿里Qwen更大規模的開源推理模型QwQ-32B-Preview。
基本介紹
- 外文名:Xiaomi MiMo
- 所屬公司 :小米
- 開源時間:2025年4月30日
發展歷史
主要功能
- 預訓練:核心是讓模型見過更多推理模式
- 數據:著重挖掘富推理語料,併合成約200B tokens推理數據。
- 訓練:進行了三階段訓練,逐步提升訓練難度,總訓練25T tokens。
- 後訓練:核心是高效穩定的強化學習算法和框架
- 算法:提出 Test Difficulty Driven Reward 來緩解困難算法問題中的獎勵稀疏問題,並引入 Easy Data Re-Sampling 策略,以穩定 RL 訓練。
- 框架:設計了Seamless Rollout系統,使得RL訓練加速2.29倍,驗證加速1.96倍。





