Xiaomi-MiMo-Audio是小米公司於2025年9月19日發布的開源語音模型,採用原生端到端架構構建。該模型基於創新預訓練架構和上億小時訓練數據,首次在語音領域實現基於ICL的少樣本泛化能力,並在預訓練過程中觀察到"湧現"行為特徵。
該模型在7B參數級別的通用語音理解及對話評測基準中取得最優性能表現。其突破性成果包括:在MMAU音頻理解標準測試集上超過Google閉源模型Gemini-2.5-Flash,在Big Bench Audio S2T複雜推理任務中超越OpenAI閉源模型GPT-4o-Audio-Preview。
基本介紹
- 外文名:Xiaomi-MiMo-Audio
- 類型:語音模型
