Xiaomi-MiMo-Audio

Xiaomi-MiMo-Audio是小米公司於2025年9月19日發布的開源語音模型,採用原生端到端架構構建。該模型基於創新預訓練架構和上億小時訓練數據,首次在語音領域實現基於ICL的少樣本泛化能力,並在預訓練過程中觀察到"湧現"行為特徵。

該模型在7B參數級別的通用語音理解及對話評測基準中取得最優性能表現。其突破性成果包括:在MMAU音頻理解標準測試集上超過Google閉源模型Gemini-2.5-Flash,在Big Bench Audio S2T複雜推理任務中超越OpenAI閉源模型GPT-4o-Audio-Preview。

基本介紹

  • 外文名:Xiaomi-MiMo-Audio
  • 類型:語音模型
發展歷史,性能參數,

發展歷史

2025年9月19日,小米正式開源首個原生端到端語音模型——Xiaomi-MiMo-Audio。它基於創新預訓練架構和上億小時訓練數據,首次在語音領域實現基於ICL的少樣本泛化,並在預訓練觀察到明顯的“湧現”行為。

性能參數

在通用語音理解及對話等多項標準評測基準中,MiMo-Audio大幅超越了同參數量的開源模型,取得7B最佳性能;在音頻理解基準MMAU的標準測試集上,MiMo-Audio超過Google閉源語音模型Gemini-2.5-Flash;在面向音頻複雜推理的基準Big Bench Audio S2T任務中,MiMo-Audio同樣超越了OpenAI閉源的語音模型GPT-4o-Audio-Preview。

相關詞條

熱門詞條

聯絡我們