Speech-02是MiniMax公司研發的語音大模型,具備文生音、聲音參考兩大核心功能,支持粵語、法語等32種語言的無縫切換。2025年5月20日,該模型在Artificial Analysis和Hugging Face TTS Arena兩項國際評測中超越OpenAI、ElevenLabs等產品,登頂雙榜榜首。
模型採用AR Transformer與Flow-VAE組合架構提升語音生成質量。支持語音情感、語速、音高及語種的實時控制,字錯率(WER)較ElevenLabs降低30%,語音相似度(SIM)接近真人水平。可套用於智慧型客服、遊戲NPC動態語音生成等場景。
Speech-02於2025年5月正式發布,其前代產品Speech-01支持17種語言並已於2023年推出。商用定價為ElevenLabs同類產品的四分之一,已與閱文集團、高途教育等企業合作,套用於教育學習機、汽車智慧型座艙等硬體場景。MiniMax通過港交所上市聆訊。
基本介紹
- 外文名:Speech-02
- 類型:語音大模型
- 發布時間:2025年5月
- 研發公司:MiniMax公司

