Speech-02

Speech-02

Speech-02是MiniMax公司研發的語音大模型,具備文生音、聲音參考兩大核心功能,支持粵語、法語等32種語言的無縫切換。2025年5月20日,該模型在Artificial Analysis和Hugging Face TTS Arena兩項國際評測中超越OpenAI、ElevenLabs等產品,登頂雙榜榜首。

模型採用AR Transformer與Flow-VAE組合架構提升語音生成質量。支持語音情感、語速、音高及語種的實時控制,字錯率(WER)較ElevenLabs降低30%,語音相似度(SIM)接近真人水平。可套用於智慧型客服、遊戲NPC動態語音生成等場景。

Speech-02於2025年5月正式發布,其前代產品Speech-01支持17種語言並已於2023年推出。商用定價為ElevenLabs同類產品的四分之一,已與閱文集團、高途教育等企業合作,套用於教育學習機、汽車智慧型座艙等硬體場景。MiniMax通過港交所上市聆訊。

基本介紹

  • 外文名:Speech-02
  • 類型:語音大模型
  • 發布時間:2025年5月
  • 研發公司:MiniMax公司
發展歷史,功能介紹,商業套用,技術架構,

發展歷史

2023年,MiniMax推出國內首個基於Transformer架構的語音大模型Speech 01。2024年,MiniMax升級了Speech 02,綜合性能躍居全球第一,力壓OpenAI、ElevenLabs等國際巨頭。2025年5月20日訊息,MiniMax發布的新一代語音大模型Speech-02,在國際最權威的兩項語音評測榜單Artificial Analysis和Hugging Face TTS Arena 上,力壓OpenAI、ElevenLabs等國際巨頭,榮登雙榜榜首。

功能介紹

基於超強技術與足夠泛化的模型能力,Speech-02為用戶帶來超擬人、個性化、多樣性的語音服務。Speech-02通過“文生音”功能給定自然語言文本描述生成符合描述的音色;通過“聲音參考”功能,對任意給定語音實現靈活控制,進行感情、語速、音高、語種等無縫切換;同時支持粵語、葡萄牙語、法語等32個語種,甚至在同一段語音里也可以實現多個語種間的自如切換。

商業套用

支撐ChatGPT高級語音模式的 LiveKit、GitHub 熱門開源框架 Pipecat、YC 孵化的語音平台 Vapi,都選擇 MiniMax Speech 作為底層技術引擎。智慧型硬體領域,Haivivi、Bubble Pal、Rokid Glasses等新銳產品,也靠它實現自然語音互動體驗。截至目前,MiniMax 語音模型已幫助用戶生成超過 2.2 億小時的語音,成為全球 Top 2 大規模商用的語音大模型。

技術架構

Speech-02採用AR Transformer與Flow-VAE組合架構提升語音生成質量。支持語音情感、語速、音高及語種的實時控制,字錯率(WER)較ElevenLabs降低30%,語音相似度(SIM)接近真人水平。

相關詞條

熱門詞條

聯絡我們