Qwen3-Omni是阿里巴巴通義千問團隊於2025年9月26日推出的原生端到端全模態大模型,通過混合單模態和跨模態數據預訓練實現文本、圖像、音頻、視頻的同步處理與流式輸出。
該模型基於MoE架構與Thinker-Talker設計,在36項音頻及音視頻基準測試中獲得32項開源SOTA與22項總體SOTA,語音識別能力超越Gemini-2.5-Pro等閉源模型,支持119種文本語言、19種語音輸入語言及10種語音輸出語言。其端到端音頻對話延遲壓縮至211ms,視頻對話延遲507ms,支持30分鐘長音頻處理和65536上下文長度。模型包含Qwen3-Omni-Flash和Qwen3-Omni-Turbo兩個版本,其中Flash版支持17種音色與流式語音生成。開源生態包括Qwen3-Omni-30B-A3B-Captioner通用音頻描述模型,可自動生成複雜音頻的精準描述。
2025年9月26日發布的Auto Omni汽車解決方案率先搭載該模型,基於高通驍龍8397晶片平台實現端側部署,未來可擴展至智慧型穿戴設備領域,支持用戶定製個性化對話角色。
基本介紹
- 外文名:Qwen3-Omni
- 發布時間:2025年9月26日
