Qwen-Audio

Qwen-Audio是阿里雲於2023年12月推出的通義千問系列多模態開源模型,作為國內首個開源的通用音頻理解大模型。該模型支持人類語音、自然音、音樂、歌聲等多元音頻輸入,具備音頻轉錄、語義理解、情感分析、音頻事件檢測及語音聊天等多任務處理能力,在Aishell1、cochlscene、ClothoAQA和VocalSound等測試集上達到業界領先水平。其創新性多任務訓練框架可同時支持超過30種任務,通過知識共享避免一對多干擾。基於該模型,阿里雲後續開發了支持多輪對話的Qwen-Audio-Chat,並於2025年推出升級版Qwen2-Audio。

基本介紹

  • 模型類型:音頻語言大模型
  • 發布時間:2023年12月1日  
  • 支持任務:≥30項 
  • 輸入類型:音頻/文本混合  
  • 部署實例:AMD ecs.g8a.4xlarge 
  • 免費額度:10萬Token/180天(截至2025年5月) 
技術特點,套用場景,開源進展,計費規則,

技術特點

  • 採用大規模音頻語言模型架構,具備720億參數規模
  • 首創多任務訓練框架,解決文本標籤異構性問題,支持知識共享機制
  • 音頻輸入處理能力達每秒25 Token
  • 支持中、英、法等8種語言及方言(截至2025年3月)

套用場景

  • 音頻理解:可識別人聲、動物聲、音樂聲等九類聲學信號
  • 內容創作:支持基於音頻的文學創作、故事續寫任務
  • 工業部署:適配AMD CPU實例穩定運行,提供WebUI服務接口
  • 科研套用:開源模型支持企業級、科研級高性能套用

開源進展

2023年12月首次開源即實現"全尺寸、全模態"布局,涵蓋18億至720億參數模型。2024年9月發布部署指南,2025年3月推出增強版Qwen2-Audio,其音頻理解能力提升併入選ACL 2024國際頂會。配套開源的還有ASR專用Beta版,專注提高語音識別準確率。

計費規則

穩定版qwen-audio-turbo提供:
  • 上下文長度8,000 Token
  • 最大輸入6,000 Token
  • 最大輸出1,500 Token
  • 免費體驗額度包含輸入/輸出各10萬Token

相關詞條

熱門詞條

聯絡我們