Qwen3-Next

Qwen3-Next

Qwen3-Next是阿里雲通義團隊於2025年9月12日發布的下一代大模型基礎架構,針對長上下文與大參數規模最佳化,通過混合注意力機制(75%線性注意力與25%原創門控注意力的混合機制)、512專家路由的3B激活超稀疏MoE結構(包含10路由專家與1共享專家)和多token預測機制等核心改進,實現訓練成本較Qwen3-32B降低90%以上,32k以上上下文推理吞吐量提升十倍以上。

該架構總參數規模達800億,每次推理僅激活約30億參數,採用基於Gated DeltaNet的線性注意力結合門控注意力機制,實現記憶體占用最佳化與長上下文處理能力提升。

2025年9月,阿里雲基於該架構在雲棲大會上開源Qwen3-Next-80B-A3B系列模型,包含Base、Instruct和Thinking三個版本。Base模型採用15T tokens預訓練數據集,GPU資源消耗僅為Qwen3-32B的9.3%,在編程(LiveCodeBench v6)、數學推理(AIME25)等任務中性能接近或超越Qwen3-32B密集模型。Instruct模型支持256K上下文處理,在人類偏好對齊(Arena-Hard v2)、綜合性能力(LiveBench)評測中表現超過Qwen3-235B-A22B-Instruct-2507;Thinking模型在複雜推理任務中數學推理AIME25評測獲87.8分,超越Gemini-2.5-Flash-Thinking。該系列通過魔搭社區和HuggingFace開源,原生支持Transformers、SGLang等部署框架。

基本介紹

  • 外文名:Qwen3-Next
  • 所屬行業:大模型
發展歷史,模型架構,

發展歷史

2025年9月12日,阿里雲通義團隊在雲棲大會上發布下一代基礎模型架構Qwen3-Next,並開源基於該架構的Qwen3-Next-80B-A3B系列模型,包含Base、Instruct和Thinking三個版本。該系列通過魔搭社區和HuggingFace開源,原生支持Transformers、SGLang等部署框架。
2025年11月27日,阿里通義千問團隊憑藉Qwen3-Next中套用的注意力門控研究成果榮獲NeurIPS 2025最佳論文獎,該技術顯著提升模型性能與魯棒性。

模型架構

該結構相比 Qwen3 的 MoE 模型結構,進行了以下核心改進:混合注意力機制、高稀疏度 MoE 結構、一系列訓練穩定友好的最佳化,以及提升推理效率的多 token 預測機制。
基於 Qwen3-Next 的模型結構,通義團隊訓練了 Qwen3-Next-80B-A3B-Base 模型,該模型擁有 800 億參數(僅激活 30 億參數)、3B 激活的超稀疏MoE架構(512 專家,路由 10 個 + 1 共享),結合 Hybrid Attention(Gated DeltaNet + Gated Attention)與多 Token 預測(MTP)。其中Gated Attention技術通過注意力頭門控機制降低首token注意力占比和激活值幅度,有效緩解注意力池現象與激活值異常問題。

相關詞條

熱門詞條

聯絡我們