Qwen3-4B

Qwen3-4B是阿里巴巴通義千問團隊於2025年4月28日發布的Qwen3系列開源語言模型,屬於密集架構(Dense)的40億參數模型,採用Apache 2.0協定開源。該模型屬於Qwen3系列,包含六個Dense模型及兩款MoE模型,部署時最低需1卡A10/GU30(24GB顯存),支持32768 Token上下文長度並通過RoPE縮放擴展至131072。

模型基於三階段預訓練流程構建,訓練數據規模達36萬億tokens,覆蓋119種語言。採用分組查詢注意力(GQA)、旋轉位置嵌入(RoPE)和預歸一化RMSNorm技術,移除QKV-bias並引入QK-Norm增強穩定性。支持動態切換快思考與慢思考混合推理模式,兼容Transformers、TensorRT-LLM(支持FP8/FP4量化)等框架。部署時通過連續批處理、分頁KV快取等技術實現BF16精度下最高16.04倍推理吞吐加速,適配PC終端及移動端設備。

2025年8月7日,阿里通義千問發布Qwen3-4B-Instruct-2507和Qwen3-4B-Thinking-2507。

基本介紹

  • 外文名:Qwen3-4B
  • 所屬:阿里巴巴通義千問系列模型
簡介,發展歷史,

簡介

通義千問3.0(Qwen3)系列模型在數學和編程等多個方面均可與DeepSeek媲美。與其他主流模型相比,Qwen3還顯著降低了部署成本。阿里表示,Qwen3無縫集成兩種思考模式,支持119種語言,便於Agent調用。
在非推理(non-thinking)領域,Qwen3-4B-Instruct-2507 顯著提升通用能力,目標成為更全能的端側利器。該模型掌握更多語言和長尾知識,上下文理解擴展至 256K,小模型也能處理長文本。該模型通用能力超越了閉源的小尺寸模型 GPT-4.1-nano,性能接近等規模的 Qwen3-30B-A3B(non-thinking)。在推理(thinking)領域,Qwen3-4B-Thinking-2507 大幅提升了推理能力,AIME25 高達 81.3 分。Qwen3-4B-Thinking-2507 的推理表現可媲美中等模型 Qwen3-30B-Thinking,在聚焦數學能力的 AIME25 測評中,以 4B 參數量斬獲 81.3 分的成績。

發展歷史

2025年4月28日,Qwen3-4B發布。
2025年8月7日,阿里通義千問發布Qwen3-4B-Instruct-2507和Qwen3-4B-Thinking-2507。

熱門詞條

聯絡我們