Qwen3-32B

Qwen3-32B

Qwen3-32B是阿里巴巴通義千問團隊開發的稠密(Dense)結構大語言模型,屬於Qwen3系列六款Dense模型之一,於2025年4月29日發布並通過Apache 2.0協定開源。該模型含320億參數,支持119種語言和32768token上下文長度,採用包含GQA、SwiGLU、RoPE等技術改進的架構,支持全參/LoRA/QLoRA微調和GRPO訓練。

模型具備混合推理能力,可通過“思考模式”與“非思考模式”動態調整算力消耗,集成四階段訓練流程(長思維鏈冷啟動/強化學習/模式融合/通用強化學習)。其顯存占用為同類模型的1/3,最低部署配置需1塊昇騰Atlas800系列GPU,支持通過TensorRT、vLLM等框架進行生產級部署。在AIME25測評中獲得81.5分,LiveCodeBench代碼能力突破70分,適配魔搭社區、HuggingFace等開源平台及阿里雲百鍊API服務。

基本介紹

  • 中文名:Qwen3-32B
  • 所屬:阿里巴巴通義千問
簡介,發展歷史,

簡介

阿里巴巴旗下Dense模型。

發展歷史

2025年4月28日,Qwen3-32B發布。

相關詞條

熱門詞條

聯絡我們