Qwen3-8B

Qwen3-8B是阿里雲通義千問團隊開源的大型語言模型,屬於Qwen3系列六款Dense模型之一,採用Apache 2.0協定開源。該模型參數量為80億,支持魔搭社區、HuggingFace等平台下載及商用場景部署,部署最低配置需4張H20顯示卡(24GB顯存)。

模型原生支持32768 Token上下文長度,通過RoPE縮放技術可擴展至131072 Token,支持119種語言處理。技術特性包含Function Call解析、思考模式切換及API調用功能,提供SFT(全參/LoRA/QLoRA)、GRPO訓練方式。預訓練階段使用36萬億token多語言數據,後訓練經過知識強化、長上下文擴展等四階段最佳化流程。Qwen3-8B適配端側部署場景,可通過阿里雲百鍊平台實現10分鐘快速調用,支持對話系統、檢索增強生成(RAG)等套用。

基本介紹

  • 外文名:Qwen3-8B
  • 開發機構:阿里
發展歷史
2025年4月,阿里發布並開源Dense模型,其中包括Qwen3-8B。

熱門詞條

聯絡我們