混元Large

混元Large是騰訊開發的基於混合專家架構(MoE)的大語言模型,於2024年11月5日正式開源。該模型總參數量達3890億,激活參數量為520億,支持256K上下文長度,在CMMLU、MMLU、CEval等9項公開評測中綜合表現超過Llama3.1、Mixtral等國際開源模型。通過隨機補償路由策略與KV Cache壓縮技術最佳化訓練穩定性,結合合成數據構建與長文本處理能力增強,模型在數學邏輯、代碼生成等任務中展現顯著優勢。目前已通過騰訊元寶AI助手等近700個業務場景驗證,並提供HuggingFace、GitHub等開源平台免費商用。

基本介紹

  • 發布時間:2024年11月5日
  • 總參數量:3890億 
  • 激活參數:52億 
  • 上下文長度:256K tokens 
  • 評測表現:9項維度領先 
  • 開源平台:HuggingFace/GitHub
技術架構,訓練最佳化,性能評測,開源與套用,

技術架構

混元Large採用混合專家模型(MoE)架構,包含16個路由專家與共享專家模組,通過隨機補償路由策略將滿負載專家丟棄的token隨機分配至冗餘專家,提升模型訓練穩定性。在注意力機制中創新性使用Grouped-Query Attention與Cross-Layer Attention組合,通過KV Cache壓縮使記憶體占用降至標準多頭注意力(MHA)的5%,推理顯存減少50%以上。模型支持動態載入專家權重,結合專家特化學習率適配技術,實現不同領域知識的差異化學習。

訓練最佳化

預訓練階段構建覆蓋數學推導、代碼生成等數十類目的中英文合成數據集,通過自動化數據鏈路提升數學與代碼能力超10%。針對長文本處理需求,開發企鵝捲軸(PenguinScrolls)評測數據集,涵蓋閱讀理解、摘要生成等任務,單次可處理相當於《三國演義》全書長度的文本。基於AngelPTM訓練框架實現通信效率最佳化,相比主流框架DeepSpeed提升2.6倍訓練速度。

性能評測

截至2024年11月公開評測數據顯示,混元Large在CMMLU(中文理解)、MMLU(多學科推理)、CEval(綜合評估)、MATH(數學能力)等9項核心指標中,綜合得分超越DeepSeek-V2、Llama3.1-70B等同類模型。其中代碼生成任務達到HumanEval基準的76.8分,長文本處理支持256K上下文長度。在騰訊內部業務測試中,廣告文案生成準確率提升34%,元寶AI助手文檔解析效率提高28%。

開源與套用

模型通過HuggingFace、GitHub平台提供Apache 2.0協定開源版本,支持商業場景免費使用。騰訊雲TI平台集成線上精調功能,基於AngelPTM訓練框架實現2.6倍推理吞吐量提升,配套HAI服務支持私有化部署。實際套用覆蓋智慧型客服、代碼輔助、廣告創意生成等場景,已在微信讀書、騰訊廣告等業務實現規模化落地。2025年2月更新版本支持256K上下文長度,進一步適配多輪對話需求。

相關詞條

熱門詞條

聯絡我們