技術架構
混元Large採用
混合專家模型(MoE)架構,包含16個路由專家與共享專家模組,通過隨機補償路由策略將滿負載專家丟棄的token隨機分配至冗餘專家,提升模型訓練穩定性。在注意力機制中創新性使用Grouped-Query Attention與Cross-Layer Attention組合,通過KV Cache壓縮使記憶體占用降至標準多頭注意力(MHA)的5%,推理顯存減少50%以上。模型支持動態載入專家權重,結合專家特化學習率適配技術,實現不同領域知識的差異化學習。
訓練最佳化
預訓練階段構建覆蓋數學推導、
代碼生成等數十類目的中英文合成數據集,通過自動化數據鏈路提升數學與代碼能力超10%。針對長文本處理需求,開發企鵝捲軸(PenguinScrolls)評測數據集,涵蓋閱讀理解、摘要生成等任務,單次可處理相當於《三國演義》全書長度的文本。基於AngelPTM訓練框架實現通信效率最佳化,相比主流框架
DeepSpeed提升2.6倍訓練速度。
性能評測
截至2024年11月公開評測數據顯示,混元Large在CMMLU(中文理解)、MMLU(多學科推理)、CEval(綜合評估)、MATH(數學能力)等9項核心指標中,綜合得分超越
DeepSeek-V2、Llama3.1-70B等同類模型。其中代碼生成任務達到HumanEval基準的76.8分,長文本處理支持256K上下文長度。在騰訊內部業務測試中,廣告文案生成準確率提升34%,元寶AI助手文檔解析效率提高28%。
開源與套用
模型通過HuggingFace、GitHub平台提供Apache 2.0協定開源版本,支持商業場景免費使用。騰訊雲TI平台集成線上精調功能,基於AngelPTM訓練框架實現2.6倍推理吞吐量提升,配套
HAI服務支持私有化部署。實際套用覆蓋智慧型客服、代碼輔助、廣告創意生成等場景,已在
微信讀書、
騰訊廣告等業務實現規模化落地。2025年2月更新版本支持256K上下文長度,進一步適配多輪對話需求。