盤古Ultra

盤古Ultra

盤古Ultra是華為旗下盤古系列AI大模型,包含135B參數密集模型與7180億參數混合專家(MoE)模型。其中密集模型基於純昇騰NPU集群訓練,採用94層架構設計,通過Depth-Scaled Sandwich-Norm和TinyInit初始化方法實現13.2T高質量數據的全流程無loss突刺訓練。MoE模型採用MLA架構與多專家負載均衡策略,支持128K長序列處理,訓練數據規模達19T tokens。

該密集模型在MMLU、TriviaQA等基準測試中超越Llama 405B和DeepSeek-V3,指令調優後在AIME 2024數學推理任務和LiveCodeBench編程任務達到SOTA水平,綜合性能超越GPT-4o。訓練使用8192張昇騰NPU集群,通過混合併行策略提升算力利用率至52%以上。MoE版本在昇騰CloudMatrix 384超節點實現41%預訓練MFU,採用Dropless訓練策略平衡效率與效果

基本介紹

  • 中文名:盤古Ultra
  • 所屬公司 :華為 
  • 類型:密集模型 
  • 模型大小:135B 
模型特點,

模型特點

盤古Ultra 是一個擁有 94 層架構、總參數量達 135B 的超大稠密模型。針對超深千億級大模型的訓練穩定性問題,研究團隊提出了新的穩定性架構和初始化方法,成功實現了在 13.2T 高質量數據上的全流程無 loss 突刺長穩訓練。同時,在系統實現層面,團隊通過一系列系統最佳化策略,在 8192 張昇騰 NPU 構建的大規模集群上將算力利用率(MFU)提升至 50%。
在預訓練階段模型的評測中,盤古Ultra在絕大部分英文基準任務和全部中文任務上取得了最佳性能,優於Llama 405B、DeepSeek-V3等baseline模型。
尤其在MMLU、TriviaQA、GSM8K等具有挑戰性的數據集上,盤古Ultra展現出了卓越的語言理解和推理能力。
盤古Ultra
盤古Ultra Base 測評結果
經過指令調優後,盤古Ultra的性能進一步提升,尤其在AIME 2024、MATH-500等數學推理任務和LiveCodeBench等編程競賽題上達到了SOTA水平。
綜合來看,盤古Ultra超越了包括GPT-4o、Mistral-Large 2等強大模型,與DeepSeek-R1等MoE模型競爭激烈。同時,盤古Ultra在Arena Hard、MMLU-pro等涵蓋通用語言理解和推理的評測中也表現優異。
盤古Ultra
在 Reasoning Benchmarks 上的表現

相關詞條

熱門詞條

聯絡我們