盤古Ultra是華為旗下盤古系列AI大模型,包含135B參數密集模型與7180億參數混合專家(MoE)模型。其中密集模型基於純昇騰NPU集群訓練,採用94層架構設計,通過Depth-Scaled Sandwich-Norm和TinyInit初始化方法實現13.2T高質量數據的全流程無loss突刺訓練。MoE模型採用MLA架構與多專家負載均衡策略,支持128K長序列處理,訓練數據規模達19T tokens。
該密集模型在MMLU、TriviaQA等基準測試中超越Llama 405B和DeepSeek-V3,指令調優後在AIME 2024數學推理任務和LiveCodeBench編程任務達到SOTA水平,綜合性能超越GPT-4o。訓練使用8192張昇騰NPU集群,通過混合併行策略提升算力利用率至52%以上。MoE版本在昇騰CloudMatrix 384超節點實現41%預訓練MFU,採用Dropless訓練策略平衡效率與效果
基本介紹
- 中文名:盤古Ultra
- 所屬公司 :華為
- 類型:密集模型
- 模型大小:135B



