KUAE

KUAE是由摩爾執行緒研發的全國產千卡千億模型訓練平台,於2023年12月19日正式揭牌運行。該平台以全功能GPU為硬體底座,內置數千張MTT S4000智算加速卡,支持700億至1300億參數規模的大模型訓練與推理任務。通過MTLink 1.0技術實現多卡互聯,單卡提供48GB顯存和768GB/s頻寬,整體集群可輸出300P算力。

2024年4月,摩爾執行緒與無問芯穹達成戰略合作,基於KUAE平台實現LLama2-70B大模型的訓練測試。同年5月完成3B規模大模型實訓,千卡擴展效率超90%,訓練穩定性達100%。平台採用軟硬一體化交付模式,融合分散式框架最佳化與CUDA代碼遷移技術,形成從硬體集群到套用服務的完整解決方案。

基本介紹

  • 所屬公司:摩爾執行緒
  • 發布時間:2023年12月19日
  • 硬體底座:MTT S4000 GPU集群 
  • 參數支持:700-1300億 
  • 核心技術:MTLink 1.0互聯 
  • 生態聯盟:PES-KUAE智算聯盟
技術架構與硬體配置,核心功能特性,合作與套用案例,技術突破與產業影響,

技術架構與硬體配置

平台基於第三代MUSA核心架構開發,採用雙路8卡伺服器MCCX D800作為基礎單元。單張MTT S4000智算加速卡配備48GB顯存,支持FP16精度下768GB/s顯存頻寬與PCIe 5.0高速接口,通過MTLink 1.0技術實現多卡互聯,單節點最大支持8卡互連。
集群管理平台集成分散式訓練框架最佳化技術,支持DeepSpeed、Megatron等主流框架,實現線性加速比達91%。硬體層面支持3096塊GPU協同工作,單任務最大可調度2048張顯示卡,7×24小時穩定運行及斷點續訓功能。

核心功能特性

  • 支持700億至1300億參數大模型訓練,以2000億訓練數據量為例:700億模型訓練周期33天,1300億模型需56天
  • 實現CUDA代碼零成本遷移至MUSA平台,配備MUSIFY開發工具鏈
  • 融合數據並行、流水線並行與張量並行策略,最佳化Flash Attention運算效率
  • 支持模型推理服務部署,提供動態批處理與顯存最佳化技術

合作與套用案例

2024年4月與無問芯穹達成戰略合作,雙方基於KUAE平台完成LLama2-70B模型的訓練測試,並推出"無穹Infini-AI"雲端調度平台。該合作案例中,千卡集群在千億參數模型訓練場景下實現超過90%的算力利用率。
2024年5月聯合開展的MT-infini-3B實訓項目中,完成國產GPU晶片從0到1的大模型完整訓練流程,訓練總時長13.2天。在C-Eval、MMLU等基準測試中,模型表現達到行業先進水平。

技術突破與產業影響

作為國內首個全國產千卡集群,KUAE平台實現三大突破:1)全棧自主可控的硬體架構;2)千卡規模下的線性加速比保持91%;3)支持斷點續訓與多任務並行調度。該平台建設周期縮短至30天即可完成商業化部署,已套用於數字孿生、AIGC等領域。
平台聯合中國移動、聯想等企業成立PES-KUAE智算聯盟,協同清華大學等科研機構構建大模型開發生態。在智慧型化算力調度、混合精度訓練最佳化等領域形成10項核心技術專利。

相關詞條

熱門詞條

聯絡我們