技術特點
XDNA 2是
AMD推出的第二代神經處理單元(NPU)架構,首發套用於銳龍AI 300系列(代號Strix Point)移動處理器。相較於初代XDNA架構,其在計算單元規模、數據格式支持、能效控制等方面進行了升級,旨在為AI PC提供本地AI計算能力。其核心AI引擎單元(AI Tile)數量從初代的20個增加至32個(分為四行八列),且每個AI引擎單元內的MAC(乘加累計操作)數量翻倍。板載(片上)記憶體容量增加了1.6倍,以支持更大規模的本地調度與運算。
該架構支持8條並發空間流(比上代翻倍),並支持空間分區和時間分區。空間分區可將不同列的核心單元分配給實時視頻、音頻等不同任務;時間分區則適合讓全部核心先後處理大語言模型等大型任務。根據負載不同,NPU可以按列(4/8/16/20/24/28/32)進行開關,以最佳化能效。
XDNA 2支持Block FP16(塊浮點)格式。該格式在計算性能上與INT8格式相當,是傳統FP16格式的兩倍,同時其精度接近傳統FP16甚至FP32(可達FP32的99.7%-100%),使得模型在幾乎無損精度的情況下,體積相比FP16可減小44%。這有助於緩解AI計算中速率與精度難以兼顧的問題。
此外,架構增強了對非線性函式的支持,並增加了稀疏計算相關功能。在能效方面,採用了基於列的精細電源門控設計,結合工藝改進,使得其能效比(性能功耗比)相比前代產品最多提升2倍。
綜合以上升級,XDNA 2 NPU在INT8和Block FP16格式下可提供高達50
TOPS的AI算力,部分型號如銳龍AI 9 HX PRO 375可達55 TOPS。AI性能較上一代產品最多提升3倍,成為當時算力較高的集成NPU方案之一。
性能參數
XDNA2 NPU可提供高達50 TOPS的峰值AI算力,部分高端型號如銳龍AI 9 HX PRO 375的NPU算力可達55 TOPS。相比初代XDNA NPU的10 TOPS,XDNA2 NPU的算力提升達5倍;與AMD銳龍7040系列處理器相比,其NPU在處理AI工作負載時性能預計可提高3倍。
在處理某些AI工作負載時,XDNA2 NPU的能效相比前代產品預計最多可提高2倍。
其50 TOPS的算力完全滿足微軟Copilot+ PC對NPU算力需達到40+ TOPS的要求。
套用與功能
在視頻會議或直播場景中,該
NPU可在Camo Studio等軟體中實現手勢識別、AR特效與視頻增強。XDNA2 NPU能加速文檔處理、郵件協助等AI辦公套用,並支持企業級安全軟體進行AI反釣魚數據分析。用戶可通過Windows任務管理器查看該NPU的實時占用情況。
XDNA2 NPU使相關設備能夠支持
Windows 11的AI功能生態、本地運行大型語言模型以及使用AI辦公與創意工具。
產品搭載
XDNA2 NPU是AMD的第二代神經處理單元。其首發搭載於AMD銳龍AI 300系列移動處理器,代號Strix Point。該NPU是銳龍AI 300系列處理器的標準配置,涵蓋AI 9、AI 7和AI 3等子系列。XDNA2 NPU亦套用於AMD銳龍AI Max系列處理器及定製型號如銳龍AI 9 HX PRO 375。製造工藝採用4nm製程。與Zen 5 CPU架構、RDNA 3.5 GPU架構共同構成Zen 5 + RDNA 3.5 + XDNA 2三重架構組合。
發展沿革
其前身為
AMD第一代NPU架構XDNA。2023年12月,訊息泄露稱下一代移動處理器(代號Strix Point,後定名為銳龍AI 300系列)將採用XDNA2 NPU,實現3倍生成式AI性能。2024年6月,AMD正式發布銳龍AI 300系列處理器,XDNA2 NPU作為其核心組件同步亮相。同期,AMD發布了專為XDNA/XDNA2 NPU設計的開源Peano LLVM編譯器,以完善開發工具鏈。AMD公布了銳龍AI軟體棧的長期路線圖,將持續為XDNA2 NPU最佳化並支持更多AI模型(如Llama 2/3、通義千問等)。
市場評價與對比
XDNA2 NPU在發布時其算力參數為50-55 TOPS,高於同期部分競品。XDNA2 NPU支持Block FP16浮點格式,該格式使其在AI計算中兼顧性能與精度,與支持INT8格式的方案在精度方面有所不同。
XDNA2 NPU可分擔CPU和GPU的AI計算負載。與上一代產品相比,XDNA2 NPU在處理部分AI工作負載時能效有所提升。
XDNA2 NPU套用於
Windows 11的AI功能、本地大模型運行及部分AI創意工具中。其算力滿足微軟Copilot+PC的相關要求,是AI PC的硬體組件之一。