XDNA2 NPU

XDNA2 NPU是AMD公司推出的第二代神經處理單元(NPU)架構。該架構隨銳龍AI 300系列移動處理器(代號Strix Point)首次推出。其AI算力高達50 TOPS(個別型號可達55 TOPs),性能為上一代XDNA架構的3倍。XDNA2 NPU支持Block FP16浮點格式,在計算速度與INT8格式相當的同時,提供接近FP16格式的高精度。架構層面,AI計算引擎(AIE Tile)從20個增至32個,每個引擎內乘加器(MAC)數量翻倍,片上快取增加60%,並通過最佳化實現了最多2倍的能效提升。該NPU可用於運行本地大語言模型(如Llama)、AI助手(如Copilot)、視頻會議背景虛化、AI繪圖等任務,並滿足Windows 11 AI PC對NPU算力的要求。

基本介紹

  • 中文名:XDNA2 NPU
  • 產品類型:神經處理單元
  • 上市時間:2024年6月
  • 所屬品牌:AMD
技術特點,性能參數,套用與功能,產品搭載,發展沿革,市場評價與對比,

技術特點

XDNA 2是AMD推出的第二代神經處理單元(NPU)架構,首發套用於銳龍AI 300系列(代號Strix Point)移動處理器。相較於初代XDNA架構,其在計算單元規模、數據格式支持、能效控制等方面進行了升級,旨在為AI PC提供本地AI計算能力。其核心AI引擎單元(AI Tile)數量從初代的20個增加至32個(分為四行八列),且每個AI引擎單元內的MAC(乘加累計操作)數量翻倍。板載(片上)記憶體容量增加了1.6倍,以支持更大規模的本地調度與運算。
該架構支持8條並發空間流(比上代翻倍),並支持空間分區和時間分區。空間分區可將不同列的核心單元分配給實時視頻、音頻等不同任務;時間分區則適合讓全部核心先後處理大語言模型等大型任務。根據負載不同,NPU可以按列(4/8/16/20/24/28/32)進行開關,以最佳化能效。
XDNA 2支持Block FP16(塊浮點)格式。該格式在計算性能上與INT8格式相當,是傳統FP16格式的兩倍,同時其精度接近傳統FP16甚至FP32(可達FP32的99.7%-100%),使得模型在幾乎無損精度的情況下,體積相比FP16可減小44%。這有助於緩解AI計算中速率與精度難以兼顧的問題。
此外,架構增強了對非線性函式的支持,並增加了稀疏計算相關功能。在能效方面,採用了基於列的精細電源門控設計,結合工藝改進,使得其能效比(性能功耗比)相比前代產品最多提升2倍。
綜合以上升級,XDNA 2 NPU在INT8和Block FP16格式下可提供高達50TOPS的AI算力,部分型號如銳龍AI 9 HX PRO 375可達55 TOPS。AI性能較上一代產品最多提升3倍,成為當時算力較高的集成NPU方案之一。

性能參數

XDNA2 NPU可提供高達50 TOPS的峰值AI算力,部分高端型號如銳龍AI 9 HX PRO 375的NPU算力可達55 TOPS。相比初代XDNA NPU的10 TOPS,XDNA2 NPU的算力提升達5倍;與AMD銳龍7040系列處理器相比,其NPU在處理AI工作負載時性能預計可提高3倍。
在處理某些AI工作負載時,XDNA2 NPU的能效相比前代產品預計最多可提高2倍。
當NPU與CPU、GPU協同工作時,平台的總算力最高可達80TOPS。
其50 TOPS的算力完全滿足微軟Copilot+ PC對NPU算力需達到40+ TOPS的要求。

套用與功能

XDNA2 NPU為Windows 11 AI PC提供AI算力,支持Copilot、Recall(回顧)、實時字幕、Windows Studio Effects(背景虛化、眼神互動、自動構圖)等系統級AI功能。其可本地運行Llama 2/3、通義千問等大型語言模型,並支持Stable Diffusion、Amuse AI等AI繪圖軟體完成文生圖與圖像超解析度任務。
在視頻會議或直播場景中,該NPU可在Camo Studio等軟體中實現手勢識別、AR特效與視頻增強。XDNA2 NPU能加速文檔處理、郵件協助等AI辦公套用,並支持企業級安全軟體進行AI反釣魚數據分析。用戶可通過Windows任務管理器查看該NPU的實時占用情況。
XDNA2 NPU使相關設備能夠支持Windows 11的AI功能生態、本地運行大型語言模型以及使用AI辦公與創意工具。

產品搭載

XDNA2 NPU是AMD的第二代神經處理單元。其首發搭載於AMD銳龍AI 300系列移動處理器,代號Strix Point。該NPU是銳龍AI 300系列處理器的標準配置,涵蓋AI 9、AI 7和AI 3等子系列。XDNA2 NPU亦套用於AMD銳龍AI Max系列處理器及定製型號如銳龍AI 9 HX PRO 375。製造工藝採用4nm製程。與Zen 5 CPU架構、RDNA 3.5 GPU架構共同構成Zen 5 + RDNA 3.5 + XDNA 2三重架構組合。

發展沿革

其前身為AMD第一代NPU架構XDNA。2023年12月,訊息泄露稱下一代移動處理器(代號Strix Point,後定名為銳龍AI 300系列)將採用XDNA2 NPU,實現3倍生成式AI性能。2024年6月,AMD正式發布銳龍AI 300系列處理器,XDNA2 NPU作為其核心組件同步亮相。同期,AMD發布了專為XDNA/XDNA2 NPU設計的開源Peano LLVM編譯器,以完善開發工具鏈。AMD公布了銳龍AI軟體棧的長期路線圖,將持續為XDNA2 NPU最佳化並支持更多AI模型(如Llama 2/3、通義千問等)。

市場評價與對比

XDNA2 NPU在發布時其算力參數為50-55 TOPS,高於同期部分競品。XDNA2 NPU支持Block FP16浮點格式,該格式使其在AI計算中兼顧性能與精度,與支持INT8格式的方案在精度方面有所不同。
XDNA2 NPU可分擔CPU和GPU的AI計算負載。與上一代產品相比,XDNA2 NPU在處理部分AI工作負載時能效有所提升。
XDNA2 NPU套用於Windows 11的AI功能、本地大模型運行及部分AI創意工具中。其算力滿足微軟Copilot+PC的相關要求,是AI PC的硬體組件之一。

相關詞條

熱門詞條

聯絡我們