NVIDIA Llama Nemotron是NVIDIA於2025年3月在GTC大會發布的開源推理模型系列,旨在為開發者提供構建代理式AI平台的基礎架構。該系列基於Llama模型架構構建,通過後訓練增強多步數學運算、編碼及複雜決策能力,精度較基礎模型提升20%,推理速度達到其他領先模型的5倍。
模型提供Nano(8B參數,PC/邊緣設備最佳化)、Super(49B參數,數據中心最佳化)和Ultra(253B參數,多GPU伺服器最佳化)三種版本,採用神經架構搜尋與知識蒸餾技術最佳化推理效率。系列支持動態推理開關功能,通過NVIDIA NIM微服務部署並集成至AI Enterprise平台,已在物流路徑規劃、科研假設生成等場景套用。模型權重及相關數據集在Hugging Face開源,企業可通過NVIDIA NeMo框架進行定製開發。
基本介紹
- 中文名:NVIDIA Llama Nemotron
- 所屬企業:NVIDIA
特點
規模分類
- Nano模型:可在PC和邊緣設備上提供準確性
- Super模型:能夠在單個GPU上提供最佳準確性和最高吞吐量
- Ultra模型:在多GPU伺服器上實現最高代理準確
套用
- 微軟將NVIDIA Llama Nemotron推理模型和NVIDIA NIM微服務集成到Microsoft Azure AI Foundry中。此舉擴展了Azure AI Foundry模型目錄,為客戶提供增強服務的選項,如針對Microsoft 365的Azure AI Agent Service。
- SAP利用NVIDIA Llama Nemotron模型,推動SAP Business AI解決方案和SAP智慧型副駕Joule的發展。
- ServiceNow利用NVIDIA Llama Nemotron模型構建AI智慧型體,提供更高的性能和準確性,從而提升各行各業的企業生產力。
- 埃森哲已經在其AI Refinery平台上提供NVIDIA Llama Nemotron推理模型,包括發布的行業智慧型體解決方案——可助力客戶快速開發和部署定製AI智慧型體,以應對行業特定挑戰,加速業務轉型。
- 德勤計畫將NVIDIA Llama Nemotron推理模型納入其發布的Zora AI代理式AI平台,該平台旨在通過包含深度功能性、特定行業業務知識以及具備透明度的智慧型體,為人類決策和行動提供支持。
