NVIDIA 微服務是NVIDIA於2024年3月在GTC 2024大會上推出的企業級生成式AI解決方案,核心包含NIM推理微服務和CUDA-X微服務兩大組件。該服務通過預最佳化的容器技術(集成Triton推理伺服器、TensorRT-LLM等工具),可將AI模型部署時間從數周縮短至數分鐘,支持在雲、數據中心及配備CUDA GPU的終端設備運行。截至2024年6月,全球已有150餘家技術合作夥伴集成該服務,涵蓋醫療、物流、數字人等領域的定製化開發,併兼容AWS、谷歌雲、Azure等主流雲平台。
基本介紹
- 發布時間:2024年3月
- 核心組件:NIM、CUDA-X
- 技術架構:CUDA®、Triton、TensorRT™
- 部署方式:雲/數據中心/工作站
- 支持模型:40餘個主流模型
- 適用領域:語言/語音/藥物發現
技術架構
- NIM微服務:採用預構建容器封裝模型推理組件,整合Triton推理伺服器、TensorRT-LLM加速庫及行業標準API,提供40餘個AI模型端點的標準化部署能力
- CUDA-X微服務:包含檢索增強生成(RAG)、數據處理、路徑最佳化等模組,其中cuOpt微服務實現動態路線規劃,在Li & Lim基準測試中創世界紀錄級求解精度
核心功能
- 推理最佳化:通過NVIDIA AI Enterprise 5.0平台提供生產級部署支持,在認證設備上實現Llama 3-8B模型token生成效率提升3倍
- CUDA-X模組:
- Riva語音工具作為CUDA-X微服務組件支持多語種互動式數字人開發
- Earth-2氣候模擬組件是NVIDIA CUDA-X微服務的組成部分
- cuOpt實時動態路徑最佳化技術,可將1000包裹路線規劃時間從20分鐘壓縮至10秒
套用場景
- 醫療領域:截至2024年6月,已有數十家公司套用NIM進行手術規劃、藥物研發,其中ACE NIM微服務實現互動式數字人開發
- 物流領域:川崎重工通過SyncTwin數字孿生集成cuOpt,最佳化半導體工廠維修路徑規劃;全球汽車座椅製造商套用該技術提升裝卸碼頭網路效率
合作夥伴
- 雲服務商:亞馬遜雲科技、微軟Azure AI、谷歌雲完成NIM微服務集成
- 系統集成商:埃森哲、德勤提供企業級部署支持
- 套用開發商:Cadence、ServiceNow基於該架構開發領域專用AI助手
部署與支持
- 測試許可權:開發者可通過ai.nvidia.com獲取免費研究與測試資源
- 生產部署:需通過NVIDIA AI Enterprise平台在認證系統運行,支持HPE ProLiant、戴爾PowerEdge等伺服器硬體
- 混合雲支持:兼容紅帽OpenShift、VMware Private AI Foundation等虛擬化環境
