Nemotron Ultra

Nemotron Ultra

Nemotron Ultra(全稱:Llama-3.1-Nemotron-Ultra-253B-v1)是英偉達於2025年3月發布的2530億參數開源大型語言模型,專為多GPU數據中心設計,支持複雜推理、工具調用及企業級套用場景。該模型通過神經架構搜尋(NAS)算法最佳化記憶體占用,採用跳躍注意力機制與FFN融合技術提升推理效率,可在單8xH100節點運行,降低部署成本。

模型開發歷經神經架構搜尋與知識蒸餾、合成數據監督微調、強化學習三階段後訓練流程,使用NVIDIA NeMo框架和FP8精度最佳化。在GPQA Diamond科學推理基準測試中準確率達76%,超越同類模型,並在AIME數學評估、LiveCodeBench編碼任務中取得SOTA性能。其支持128K token上下文視窗,通過系統提示詞切換推理模式,適用於代碼生成、客服機器人及研究智慧型體等場景。

基本介紹

  • 外文名:Nemotron Ultra
  • 全稱: Llama-3.1-Nemotron-Ultra-253B-v1
  • 所屬公司:英偉達
  • 發布時間:2025年
發展歷史,功能簡介,

發展歷史

2025年4月訊息, 英偉達發布Llama-3.1-Nemotron-Ultra-253B-v1大型語言模型。

功能簡介

英偉達最新發布的Llama-3.1-Nemotron-Ultra-253B-v1(簡稱 Nemotron Ultra)直面這一挑戰,該模型基於 Meta的Llama-3.1-405B-Instruct架構,專為商業和企業需求設計,支持從工具使用到多輪複雜指令執行等任務。
Nemotron Ultra採用僅解碼器的密集Transformer 結構,通過神經架構搜尋(NAS)算法最佳化,其創新之處在於採用跳躍注意力機制,在部分層中省略注意力模組或替換為簡單線性層。
在部署效率上,Nemotron Ultra也實現突破。它能在單 8xH100 節點上運行推理,顯著降低數據中心成本,提升企業開發者的可及性。

相關詞條

熱門詞條

聯絡我們