Nemotron 3

Nemotron 3,是2025年12月15日英偉達發布的開源模型系列,包括 Nano、Super 和 Ultra 三種規格,其中 Nano 已發布,Super 和 Ultra 預計於2026年上半年發布。

該系列模型採用混合Mamba-Transformer架構和MoE(混合專家模型)技術,擁有100萬token的上下文視窗。

基本介紹

  • 外文名:Nemotron 3
  • 上市時間:2025年
  • 所屬品牌:英偉達
發展歷史,規格參數,配套資源,主要功能,技術架構,

發展歷史

2025年12月15日,英偉達發布 Nemotron 3 開源模型系列,包括 Nano、Super 和 Ultra 三種規格。該系列旨在為構建 AI 智慧型體套用提供開源模型選項,並開放了模型權重,以及超過10萬億token的訓練數據、預訓練和後訓練軟體與訓練配方。
其中,Nemotron 3 Nano已率先發布,而Super和Ultra規格預計在2026年上半年推出。
2026年1月,在拉斯維加斯國際消費電子展(CES)期間,英偉達公布了全新的Nemotron-3模型系列,包括70B、34B和8B三種規模的Llama Nemotron-3變體。同時,英偉達發布了名為Nemotron-CC的多語言預訓練語料庫,覆蓋140多種語言。

規格參數

Nemotron 3 的 MoE 模型系列包括三種規格:
Nemotron 3 Nano,一款小型的30-billion-parameter模型,激活參數約30億(3B),適用於針對性強、高度高效的任務。
其架構主要由交替堆疊的Mamba-2層和MoE層構成,具體層排布模式為5個Mamba-2+MoE的重複單元,接3個同樣結構的單元,再來1個包含注意力層的單元,最後是4個Mamba-2+MoE單元。
此外,它支持100萬token的超長上下文視窗。
Nemotron 3 Super,一款高準確性的推理模型,擁有約1000億參數,激活參數約100億(10B),適用於多智慧型體套用。
Nemotron 3 Ultra是一款擁有約5000億參數和激活參數約500億(50B)的大型推理引擎,適用於複雜的AI套用。

配套資源

英偉達發布了Nemotron-CC語料庫,這是一個多語言預訓練語料庫,覆蓋140多種語言,總規模達1.4萬億token。同時發布了名為Granary的指令數據集,旨在提升模型在企業級任務上的套用性。

主要功能

Nemotron 3系列提供Nano、Super、Ultra三種規格,針對從邊緣計算到高性能計算的全場景AI套用進行功能最佳化。針對Super和Ultra規格,Nemotron 3採用了LatentMoE架構並使用NVFP4格式進行訓練。Nemotron 3 Nano 宣稱是目前計算成本效率最高的模型,專為軟體調試、內容摘要、AI 助手工作流程和低推理成本的信息檢索等任務進行最佳化。該模型相比 Nemotron 2 Nano 實現了高達 4 倍的 token 處理吞吐量,並將推理 token 生成減少了 60%,顯著降低了推理成本。根據官方測試,Nemotron 3系列模型在性能上與其他主流開源模型具有競爭力,在典型推理場景下,其吞吐量可達同類模型的1.5至3.3倍,序列越長優勢越明顯。憑藉 100 萬 token 的上下文視窗,Nemotron 3 Nano 能記住更多信息,使其在處理長時間、多步驟任務時更加準確且具備更強的信息關聯能力。在RULER長上下文基準測試中,Nemotron 3 Nano在100萬token輸入長度下取得了68.2分的成績。
Nemotron 3 Nano 今日已在 Hugging Face 上線,Nemotron 3 Super 和 Ultra 預計將在 2026 年上半年推出。

技術架構

Nemotron 3採用混合Mamba-Transformer架構,融合了Mamba、Transformer和MoE技術,論文給出的層排布模式是:5個Mamba-2+MoE的重複單元,接3個同樣結構的單元,再來1個包含注意力層的單元,最後是4個Mamba-2+MoE單元。該架構使Nemotron 3 Nano具備100萬token的上下文視窗,在8k輸入、16k輸出的典型推理場景下,Nemotron 3 Nano 30B-A3B的吞吐量是Qwen3-30B-A3B的3.3倍,序列越長優勢越明顯;在長上下文任務上,Nemotron 3 Nano基座模型在100萬token輸入長度下的RULER基準測試中拿到68.2分,而Nemotron 2 Nano 12B在同樣條件下只有23.43分。針對Super和Ultra型號,Nemotron 3引入了LatentMoE架構,使用512個專家、激活22個,提升下游任務性能如MMLU-Pro從48.30提升到52.87。使用NVFP4格式進行訓練,穩定訓練高達25萬億token,與BF16訓練相比損失差距控制在1%以內;並非所有層都適合量化,Mamba輸出投影層保留在MXFP8精度,QKV投影和注意力投影保留在BF16。後訓練採用多環境強化學習,同步訓練所有任務,覆蓋數學推理、競賽編程等多種環境,並開源NeMo-RL和NeMo-Gym軟體棧。支持推理時的思維預算控制,允許用戶指定思維鏈最大token數。

相關詞條

熱門詞條

聯絡我們