Nemotron-CC

Nemotron-CC是英偉達宣布推出的大型英文AI訓練資料庫,總計包含6.3 萬億個Token,其中1.9萬億為合成數據。

基本介紹

  • 中文名:Nemotron-CC
  • 推出方:英偉達
背景,特點,

背景

業界各類AI模型的具體性能主要取決於相應模型的訓練數據。然而現有公開資料庫在規模和質量上往往存在局限性,英偉達稱Nemotron-CC的出現正是為了解決這一瓶頸,該訓練資料庫6.3萬億Token的規模內含大量經過驗證的高質量數據,號稱是“訓練大型語言模型的理想素材”。

特點

數據來源方面,Nemotron-CC基於Common Crawl網站數據構建,並在經過嚴格的數據處理流程後,提取而成高質量子集Nemotron-CC-HQ。
在性能方面,英偉達稱與目前業界領先的公開英文訓練資料庫DCLM(Deep Common Crawl Language Model)相比,使用Nemotron-CC-HQ訓練的模型在MMLU(Massive Multitask Language Understanding)基準測試中的分數提高了5.6分。
進一步測試顯示,使用Nemotron-CC訓練的80億參數模型在 MMLU 基準測試中分數提升5分,在ARC-Challenge基準測試中提升3.1分,並在10項不同任務的平均表現中提高0.5分,超越了基於Llama 3訓練數據集開發的Llama3.1 8B模型。

熱門詞條

聯絡我們