DeepSeek-V2

DeepSeek-V2是國產開源MoE大模型,性能達GPT-4級別,但開源、可免費商用、API價格僅為GPT-4-Turbo的百分之一。

基本介紹

  • 中文名:DeepSeek-V2
  • 類型:MoE大模型
性能,功能,

性能

DeepSeek-V2性能達GPT-4級別,但開源、可免費商用、API價格僅為GPT-4-Turbo的百分之一。DeepSeek-V2以236B總參數、21B激活,大致達到70B~110B Dense的模型能力。DeepSeek-V2消耗的顯存(KV Cache)只有同級別Dense模型的1/5~1/100,每token成本大幅降低。DeepSeek-V2 採用了創新的架構。提出MLA(Multi-head Latent Attention)架構,大幅減少計算量和推理顯存。

功能

測試顯示,DeepSeek-V2的知識內容更新到2023年。DeepSeek-V2的中文綜合能力超越一眾開源模型,並和GPT-4-Turbo、文心4.0等閉源模型同處第一梯隊。

相關詞條

熱門詞條

聯絡我們