DeepSeek-V2是國產開源MoE大模型,性能達GPT-4級別,但開源、可免費商用、API價格僅為GPT-4-Turbo的百分之一。
基本介紹
- 中文名:DeepSeek-V2
- 類型:MoE大模型
性能,功能,
性能
DeepSeek-V2性能達GPT-4級別,但開源、可免費商用、API價格僅為GPT-4-Turbo的百分之一。DeepSeek-V2以236B總參數、21B激活,大致達到70B~110B Dense的模型能力。DeepSeek-V2消耗的顯存(KV Cache)只有同級別Dense模型的1/5~1/100,每token成本大幅降低。DeepSeek-V2 採用了創新的架構。提出MLA(Multi-head Latent Attention)架構,大幅減少計算量和推理顯存。
功能
測試顯示,DeepSeek-V2的知識內容更新到2023年。DeepSeek-V2的中文綜合能力超越一眾開源模型,並和GPT-4-Turbo、文心4.0等閉源模型同處第一梯隊。
