模型簡介
DeepSeek-Math-V2為全球首個以開源形式達到國際數學奧林匹克(IMO)金牌水平的數學推理大模型,基於685B參數規模開發。基於
DeepSeek-V3.2實驗版基礎架構開發,以 Apache2.0開源協定完整放出權重並在
Hugging Face與GitHub開源,在數學推理能力上實現了質的飛躍。
DeepSeek-Math-V2成功解決2025年IMO六道題中的五道,以83.3% 的正確率獲得金牌。在2024年
中國數學奧林匹克(
CMO)中,該模型同樣達到金牌水準。在2024年
普特南數學競賽中取得118/120的成績,同時以自驗證機制為核心技術突破。在IMO-ProofBench基準測試Basic子集達到99%正確率,Advanced子集取得61.9%正確率。
模型簡介
DeepSeek-Math-V2是DeepSeek發布的大模型,該模型為全球首個以開源形式達到國際數學奧林匹克(IMO)金牌水平的數學推理大模型。基於
DeepSeek-V3.2實驗版基礎架構開發,以 Apache2.0開源協定完整放出權重,在數學推理能力上實現了質的飛躍。
技術突破
DeepSeek-Math-V2 核心突破在於首次實現了自驗證機制。該機制通過訓練高精度驗證器檢查定理證明的邏輯正確性,並利用驗證器作為獎勵模型訓練生成器,形成閉環訓練體系,使模型能在提交最終證明前主動修正推理漏洞。該設計使模型在未依賴大規模題庫的前提下,在 IMO 2025、CMO 2024 和 Putnam 2024 測試中均達到金牌水平。
在 IMO-ProofBench 基準測試中,Basic 子集以99%得分率領先 Gemini DeepThink(89%),Advanced 子集61.9%略低於後者(65.7%)。其獨特優勢體現在真實競賽場景:Putnam 2024 測試中獲得118分(滿分120),且未依賴題庫答案訓練。
該模型首次實現過程導向訓練方法,將研發重點從結果正確性轉向推理嚴謹性驗證。通過擴展驗證算力自動標註複雜推理樣本,使驗證器與生成器形成持續進化的閉環系統,為處理無標準答案的開放數學問題提供了技術路線。
該模型的自我驗證機制被論文《DeepSeek Math-V2:邁向可自驗證的數學推理》論證為下一代數學型AI的關鍵技術路徑,標誌著數學推理AI從'答案正確'到'推導可信'的範式轉變。
社區評價
Reddit、Hacker News 等海外開發者社區對此次開源給出強烈反響,有用戶稱“
DeepSeek這頭鯨魚終於回來了”,並驚嘆其 Basic 基準領先谷歌 Gemini DeepThink 10 個百分點。國內
知乎平台用戶認為 DeepSeek 數學推理團隊可能是其“最有潛力的一張王牌”,指出數學推理作為最苛刻的 AI 推理任務需要嚴格的邏輯鏈支持。開發者社區提出對數學代碼生成能力的期待,希望利用該模型生成複雜數學性代碼,並強調數學正確性在代碼實現中的核心地位。X 平台用戶指出中國模型普遍數學能力較強,除 DeepSeek 外,
Qwen等模型也展現出類似特質。