DeepSeek-V3.2-Speciale

DeepSeek於2025年12月1日發布的AI模型DeepSeek-V3.2-Speciale,作為DeepSeek-V3.2的長思考增強版,該版本同時結合了DeepSeek-Math-V2的定理證明能力。其定位為將開源模型的推理能力推向極致的探索性版本,旨在系統化拓展模型的長程邏輯處理邊界,當前主要面向研究領域開放使用。該版本採用專家蒸餾+多軌強化學習+工具思維融合的三層訓練體系,通過數學、編程、邏輯推理等六類領域專家模型生成高質量訓練樣本,結合自研GRPO強化學習策略與工具調用思考鏈的融合機制,構建了結構化任務-自動評分-行為最佳化的閉環學習路徑。

與同期發布的通用型DeepSeek-V3.2不同,V3.2-Speciale在主流推理基準測試中達到媲美Gemini 3.0 Pro的水平,在數學、邏輯和多輪工具調用中表現異常強勢。其技術報告顯示,該模型在多個推理基準測試中超越GPT-5和谷歌Gemini 3 Pro,成為首個在多維度超越國際頂尖水平的中國AI模型。該版本聚焦於複雜問題求解場景,採用Group Relative Policy Optimization策略整合推理獎勵、語言一致性得分與任務完成度三維評估指標,通過任務環境自動反饋機制實現閉環訓練,強化學習投入占整體訓練預算超10%。

基本介紹

  • 軟體名稱:DeepSeek-V3.2-Speciale
  • 上線時間:2025年12月1日
  • 開發商:DeepSeek
國際影響與技術突破,主要功能,後訓練戰術體系,訓練體系架構,工具調用機制,發展歷程,

國際影響與技術突破

2025年12月1日,DeepSeek發布DeepSeek-V3.2和DeepSeek-V3.2-Speciale模型。技術報告顯示,V3.2-Speciale模型在多個推理基準測試中超越GPT-5和谷歌Gemini 3 Pro,成為首個在多維度超越國際頂尖水平的中國AI模型。例如,在數學推理(MATH基準)和代碼生成(HumanEval基準)等核心領域達到領先水平。
V3.2模型在評測中達到當前開源模型最高水平,V3.2-Speciale模型採用的新型混合架構使其在數學推理(MATH基準得分92.1)、代碼生成(HumanEval得分89.7)等核心指標上較前代提升27%以上。
此次突破性發布正值美國政府強化技術封鎖背景下,驗證了中國科技企業通過自主創新突破技術壁壘的能力。12月8日《光明日報》國際觀察指出,DeepSeek的成果證明"封鎖鎖不住創新,圍堵堵不住發展",直接影響了全球AI競爭格局。

主要功能

DeepSeek-V3.2的目標是平衡推理能力與輸出長度,適合日常使用,例如問答場景和通用Agent任務場景;V3.2-Speciale是DeepSeek-V3.2的長思考增強版,同時結合了DeepSeek-Math-V2的定理證明能力。在標準推理基準測試中展現頂尖性能,根據DeepSeek實驗室2025年12月技術報告顯示,該模型在GSM-8K、MATH等推理基準測試中達到開源模型的最高性能水平。該版本聚焦於複雜問題求解場景,當前主要面向數學定理證明、算法最佳化等科研場景開放使用。其定位為將開源模型的推理能力推向極致的探索性版本,旨在系統化拓展模型的長程邏輯處理邊界。

後訓練戰術體系

訓練體系架構

DeepSeek-V3.2-Speciale採用專家蒸餾+多軌強化學習+工具思維融合的三層訓練體系。該方法體系通過數學、編程、邏輯推理等六類領域專家模型生成高質量訓練樣本,結合自研GRPO強化學習策略與工具調用思考鏈的融合機制,構建了結構化任務-自動評分-行為最佳化的閉環學習路徑。
在密集訓練階段,通過數學、編程、Agent搜尋等六組專家模型反向生成訓練數據,實現專項能力向通用模型的蒸餾遷移。採用Group Relative Policy Optimization(GRPO)策略,整合推理獎勵、語言一致性得分與任務完成度三維評估指標,該策略基於穩定的強化學習協定,能夠有效擴展訓練規模而不失穩定性。通過任務環境自動反饋機制實現閉環訓練,後訓練計算預算超過預訓練成本的10%,強化學習投入占整體訓練預算超10%。

工具調用機制

設計系統提示在思維軌跡中預置工具調用示例,構建上下文狀態延續策略。工具調用不會中斷思考內容,用戶新輸入才會觸髮狀態重置。

發展歷程

2025年12月1日,DeepSeek宣布同時發布兩個正式版模型:DeepSeek-V3.2和DeepSeek-V3.2-Speciale。

相關詞條

熱門詞條

聯絡我們