DeepSeek於2025年12月1日發布的AI模型DeepSeek-V3.2-Speciale,作為DeepSeek-V3.2的長思考增強版,該版本同時結合了DeepSeek-Math-V2的定理證明能力。其定位為將開源模型的推理能力推向極致的探索性版本,旨在系統化拓展模型的長程邏輯處理邊界,當前主要面向研究領域開放使用。該版本採用專家蒸餾+多軌強化學習+工具思維融合的三層訓練體系,通過數學、編程、邏輯推理等六類領域專家模型生成高質量訓練樣本,結合自研GRPO強化學習策略與工具調用思考鏈的融合機制,構建了結構化任務-自動評分-行為最佳化的閉環學習路徑。
與同期發布的通用型DeepSeek-V3.2不同,V3.2-Speciale在主流推理基準測試中達到媲美Gemini 3.0 Pro的水平,在數學、邏輯和多輪工具調用中表現異常強勢。其技術報告顯示,該模型在多個推理基準測試中超越GPT-5和谷歌Gemini 3 Pro,成為首個在多維度超越國際頂尖水平的中國AI模型。該版本聚焦於複雜問題求解場景,採用Group Relative Policy Optimization策略整合推理獎勵、語言一致性得分與任務完成度三維評估指標,通過任務環境自動反饋機制實現閉環訓練,強化學習投入占整體訓練預算超10%。
基本介紹
- 軟體名稱:DeepSeek-V3.2-Speciale
- 上線時間:2025年12月1日
- 開發商:DeepSeek
