發展歷程
DeepSeek於2025年8月19日在Hugging Face 上開源了新模型 V3.1-Base,根據介紹,該
模型將上下文長度拓展至 128K,參數約為 685B。
2025年8月21日,DeepSeek正式發布DeepSeek-V3.1。本次升級包含了混合推理架構、更高的思考效率、更強的Agent能力等。DeepSeek-V3.1一個模型同時支持思考模式與非思考模式。官方App與網頁端模型已同步升級為DeepSeek-V3.1。用戶可以通過“深度思考”按鈕,實現思考模式與非思考模式的自由切換。
台北時間2025年9月6日凌晨起,DeepSeek開放平台API接口調用價格調整,取消夜間時段優惠。
2025年8月22日訊息,騰訊元寶已正式接入DeepSeek V3.1最新版。相比上一代,DeepSeek V3.1-Think能在更短的時間內給出答案。8月22日,騰訊雲宣布上線DeepSeek-V3.1版本。
2025年8月23日報導訊息:DeepSeek-V3.1 正式上線火山方舟,企業用戶可以在更快、更穩的資源保障下體驗最新 DeepSeek-V3.1 模型:實現 20-40ms 吐字間隔(TPOT)超低延遲,並提供全網最高的 500 萬初始並發 TPM。
主要升級
本次升級包含以下主要變化:
混合推理架構:一個模型同時支持思考模式與非思考模式;
更高的思考效率:相比DeepSeek-R1-0528,DeepSeek-V3.1-Think能在更短時間內給出答案;
更強的Agent能力:通過Post-Training最佳化,新模型在工具使用與智慧型體任務中的表現有較大提升。
官方App與網頁端模型已同步升級為DeepSeek-V3.1。用戶可以通過“深度思考”按鈕,實現思考模式與非思考模式的自由切換。
DeepSeek API也已同步升級,deepseek-chat對應非思考模式,deepseek-reasoner對應思考模式,且上下文均已擴展為128K。同時,API Beta接口支持了strict模式的Function Calling,以確保輸出的Function滿足schema定義。增加了對Anthropic API格式的支持,可以輕鬆將DeepSeek-V3.1的能力接入Claude Code框架。
技術要點
DeepSeek-V3.1 基於全新的 V3.1-Base 模型開發,該基礎模型採用「兩階段長上下文擴展方法」,在原始 V3 模型檢查點基礎上進行大規模擴展訓練。整個訓練過程新增了 8400 億個 tokens,其中 32K 上下文擴展階段的訓練量增加了 10 倍,達到 6300 億 tokens,而 128K 擴展階段則增加了 3.3 倍,達到 2090 億 tokens。通過收集更多長文檔,DeepSeek 研發團隊顯著擴展了兩個訓練階段的數據集規模。
技術規格上,新版本採用 UE8M0 FP8 縮放格式訓練,並升級了分詞器,相關配置檔案已同步至官方 GitHub 與 HuggingFace。
DeepSeek還表示,DeepSeek-V3.1 使用了 UE8M0 FP8 Scale 的參數精度。UE8M0 FP8是針對即將發布的下一代國產晶片設計。
價格調整
DeepSeek宣布自2025年9月6日凌晨起,對DeepSeek開放平台 API 接口調用價格進行調整並取消夜間時段優惠。輸入:0.5元/百萬tokens(快取命中),4元/百萬tokens(快取未命中);輸出:12元/百萬tokens。
2025年2月,DeepSeek曾經宣布,台北時間每日 00:30 至 08:30 的夜間空閒時段,DeepSeek開放平台推出錯峰優惠活動。在此期間,API 調用價格大幅下調:DeepSeek-V3 降至原價的 50%,DeepSeek-R1 更低至 25%。V3標準時間段收費為:輸入:0.5元/百萬tokens(快取命中),2元/百萬tokens(快取未命中);輸出:8元/百萬tokens。
模型評測
V3.1在編程任務中表現突出。根據社區使用Aider測試數據,V3.1在AiderPolyglot多語言編程測試中,拿下了71.6%的高分,超越了Claude4Opus和DeepSeekR1等模型。在SVGBench基準測試中,其實力僅次於GPT-4.1-mini,遠超DeepSeekR1。
DeepSeek方面表示,V3.1在多項搜尋評測指標上也取得了較大提升。在需要多步推理的複雜搜尋測試(browsecomp)與多學科專家級難題測試(HLE)上,DeepSeek-V3.1 性能已大幅領先 R1-0528。
在多語言支持方面,V3.1也進行了明顯的能力最佳化,目前能處理超過100種語言,尤其最佳化了亞洲語言和資源較少語種的運用。
此外,V3.1在Token使用量方面較0324版本下降約13%,每次完整編程任務僅需1.01美元,成本僅為專有系統的六十分之一,具有節約成本的優勢。
DeepSeek新模型一經推出,便在技術社區擁有超高人氣和受關注度,一舉衝到HuggingFace趨勢榜第三。
不過,雖然V3.1在多個方面有進步,但部分功能體驗也受到網友詬病。多名測試者反饋,V3.1在數學推理、邏輯分析等綜合推理任務中無明顯進步,甚至在部分場景下表現不及舊版,也未看到“幻覺”問題的改善跡象,還出現了“中英文混雜”的新問題。在一些特定領域,如研究生級基準問答、軟體工程的某些複雜場景中,與頂尖模型如GPT-5相比仍有一定差距。