Kimi-k2 thinking

Kimi-k2 thinking是由月之暗面於2025年11月6日發布的開源通用Agentic思考模型,具備深度推理能力和多輪工具調用功能。該模型總參數達10000億,激活參數為320億,支持256K上下文視窗及Claude Code,採用新一代最佳化器實現訓練效率翻倍,其提供了標準API服務及高速版本kimi-k2-thinking-turbo。2025年11月18日,該模型被AI搜尋套用Perplexity正式接入,成為該平台唯一合作的國產模型,同批接入的還有OpenAI發布的GPT-5.1。

其發展歷程始於2025年7月11日發布的初代Kimi K2模型,同年9月5日升級為Kimi K2-0905版本,強化Agentic Coding能力。11月6日發布的Kimi-k2 thinking在Humanity's Last Exam、BrowseComp等基準測試中表現優於GPT-5和Claude Sonnet 4.5,在SWE-bench編程任務中連續調用工具達200-300次無需人工干預,並在Artificial Analysis智慧型體工具評測中獲得93%的得分。發布後兩天內即在Hugging Face平台獲得超過5萬次下載。該模型具備生成網頁原型的能力,但在解答特定數學題時存在誤差。據2025年11月官方披露,其API調用成本包含研究實驗難以量化。

通過與趨境科技開源的KTransformers框架深度集成,該模型支持在單張消費級GPU完成推理任務,其異構微調方案可將LoRA微調顯存占用降低82%、微調吞吐量達46.55 token/s,並在昇騰NPU實現全國產化推理解決方案。2025年12月2日DeepSeek-V3.2發布後,在Artificial Analysis智慧型體工具評測中超越Kimi-K2-Thinking。2025年12月31日,月之暗面宣布完成C輪融資,投後估值達43億美元。2026年1月5日,MiroMind發布MiroThinker 1.5系列模型,其輕量級版本在BrowseComp-ZH等評測中實現對Kimi-K2-Thinking的性能超越。

基本介紹

  • 外文名:Kimi-k2 thinking
  • 發布時間:2025年11月6日
發展歷史,行業影響與競爭,價格方面,技術合作,

發展歷史

Kimi K2首次發布是2025年7月11日,該模型總參數10000億,激活參數320億。Kimi K2-0905於2025年9月5日發布,其核心升級了Agentic Coding能力、支持256K上下文、API支持60-100Token/s的輸出速度、支持Claude Code。
2025年11月6日,月之暗面正式發布了Kimi-k2 thinking模型。該模型在Humanity‘s Last Exam、BrowseComp基準測試中超越GPT-5和Claude Sonnet 4.5,SWE-bench編程任務中連續調用工具達200-300次無需人工干預,並在Artificial Analysis智慧型體工具評測中以93%得分創第三方機構最高紀錄。通過與KTransformers框架的深度集成,其異構推理能力進一步降低了微調千億級模型的硬體門檻,使得單個消費級GPU即可實現46.55 token/s的微調吞吐量。發布後兩天內即在Hugging Face平台獲得超過5萬次下載。趨境科技開發的KTransformers框架迅速完成全面適配,支持用戶在單張消費級GPU上完成推理任務、雙卡環境下執行LoRA微調任務,同時已完成該模型在昇騰NPU的適配並提供全國產化推理解決方案。
發布後迅速成為Hugging Face平台最受歡迎的模型,Thomas Wolf稱其定價策略可能衝擊企業採用模式,CNBC報導引發中美AI發展模式差異的廣泛討論。
2025年11月18日,Kimi K2 Thinking模型被AI搜尋套用Perplexity正式接入,成為該平台唯一合作的國產模型,同批被接入的還有OpenAI發布的GPT-5.1。
2025年12月2日,DeepSeek發布DeepSeek-V3.2系列模型,在Artificial Analysis智慧型體工具評測中超越Kimi-K2-Thinking,其標準版在主流推理基準測試達到GPT-5水平。
2026年1月5日,MiroMind公司發布了搜尋智慧型體模型MiroThinker 1.5,其30B參數版本在關鍵搜尋智慧型體評測集BrowseComp-ZH中實現了對Kimi-K2-Thinking的性能超越,且單條調用成本低至0.07美元,僅為Kimi-K2-Thinking的1/20。這一事件引發了業界對於以“互動式擴展”為核心的高效智慧型體路線與傳統大參數模型發展路徑的討論。
2025年12月31日,月之暗面宣布完成C輪融資,投後估值達43億美元。

行業影響與競爭

伴隨著「互動式擴展」技術範式的提出,行業對模型發展路徑的討論日益增多。例如,2026年1月,MiroMind發布的30B參數搜尋智慧型體模型MiroThinker 1.5,在關鍵評測集BrowseComp-ZH中實現了對包括Kimi-K2-Thinking在內的主流大模型的性能超越,同時單條推理成本僅為前者的1/20。
其研發者指出,以擴大模型內部參數規模為核心的傳統Scaling Law已觸及邊際瓶頸,主張以模型與外部世界的高頻、深度互動作為性能增長的新範式。這一路線強調通過「推理-驗證-修正」循環和時序敏感訓練,用小參數量模型實現高智慧型密度,對行業內「參數越大越強」的共識形成挑戰。

價格方面

kimi-k2-thinking每百萬tokens的輸入價格(快取未命中)為4元、輸出價格為16元;“高速版”kimi-k2-thinking-turbo每百萬tokens的輸入價格(快取未命中)為8元、輸出價格為58元,適用於需要深度推理和追求極致高速的場景。
據2025年11月官方披露信息,Kimi K2 Thinking的訓練成本為460萬美元,API調用輸入和輸出成本分別為0.15美元/百萬Token和2.5美元/百萬Token。其異構微調方案可將傳統需數百萬成本的LoRA微調任務部署於單個消費級GPU(如RTX 4090),實現顯存占用降低82%、微調吞吐量達46.55 token/s。價格數據源自月之暗面2025年11月發布的《K2 Thinking商業白皮書》(基準匯率:1美元≈7.2人民幣)
Kimi-k2 thinking
Kimi K2系列模型價格

技術合作

Kimi-K2-Thinking 模型的技術合作框架包括與趨境科技開源的KTransformers的深度適配,支持用戶在單卡 GPU 環境下完成推理任務,並在 2 卡環境下實現 LoRA 微調任務。趨境科技已完成該模型在昇騰 NPU 上的全面適配,提供全國產化推理解決方案。
KTransformers與推理框架 SGLang 架構整合後,用戶僅需通過一條命令即可在單卡 GPU+CPU 混合環境下啟動 Kimi-K2-1TB 模型的推理服務,兼容 GPU+CPU 異構推理模式及全 GPU 傳統模式。與 LLaMA-Factory 的深度集成使得 LoRA 微調顯存占用降至約 41GB,實現 46.55 token/s 的吞吐量。
藉助KTransformers的異構微調能力,LoRA 微調資源需求已降低至單個消費級 GPU 起,顯存占用減少 82%,吞吐量提升 1.8 倍。

相關詞條

熱門詞條

聯絡我們