發展歷史
Kimi K2首次發布是2025年7月11日,該模型總參數10000億,激活參數320億。Kimi K2-0905於2025年9月5日發布,其核心升級了Agentic Coding能力、支持256K上下文、API支持60-100Token/s的輸出速度、支持Claude Code。
2025年11月6日,
月之暗面正式發布了Kimi-k2 thinking模型。該模型在Humanity‘s Last Exam、
BrowseComp基準測試中超越
GPT-5和
Claude Sonnet 4.5,SWE-bench編程任務中連續調用工具達200-300次無需人工干預,並在Artificial Analysis智慧型體工具評測中以93%得分創第三方機構最高紀錄。通過與KTransformers框架的深度集成,其異構推理能力進一步降低了微調千億級模型的硬體門檻,使得單個消費級GPU即可實現46.55 token/s的微調吞吐量。發布後兩天內即在
Hugging Face平台獲得超過5萬次下載。趨境科技開發的KTransformers框架迅速完成全面適配,支持用戶在單張消費級GPU上完成推理任務、雙卡環境下執行LoRA微調任務,同時已完成該模型在昇騰NPU的適配並提供全國產化推理解決方案。
發布後迅速成為
Hugging Face平台最受歡迎的模型,Thomas Wolf稱其定價策略可能衝擊企業採用模式,
CNBC報導引發中美AI發展模式差異的廣泛討論。
2025年11月18日,Kimi K2 Thinking模型被AI搜尋套用
Perplexity正式接入,成為該平台唯一合作的國產模型,同批被接入的還有OpenAI發布的
GPT-5.1。
2025年12月2日,DeepSeek發布
DeepSeek-V3.2系列模型,在Artificial Analysis智慧型體工具評測中超越Kimi-K2-Thinking,其標準版在主流推理基準測試達到
GPT-5水平。
2026年1月5日,MiroMind公司發布了搜尋智慧型體模型MiroThinker 1.5,其30B參數版本在關鍵搜尋智慧型體評測集BrowseComp-ZH中實現了對Kimi-K2-Thinking的性能超越,且單條調用成本低至0.07美元,僅為Kimi-K2-Thinking的1/20。這一事件引發了業界對於以“互動式擴展”為核心的高效智慧型體路線與傳統大參數模型發展路徑的討論。
2025年12月31日,
月之暗面宣布完成C輪融資,投後估值達43億美元。
行業影響與競爭
伴隨著「互動式擴展」技術範式的提出,行業對模型發展路徑的討論日益增多。例如,2026年1月,
MiroMind發布的30B參數搜尋智慧型體模型
MiroThinker 1.5,在關鍵評測集BrowseComp-ZH中實現了對包括Kimi-K2-Thinking在內的主流大模型的性能超越,同時單條推理成本僅為前者的1/20。
其研發者指出,以擴大模型內部參數規模為核心的傳統
Scaling Law已觸及邊際瓶頸,主張以模型與外部世界的高頻、深度互動作為性能增長的新範式。這一路線強調通過「推理-驗證-修正」循環和時序敏感訓練,用小參數量模型實現高智慧型密度,對行業內「參數越大越強」的共識形成挑戰。
價格方面
kimi-k2-thinking每百萬tokens的輸入價格(快取未命中)為4元、輸出價格為16元;“高速版”kimi-k2-thinking-turbo每百萬tokens的輸入價格(快取未命中)為8元、輸出價格為58元,適用於需要深度推理和追求極致高速的場景。
據2025年11月官方披露信息,
Kimi K2 Thinking的訓練成本為460萬美元,
API調用輸入和輸出成本分別為0.15美元/百萬
Token和2.5美元/百萬Token。其異構微調方案可將傳統需數百萬成本的LoRA微調任務部署於單個消費級GPU(如
RTX 4090),實現
顯存占用降低82%、微調吞吐量達46.55 token/s。價格數據源自
月之暗面2025年11月發布的《K2 Thinking商業白皮書》(基準匯率:1美元≈7.2人民幣)
技術合作
Kimi-K2-Thinking 模型的技術合作框架包括與趨境科技開源的
KTransformers的深度適配,支持用戶在單卡 GPU 環境下完成推理任務,並在 2 卡環境下實現 LoRA 微調任務。趨境科技已完成該模型在昇騰 NPU 上的全面適配,提供全國產化推理解決方案。
KTransformers與推理框架 SGLang 架構整合後,用戶僅需通過一條命令即可在單卡 GPU+CPU 混合環境下啟動 Kimi-K2-1TB 模型的推理服務,兼容 GPU+CPU 異構推理模式及全 GPU 傳統模式。與 LLaMA-Factory 的深度集成使得 LoRA 微調顯存占用降至約 41GB,實現 46.55 token/s 的吞吐量。
藉助
KTransformers的異構微調能力,LoRA 微調資源需求已降低至單個消費級 GPU 起,顯存占用減少 82%,吞吐量提升 1.8 倍。