k0-math是月之暗面旗下人工智慧助手Kimi於2024年11月16日發布的數學推理模型,採用強化學習與思維鏈推理技術,通過模擬人腦思考和反思過程提升解題能力。該模型在中考、高考、考研及數學競賽基準測試中表現超過OpenAI o1-mini和o1-preview公開模型,其技術將分批套用於Kimi平台的教育場景和搜尋調研類任務。截至2024年10月,Kimi月活躍用戶數已突破3600萬。
基本介紹
- 發布方:月之暗面
- 發布日期:2024年11月16日
- 核心技術:強化學習、思維鏈推理
- 測試基準:MATH(得分93.8分)
- 套用領域:教育產品、搜尋場景
- 用戶數據:3600萬月活(截至2024年10月)
技術特點,基準測試表現,套用場景,局限性,技術疊代,
技術特點
k0-math是首款專攻數學推理的強化學習模型,採用以下技術路徑:
- 思維鏈推理:模擬人類分步驟解題的思考過程
- 反思機制:通過反覆驗證推導過程提升準確性
- 大語言模型架構與強化學習算法融合,支持複雜數學符號處理
基準測試表現
在2024年11月發布的測試結果中:
- MATH基準測試得分93.8分,超過o1-mini(84.2分)和o1-preview(89.1分)
- 中高考數學題正確率較前代模型提升27%
- 考研數學真題處理能力在基準測試中表現優異,成績超過OpenAI o1-mini和o1-preview模型
套用場景
- 教育輔助:支持中考、高考、考研數學題的解題指導
- 科研搜尋:最佳化複雜數學公式的檢索與解析
- 競賽訓練:在包含入門競賽題的MATH基準測試中成績超過o1-mini和o1-preview
局限性
2024年11月發布的初代版本存在以下限制:
- 無法解析LaTeX格式描述的幾何圖形
- 處理高考壓軸題存在一定機率做錯
- 對過於基礎的算術問題回響效率較低
技術疊代
月之暗面在k0-math發布後持續推進模型升級:
- 2024年11月推出視覺思考模型k1
- 2025年1月發布支持多模態推理的k1.5模型
- 持續最佳化強化學習算法在數學場景的泛化能力

