Kimi Linear 是月之暗面於2025年10月推出的新型混合線性注意力架構,旨在解決大型語言模型(LLMs)處理長序列任務時的計算效率與性能瓶頸問題。該架構核心為 Kimi Delta Attention(KDA),通過精細化門控機制最佳化循環神經網路有限狀態記憶的利用,並採用3:1比例的KDA層與全注意力層(MLA)混合結構平衡性能與效率。
研究團隊驗證在短上下文、長上下文及強化學習等場景中,Kimi Linear 性能均優於傳統全注意力機制。該架構通過硬體高效塊處理算法實現效率突破:Key-Value 快取使用量減少75%,百萬級上下文解碼吞吐量提升6倍,預填充速度提升2.9倍。結合專家混合(MoE)技術構建的模型總參數量達480億,激活參數30億。2025年10月31日,月之暗面開源了技術報告、核心代碼及模型檢查點。
基本介紹
- 外文名:Kimi Linear
- 推出單位:月之暗面
