Kimi Linear

Kimi Linear 是月之暗面於2025年10月推出的新型混合線性注意力架構,旨在解決大型語言模型(LLMs)處理長序列任務時的計算效率與性能瓶頸問題。該架構核心為 Kimi Delta Attention(KDA),通過精細化門控機制最佳化循環神經網路有限狀態記憶的利用,並採用3:1比例的KDA層與全注意力層(MLA)混合結構平衡性能與效率。

研究團隊驗證在短上下文、長上下文及強化學習等場景中,Kimi Linear 性能均優於傳統全注意力機制。該架構通過硬體高效塊處理算法實現效率突破:Key-Value 快取使用量減少75%,百萬級上下文解碼吞吐量提升6倍,預填充速度提升2.9倍。結合專家混合(MoE)技術構建的模型總參數量達480億,激活參數30億。2025年10月31日,月之暗面開源了技術報告、核心代碼及模型檢查點。

基本介紹

  • 外文名:Kimi Linear
  • 推出單位:月之暗面
相關信息
2025年10月,月之暗面推出了一個全新的注意力架構Kimi Linear,有望成為下一代Agent LLM的基石技術。月之暗面已經放出了技術報告《KIMI LINEAR:一種高表達力且高效的注意力結構》並開源了核心代碼。
單來說月之暗面推出了名為 Kimi Linear 的新型混合線性注意力架構,核心目標是解決當前LLMs在處理長序列任務時面臨的計算效率和性能瓶頸。研究團隊首次證明,在包括短上下文、長上下文和強化學習等多種場景的公平比較下,Kimi Linear 的性能全面超越了傳統的full attention機制。Kimi Linear架構的核心是 Kimi Delta Attention (KDA),一種表達能力更強的線性注意力模組,通過更精細的門控機制實現了對循環神經網路有限狀態記憶的有效利用。最終,Kimi Linear 模型不僅在各項任務上取得了更優異的性能,還在效率上實現了巨大突破:與full attention模型相比,能將 Key-Value (KV) 快取的使用量減少高達 75%,並在處理百萬級別的長下文時,實現高達 6 倍的解碼吞吐量提升。這表明 Kimi Linear 可以作為全注意力架構的“即插即用”替代品,在提升性能的同時顯著增強了效率。

相關詞條

熱門詞條

聯絡我們