Conditional Memory via Scalable Lookup

《Conditional Memory via Scalable Lookup》是DeepSeek與北京大學合作完成並於1月12日發布的學術論文。論文作者包括梁文鋒。

論文針對大模型包含組合推理與靜態知識檢索兩類不同任務而現有Transformer架構缺乏原生知識查找機制的問題,提出了條件記憶作為補充的稀疏性維度。該研究通過可擴展的查找記憶結構Engram模組實現條件記憶,在等參數、等算力條件下提升了模型在知識調用、推理、代碼及數學等任務上的表現。團隊發現了U型縮放定律,表明混合稀疏容量分配嚴格優於純MoE基準。論文指出條件記憶將成為下一代稀疏模型不可或缺的建模原語。

基本介紹

  • 作者:梁文鋒
  • 發表日期:2026年1月12日
論文基本信息,研究背景與問題,核心技術與創新點,實驗發現與性能提升,開源影響與未來展望,

論文基本信息

《Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models》是由DeepSeek與北京大學合作完成並於2026年1月12日晚發布的一篇論文。合著作者包括DeepSeek創始人梁文鋒。

研究背景與問題

這篇論文的核心觀察是,大型語言模型包含兩種性質完全不同的任務,一種是需要深度動態計算的組合推理,另一種則是檢索靜態知識,而現有的Transformer架構缺乏原生的知識查找機制,只能通過計算低效地模擬檢索過程,這構成了論文旨在解決的根本問題。

核心技術與創新點

該論文的核心觀察是,大模型包含兩種性質完全不同的任務,一種是需要深度動態計算的組合推理,另一種則是檢索靜態知識,而現有的Transformer架構缺乏原生的知識查找機制,只能通過計算低效地模擬檢索過程。
為此,論文提出了條件記憶作為補充的稀疏性維度,該技術通過引入可擴展的查找記憶結構實現,其具體實現模組名為Engram。條件記憶旨在最佳化神經計算與靜態記憶之間的權衡關係。
團隊還發現了U型縮放定律,表明MoE專家和Engram記憶之間的混合稀疏容量分配嚴格優於純MoE基準模型,儘管記憶模組直觀上有助於知識檢索,但團隊在通用推理、代碼和數學領域觀察到了更為顯著的收益。
論文最後表明,條件記憶將成為下一代稀疏模型不可或缺的建模原語,其本質是給大模型做了分工最佳化。

實驗發現與性能提升

核心實驗發現了MoE專家與Engram記憶之間的U型縮放定律,表明 MoE 專家和 Engram 記憶之間的混合稀疏容量分配嚴格優於純 MoE 基準模型。在等參數、等算力條件下顯著提升模型在知識調用、推理、代碼、數學等任務上的表現。值得注意的是,儘管記憶模組直觀上有助於知識檢索,但團隊在通用推理、代碼和數學領域觀察到了更為顯著的收益。

開源影響與未來展望

2026年1月12日,DeepSeek公司宣布開源了論文中提出的相關記憶模組Engram。論文在結論中指出,條件記憶在下一代稀疏模型的構建中是一種重要的建模方式。有行業分析人士基於此論文認為,其中提出的條件記憶技術可能套用於未來大模型的架構。

相關詞條

熱門詞條

聯絡我們