《Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models》是一篇由DeepSeek與北京大學於2026年1月12日聯合發表的學術論文,合著者包括梁文鋒。該論文提出了“條件記憶(conditional memory)”機制,通過引入可擴展的查找記憶結構,旨在同等參數規模和計算量下,提升大語言模型在知識調用、推理、代碼及數學等任務上的性能,並同步開源了相關記憶模組Engram。論文認為條件記憶與混合專家(MoE)模型的條件計算形成互補。其實現的Engram模組基於哈希N-gram,以O(1)時間複雜度完成知識查找,通過確定性哈希機制檢索嵌入表示,並採用上下文感知門控機制動態調整檢索結果。神經計算與靜態記憶之間存在U型的最優權衡擴展規律,當約20%-25%的稀疏參數預算分配給Engram時模型性能達到最佳。通過將該模組擴展至270億參數規模進行實驗,在等參數量、等FLOPs條件下,其整體性能優於純MoE基線模型,在32k上下文長度的複雜檢索任務中,多查詢NIAH準確率從84.2%提升至97.0%,變數跟蹤準確率從77.0%提升至89.0%。Engram支持存儲與計算的系統級解耦,通過預取-重疊策略和多級快取最佳化大規模記憶訪問效率。
《Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models》(基於可擴展查找的條件記憶:大型語言模型稀疏性的新維度)是一篇學術論文。該論文由人工智慧公司DeepSeek與北京大學聯合完成,於2026年1月12日晚間發布,合著作者中包括DeepSeek創始人梁文鋒。論文的核心創新點是提出了“條件記憶”(conditional memory)機制。
目前大語言模型主要通過混合專家(MoE)來實現稀疏化,這被稱為“條件計算”。然而,現有的Transformer架構缺少原生的知識查找機制,只能被迫通過計算過程低效地模擬檢索行為。針對這一現狀,該論文提出了“條件記憶”(conditional memory)作為稀疏化的新維度,旨在與MoE的條件計算形成互補。
條件記憶(conditional memory)是一種由DeepSeek與北京大學提出的創新機制,旨在通過引入可擴展的查找記憶結構,在等參數、等算力條件下顯著提升大語言模型在知識調用、推理、代碼、數學等任務上的表現。該機制與混合專家(MoE)的條件計算形成互補,構成了稀疏性的新維度。條件記憶通過Engram模組實現,這是一個基於哈希N-gram的可擴展查找記憶結構,能夠以O(1)時間複雜度完成知識查找,並在系統層面支持存儲與計算的解耦。
Engram模組的設計目標是在結構上將靜態模式存儲與動態計算過程從Transformer主幹網路中分離出來,從而對其進行增強。該模組對序列中每一個位置依次執行兩個功能階段:檢索與融合。基於哈希N-gram的稀疏檢索階段包括分詞器壓縮以及通過確定性哈希機制來檢索對應的嵌入表示。上下文感知的門控機制用於在當前隱藏狀態的調製下動態調整檢索到的嵌入。Engram在系統層面支持計算與存儲的解耦,通過確定性檢索實現預取-重疊策略和多級快取層次結構,以最佳化大規模記憶訪問效率。
作為條件記憶的一種具體實現,Engram在結構上與MoE的條件計算形成互補。通過U型擴展規律,在等參數、等FLOPs條件下,將大約20%-25%的稀疏參數預算重新分配給Engram獲得最佳性能。在無限記憶範式中,Engram表現出可預測的冪律擴展,記憶容量增加持續改善驗證損失而不增加計算開銷。
Engram所採用的確定性檢索機制天然支持將參數存儲與計算資源進行解耦。在推理階段,這種確定性特性支持一種預取-重疊策略,系統能夠利用前序Transformer層的計算作為緩衝,以隱藏從主機記憶體預取嵌入向量的通信延遲。此外,其訪問模式遵循Zipfian分布,支持構建多級快取層次結構,從而將Engram擴展到極大規模的記憶容量。
在總參數量和訓練計算量固定的條件下,MoE與Engram之間存在最優的稀疏容量分配比例。將大約20%-25%的稀疏參數預算分配給Engram可獲得最佳性能,驗證損失與分配比例呈U形關係。在無限記憶體擴展範式下,Engram性能隨記憶槽數量增加遵循嚴格的冪律提升,這提供了一個可預測的擴展旋鈕。
論文總共訓練了四種模型用於對比驗證,分別是Dense-4B(總參數量41億)、MoE-27B(總參數量267億)、Engram-27B(總參數量267億)以及Engram-40B(總參數量395億)。所有模型均在包含2620億token的相同語料庫上進行預訓練,並採用了DeepSeek-v3的分詞器(詞表大小為128k)。在評估方面,研究在涵蓋語言建模、知識、推理、閱讀理解以及代碼/數學的多樣化基準測試集上對模型進行了評估。
論文通過在涵蓋語言建模、知識、推理、閱讀理解以及代碼/數學的多樣化基準測試集上對模型進行評估。總共訓練了四種模型:Dense-4B(總參數量41億)、MoE-27B(總參數量267億)、Engram-27B(總參數量267億)以及Engram-40B(總參數量395億),所有模型均採用完全相同的數據訓練流程,且在激活參數量上嚴格匹配。
實驗結果顯示,在等參數、等FLOPs條件下,Engram-27B在所有基準測試中顯著超越了iso-FLOPs的Dense-4B基準,並在iso-參數和iso-FLOPs的MoE-27B基準上持續取得改進。這些提升在知識密集型任務中表現顯著,例如:MMLU提升+3.0,MMLU-Pro提升+1.8,CMMLU提升+4.0。值得注意的是,性能提升並不限於知識任務,在一般推理領域,例如BBH提升+5.0,ARC-Challenge提升+3.7,DROP提升+3.3;在代碼和數學推理任務中,例如HumanEval提升+3.0,MBPP提升+1.6,GSM8K提升+2.2,MATH提升+2.4,改進更加顯著。
在長上下文訓練中,通過將局部依賴建模卸載至靜態查找,Engram為處理全局上下文保留了寶貴的注意力容量。在控制基礎模型能力的前提下,Engram表現出顯著增益,如在複雜檢索任務中大幅超越基準模型,例如多查詢「大海撈針」NIAH準確率從84.2提升至97.0,變數跟蹤VT從77.0提升至87.2。在等計算量設定下,Engram-27B進一步拉大了差距,在所有指標上均實現了頂尖性能。
進一步的表示對齊分析表明,Engram能夠加速模型淺層預測的收斂。基於CKA計算的相似度熱力圖顯示,Engram的淺層在功能上等效於MoE模型的深層,從而有效地增加了模型用於複雜推理的有效深度。
DeepSeek於2026年1月12日晚發布該論文,並同步開源了論文中提出的Engram(印記)記憶模組。相關代碼與論文全文已在GitHub平台公開。
論文在結論部分指出,條件記憶(conditional memory)與混合專家(MoE)提供的條件計算(conditional computation)形成了結構互補。論文揭示了一種指導兩者容量最優分配的U型擴展規律,並認為條件記憶將成為構建下一代稀疏大語言模型中不可或缺的核心建模原語(core modeling primitive)。
