Engram模組

Engram模組是DeepSeek團隊開發的一種大語言模型架構模組,由DeepSeek團隊與北京大學合作於2026年1月12日晚或13日凌晨開源發布,並同步發表題為《Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models》的技術論文。模組名稱“Engram”源自神經科學,意為“記憶痕跡”。該模組旨在解決當前主流大語言模型在處理依賴固定知識的“查表式”記憶和複雜推理與組合計算兩類任務時存在的結構性低效問題,通過引入可擴展的查找式記憶結構,為大模型提供了區別於傳統Transformer與混合專家模型(MoE)的“條件記憶”新稀疏性維度。

其核心是基於現代化哈希N-Gram嵌入的O(1)查找式記憶,工作流程為對輸入Token序列進行N-Gram切片,並通過多頭哈希映射到一個規模可擴展的靜態記憶表中。關鍵技術設計包括詞表壓縮與上下文門控。該模組通常被放置在模型早期層(如第2層),用於承擔“模式重建”職責。在參數分配上,給定固定的總參數預算,將約20%-25%的稀疏參數從MoE專家重新分配給Engram記憶表效果最好。Engram提供的“條件記憶”與MoE提供的“條件計算”形成互補。在27B參數規模的實驗中,在等參數、等算力的條件下,集成Engram的模型相比純MoE模型在多項任務上取得顯著提升。Engram的確定性定址方式支持在推理時從主機記憶體進行大規模記憶表的預取,從而幾乎不增加GPU顯存壓力和推理延遲。

發布與背景,技術原理與架構,實驗效果與性能,影響與評價,工程最佳化與系統特性,技術特點,

發布與背景

Engram模組由DeepSeek團隊與北京大學合作於2026年1月12日晚或13日凌晨開源發布,並同步發表題為《Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models》的技術論文,論文署名作者中包括梁文鋒。模組名稱“Engram”源自神經科學,意為“記憶痕跡”。
同期,DeepSeek團隊還在2026年1月1日發布了關於模型架構穩定性的論文《mHC》,該論文作者同樣包括創始人梁文鋒。
該模組的提出,旨在解決當前主流大語言模型在處理依賴固定知識的“查表式”記憶和複雜推理與組合計算兩類任務時存在的結構性低效問題。論文將語言建模任務明確分為需要動態推理的創造性任務以及依賴固定知識的查表式任務,後者是Engram模組主要針對並旨在高效處理的。Engram通過引入可擴展的查找式記憶結構,旨在為大語言模型提供區別於傳統Transformer與混合專家模型(MoE)的全新稀疏性維度,其最終目標是最佳化大模型處理靜態知識的方式。

技術原理與架構

Engram是一個可擴展的查找式記憶模組,旨在通過在結構上分離靜態模式存儲與動態計算過程,通過O(1)時間複雜度的查找式記憶實現高效知識調取,以最佳化模型在複雜推理上的資源分配,為大語言模型提供區別於傳統Transformer與MoE的全新稀疏性維度,即“條件記憶”。該模組的總體架構設計旨在通過在模型早期層建立靜態記憶庫,將頻繁出現的、可預測的模式(如固定短語、常識知識)的存儲與重建任務分離,從而最佳化後續Transformer層(尤其是注意力機制)在複雜推理和長程依賴建模上的計算資源。其設計目標是將靜態知識的重建負擔從模型淺層中移出,以加深網路用於複雜推理的有效深度,並釋放注意力機制的容量以專注於全局上下文建模。
Engram的核心機制是基於現代化的哈希N-Gram嵌入。工作流程為對輸入Token序列進行N-Gram切片,並通過多頭哈希映射到一個規模可擴展的靜態記憶表中,實現常數時間的確定性檢索。這種查找與模型規模無關,即便記憶表擴展至百億級參數,檢索成本仍保持穩定。關鍵技術設計包括詞表壓縮,例如將“Apple”和“apple”歸併,實測可將128k詞表壓縮23%;以及上下文門控,模組會根據當前上下文隱向量作為裁判給查出的記憶向量打分,通過門控機制決定其權重並與主幹網路融合,實現“條件記憶”。在參數分配上,給定固定的總參數預算,將約20%~25%的稀疏參數從MoE專家重新分配給Engram記憶表效果較好。實驗發現Engram通常被放置在模型早期層用於承擔模式重建職責,如第2層效果較好。
Engram提供的“條件記憶”與MoE提供的“條件計算”形成互補。從功能分工上看,MoE通過選擇性地激活部分參數(“條件計算”)來提升計算效率;Engram則通過提供即查即用的、基於上下文門控的記憶向量(“條件記憶”),旨在減少模型主幹網路對固有模式進行重複計算的需求,兩者協同提升了模型的參數利用效率。在嚴格等參數量、等算力的條件下,集成Engram的模型相比純MoE模型,在知識檢索、通用推理、代碼與數學推理等多項任務上均有提升。分析工具表明,Engram能使模型預測收斂更快,並等效於增加了網路的有效深度。
Engram的確定性定址方式支持在推理時從主機記憶體進行大規模記憶表的預取,從而對GPU顯存壓力和推理延遲的增加較少,展現出基礎設施感知的高效性。

實驗效果與性能

在論文《Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models》中,DeepSeek團隊通過實驗驗證了Engram模組的有效性。研究以參數規模為27B的模型為基礎,在嚴格保證等參數、等算力(FLOPs)的條件下,將配備了Engram模組的模型與傳統的MoE基線模型進行對比。
實驗結果顯示,Engram模型的整體性能優於純MoE基線模型。具體表現為在知識類任務上,MMLU提升+3.4、CMMLU提升+4.0;在推理類任務上,BBH提升+5.0、ARC-Challenge提升+3.7;在代碼與數學推理任務上,HumanEval提升+3.0、MATH提升+2.4。進一步測試顯示,在代碼補全任務中準確率提升12%,數學推理能力提高9%。此外,在衡量長文本處理能力的“大海撈針”測試中,模型的準確率從基線模型的84.2%提升至配備了Engram模組模型的97.0%。
論文揭示的“U形縮放定律”表明,當Engram模組與MoE專家的資源配比達到臨界點時,模型性能會產生躍升。實驗進一步表明,在同等參數量和計算量(Iso-FLOPs)的限制下,將大約20%-25%的資源分配給Engram靜態記憶模組,其餘分配給MoE神經計算,是模型性能較好的配比。
論文藉助分析工具深入探究了Engram的作用機制。LogitLens工具顯示,Engram模型在早期層就能達到較高的預測置信度,預測收斂速度明顯快於基線模型。通過中心核對齊(CKA)分析發現,配備了Engram的模型第5層的表示,與僅使用MoE的模型第12層的表示最相似,這表明Engram模組等效於增加了模型網路用於複雜推理的有效深度。
消融實驗進一步證實,模型中的事實知識主要存儲在Engram模組中。對門控機制的可視化分析表明,Engram能夠對多token實體(如“Alexander the Great”)或固定搭配(如“By the way”)有效觸發高激活。根據實驗摸索的實踐,Engram模組放置在模型的第2層效果較好;如需放置兩個模組,則第2層與第15層的組合效果較好。在有限的參數預算下,採用2-gram加3-gram的組合方式優於單一的4-gram。

影響與評價

2026年1月13日,DeepSeek與北京大學合作發布論文《Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models》並開源記憶模組Engram。技術社區評價認為,Engram減少了模型早期層對靜態模式的重建需求。有觀點指出,Engram為大模型稀疏化提供了與MoE“條件計算”不同的“條件記憶”路徑。其確定性的定址方式支持在運行時從主機記憶體進行預取,從而在推理階段保持低開銷。在27B參數規模下,在等參數、等算力的條件下,Engram模型在知識、推理、代碼與數學任務上的性能有所提升。有行業觀察者推測,Engram可能套用於DeepSeek後續模型的開發。該模組的相關代碼已在GitHub平台開源。

工程最佳化與系統特性

Engram模組的確定性定址特性支持從主機記憶體進行數據預取。該特性允許將大規模靜態記憶表存放在主機記憶體而非GPU顯存中,有助於緩解GPU顯存的壓力。Engram支持“預取-重疊”策略,使得大規模靜態記憶表可存放於主機CPU記憶體中,而GPU則專注於計算邏輯。在實測中,將100B參數的Engram表置於主機記憶體時,對推理吞吐量的影響較小。Engram在系統層面的設計考慮了基礎設施的特性。

技術特點

Engram是DeepSeek團隊於2026年1月開源的大語言模型擴展模組。它通過引入可擴展的查找式記憶結構,為大模型提供了區別於傳統Transformer與MoE的“條件記憶”新稀疏性維度。在等參數、等算力條件下,該模組能顯著提升模型在知識檢索、推理、代碼與數學等多任務上的性能。
其核心技術基於現代化的哈希N-Gram嵌入,對輸入Token序列進行N-Gram切片,並通過多頭哈希函式映射到可擴展的靜態記憶表,實現O(1)時間的確定性檢索。同時,模組集成了上下文門控機制,根據當前上下文決定查找結果的啟用與融合。此外,還包括詞表壓縮技術,例如將語義相同的大小寫變體Token(如“Apple”與“apple”)映射到同一規範ID,以提升存儲效率。
實驗發現,Engram模組通常被放置在模型早期層(如第2層)以承擔“模式重建”職責,從而有效加深網路用於複雜推理的有效深度,並釋放注意力機制的容量以專注於全局上下文建模。在固定參數預算下,將約20-25%的稀疏參數從MoE專家重新分配給Engram記憶表,能獲得最優效果。其確定的定址方式支持在推理時從主機記憶體進行數據預取,即使記憶表擴展至百億參數,推理吞吐量開銷也極低。

相關詞條

熱門詞條

聯絡我們