Engram(DeepSeek與北京大學共同提出的一個模組)

本詞條是多義詞,共2個義項
更多義項 ▼ 收起列表 ▲

Engram(直譯為:記憶痕跡)是由DeepSeek與北京大學共同提出的一個模組,旨在解決大語言模型存在的記憶力“短板”,其代碼已於2026年1月13日開源。

該模組基於論文《Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models》中提出的“條件記憶”概念設計,該概念被視為一種新的大模型稀疏化方向(即條件存儲)。在整體架構上,DeepSeek把大模型的能力拆分為三個維度:模型深度、以MoE為代表的計算稀疏性以及Engram引入的存儲稀疏性。根據論文,在總參數和算力預算固定的情況下,將20%至25%的稀疏參數分配給Engram模組是達到最優性能的平衡點,即便掛載規模高達千億參數的記憶庫,推理吞吐損失也能控制在3%以內。

DeepSeek預計將在2026年中國春節前後發布其最新的V4模型,Engram模組的技術方向或為其提供了重要線索。

基本介紹

  • 中文名:記憶痕跡
  • 外文名:Engram
核心機制,意義與展望,

核心機制

Engram將語言建模任務拆解為兩大分支
1. 靜態模式檢索:負責實體、固定短語等確定性知識的快速調取。
2. 動態組合推理:交由Transformer架構專注完成複雜邏輯運算。
Engram是一種可微分、可訓練、原生嵌入模型結構的組件,其設計核心是將記憶性負載從主幹計算中剝離,通過高速檢索模組直接調用穩定存在、高頻出現的知識。通過哈希映射從靜態嵌入表中檢索向量,並使用輕量化門控機制判斷記憶的語境適用性。在整體架構層面,Engram引入了存儲稀疏性,與模型深度和計算稀疏性協同工作。在總參數和算力預算固定的情況下,將20%至25%的稀疏參數分配給Engram能最佳化平衡,實現高效推理,掛載規模高達千億參數的記憶庫時推理吞吐損失能控制在3%以內。

意義與展望

論文將條件記憶視為下一代稀疏模型的建模原語。Engram模組的相關研究為模型技術方向提供了參考。
2026年1月13日,DeepSeek在GitHub開源了Engram模組,並發布了關於條件存儲這一大模型稀疏化方向的論文。
2026年1月16日,DeepSeek發布了關於Conditional Memory的論文,其中Engram模組作為條件存儲的新方向被提出,並與位元組Seed的OverEncoding等工作存在關聯。

相關詞條

熱門詞條

聯絡我們