订阅

新文章,直接发到你的邮箱。

无垃圾邮件,随时取消。

← 返回博客
DeepSeek的Engram:教AI像人一样记忆

DeepSeek的Engram:教AI像人一样记忆

你有没有想过,人是怎么记住东西的?

比如说,当你看到"法国的首都"这几个字,你需要苦思冥想吗?不需要。你立刻就知道是巴黎。答案从记忆中跳出来,就像鱼儿跃出水面,毫不费力。

但奇怪的是,今天的AI不是这样工作的。每当ChatGPT或者其他大语言模型看到"法国的首都",它必须从头计算答案。每一次都要重新算。这就像有一个聪明绝顶的朋友,解决每道数学题都要从第一原理推导,从不记得2+2=4。你可能会问:这不是很傻吗?确实很傻。

为什么会这样呢?这要从大语言模型的工作原理说起。

今天的大语言模型,比如GPT、Claude、DeepSeek,它们把所有学到的东西都存储在一种叫做"参数"的数字里面。你可以把参数想象成模型大脑里的神经连接。一个模型有几百亿甚至上千亿个参数,每一个参数都是一个小数字,它们组合在一起,就形成了模型的"知识"。

问题在于,这些参数都必须存放在GPU的内存里。GPU是运行AI的专用芯片,它的内存非常昂贵,容量也很有限。一块顶级的NVIDIA H100 GPU,内存只有80GB。而一个700亿参数的模型,光是存放参数就需要140GB。这意味着还没开始干活,就已经需要两块GPU了。

你可以这样理解:现在的AI就像一个人,把所有知识都刻在金板上,然后把所有金板都锁在一个很小很贵的保险库里。想要更多知识?那就需要更多金板,需要更大的保险库,成本直线上升。

但是,DeepSeek的研究者们发现了一个关键问题:并非所有知识都需要这样存储。

让我们仔细想想模型到底学了什么。有一部分确实很复杂,比如如何理解一句话的意思,如何把几个想法连贯地组织起来,如何根据上下文做出判断。这些能力需要灵活的计算,因为每次遇到的情况都不一样。

但还有一大部分知识其实很简单,就是一些固定的事实和模式。"纽约"这个词后面经常跟什么?"机器学习"通常出现在什么样的句子里?法国的首都是巴黎。这些东西不会因为上下文而改变,它们是固定的。

那么问题来了:为什么要把这两种完全不同的知识用同样的方式存储呢?那些需要灵活计算的能力,确实应该用昂贵的GPU参数来实现。但那些固定的事实和模式,为什么不能放在更便宜的地方,用的时候查一下就好?

这就是Engram的核心思想。

Engram是DeepSeek在2026年1月发布的一项新技术。这个名字来自神经科学。在大脑研究中,"engram"(记忆印迹)指的是记忆在大脑中留下的物理痕迹,是编码特定信息的神经连接模式。DeepSeek借用了这个概念,为AI构建了一个专门存储模式记忆的系统。

简单来说,Engram就是给AI加了一个"记忆本"。那些经常出现的固定模式,比如常见的词语搭配,就预先存好,用的时候直接查,不用每次都重新计算。

这个系统有四个关键部分,让我一个一个解释。

其一,是常见模式的快速查找。Engram的核心是一张巨大的表格,里面存储着常见的词语组合。比如"气候变化"这个短语,在传统模型里,每次看到这两个词,模型都要花很多计算资源去理解它们的关系。但在Engram里,这个常见搭配已经预先计算好了,存在表格里,只需要查一下就能取出来。这种查找非常快,不管表格有多大,查找时间都差不多,就像你用字典查单词,不管字典多厚,翻到那一页就行了。

其二,是词汇的标准化。同一个意思可能有很多种写法。"Running"、"running"和"RUNNING"其实是同一个词。"Café"和"cafe"意思也一样。Engram会把这些不同的写法统一处理,这样就不用为同一个概念存储多个版本,节省了大约23%的存储空间。更重要的是,这样模型能学得更好,因为它知道这些其实是同一个东西。

想看更多实战拆解?

AI、工程与实验,每月 1–2 封。

无垃圾邮件,随时取消。

其三,是处理查找冲突的机制。用表格查找有一个问题:有时候两个不同的词语组合可能指向表格的同一个位置。这就像两个人的电话号码恰好一样。Engram的解决办法是同时用好几套查找系统,就像同一本书既按作者名排序,又按书名排序,又按出版日期排序。如果一种排序方式出了问题,其他方式还能用。

其四,是一个智能开关。并不是所有情况都适合查记忆本。有时候遇到的是常见情况,直接查记忆本就好。有时候遇到的是新情况,需要模型认真思考。Engram有一个自动学习的开关,能判断什么时候该查记忆,什么时候该从头计算。如果它觉得查到的内容可能不太可靠,就会自动切换到计算模式。

说到这里,你可能会问:这个"记忆本"存在哪里呢?

这正是Engram最有意思的地方。在实验中,DeepSeek把记忆本和模型参数放在一起,都存在GPU内存里。但这个设计其实很灵活。查记忆本和做神经网络计算对硬件的要求是不一样的。神经网络计算需要同时读取大量数据,对带宽要求很高。而查记忆本每次只需要读取少量数据,对带宽要求不高,但要求响应快。

这种差异意味着,记忆本完全可以放在GPU内存以外的地方。比如放在普通的电脑内存里(比GPU内存便宜很多),或者放在高速硬盘里,甚至放在其他机器上。论文明确指出,静态记忆可以用很低的代价存储在GPU以外。

这对实际应用意味着什么呢?想象一下,一个模型可以把需要"思考"的部分(比如理解上下文、做推理的能力)保留在昂贵的GPU内存里,同时把几个GB甚至几十个GB的"记忆本"放到便宜的普通内存里。模型照样聪明,但硬件成本大大降低了。

那么,这个方法实际效果怎么样呢?

DeepSeek训练了几个模型来做对比。一个是传统的40亿参数模型,一个是267亿参数的混合专家模型(MoE),还有一个是同样大小但加了Engram的模型。所有模型都用同样的数据训练,条件完全可比。

结果很明显。在知识问答测试中,Engram模型比同等大小的传统模型高出3到4分。在推理测试中,提升了5分。在编程测试和数学测试中也都有提升。

最惊人的提升出现在长文档处理上。有一个测试叫"大海捞针",就是在一篇很长的文章里找一个特定的信息。传统模型的准确率是84%左右,而Engram模型达到了97%。这是一个巨大的进步。

为什么会这样?在处理长文档时,模型需要同时关注很多内容,注意力资源被分散了。如果模型还需要用注意力去回忆那些固定的模式,留给真正重要任务的注意力就更少了。Engram把固定模式的回忆交给了记忆本,这样模型就能把全部注意力集中在真正需要思考的地方。

DeepSeek还做了一些深入分析。他们发现,Engram放在网络的早期层效果最好,这很合理,因为早期层主要处理词汇和模式层面的东西,后面的层才做更抽象的推理。他们还发现,如果训练完之后把Engram关掉,模型在事实问答上的表现会大幅下降,准确率掉了29%。这说明模型确实学会了依赖记忆本来获取固定知识。

也许最有趣的发现是:即使不增加计算量,只是增加记忆本的大小,模型的表现也会持续提升。这暗示了一种"无限记忆"的可能性。和增加模型参数不同,增加记忆的成本很低,而且好处是持久的。

Engram揭示了一个关于AI的深刻道理。过去几年,我们一直通过增加参数来提升AI的能力。更多参数意味着更强的计算能力,但也意味着更高的硬件成本。Engram表明,计算能力和记忆能力可以分开来看。一个模型可以计算能力适中但记忆能力很强,也可以反过来。不同的应用可以做不同的选择。

如果记忆可以放在GPU以外,那么模型可以变得更大,而GPU成本不用同比例增加。普通内存对AI变得有用了。GPU扩展的"内存墙"问题也没那么严重了。DeepSeek即将推出的V4模型预计会整合Engram,届时我们可能会看到这些好处在更大规模上的体现。

Engram还暗示,现在单一的Transformer架构可能不是最优的。不同类型的知识,固定的和灵活的,适合用不同的方式来存储和处理。这让人想到一些新问题:还有什么其他类型的专用记忆可能有帮助?能不能单独存储和过去对话相关的记忆?能不能区分"知道什么"和"知道怎么做"?大脑就有多个不同的记忆系统。也许AI也应该如此。

当然,没有完美的方案。Engram也有一些局限。它在推理和长文档任务上的提升比在纯粹的事实问答上更大,这有点反直觉。可能的解释是,事实问答用传统方法已经做得不错了,而推理和长文档处理原本更受限制,所以释放出来的注意力资源带来了更大的收益。另外,记忆本的查找冲突问题虽然得到了缓解,但没有完全解决。如果记忆本变得非常大,冲突可能会成为问题。还有,Engram给训练流程增加了一些复杂性。最后,论文主要测试了标准的基准任务,对于更复杂的智能体任务(比如规划、使用工具、跨对话的记忆)还没有充分评估。

让我们退后一步,想想Engram教给我们什么。

这个突破不是来自于让计算更快,或者用更多数据训练。它来自于问一个不同的问题:如果我们不需要计算所有东西呢?不同的问题需要不同的解决方案。把固定的记忆和灵活的思考用同一种机制来处理,就像用锤子同时敲钉子和拧螺丝,能用,但效果不好。

最好的工程,就像最好的策略,来自于理解问题的本质。DeepSeek仔细观察了大语言模型实际在做什么,然后问:哪些部分需要计算,哪些部分只需要记忆?这个问题事后看来显而易见。最好的问题总是如此。

Engram代表了大语言模型架构的一个重要进步。通过把固定记忆和灵活计算分开,它用更低的硬件成本实现了更好的性能。更重要的是,它开辟了一个新的设计方向。未来的模型可以根据具体用途,在记忆和计算之间做出不同的分配。那种"把所有东西都塞进参数"的做法,可能会让位于更专业、更高效的架构。

我们对如何构建智能系统的理解还处于早期阶段。Engram表明,借鉴大脑的工作方式,为不同类型的知识设计不同的存储系统,可能会继续为人工智能带来新的突破。

道理很简单:不是所有东西都需要计算。有些东西只需要被记住。


原文链接:Engram: Conditional Memory via Scalable Lookup

Engram论文《通过可扩展查找实现条件记忆:大语言模型稀疏性的新维度》由DeepSeek和北京大学研究者于2026年1月发布。代码和记忆模块实现已开源。

新文章,直接发到你的邮箱。

AI、工程与实验,每月 1–2 封。

无垃圾邮件,随时取消。