星光澄海 | BLOG

EngramEdit:大模型知识更新,不用改Transformer核心

刚刷到DeepSeek挂在arXiv cs.CL分类下的新工作,最扎眼的数字是:EngramEdit在链式推理(CoT)提示下的准确率,是现有最强基线的近三倍。它解决的那个痛点,其实很多人都踩过——之前给大模型改个具体知识点,总免不了要碰核心Transformer架构,搞不好还连带崩了别的知识。

改知识点之前,为啥总搞成“牵一发动全身”?

条件记忆架构(比如DeepSeek Engram)本来是用输入n-gram查学到的嵌入,靠加少量计算扩展大模型容量,但之前没法在不改Transformer的前提下更新事实知识。难点很实际:同一个事实的不同表达,会激活不同的n-gram嵌入;要是直接改共享的n-gram嵌入,很容易牵连其他事实。比如你改“Python的创始人是Guido”,可能连带着“Guido是荷兰人”也被乱改——因为两个事实共享了部分嵌入向量,改一个就带偏了另一个。之前想改知识点,要么微调整个模型(成本高),要么单句硬调(难覆盖所有表达),总有短板。

EngramEdit的核心:给知识“换零件”不碰骨架

这个新方案的思路,是把知识更新和模型核心彻底解耦,具体分两步:
第一步,先算“目标记忆表征”——让模型不管用啥表达(比如“谁发明了Python”“Python的创建者是谁”),都能预测正确的更新后事实;
第二步,联合更新共享n-gram嵌入,匹配这些目标,还对频繁复用的嵌入罚得更重——说白了就是“改的时候避开大家共用的核心零件,只调和目标事实相关的部分”。
实验结果够硬:几乎完美的编辑成功率,更新的知识在未见过的表达里也能用,多跳推理里也没问题;更关键的是,哪怕多改几次事实,无关知识和通用能力几乎没受影响。

这玩意儿,对大模型来说意味着啥?

之前条件记忆的定位,只是给模型“扩容”,现在EngramEdit把它变成了可编辑的知识接口——不用动Transformer核心,就能给大模型打“知识补丁”。对企业来说,以后要更自己的行业知识库,不用再花大价钱微调整个大模型,成本至少降个量级;而且不用担心改了知识后,模型的通用推理能力崩掉——毕竟实验里的CoT准确率都快到基线的三倍了,不是只改了单句的花架子。
更有意思的是,它把“事实知识”和“通用计算”的边界划得更清了——以后大模型的核心可能只负责逻辑推理,具体的行业知识、企业私货,都能通过这个接口单独更新,不用捆死在模型骨架里。

现在大模型的知识更新,还像给Windows重装系统——改个小功能就得动全局。EngramEdit搞不好能改成换插件:不用碰核心,只改要更的那部分。但反过来说,这种模块化的知识更新,会不会反而让大模型的知识变得支离破碎?毕竟每个公司都想加自己的私货,最后大家的模型可能都成了“知识补丁堆”,通用能力反而没了之前的稳定性?这事儿,我还想不明白。


素材来源:arXiv (LLM/多模态新论文) · AI情报、大模型、科研前沿
查看报道原文

发表第一条评论吧

支持 Markdown