模型更新不是一次写入,而是一张随版本扩大的回归合同
学会一个新事实或新领域,只证明更新有收益;它是否值得上线,还要减去旧能力回归、时态冲突、推理成本和恢复风险。持续学习与模型编辑真正共享的核心,是把每次改变绑定到明确协议、完整历史矩阵、编辑账本与可执行回滚点。
先问“新知识应住在哪”,再问“用哪个算法写进去”
模型输出变化可能来自四层:一次会话的上下文、可版本化的外部检索、可路由的 adapter(适配器)或基础权重。四层都能让答案改变,却有完全不同的寿命、引用、权限、推理开销和撤销方式。把它们混称“模型学会了”,会让回归与责任边界一起消失。
会话上下文
只在当前请求生效,更新最快;删除上下文即可撤销。适合临时约束与少量事实,但受上下文窗口、指令冲突和 prompt injection(提示注入)影响。
版本化外部记忆
数据库、知识图谱或文档保存事实与有效期,推理时检索并引用。回滚最直观,但召回、排序、来源冲突与多跳组合成为新失败面。
可路由参数层
冻结骨干,按版本、租户或领域加载 Low-Rank Adaptation(LoRA,低秩适配)等模块。模块易卸载,不代表默认路由、合并权重和共享模板不会引入回归。
基础权重
持续预训练、全量微调或直接编辑都改共享参数。推理不一定增加检索步骤,却把副作用扩散到更大的输入空间;撤销通常回到 checkpoint(检查点)或重放更新日志。
更新净价值 = 新目标收益 − 历史回归 − 在线成本 − 恢复风险
同一条新事实,RAG 可能多付一次检索延迟,却换来引用、权限和即时撤销;直接权重编辑可能没有显式检索,却要支付更大的近邻、多跳与连续历史回归。四项必须放在同一业务 SLO(Service-Level Objective,服务级目标)下比较。
“持续学习分数”没有脱离协议的含义
同样是顺序学习 A、B、C,推理时是否告诉模型当前任务、旧原始数据能否保存、标签空间是否扩张、边界是否可见,都会改变难度和可用方法。先声明协议,才知道两个分数能不能比较。
| 协议维度 | 必须声明 | 为什么会改结论 | LLM 生产对应 |
|---|---|---|---|
| Boundary | 任务 / 分布边界已知还是未知 | 已知边界可切 adapter、重置优化器或触发回归;未知流必须在线检测漂移 | 数据批次、政策版本或客户域是否有可靠事件 |
| Replay access | 可保存多少旧原始样本、特征或 logits | 能直接优化旧损失,与只能靠参数正则不是同一信息条件 | 隐私、版权、数据驻留与保留期限 |
| Context identity | 推理时是否提供 task / version / tenant | 有身份可选择专用 head 或 adapter;无身份还要解决路由与开放世界识别 | 请求是否携带租户、地区、时间和模型版本 |
| Output space | 输出固定、扩张,还是新旧目标冲突 | 新增技能与覆盖旧政策的优化目标不同;后者必须定义 supersede(取代)语义 | 新增工具、改 JSON schema、更新事实或撤销规则 |
| Order | 真实时间、随机顺序、重复与撤销是否保留 | 随机打乱能抹掉难例;真实流里的冲突和重复决定长期稳定性 | 按线上事件时间重放,不能只做随机 IID(独立同分布)切分 |
Task-Incremental Learning(任务增量学习)在推理时提供 context identity;Domain-Incremental Learning(域增量学习)通常保持输出任务、让输入分布变化且不提供 context;Class-Incremental Learning(类别增量学习)让可预测类别随任务扩张且推理时不给 task ID。LLM 的“新领域、事实覆盖、租户适配、工具新增”常同时跨越这三类,不要只贴一个缩写。
一个单元格就是一份回归记录
完成更新 i 后,在能力 j 的冻结测试快照上评估。j 可以是准确率,也可以是奖励、业务成功率或“负损失”;必须统一成越大越好,或显式说明方向。
Backward Transfer(后向迁移)
(1/(T−1)) Σⱼ<T (RT,j−Rj,j)。它比较最终版本与刚学完任务 j 时的分数;负值是平均退化,但平均值仍可能掩盖关键单域。
Forgetting(遗忘量)
maxᵢ∈[j,T−1] Ri,j − RT,j。它只对最终更新前已经学过的能力定义,看能力 j 从历史最好点掉了多少;若业务只承诺发布基线,也应另报相对承诺阈值的跌幅。
新梯度不是在“删除记忆”,它只是没有收到保护旧能力的合同
一次新任务更新为 θ′ = θ − ηgnew。对旧任务做一阶近似:ΔLold ≈ −η gold·gnew。两个梯度内积为负时,新步会抬高旧损失,这叫 interference(干扰);连续很多小干扰也能累积成大回归。
共享表示让“一处更新”影响许多输入
事实、语言格式、推理策略和安全行为通常复用 attention(注意力)、MLP(Multi-Layer Perceptron,多层感知机)与归一化路径。参数 diff 很小,只说明改动稀疏或低秩,不说明函数空间里的影响局部。
数据顺序改变优化器看到的世界
若新域 mini-batch 长时间占满训练流,梯度估计就几乎不包含旧分布。学习率、动量、weight decay(权重衰减)、训练步数和 optimizer state(优化器状态)会共同决定漂移;“同一批数据”换顺序也不保证同一结果。
遗忘可能先发生,再被平均分掩盖
持续预训练可在开头出现 stability gap(稳定性缺口):通用表现先跌、之后部分恢复。若只评训练终点,就看不到上线中途会遇到的低谷;若只看 perplexity(困惑度),又可能漏掉事实、格式或安全能力变化。
“保护旧模型”也会保护旧错误
正则、蒸馏和 replay 都在约束偏移。若旧行为本应被政策更新覆盖,过强保护会阻碍新目标;因此回归集必须把“应保持”“应改变”“仅在某时段改变”分开,而不是要求所有旧输出逐字不动。
L = Lnew + λ/2 · Σᵢ Fᵢ(θᵢ−θ*ᵢ)²
θ* 是旧任务参数,Fᵢ 用 Fisher information(Fisher 信息)的对角近似估计参数重要性。它不是“冻结重要神经元”:重要性估计、对角假设、多个任务的累计存储和 λ 都会影响结果;约束太强会失去 plasticity(可塑性),太弱则挡不住遗忘。
ROME 的因果追踪在特定 GPT 模型与事实召回设置中发现中层 MLP 的关键作用;Hase 等在 NeurIPS 2023 进一步发现,representation denoising(表示去噪)得到的定位并不能直接预测哪个 MLP 层最适合编辑。把“某路径对输出有因果作用”翻译成“事实只存在这里、改这里就无副作用”跨过了没有被证明的一步。
Replay、约束与隔离,是三种不同的“旧能力证据”
持续学习方法不是免费午餐分类表。它们分别用旧样本、旧模型行为或独立容量提醒优化器“哪些东西不能丢”;可用数据、推理身份和增长预算不同,最强组合也不同。
把旧分布带回训练
混入真实旧样本、生成样本、特征或 logits(未归一化输出)。它直接提供旧损失信号,通常是强基线;buffer(缓存)覆盖不足、采样比例错误、隐私与版权限制仍会留下长尾遗忘。
限制参数或输出漂移
EWC 保护估计为重要的参数;knowledge distillation(知识蒸馏)让新模型在旧输入上接近旧模型。它能少存数据,却依赖重要性或教师近似,也可能保留旧偏差。
给新任务独立容量
冻结骨干,增加 adapter、prompt、expert(专家)或新 head。旧参数不变使回滚清楚,但模块会增长,路由可能选错,基础模板、tokenizer 或共享骨干升级仍能改变旧模块行为。
把证据组合起来
生产常见组合是冻结大部分骨干 + 小型 replay + 旧模型蒸馏 + 专用 adapter。组合前先跑单独消融,证明每个机制挡住哪类回归,而不是把复杂度当可靠性。
40 个规模,40M–5B
跨语言持续预训练研究在 40 个模型规模上观察迁移与训练时长、语言属性有关,并报告 replay 能有效缓解其设置下的灾难性遗忘。结论属于跨语言 CPT,不自动覆盖指令对齐与事实编辑。
36.2% → 40.7%(+4.5 pp),40% 训练预算
stability-gap 论文在 OpenLlama-3B 医疗持续预训练设置中,用合适子集多轮、高质量语料和近原分布混合,把平均医疗任务从 36.2% 提到 40.7%(增加 4.5 个百分点),使用原训练预算的 40%;这是该实验组合结果,不是通用比例。
格式、知识、可靠性分开测
对齐模型继续预训练的预印本显示,遗忘不只表现为知识题下降,也可能出现输出格式、可靠性和重复问题。若先 SFT / 对齐再 CPT,必须把对齐能力重新放进矩阵。
新域语料不是唯一输入;版本清单和历史回归也属于训练资产
至少绑定 base checkpoint、tokenizer、chat template(对话模板)、新域快照、replay 快照与采样权重、优化器状态、学习率计划、随机种子、每个中间 checkpoint 和矩阵版本。先跑“只训练新域”的朴素基线,再逐项加入混合、蒸馏或 adapter;否则无法知道改进来自哪里。
模型编辑的核心不是“改对一题”,而是定义这次改动的作用域
给定编辑请求 (xe, y*),至少还要定义三组输入:应一起变化的泛化集 G、应由新事实传播到的推理集 P、必须保持的局部性集 U。没有 G / P / U,编辑器可以只背原字符串,也可以把大半个模型一起推向新答案,仍在单题上“成功”。
ROME:对单层 MLP 施加 rank-one(秩一)更新
ROME 先在论文模型中用 Causal Tracing(因果追踪)研究 subject token(主体词元)的事实召回,再构造一个秩一权重更新,把指定 subject–relation 映射到新 object。它在 CounterFact 与 zsRE 的单次编辑实验中联合看 efficacy、paraphrase 和 specificity;这些结果不是任意模型、任意事实的数据库事务保证。
MEMIT:把批量关联更新分配到多个 MLP 层
MEMIT 在 GPT-J 6B 与 GPT-NeoX 20B 上把直接编辑扩展到数千关联。Mass editing(批量编辑)指论文设置中可一次处理更多目标,不代表无限顺序写入;Findings of ACL 2024 后续观察到 ROME / MEMIT 随连续编辑出现旧编辑遗忘、可编辑性下降和下游退化。
MEND:先训练一个“怎样变换梯度”的 editor
Model Editor Networks with Gradient Decomposition(基于梯度分解的模型编辑器网络)把普通微调梯度低秩分解,再由小型网络产生快速参数更新。编辑时快,是因为训练成本被前置;目标模型权重和编辑分布不断变化时,editor 是否仍匹配必须重新测,RLEdit 也正针对这个终身失配问题继续研究。
SERAC / WISE:把新知识放在可路由的旁路记忆
SERAC 保存显式编辑记忆,先判断输入是否落入编辑作用域,再让 counterfactual model(反事实模型)产生结果;WISE 用主记忆与侧参数记忆、路由和分片合并探索 lifelong editing(终身编辑)。它们保护主权重,却引入误路由、记忆增长、查询延迟和作用域分类问题。
AlphaEdit 与 2026 前沿:仍在优化同一组张力
AlphaEdit 把更新投影到用于保留旧知识的 null space(零空间),在 ICLR 2025 获 Oral;ICLR 2026 的 MeG 则探索动态生成附加权重。它们说明研究仍在推进 reliability、generality、locality 与规模之间的取舍,不构成“直接编辑已经取代版本化知识库”的证据。
EasyEdit 能统一多种方法、模型与指标,适合复现实验;但同名算法仍受模型 revision、层选择、超参数、prompt template、batching 与解码设置影响。生产清单必须保存完整配置和输出 diff,不能只写“用了 MEMIT”。
原提示成功,只通过八道门里的第一道
编辑评测要从“一个三元组在一种问法上生效”,扩展到自然改写、近邻保持、逻辑传播、多语言、真实材料、连续冲突、通用能力和系统成本。每一维都对应不同失败,不能压成一个 edit score 后丢掉分项。
| 门禁 | 至少怎么测 | 典型假阳性 | 相关证据 |
|---|---|---|---|
| 01 Reliability | 原请求多模板、多采样,比较编辑前后目标概率与生成 | 只把一个 prompt 背下来 | CounterFact / zsRE |
| 02 Generality | 别名、语序、上下文、问答 / 判断等格式变换 | 同义改写仍回旧答案 | ROME、AKEW |
| 03 Locality | 同实体其他关系、同关系其他实体、语义近邻与随机无关题 | 随机题不变,却污染最近邻 | CounterFact、WISE |
| 04 Portability | 让新事实参与 2/3/4-hop 与逻辑蕴含 | 能复述新事实,推理仍走旧链 | MQuAKE、RippleEdits |
| 05 Multilingual | 源语言编辑,五种目标语言同测直接与多跳问题 | 英文成功被误当跨语言成功 | MLaKE |
| 06 Sequential | 按真实顺序做新增、覆盖、撤销、重复和冲突;复测全部旧编辑 | 批量一次成功,被外推到终身写入 | ACL 2024、WikiBigEdit |
| 07 General & Safety | 基础能力、安全、校准、拒答与长文本回归 | 编辑题更准,通用任务已经退化 | ACL 2024 scale study |
| 08 Systems | 写入时间、峰值内存、增量存储、P95 延迟、路由命中与回滚时间 | 离线精度高,线上成本或恢复不可接受 | 产品自有 workload |
直接记住 ≠ 推理传播
用 2/3/4-hop 问题检查编辑事实的蕴含结果;论文发现当时方法可以较好回忆编辑事实,却在构造的多跳问题上严重失败。
4,072 多跳 + 5,360 单跳
覆盖英语、中文、日语、法语和德语。论文观察英语编辑表现明显高于其他语言,且跨语言家族转移更差,提醒多语言不能由英文 proxy(代理指标)代替。
首个实例 500K+ QA
把真实 Wikidata 更新扩展成可持续增长的终身 benchmark。论文在 Llama-2-7B 的前 10K 更新分析中观察直接局部方法较早退化,RAG 与持续微调是必须保留的强基线。
随机无关题只是一层;真正危险的是“很像、但不该变”的问题
若把“北辰云 CEO 是林岚”改成“周屿”,局部性集至少包含:北辰云的总部、林岚的其他身份、周屿的其他关系、其他公司的 CEO、有效日前的问题、不同地区同名实体,以及否定式和带旧事实诱导的问法。语义越近,越能暴露作用域泄漏。
默认从最外层、最可撤销的方案开始证明
选择原则不是“哪篇论文最新”,而是更新寿命、需要引用、离线要求、覆盖规模、冲突频率和允许的回滚时间。强基线顺序应从 no-update control、context / RAG、adapter / LoRA、持续微调,再到直接编辑;只有后者带来明确净收益,才值得承担更深的权重风险。
| 更新层 | 最适合 | 知识真正存放处 | 回滚方式 | 上线前必须证明 |
|---|---|---|---|---|
| Context | 一次会话、临时规则、少量高优先级信息 | 当前 prompt / state | 删除或换会话状态 | 上下文不被截断、冲突优先级和注入防护 |
| RAG / DB | 价格、库存、政策、人员、法规等时变事实 | 版本化外部数据 | 撤记录、切索引或切快照 | 召回、引用、时态、ACL(访问控制)和多跳 |
| Adapter / LoRA | 稳定语气、格式、租户或领域行为 | 可加载增量参数 | 卸载模块或切路由 | 默认路由、模块组合、骨干与模板兼容 |
| CPT / Fine-tune | 大范围领域知识与成体系技能 | 共享或大范围参数 | 恢复 checkpoint,重放训练 | 数据混合、历史矩阵、中间 stability gap 与对齐回归 |
| Direct edit | 少量、确定、必须离线内化的关联研究 | 目标权重或侧参数 | 参数 diff、侧记忆撤销或整版回滚 | 八道门、连续规模、冲突、重放与恢复 |
| Retrain | 基础分布、架构或高保证训练流程整体变化 | 新 checkpoint | 保留上一发布线 | 全训练数据与供应链治理,成本收益超过增量更新 |
只要事实变化快、要求引用、需要权限控制或可能被删除,就先让版本化外部知识库赢得比赛。WikiBigEdit 的大规模真实更新结果进一步说明,RAG 和简单持续微调不能只当陪跑;直接编辑必须在同预算、同延迟目标和同八维门禁下证明净优势。
一条“CEO 变更”为什么首先是时态数据库问题
下面使用虚构公司,不对应现实事实。2026-08-01 起,“北辰云”的 CEO 从林岚变为周屿;公告在 2026-07-20 签署,2026-07-21 发布。若只把旧 object 替换成新 object,模型就无法回答有效日前、公告日前或历史回溯问题。
| 字段 | v17 旧记录 | v18 新记录 | 为何必须保留 |
|---|---|---|---|
| claim | 北辰云 CEO = 林岚 | 北辰云 CEO = 周屿 | 明确 subject–relation–object |
| valid time | … → 2026-07-31 23:59 | 2026-08-01 00:00 → … | 回答“当时是谁”,不能只存最新值 |
| transaction time | 历史导入时间 | 2026-07-21 发布入库 | 区分事实何时生效与系统何时知道 |
| evidence | 上一版官方公告 | 公告哈希、签署方、抓取快照 | 引用、撤销、权限和争议处理 |
| supersedes | — | v17,仅在有效期后取代 | 避免把历史事实判成“错误” |
| rollback | 保留 | 撤回 v18 → 恢复 v17 当前态 | 公告更正或抓取错误时可恢复 |
先选 RAG:它天然能表达双时间与证据
查询时把用户问题中的时间、地区和语言解析为过滤条件,检索有效记录并附来源。模型权重保持不变,公告撤回时切回 v17;代价是检索与上下文必须可靠。
冻结 5 组“应改变”和 5 组“应保持”
应改变:有效日后的直接问法、别名、英文问法、公告上下文、带旧事实诱导。应保持:有效日前历史问法、总部、两位人物其他关系、其他公司 CEO、证据不足的推断。数量只是教学结构,真实发布按风险扩展。
再加传播、连续与系统测试
传播题检查新 CEO 参与的明确可证推理;连续题在 v18 后追加“代理 CEO”“撤回公告”等冲突;系统测试记录 P95 召回延迟、未命中、旧索引命中、权限拒绝和回滚时间。
只有离线内化是硬约束,才研究直接编辑
例如无网络设备必须回答固定离线知识。此时 RAG 离线包、adapter 与直接编辑仍要同测;若 ROME / MEMIT 只在当前问法更快,却不能表达有效期、来源和撤销,就没有满足原业务合同。
发布的是版本,不是一个“已编辑模型”文件
manifest(清单)绑定 base revision、知识快照、editor 配置、参数或记忆 diff、八维报告、审批者、灰度 cohort、监控阈值和上一可用版本。线上答案必须能追到到底用了哪条记录或哪次编辑。
“现在是谁?”与“2026 年 7 月 25 日是谁?”必须得到不同答案
前者按请求时间命中 v18;后者按 valid time 命中 v17;“公告是什么时候发布的?”读 transaction time;“为什么变更?”只有证据中明确给出原因才回答。一个只会把所有问法都改成“周屿”的编辑器,在可靠性单题上可能高分,在时态真实性上却是错误系统。
更新成功不证明事实为真,也不证明旧知识已消失
编辑器执行目标,不验证目标真实性
错误或恶意 target 也能获得高 reliability。来源权威、签名、有效期、冲突策略和审批属于知识治理控制面,不能交给 edit score。
函数局部性不能由参数量推出
秩一、低秩、少层或小 adapter 都是在参数空间描述改动;模型在输入空间的影响要靠近邻、格式、多语言、推理与安全回归实测。
RAG 不是零风险替代品
它避免改基础权重,却会漏召回、取错版本、暴露无权文档、遭提示注入或在多跳时拼错证据。选择 RAG 是改变故障位置,不是消灭故障。
拒答不等于 unlearning
Certified Removal(可认证删除)的强定义要求移除后的模型与从未见过该数据的模型不可区分。把答案编辑为“不知道”只改变可观察行为之一,不能证明参数、表征或攻击下的知识已经被删除。
benchmark 结论必须绑定模型与序列
CounterFact、MQuAKE、MLaKE、WikiBigEdit 测的是不同知识类型、语言、模型和更新规模;任何“领先 X%”都要带 base model、编辑次数、推理设置、基线和置信区间,不能横向拼成通用排行。
01为什么单次编辑成功不能代表生产可用?
因为它没有覆盖自然改写、近邻保持、逻辑传播、多语言、连续冲突、通用能力、系统开销和回滚。生产发布单位是带八维证据的版本,不是一个 prompt 的答案。
02能力矩阵比最终平均分多告诉了什么?
它保留每次更新后的历史轨迹,能看到某个关键旧域在何时开始退化、后来是否恢复,以及平均数是否被新任务高分掩盖。
03什么时候优先 replay,什么时候优先 adapter?
能合法保存代表性旧数据、需要共享知识迁移时,replay 是直接旧损失证据;推理时有明确租户 / 任务身份、要求模块化回滚时,adapter 更自然。两者常组合,但都受覆盖、路由和共享组件变化影响。
04ROME 与 RAG 最根本的差别是什么?
ROME 把目标关联写进模型 MLP 权重,通常不增加检索步骤;RAG 把事实留在外部存储,查询时检索并注入。前者回归面更深,后者在线路由与证据治理更重。
05一个隐私删除请求能否用模型编辑完成?
可以把拒答当作行为缓解或 unlearning 基线之一,但不能把它当删除证明。删除请求要进入独立的数据定位、训练血缘、攻击评测与可认证或可审计遗忘流程。
一手来源与证据边界
优先使用论文、官方文档、官方模型卡和代码仓库。页面中的数字只代表来源所述设置,不自动外推到其他模型与数据。
Elastic Weight Consolidation(EWC,弹性权重巩固)的原始方法、Fisher 信息近似和稳定性—可塑性取舍。
能力矩阵、Average Accuracy、Backward Transfer、Forward Transfer 的明确公式,以及用 episodic memory 约束旧任务损失的 GEM。
Task-Incremental、Domain-Incremental、Class-Incremental 三种协议以及推理时是否提供 context identity 的关键差异。
40 个模型规模、40M–5B 参数的跨语言持续预训练实验,以及 replay 对遗忘的缓解证据与适用范围。
持续预训练开头的 stability gap、子集多轮、高质量语料和接近原预训练分布的数据混合策略;数字只按论文实验口径引用。
对齐模型继续预训练时,分别观察格式、知识、可靠性与重复问题;作为预印本证据,不当作普遍定律。
Causal Tracing(因果追踪)、CounterFact 与 Rank-One Model Editing(ROME,秩一模型编辑)的原始实验。
MEMIT 将更新分配到多个 MLP 层,并在 GPT-J 6B 与 GPT-NeoX 20B 上扩展到数千事实关联。
Model Editor Networks with Gradient Decomposition(MEND)的低秩梯度变换、编辑器训练成本和 10B+ 参数模型实验边界。
SERAC 的显式编辑记忆、作用域分类与 counterfactual model,说明旁路记忆如何把写入成本换成推理路由成本。
因果定位结论并不能直接预测哪个 MLP 层最适合编辑,约束“事实只在某一层”的过度表述。
用 2/3/4-hop 问题检查编辑事实能否传播到蕴含结论,以及 MeLLo 外部记忆基线。
RippleEdits 对逻辑蕴含、组合关系与相关事实一致性的评测,补足原提示和同义改写之外的传播面。
ROME / MEMIT 连续编辑下的可编辑性下降、旧编辑遗忘与下游能力退化,以及渐进后突发的失败形态。
终身编辑中的 reliability–generalization–locality 张力,以及双参数记忆、侧记忆与路由设计。
将更新约束到保留知识表示的零空间,以降低尤其是连续编辑时的破坏;不外推为无副作用保证。
首个实例含 500K+ 问答对的真实 Wikidata 更新基准,以及 RAG、持续微调和多种编辑方法在长更新序列中的对比。
4,072 个多跳、5,360 个单跳问题和英中日法德五种语言的评测规模与跨语言迁移问题。
把真实更新扩展到结构化事实、非结构化文本和抽取三元组,揭示干净三元组 benchmark 与实际材料之间的差距。
统一实现和评测多类知识编辑方法;框架可复现实验,但不替代独立基线、版本锁定与生产门禁。
把动态变化的目标模型纳入 hypernetwork 终身编辑问题,说明固定 editor 与不断变化权重之间的失配是活跃研究方向。
2026 年 accepted frontier:用动态权重生成探索大规模编辑;作为前沿候选呈现,不据此改写生产默认路径。
Certified Removal 的强定义:移除后模型应与从未见过该数据的模型不可区分,用于界定编辑成拒答不等于已删除。
逐任务 forgetting measure 的原始定义:只对旧任务 j<k,比较当前分数与此前历史最好分数;页面采用同一思想并显式声明索引区间。