跳到正文
训练与对齐 · CONTINUAL UPDATE

模型更新不是一次写入,而是一张随版本扩大的回归合同

学会一个新事实或新领域,只证明更新有收益;它是否值得上线,还要减去旧能力回归、时态冲突、推理成本和恢复风险。持续学习与模型编辑真正共享的核心,是把每次改变绑定到明确协议、完整历史矩阵、编辑账本与可执行回滚点。

持续学习与模型编辑总览插画:新知识卡片经过版本门进入分层模型记忆,旧样本由回放环路补充,关键连接受保护,旁路模块承载独立更新,输出再进入回归、外部记忆和回滚检查。
直觉总览:模型像一座不断改造的图书馆;新书入馆之前,要知道放哪一层、会不会覆盖旧索引、怎样巡检,以及哪一个版本可以撤回。图只表达更新与保护的关系,精确协议见下方 SVG。查看原图 ↗
01 · Versioned Update Contract

先问“新知识应住在哪”,再问“用哪个算法写进去”

模型输出变化可能来自四层:一次会话的上下文、可版本化的外部检索、可路由的 adapter(适配器)或基础权重。四层都能让答案改变,却有完全不同的寿命、引用、权限、推理开销和撤销方式。把它们混称“模型学会了”,会让回归与责任边界一起消失。

CONTEXT

会话上下文

只在当前请求生效,更新最快;删除上下文即可撤销。适合临时约束与少量事实,但受上下文窗口、指令冲突和 prompt injection(提示注入)影响。

RETRIEVAL

版本化外部记忆

数据库、知识图谱或文档保存事实与有效期,推理时检索并引用。回滚最直观,但召回、排序、来源冲突与多跳组合成为新失败面。

ADAPTER

可路由参数层

冻结骨干,按版本、租户或领域加载 Low-Rank Adaptation(LoRA,低秩适配)等模块。模块易卸载,不代表默认路由、合并权重和共享模板不会引入回归。

BASE WEIGHTS

基础权重

持续预训练、全量微调或直接编辑都改共享参数。推理不一定增加检索步骤,却把副作用扩散到更大的输入空间;撤销通常回到 checkpoint(检查点)或重放更新日志。

决策账 · 不是论文公式

更新净价值 = 新目标收益 − 历史回归 − 在线成本 − 恢复风险

同一条新事实,RAG 可能多付一次检索延迟,却换来引用、权限和即时撤销;直接权重编辑可能没有显式检索,却要支付更大的近邻、多跳与连续历史回归。四项必须放在同一业务 SLO(Service-Level Objective,服务级目标)下比较。

版本化模型更新合同:更新请求先冻结学习协议和更新前基线,再产生上下文、检索、适配器或基础权重候选;越向权重深处写入,回归面与恢复成本越大;候选必须经过全历史回归、证据账本、灰度监控,并在失败时回到上一验证版本。
珊瑚红表示新更新,蓝色表示历史能力,绿色表示已验证状态,红色虚线表示阻断与回滚。知识层不是成熟度阶梯:动态事实留在外层往往比写进权重更正确。 查看原图 ↗
02 · Protocol Before Score

“持续学习分数”没有脱离协议的含义

同样是顺序学习 A、B、C,推理时是否告诉模型当前任务、旧原始数据能否保存、标签空间是否扩张、边界是否可见,都会改变难度和可用方法。先声明协议,才知道两个分数能不能比较。

协议维度必须声明为什么会改结论LLM 生产对应
Boundary任务 / 分布边界已知还是未知已知边界可切 adapter、重置优化器或触发回归;未知流必须在线检测漂移数据批次、政策版本或客户域是否有可靠事件
Replay access可保存多少旧原始样本、特征或 logits能直接优化旧损失,与只能靠参数正则不是同一信息条件隐私、版权、数据驻留与保留期限
Context identity推理时是否提供 task / version / tenant有身份可选择专用 head 或 adapter;无身份还要解决路由与开放世界识别请求是否携带租户、地区、时间和模型版本
Output space输出固定、扩张,还是新旧目标冲突新增技能与覆盖旧政策的优化目标不同;后者必须定义 supersede(取代)语义新增工具、改 JSON schema、更新事实或撤销规则
Order真实时间、随机顺序、重复与撤销是否保留随机打乱能抹掉难例;真实流里的冲突和重复决定长期稳定性按线上事件时间重放,不能只做随机 IID(独立同分布)切分
三种经典情境

Task-Incremental Learning(任务增量学习)在推理时提供 context identity;Domain-Incremental Learning(域增量学习)通常保持输出任务、让输入分布变化且不提供 context;Class-Incremental Learning(类别增量学习)让可预测类别随任务扩张且推理时不给 task ID。LLM 的“新领域、事实覆盖、租户适配、工具新增”常同时跨越这三类,不要只贴一个缩写。

持续学习评测协议和能力矩阵:顶部列出边界、旧数据、推理身份、输出空间和到达顺序;中部用 R i j 表示第 i 次更新后任务 j 的分数,右侧给出最终平均表现、后向迁移、前向迁移和遗忘量公式;底部要求按真实顺序保留更新、重复、冲突和最终回归。
读图顺序:先看顶部协议,再读矩阵,最后读公式。BWT 为正表示后来学习改善旧任务,为负表示退化;forgetting 的定义在文献中有变体,因此报告必须附公式与未训练基线。 查看原图 ↗
Rᵢⱼ

一个单元格就是一份回归记录

完成更新 i 后,在能力 j 的冻结测试快照上评估。j 可以是准确率,也可以是奖励、业务成功率或“负损失”;必须统一成越大越好,或显式说明方向。

BWT

Backward Transfer(后向迁移)

(1/(T−1)) Σⱼ<T (RT,j−Rj,j)。它比较最终版本与刚学完任务 j 时的分数;负值是平均退化,但平均值仍可能掩盖关键单域。

Fⱼ · j<T

Forgetting(遗忘量)

maxᵢ∈[j,T−1] Ri,j − RT,j。它只对最终更新前已经学过的能力定义,看能力 j 从历史最好点掉了多少;若业务只承诺发布基线,也应另报相对承诺阈值的跌幅。

03 · Why Models Forget

新梯度不是在“删除记忆”,它只是没有收到保护旧能力的合同

一次新任务更新为 θ′ = θ − ηgnew。对旧任务做一阶近似:ΔLold ≈ −η gold·gnew。两个梯度内积为负时,新步会抬高旧损失,这叫 interference(干扰);连续很多小干扰也能累积成大回归。

共享表示让“一处更新”影响许多输入

事实、语言格式、推理策略和安全行为通常复用 attention(注意力)、MLP(Multi-Layer Perceptron,多层感知机)与归一化路径。参数 diff 很小,只说明改动稀疏或低秩,不说明函数空间里的影响局部。

数据顺序改变优化器看到的世界

若新域 mini-batch 长时间占满训练流,梯度估计就几乎不包含旧分布。学习率、动量、weight decay(权重衰减)、训练步数和 optimizer state(优化器状态)会共同决定漂移;“同一批数据”换顺序也不保证同一结果。

遗忘可能先发生,再被平均分掩盖

持续预训练可在开头出现 stability gap(稳定性缺口):通用表现先跌、之后部分恢复。若只评训练终点,就看不到上线中途会遇到的低谷;若只看 perplexity(困惑度),又可能漏掉事实、格式或安全能力变化。

“保护旧模型”也会保护旧错误

正则、蒸馏和 replay 都在约束偏移。若旧行为本应被政策更新覆盖,过强保护会阻碍新目标;因此回归集必须把“应保持”“应改变”“仅在某时段改变”分开,而不是要求所有旧输出逐字不动。

EWC · Elastic Weight Consolidation

L = Lnew + λ/2 · Σᵢ Fᵢ(θᵢ−θ*ᵢ)²

θ* 是旧任务参数,Fᵢ 用 Fisher information(Fisher 信息)的对角近似估计参数重要性。它不是“冻结重要神经元”:重要性估计、对角假设、多个任务的累计存储和 λ 都会影响结果;约束太强会失去 plasticity(可塑性),太弱则挡不住遗忘。

定位不等于开关

ROME 的因果追踪在特定 GPT 模型与事实召回设置中发现中层 MLP 的关键作用;Hase 等在 NeurIPS 2023 进一步发现,representation denoising(表示去噪)得到的定位并不能直接预测哪个 MLP 层最适合编辑。把“某路径对输出有因果作用”翻译成“事实只存在这里、改这里就无副作用”跨过了没有被证明的一步。

04 · Continual Training Toolbox

Replay、约束与隔离,是三种不同的“旧能力证据”

持续学习方法不是免费午餐分类表。它们分别用旧样本、旧模型行为或独立容量提醒优化器“哪些东西不能丢”;可用数据、推理身份和增长预算不同,最强组合也不同。

REPLAY

把旧分布带回训练

混入真实旧样本、生成样本、特征或 logits(未归一化输出)。它直接提供旧损失信号,通常是强基线;buffer(缓存)覆盖不足、采样比例错误、隐私与版权限制仍会留下长尾遗忘。

REGULARIZE

限制参数或输出漂移

EWC 保护估计为重要的参数;knowledge distillation(知识蒸馏)让新模型在旧输入上接近旧模型。它能少存数据,却依赖重要性或教师近似,也可能保留旧偏差。

ISOLATE

给新任务独立容量

冻结骨干,增加 adapter、prompt、expert(专家)或新 head。旧参数不变使回滚清楚,但模块会增长,路由可能选错,基础模板、tokenizer 或共享骨干升级仍能改变旧模块行为。

HYBRID

把证据组合起来

生产常见组合是冻结大部分骨干 + 小型 replay + 旧模型蒸馏 + 专用 adapter。组合前先跑单独消融,证明每个机制挡住哪类回归,而不是把复杂度当可靠性。

EMNLP 2024

40 个规模,40M–5B

跨语言持续预训练研究在 40 个模型规模上观察迁移与训练时长、语言属性有关,并报告 replay 能有效缓解其设置下的灾难性遗忘。结论属于跨语言 CPT,不自动覆盖指令对齐与事实编辑。

ACL 2025

36.2% → 40.7%(+4.5 pp),40% 训练预算

stability-gap 论文在 OpenLlama-3B 医疗持续预训练设置中,用合适子集多轮、高质量语料和近原分布混合,把平均医疗任务从 36.2% 提到 40.7%(增加 4.5 个百分点),使用原训练预算的 40%;这是该实验组合结果,不是通用比例。

ALIGNED MODEL

格式、知识、可靠性分开测

对齐模型继续预训练的预印本显示,遗忘不只表现为知识题下降,也可能出现输出格式、可靠性和重复问题。若先 SFT / 对齐再 CPT,必须把对齐能力重新放进矩阵。

一个可执行的 CPT 更新批次

新域语料不是唯一输入;版本清单和历史回归也属于训练资产

至少绑定 base checkpoint、tokenizer、chat template(对话模板)、新域快照、replay 快照与采样权重、优化器状态、学习率计划、随机种子、每个中间 checkpoint 和矩阵版本。先跑“只训练新域”的朴素基线,再逐项加入混合、蒸馏或 adapter;否则无法知道改进来自哪里。

05 · Model Editing

模型编辑的核心不是“改对一题”,而是定义这次改动的作用域

给定编辑请求 (xe, y*),至少还要定义三组输入:应一起变化的泛化集 G应由新事实传播到的推理集 P必须保持的局部性集 U。没有 G / P / U,编辑器可以只背原字符串,也可以把大半个模型一起推向新答案,仍在单题上“成功”。

模型编辑方法地图按写入位置、写入动作、推理与回滚和主要风险比较四类方案:ROME、MEMIT、AlphaEdit 等直接参数编辑;MEND 更新生成器;SERAC 和 WISE 的旁路记忆与路由;以及上下文和检索基线。
这不是一条从旧到新的升级线。直接编辑把成本放在写入与回归;旁路记忆和 RAG 把部分成本移到推理与路由。所有方法都要与 RAG、LoRA / 微调和 no-update control(不更新对照)同条件比较。 查看原图 ↗

ROME:对单层 MLP 施加 rank-one(秩一)更新

ROME 先在论文模型中用 Causal Tracing(因果追踪)研究 subject token(主体词元)的事实召回,再构造一个秩一权重更新,把指定 subject–relation 映射到新 object。它在 CounterFact 与 zsRE 的单次编辑实验中联合看 efficacy、paraphrase 和 specificity;这些结果不是任意模型、任意事实的数据库事务保证。

MEMIT:把批量关联更新分配到多个 MLP 层

MEMIT 在 GPT-J 6B 与 GPT-NeoX 20B 上把直接编辑扩展到数千关联。Mass editing(批量编辑)指论文设置中可一次处理更多目标,不代表无限顺序写入;Findings of ACL 2024 后续观察到 ROME / MEMIT 随连续编辑出现旧编辑遗忘、可编辑性下降和下游退化。

MEND:先训练一个“怎样变换梯度”的 editor

Model Editor Networks with Gradient Decomposition(基于梯度分解的模型编辑器网络)把普通微调梯度低秩分解,再由小型网络产生快速参数更新。编辑时快,是因为训练成本被前置;目标模型权重和编辑分布不断变化时,editor 是否仍匹配必须重新测,RLEdit 也正针对这个终身失配问题继续研究。

SERAC / WISE:把新知识放在可路由的旁路记忆

SERAC 保存显式编辑记忆,先判断输入是否落入编辑作用域,再让 counterfactual model(反事实模型)产生结果;WISE 用主记忆与侧参数记忆、路由和分片合并探索 lifelong editing(终身编辑)。它们保护主权重,却引入误路由、记忆增长、查询延迟和作用域分类问题。

AlphaEdit 与 2026 前沿:仍在优化同一组张力

AlphaEdit 把更新投影到用于保留旧知识的 null space(零空间),在 ICLR 2025 获 Oral;ICLR 2026 的 MeG 则探索动态生成附加权重。它们说明研究仍在推进 reliability、generality、locality 与规模之间的取舍,不构成“直接编辑已经取代版本化知识库”的证据。

工具不是证据

EasyEdit 能统一多种方法、模型与指标,适合复现实验;但同名算法仍受模型 revision、层选择、超参数、prompt template、batching 与解码设置影响。生产清单必须保存完整配置和输出 diff,不能只写“用了 MEMIT”。

06 · Eight Release Gates

原提示成功,只通过八道门里的第一道

编辑评测要从“一个三元组在一种问法上生效”,扩展到自然改写、近邻保持、逻辑传播、多语言、真实材料、连续冲突、通用能力和系统成本。每一维都对应不同失败,不能压成一个 edit score 后丢掉分项。

门禁至少怎么测典型假阳性相关证据
01 Reliability原请求多模板、多采样,比较编辑前后目标概率与生成只把一个 prompt 背下来CounterFact / zsRE
02 Generality别名、语序、上下文、问答 / 判断等格式变换同义改写仍回旧答案ROME、AKEW
03 Locality同实体其他关系、同关系其他实体、语义近邻与随机无关题随机题不变,却污染最近邻CounterFact、WISE
04 Portability让新事实参与 2/3/4-hop 与逻辑蕴含能复述新事实,推理仍走旧链MQuAKE、RippleEdits
05 Multilingual源语言编辑,五种目标语言同测直接与多跳问题英文成功被误当跨语言成功MLaKE
06 Sequential按真实顺序做新增、覆盖、撤销、重复和冲突;复测全部旧编辑批量一次成功,被外推到终身写入ACL 2024、WikiBigEdit
07 General & Safety基础能力、安全、校准、拒答与长文本回归编辑题更准,通用任务已经退化ACL 2024 scale study
08 Systems写入时间、峰值内存、增量存储、P95 延迟、路由命中与回滚时间离线精度高,线上成本或恢复不可接受产品自有 workload
MQUAKE · 2023

直接记住 ≠ 推理传播

用 2/3/4-hop 问题检查编辑事实的蕴含结果;论文发现当时方法可以较好回忆编辑事实,却在构造的多跳问题上严重失败。

MLAKE · 2025

4,072 多跳 + 5,360 单跳

覆盖英语、中文、日语、法语和德语。论文观察英语编辑表现明显高于其他语言,且跨语言家族转移更差,提醒多语言不能由英文 proxy(代理指标)代替。

WIKIBIGEDIT · 2025

首个实例 500K+ QA

把真实 Wikidata 更新扩展成可持续增长的终身 benchmark。论文在 Llama-2-7B 的前 10K 更新分析中观察直接局部方法较早退化,RAG 与持续微调是必须保留的强基线。

局部性测试的最低结构

随机无关题只是一层;真正危险的是“很像、但不该变”的问题

若把“北辰云 CEO 是林岚”改成“周屿”,局部性集至少包含:北辰云的总部、林岚的其他身份、周屿的其他关系、其他公司的 CEO、有效日前的问题、不同地区同名实体,以及否定式和带旧事实诱导的问法。语义越近,越能暴露作用域泄漏。

07 · Choose the Knowledge Layer

默认从最外层、最可撤销的方案开始证明

选择原则不是“哪篇论文最新”,而是更新寿命、需要引用、离线要求、覆盖规模、冲突频率和允许的回滚时间。强基线顺序应从 no-update control、context / RAG、adapter / LoRA、持续微调,再到直接编辑;只有后者带来明确净收益,才值得承担更深的权重风险。

更新层最适合知识真正存放处回滚方式上线前必须证明
Context一次会话、临时规则、少量高优先级信息当前 prompt / state删除或换会话状态上下文不被截断、冲突优先级和注入防护
RAG / DB价格、库存、政策、人员、法规等时变事实版本化外部数据撤记录、切索引或切快照召回、引用、时态、ACL(访问控制)和多跳
Adapter / LoRA稳定语气、格式、租户或领域行为可加载增量参数卸载模块或切路由默认路由、模块组合、骨干与模板兼容
CPT / Fine-tune大范围领域知识与成体系技能共享或大范围参数恢复 checkpoint,重放训练数据混合、历史矩阵、中间 stability gap 与对齐回归
Direct edit少量、确定、必须离线内化的关联研究目标权重或侧参数参数 diff、侧记忆撤销或整版回滚八道门、连续规模、冲突、重放与恢复
Retrain基础分布、架构或高保证训练流程整体变化新 checkpoint保留上一发布线全训练数据与供应链治理,成本收益超过增量更新
模型编辑生产控制面:编辑请求先规范化事实、有效期、来源、所有者和撤销关系,再做时态与冲突检测,并行产生 RAG、LoRA、持续微调、直接编辑和不更新对照;候选绑定完整清单,经过可靠性、泛化、局部性、传播、多语言、连续历史、通用安全和系统八道门,追加账本后灰度发布,失败则回滚。
控制面把“算法实验”变成“版本发布”。所有候选使用同一测试快照、解码与 workload;对隐私删除请求,编辑成拒答不能代替独立 unlearning(机器遗忘)与数据治理证明。 查看原图 ↗
一个强默认

只要事实变化快、要求引用、需要权限控制或可能被删除,就先让版本化外部知识库赢得比赛。WikiBigEdit 的大规模真实更新结果进一步说明,RAG 和简单持续微调不能只当陪跑;直接编辑必须在同预算、同延迟目标和同八维门禁下证明净优势。

08 · Worked Version Trace

一条“CEO 变更”为什么首先是时态数据库问题

下面使用虚构公司,不对应现实事实。2026-08-01 起,“北辰云”的 CEO 从林岚变为周屿;公告在 2026-07-20 签署,2026-07-21 发布。若只把旧 object 替换成新 object,模型就无法回答有效日前、公告日前或历史回溯问题。

字段v17 旧记录v18 新记录为何必须保留
claim北辰云 CEO = 林岚北辰云 CEO = 周屿明确 subject–relation–object
valid time… → 2026-07-31 23:592026-08-01 00:00 → …回答“当时是谁”,不能只存最新值
transaction time历史导入时间2026-07-21 发布入库区分事实何时生效与系统何时知道
evidence上一版官方公告公告哈希、签署方、抓取快照引用、撤销、权限和争议处理
supersedesv17,仅在有效期后取代避免把历史事实判成“错误”
rollback保留撤回 v18 → 恢复 v17 当前态公告更正或抓取错误时可恢复

先选 RAG:它天然能表达双时间与证据

查询时把用户问题中的时间、地区和语言解析为过滤条件,检索有效记录并附来源。模型权重保持不变,公告撤回时切回 v17;代价是检索与上下文必须可靠。

冻结 5 组“应改变”和 5 组“应保持”

应改变:有效日后的直接问法、别名、英文问法、公告上下文、带旧事实诱导。应保持:有效日前历史问法、总部、两位人物其他关系、其他公司 CEO、证据不足的推断。数量只是教学结构,真实发布按风险扩展。

再加传播、连续与系统测试

传播题检查新 CEO 参与的明确可证推理;连续题在 v18 后追加“代理 CEO”“撤回公告”等冲突;系统测试记录 P95 召回延迟、未命中、旧索引命中、权限拒绝和回滚时间。

只有离线内化是硬约束,才研究直接编辑

例如无网络设备必须回答固定离线知识。此时 RAG 离线包、adapter 与直接编辑仍要同测;若 ROME / MEMIT 只在当前问法更快,却不能表达有效期、来源和撤销,就没有满足原业务合同。

发布的是版本,不是一个“已编辑模型”文件

manifest(清单)绑定 base revision、知识快照、editor 配置、参数或记忆 diff、八维报告、审批者、灰度 cohort、监控阈值和上一可用版本。线上答案必须能追到到底用了哪条记录或哪次编辑。

正确回答合同

“现在是谁?”与“2026 年 7 月 25 日是谁?”必须得到不同答案

前者按请求时间命中 v18;后者按 valid time 命中 v17;“公告是什么时候发布的?”读 transaction time;“为什么变更?”只有证据中明确给出原因才回答。一个只会把所有问法都改成“周屿”的编辑器,在可靠性单题上可能高分,在时态真实性上却是错误系统。

09 · Boundaries & Recall

更新成功不证明事实为真,也不证明旧知识已消失

编辑器执行目标,不验证目标真实性

错误或恶意 target 也能获得高 reliability。来源权威、签名、有效期、冲突策略和审批属于知识治理控制面,不能交给 edit score。

函数局部性不能由参数量推出

秩一、低秩、少层或小 adapter 都是在参数空间描述改动;模型在输入空间的影响要靠近邻、格式、多语言、推理与安全回归实测。

RAG 不是零风险替代品

它避免改基础权重,却会漏召回、取错版本、暴露无权文档、遭提示注入或在多跳时拼错证据。选择 RAG 是改变故障位置,不是消灭故障。

拒答不等于 unlearning

Certified Removal(可认证删除)的强定义要求移除后的模型与从未见过该数据的模型不可区分。把答案编辑为“不知道”只改变可观察行为之一,不能证明参数、表征或攻击下的知识已经被删除。

benchmark 结论必须绑定模型与序列

CounterFact、MQuAKE、MLaKE、WikiBigEdit 测的是不同知识类型、语言、模型和更新规模;任何“领先 X%”都要带 base model、编辑次数、推理设置、基线和置信区间,不能横向拼成通用排行。

01为什么单次编辑成功不能代表生产可用?

因为它没有覆盖自然改写、近邻保持、逻辑传播、多语言、连续冲突、通用能力、系统开销和回滚。生产发布单位是带八维证据的版本,不是一个 prompt 的答案。

02能力矩阵比最终平均分多告诉了什么?

它保留每次更新后的历史轨迹,能看到某个关键旧域在何时开始退化、后来是否恢复,以及平均数是否被新任务高分掩盖。

03什么时候优先 replay,什么时候优先 adapter?

能合法保存代表性旧数据、需要共享知识迁移时,replay 是直接旧损失证据;推理时有明确租户 / 任务身份、要求模块化回滚时,adapter 更自然。两者常组合,但都受覆盖、路由和共享组件变化影响。

04ROME 与 RAG 最根本的差别是什么?

ROME 把目标关联写进模型 MLP 权重,通常不增加检索步骤;RAG 把事实留在外部存储,查询时检索并注入。前者回归面更深,后者在线路由与证据治理更重。

05一个隐私删除请求能否用模型编辑完成?

可以把拒答当作行为缓解或 unlearning 基线之一,但不能把它当删除证明。删除请求要进入独立的数据定位、训练血缘、攻击评测与可认证或可审计遗忘流程。

继续学习

想深入训练更新,接着看 后训练决策树LoRA / QLoRA 实践LLM 评测;想理解“定位为何不等于可控修改”,进入 机制可解释性;想把时变事实留在外部,则回到 RAG检索系统

RESEARCH LEDGER

一手来源与证据边界

优先使用论文、官方文档、官方模型卡和代码仓库。页面中的数字只代表来源所述设置,不自动外推到其他模型与数据。

CL01
Overcoming catastrophic forgetting in neural networksKirkpatrick et al. · PNAS 2017

Elastic Weight Consolidation(EWC,弹性权重巩固)的原始方法、Fisher 信息近似和稳定性—可塑性取舍。

CL02
Gradient Episodic Memory for Continual LearningLopez-Paz & Ranzato · NeurIPS 2017

能力矩阵、Average Accuracy、Backward Transfer、Forward Transfer 的明确公式,以及用 episodic memory 约束旧任务损失的 GEM。

CL03
Three types of incremental learningvan de Ven et al. · Nature Machine Intelligence 2022

Task-Incremental、Domain-Incremental、Class-Incremental 三种协议以及推理时是否提供 context identity 的关键差异。

CL04
Breaking Language Barriers: Cross-Lingual Continual Pre-Training at ScaleZheng et al. · EMNLP 2024

40 个模型规模、40M–5B 参数的跨语言持续预训练实验,以及 replay 对遗忘的缓解证据与适用范围。

CL05
Efficient Domain Continual pretraining by Mitigating the Stability GapGuo et al. · ACL 2025

持续预训练开头的 stability gap、子集多轮、高质量语料和接近原预训练分布的数据混合策略;数字只按论文实验口径引用。

CL06
Examining Forgetting in Continual Pre-training of Aligned Large Language ModelsLi & Lee · arXiv preprint 2024

对齐模型继续预训练时,分别观察格式、知识、可靠性与重复问题;作为预印本证据,不当作普遍定律。

CL07
Locating and Editing Factual Associations in GPTMeng et al. · NeurIPS 2022

Causal Tracing(因果追踪)、CounterFact 与 Rank-One Model Editing(ROME,秩一模型编辑)的原始实验。

CL08
Mass-Editing Memory in a TransformerMeng et al. · ICLR 2023

MEMIT 将更新分配到多个 MLP 层,并在 GPT-J 6B 与 GPT-NeoX 20B 上扩展到数千事实关联。

CL09
Fast Model Editing at ScaleMitchell et al. · ICLR 2022

Model Editor Networks with Gradient Decomposition(MEND)的低秩梯度变换、编辑器训练成本和 10B+ 参数模型实验边界。

CL10
Memory-Based Model Editing at ScaleMitchell et al. · ICML 2022

SERAC 的显式编辑记忆、作用域分类与 counterfactual model,说明旁路记忆如何把写入成本换成推理路由成本。

CL11
Does Localization Inform Editing?Hase et al. · NeurIPS 2023

因果定位结论并不能直接预测哪个 MLP 层最适合编辑,约束“事实只在某一层”的过度表述。

CL12
MQuAKE: Assessing Knowledge Editing in Language Models via Multi-Hop QuestionsZhong et al. · EMNLP 2023

用 2/3/4-hop 问题检查编辑事实能否传播到蕴含结论,以及 MeLLo 外部记忆基线。

CL13
Evaluating the Ripple Effects of Knowledge Editing in Language ModelsCohen et al. · TACL 2024

RippleEdits 对逻辑蕴含、组合关系与相关事实一致性的评测,补足原提示和同义改写之外的传播面。

CL14
Model Editing at Scale leads to Gradual and Catastrophic ForgettingGupta et al. · Findings of ACL 2024

ROME / MEMIT 连续编辑下的可编辑性下降、旧编辑遗忘与下游能力退化,以及渐进后突发的失败形态。

CL15
WISE: Rethinking the Knowledge Memory for Lifelong Model Editing of Large Language ModelsWang et al. · NeurIPS 2024

终身编辑中的 reliability–generalization–locality 张力,以及双参数记忆、侧记忆与路由设计。

CL16
AlphaEdit: Null-Space Constrained Knowledge Editing for Language ModelsFang et al. · ICLR 2025 Oral

将更新约束到保留知识表示的零空间,以降低尤其是连续编辑时的破坏;不外推为无副作用保证。

CL17
WikiBigEdit: Understanding the Limits of Lifelong Knowledge Editing in LLMsThede et al. · ICML 2025

首个实例含 500K+ 问答对的真实 Wikidata 更新基准,以及 RAG、持续微调和多种编辑方法在长更新序列中的对比。

CL18
MLaKE: Multilingual Knowledge Editing Benchmark for Large Language ModelsWei et al. · COLING 2025

4,072 个多跳、5,360 个单跳问题和英中日法德五种语言的评测规模与跨语言迁移问题。

CL19
AKEW: Assessing Knowledge Editing in the WildWu et al. · EMNLP 2024

把真实更新扩展到结构化事实、非结构化文本和抽取三元组,揭示干净三元组 benchmark 与实际材料之间的差距。

CL20
EasyEdit: An Easy-to-use Knowledge Editing Framework for Large Language ModelsWang et al. · ACL Demo 2024

统一实现和评测多类知识编辑方法;框架可复现实验,但不替代独立基线、版本锁定与生产门禁。

CL21
Reinforced Lifelong Editing for Language ModelsLi et al. · ICML 2025

把动态变化的目标模型纳入 hypernetwork 终身编辑问题,说明固定 editor 与不断变化权重之间的失配是活跃研究方向。

CL22
Massive Editing for Large Language Models Based on Dynamic Weight GenerationWan et al. · ICLR 2026 Poster

2026 年 accepted frontier:用动态权重生成探索大规模编辑;作为前沿候选呈现,不据此改写生产默认路径。

CL23
Certified Data Removal from Machine Learning ModelsGuo et al. · ICML 2020

Certified Removal 的强定义:移除后模型应与从未见过该数据的模型不可区分,用于界定编辑成拒答不等于已删除。

CL24
Riemannian Walk for Incremental Learning: Understanding Forgetting and IntransigenceChaudhry et al. · ECCV 2018

逐任务 forgetting measure 的原始定义:只对旧任务 j<k,比较当前分数与此前历史最好分数;页面采用同一思想并显式声明索引区间。