Wink Pings

模型没变,行为却崩了:一篇论文把问题指向了agent的“外挂”

南京大学和卧龙岗大学的新论文提出了Harness Continual Learning(HCL)范式,指出现代AI agent的持续学习问题已从模型权重转移到prompts、记忆、工具等外部组件上。更新这些组件可能导致此前可靠的行为崩溃,即使模型本身未动。论文提出的guarded harness evolution方案在多个任务上实现了超过10%的相对性能提升。

如果你已经在让agent自己改写prompt、技能或记忆文件,这篇论文值得花时间读完。

![论文截图:Harness Continual Learning: Continual Adaptation Beyond Model Parameters](https://wink.run/image?url=https%3A%2F%2Fpbs.twimg.com%2Fmedia%2FHQMRN8HaIAAzAfP%3Fformat%3Djpg%26name%3Dlarge)

持续学习的研究一直盯着模型权重:训练一个模型,让它学新东西的同时不忘旧知识。这套思路在大模型时代遇到了一个尴尬——现代agent的适应方式早就变了。

现在的agent怎么适应?通过外部harness:prompts、记忆、工具、技能规范、路由规则。基础模型可以冻结不动,但这些组件在持续变化,agent的经验就积累在这些组件里。

问题来了:你改了一个prompt或者一条路由规则,模型没动,但之前一直正常的行为突然崩了。论文给这个现象起了个名字:**harness-level forgetting**(harness级遗忘)。

这意味着持续学习的战场转移了。以前你只需要担心权重被新知识覆盖,现在你还要担心外部状态被自己改坏。

论文来自南京大学和澳大利亚卧龙岗大学的研究团队(Borui Kang、Jinrui Gu、Junhan Lv、Wenbin Li、Lei Wang、Yang Gao),正式提出了**Harness Continual Learning(HCL)**范式:围绕冻结的基础模型,顺序更新辅助系统状态来获取和保留能力。

## 核心方案:把“提议”和“提交”分开

论文给出的方法叫**guarded harness evolution**(受保护的harness演化),核心就一个动作:分离更新提议和状态提交。

- **Continual Optimizer**:根据执行后的反馈,起草候选harness

- **Continual Evaluator**:只有通过三项检查才允许提交——当前改进、历史保留、有效性

说白了:你可以提方案,但不能直接改。先验证,再落地。

HCL包含四个执行相关组件:Task Interface(任务接口)、Experience Memory(经验记忆)、Capability Map(能力图谱)、Adaptive Router(自适应路由)。

## 实验数据

论文在文本推理、多模态感知、开放世界交互三个场景做了实验,多个设置下相对基线增益超过10%。同时通过组件消融评估了每个组件的贡献,还量化了harness-level forgetting的存在,并证明稳定性-可塑性权衡是可以显式调节的。

实验结果表明,这种“先验证再提交”的机制既能积累能力,也能在出问题时恢复失败。

## 一点延伸思考

这篇论文的价值在于把一个问题正式化了:当agent的经验从权重转移到外部文件时,版本管理、回归测试、回滚机制就变成了刚需。

评论区有人提到,可编辑记忆也应纳入框架——agent不断积累和更新上下文,过期或错误的记忆同样会造成harness-level forgetting。还有人指出,评估器必须测试整个harness状态,因为路由变更可能通过历史和当前检查,却破坏了它新选中的工具路径。

也有实际经验分享:让agent重写自己的代码,能存活的关键不是重写本身,而是有一份它不被允许触碰的denylist文件。

论文地址:https://arxiv.org/abs/2608.19013

跟踪更多AI论文:https://academy.dair.ai/

发布时间: 2026-08-21 08:33