Context Language Models 允许智能体(agent)编辑下一步要读取的历史,将上下文管理从固定的摘要步骤变为学习得到的行动。
Rulin Shao 和 12 位合作者将当前上下文表示为文件。模型工作时可以重写、删除或重排文件,随后从编辑后的版本继续,不必携带不断增长的转录文本,也不必接受外围软件选定的摘要。
为什么重要
开发者运行长时间研究或编程智能体时,上下文既是记忆,也是计算。反复输入旧 token 消耗时间,激进压缩则可能丢弃之后需要的证据。能决定保留什么的模型,可以按任务逐一权衡。
论文将这种方法称为 Context Language Model,简称 CLM。它将可编辑上下文文件与当前交互分离,让智能体保留精简的工作记录,同时原始环境继续产生观察。
基本方法不需要特殊模型架构。作者测试了告诉现有模型如何管理文件的指令,再通过强化学习和技能优化循环改进策略。公开仓库包含实现和示例,作者还为 Pi 智能体执行框架发布了插件。
在留出的上下文管理任务上,作者报告,优化后的自然语言指令将准确率最多提高了 35.9 个百分点,同时减少计算。“最多”的结果是报告中最大的变化,但来自作者评测,并随设置而变。
编辑同时改变缓存和文本
上下文编辑带来推理(inference)问题。Transformer 服务器通常会复用未改变前缀的键值缓存。重写中间文本会使之后的缓存状态失效,因为这些状态是根据旧版本计算的。
作者提出部分缓存复用,以避免重新计算全部内容。这项优化影响重大:复用编辑位置之后的状态可能让缓存过时,而从编辑点重新计算节省的工作较少。论文报告,其近似方法在受测设置中保持了准确率,但社区读者已将这一点视为重要复现目标。
可编辑文件也改变了安全边界。工具输出、用户指令和模型写的笔记可以一起持续存在,直到模型移除。进入文件的恶意指令因此可能比临时工具响应中的指令存活更久。论文研究的是上下文管理,没有提供经过认证的来源信息,也没有完整的提示词注入防御。
研究在上下文管理和长时间智能体任务上评测了 Qwen 和 Claude 家族模型。强化学习后报告的提升说明,编辑可以通过训练教授,而不只是通过提示词要求;但这并不能证明每个智能体都应控制自己的记录。受监管或取证工作流可能需要在可编辑工作上下文之外,保留不可变的转录文本。
预印本于 2026年9月29日提交。代码仓库已公开,因此下一步有价值的证据可以来自复现,在相同任务上比较完整重算、部分缓存复用和普通压缩。
核实
| 说法 | 标签 | 一手来源 | 独立核实 |
|---|---|---|---|
| CLM 将上下文作为模型可以重写、删除和重排的文件提供 | 据公司称 | CLM 预印本 | 公开实现 |
| 方法可用于现有模型架构 | 据公司称 | CLM 预印本 | 仓库中已提供实现 |
| 优化后的指令将留出任务准确率最多提高 35.9 个点,同时减少计算 | 据公司称 | CLM 预印本 | 无;作者评测 |
| 部分缓存复用在受测设置中保持了准确率 | 据公司称 | CLM 预印本 | 未找到独立复现 |
| 可编辑上下文可能更久地保留注入指令 | 分析 | CLM 预印本 | 威胁源于模型所写上下文的持久性 |
| 代码和 Pi 插件已公开 | 已核实 | CLM 仓库 | 仓库可用 |
| 预印本于 2026年9月29日提交 | 已核实 | arXiv 记录 | arXiv 元数据 |