一篇新的预印本报告称,即使完整交互历史仍在上下文中,语言智能体(agent)也经常无法将过去的行动与其产生的观察联系起来。
Jingyu Liu 和四位合作者研究了一类智能体:它们在选择下一步行动前,接收此前行动和环境反馈。历史记录通常有帮助,但打乱旧行动只造成小幅损失,说明智能体使用了记录,却没有可靠学会哪次行动导致了哪个结果。
为什么重要
工程师构建使用工具的智能体时,只有模型能从转录文本中学习,文本才有价值。如果智能体只是将过去结果当作零散线索,即使所有相关 token 都存在,它也可能重复失败行动,或将功劳归给错误的步骤。
研究者通过破坏行动与观察的配对来测试这一假设。他们打乱此前行动,同时让观察保持原位,因此转录文本仍包含大部分相同语言,却不再保留可信的因果顺序。任务完成率下降幅度小于预期。
这个负面结果改变了对历史收益的解读。更多转录文本带来更高成功率,本身并不能说明智能体形成了有用经验。模型可能只是在从此前观察中提取线索,或只是受益于额外的任务相关文本。
团队最简单的修复没有增加新的任务信息。每条观察都明确标注为紧前一次行动的结果。据预印本称,这种标注提高了任务成功率,并减少了下一次行动的重复。
控制器可以选择有用经验
论文随后介绍了一个学习得到的行动校准器。它重新评估此前行动,选择性记录经验用于后续决策,而不是让主智能体解释一份不加区分的转录文本。作者报告,其效果比明确标注结果又有进一步提升。
设计将智能体系统经常合并的两项工作分开:在环境中行动,以及决定此前交互教会了什么。这种划分具有实用性,因为它可以插入现有智能体循环,无需改变环境或增加外部知识。
预印本的核心证据属于行为层面。它没有确定模型内部形成了什么表征,摘要也没有提供公开代码链接。报告的提升还取决于受测任务、模型和转录格式,因此不应将其视为生产智能体的通用估计。
不过,打乱历史的对照提供了格外丰富的信息。它区分了“转录文本有帮助”和“智能体理解了自己的经验”,而智能体评测经常将这两种说法视为等价。
Liu、Zhiwen Wang、Yuxin Jing、Huanyu Zhou 和 Yong Liu 于 2026年10月2日提交了预印本。结果标注的改动说明足够清楚,其他智能体开发者可以在自己的循环中测试;没有公开训练细节和代码,学习得到的校准器则更难评估。
核实
| 说法 | 标签 | 一手来源 | 独立核实 |
|---|---|---|---|
| 打乱过去行动后,历史记录的大部分收益仍然存在 | 据公司称 | Liu 等人的预印本 | 无;预印本结果 |
| 破坏行动与观察的对应关系只造成小幅下降 | 据公司称 | Liu 等人的预印本 | 无 |
| 明确标注结果提高任务成功率,并减少重复行动 | 据公司称 | Liu 等人的预印本 | 无 |
| 学习得到的校准器比结果标注进一步提高任务成功率 | 据公司称 | Liu 等人的预印本 | 无 |
| 结果区分了转录文本收益与行动—结果学习 | 分析 | Liu 等人的预印本 | 根据打乱对照推断 |
| 预印本于 2026年10月2日提交 | 已核实 | arXiv 记录 | arXiv 元数据 |