# 智能体未能连起行动与结果

> 一篇预印本发现，打乱智能体过去的行动后，历史记录的大部分收益仍然存在。明确配对每次行动及其结果，可以提高任务完成率。

- URL: https://ai-news-daily.xyz/zh/posts/agents-miss-the-link-between-actions-and-outcomes/
- Published: 2026-10-06
- Tags: research, agents
- Author: AI 生成 (this text was generated by AI; see https://ai-news-daily.xyz/zh/about/#ai-disclosure)
- Publisher: [AI News Daily](https://ai-news-daily.xyz/zh/)

一篇新的预印本报告称，即使完整交互历史仍在上下文中，语言智能体（agent）也经常无法将过去的行动与其产生的观察联系起来。

Jingyu Liu 和四位合作者研究了一类智能体：它们在选择下一步行动前，接收此前行动和环境反馈。历史记录通常有帮助，但打乱旧行动只造成小幅损失，说明智能体使用了记录，却没有可靠学会哪次行动导致了哪个结果。

## 为什么重要 {#why-it-matters}

工程师构建使用工具的智能体时，只有模型能从转录文本中学习，文本才有价值。如果智能体只是将过去结果当作零散线索，即使所有相关 token 都存在，它也可能重复失败行动，或将功劳归给错误的步骤。

研究者通过破坏行动与观察的配对来测试这一假设。他们打乱此前行动，同时让观察保持原位，因此转录文本仍包含大部分相同语言，却不再保留可信的因果顺序。任务完成率下降幅度小于预期。

这个负面结果改变了对历史收益的解读。更多转录文本带来更高成功率，本身并不能说明智能体形成了有用经验。模型可能只是在从此前观察中提取线索，或只是受益于额外的任务相关文本。

团队最简单的修复没有增加新的任务信息。每条观察都明确标注为紧前一次行动的结果。据预印本称，这种标注提高了任务成功率，并减少了下一次行动的重复。

## 控制器可以选择有用经验

论文随后介绍了一个学习得到的行动校准器。它重新评估此前行动，选择性记录经验用于后续决策，而不是让主智能体解释一份不加区分的转录文本。作者报告，其效果比明确标注结果又有进一步提升。

设计将智能体系统经常合并的两项工作分开：在环境中行动，以及决定此前交互教会了什么。这种划分具有实用性，因为它可以插入现有智能体循环，无需改变环境或增加外部知识。

预印本的核心证据属于行为层面。它没有确定模型内部形成了什么表征，摘要也没有提供公开代码链接。报告的提升还取决于受测任务、模型和转录格式，因此不应将其视为生产智能体的通用估计。

不过，打乱历史的对照提供了格外丰富的信息。它区分了“转录文本有帮助”和“智能体理解了自己的经验”，而智能体评测经常将这两种说法视为等价。

Liu、Zhiwen Wang、Yuxin Jing、Huanyu Zhou 和 Yong Liu 于 2026年10月2日提交了预印本。结果标注的改动说明足够清楚，其他智能体开发者可以在自己的循环中测试；没有公开训练细节和代码，学习得到的校准器则更难评估。

## 核实 {#verification}

| 说法 | 标签 | 一手来源 | 独立核实 |
| --- | --- | --- | --- |
| 打乱过去行动后，历史记录的大部分收益仍然存在 | 据公司称 | [Liu 等人的预印本](https://arxiv.org/abs/2610.02769) | 无；预印本结果 |
| 破坏行动与观察的对应关系只造成小幅下降 | 据公司称 | [Liu 等人的预印本](https://arxiv.org/abs/2610.02769) | 无 |
| 明确标注结果提高任务成功率，并减少重复行动 | 据公司称 | [Liu 等人的预印本](https://arxiv.org/abs/2610.02769) | 无 |
| 学习得到的校准器比结果标注进一步提高任务成功率 | 据公司称 | [Liu 等人的预印本](https://arxiv.org/abs/2610.02769) | 无 |
| 结果区分了转录文本收益与行动—结果学习 | 分析 | [Liu 等人的预印本](https://arxiv.org/abs/2610.02769) | 根据打乱对照推断 |
| 预印本于 2026年10月2日提交 | 已核实 | [arXiv 记录](https://arxiv.org/abs/2610.02769) | arXiv 元数据 |
