一项新的可解释性研究表明,语言模型在段落中定位事实,似乎部分依靠这些事实被提及的顺序。

Yufa Zhou 用短事实列表及其后的问题测试了 Qwen、Gemma 和 Llama 模型。模型内部的问题状态针对第一条、第二条和后续事实形成了可重复的模式,即使人名和主题改变也依然如此。

为什么重要

对试图理解模型内部检索的研究者而言,这一结果提供了具体机制,而不只是又一项激活与答案之间的相关性。实验中可以移动同一条内部方向,使有关一条事实的问题检索到段落中的另一条事实。

论文将这些位置称为“事实地址”。假设上下文说 Alice 吃苹果,Bob 吃梨。在模型内部,关于 Alice 和关于 Bob 的问题沿着一条与事实提及顺序相关的方向有所差异。当研究者将从第一条到第二条的方向加到有关第一条事实的问题上时,模型经常用第二条的内容回答。

这项干预是研究最有力的证据。分类器可以在隐藏状态中发现许多模式,却不能证明模型使用了它们。通过改变所提出的地址来改变答案,为机制提供了因果支持,但测试使用的是受控事实列表,而非长篇自然文档。

在 64 组新词汇中,干预为 Qwen 选中目标事实的比例约为六分之五,Gemma 约为一半,Llama 约为三分之一。准确比例分别为 84.1%、53.9% 和 36.2%。这些差异表明,不同模型家族共享这一方向,但其可靠程度并不相同。

地址占据较小的内部空间

Zhou 报告称,事实地址位于低秩子空间。通俗地说,模型无需为每种可能的位置配置一条彼此无关的方向;一小组方向就能描述大部分顺序模式。

模型也更容易访问最先提及的事实,而非后续事实。这类似人类回忆中的首因效应,但实验没有证明人和 Transformer 使用相同机制。它识别出受测模型中一种可测量的不对称性。

该模式出现在中部偏后的层,覆盖 15 亿至 320 亿参数的模型。训练期间保存的模型版本表明,它在早期形成,并非只在大量指令微调之后才出现。与预印本一同发布的代码使这些受控干预可以接受检查。

范围有限的设置也是主要局限。简单事实列表可以清晰隔离顺序,而真实提示词包含标题、重复引用、工具和冲突陈述。论文表明,在受控条件下,提及顺序可以充当地址;它没有表明,在普通智能体(agent)转录文本中,顺序主导检索。

Zhou 于 2026年10月1日提交了预印本。下一步证据将来自在不那么规则的文档上复现干预,以及测试改变文档结构是否会改变同样的内部方向。

核实

说法标签一手来源独立核实
在 Qwen、Gemma 和 Llama 中,问题状态按事实顺序组织据公司称Zhou 预印本无;预印本结果
添加序数向量可以将问题重定向到另一条事实据公司称Zhou 预印本无;作者实验
在 64 组词汇间迁移时,Qwen 达到 84.1%,Gemma 达到 53.9%,Llama 达到 36.2%据公司称Zhou 预印本无
事实地址占据低秩子空间,并偏向第一条事实据公司称Zhou 预印本无
该模式在 15 亿至 320 亿参数模型中出现,并在预训练早期形成据公司称Zhou 预印本无
复现代码已公开已核实提及顺序仓库仓库可用