视觉语言模型可能通过两种相互竞争的内部过程解决抽象视觉比较:较早的过程追踪可见物体,较晚的过程表示物体之间的关系。
这是 Minegishi、Furuta、Kojima 及其同事一篇预印本的核心发现。团队改编了发展心理学和比较心理学中的关系样本匹配任务(Relational Match-to-Sample),随后用受控图像测试了闭源前沿系统和开放模型。
为什么重要
研究者评估视觉推理(reasoning)时,仅凭正确答案无法判断模型匹配的是底层规则,还是只是识别了相似形状。研究提供了一种区分这两条路径的方法,并对与抽象关系相关的路径实施干预。
每项任务给出一对样本物体,要求判断哪对候选物体具有相同关系。一个候选可以保留关系却改变物体;另一个可以保留表面外观却改变关系。这种冲突揭示模型遵循的是物体身份还是结构。
在 GPT、Claude、Gemini、Qwen3.5、Gemma 4 和 InternVL3 等模型家族中,四种变化让答案更偏向关系:能力更强的模型档位、更大的模型、场景中更少的物体,以及每个物体上更少的噪声。作者将这一变化过程与人类发展中观察到的“关系转变”相比较,但相似之处在于行为,并不能证明双方拥有相同的认知机制。
内部分析在不同深度发现了这两种信号。较早层的表征按物体层面的特征对样本分组,较晚层则按抽象关系分组。随后,因果中介测试识别出一些注意力头,其活动对基于关系的答案有贡献。
干预将回路与另一项任务联系起来
最有力的结果来自禁用与关系匹配相关的注意力头。作者称,这对 ARC-AGI-1 表现的损害大于禁用随机选择的注意力头。这种迁移很重要,因为这些注意力头是在心理学匹配任务中找到的,并非直接为解释 ARC 结果而挑选。
证据的适用范围仍然有限。一组注意力头可以对两项任务都有贡献,却未必构成通用推理模块。刺激材料刻意设计得很简单,论文没有证明同样的竞争也控制着照片、图表或长篇多模态对话中的识别。
研究还依赖两种不同层次的访问权限。行为结果可以包含专有 API 模型,但逐层表征分析和消融需要开放权重。因此,机制方面的说法基于接受内部检查的开放模型,更广泛的模型家族比较则属于行为层面。
参数化设计有利于复现。物体数量和视觉噪声可以分别改变,让其他团队测试这种分层现象是否在新的形状、关系和模型家族中依然存在。摘要页面没有列出公开代码仓库,因此复现完整干预需要做的不只是下载一套基准测试。
论文于 2026年10月6日提交至 arXiv,尚未经过同行评审。其有价值的贡献是在经典认知任务与模型内部回路之间建立了一条可证伪的联系:破坏已识别出的较晚路径,应当削弱遵循关系的行为,而物体匹配应当相对保持完整。
核实
| 说法 | 标签 | 一手来源 | 独立核实 |
|---|---|---|---|
| 研究在前沿 API 模型和开放视觉语言模型中测试关系匹配 | 据公司称 | 预印本 | 无;作者评测 |
| 规模、能力、更少的物体和更少的噪声让模型更偏向关系匹配 | 据公司称 | 预印本 | 无 |
| 早期层编码物体相似性,后期层编码抽象关系 | 据公司称 | 预印本 | 无 |
| 消融关系相关注意力头对 ARC-AGI-1 的损害大于随机注意力头消融 | 据公司称 | 预印本 | 无 |
| 行为相似不能证明与人类共享机制 | 分析 | 预印本 | 根据研究设计推断 |
| 预印本于 2026年10月6日提交 | 已核实 | arXiv 记录 | arXiv 元数据 |