视觉语言模型能从初次看到的角度识别景观,但镜头移动后,多数无法找出同一地点。这是 4MT-VLM 的发现,这套新基准测试改编自临床空间记忆测试。
德国应用研究机构 Fraunhofer IAIS 的 Markus Frey,让 16 个开放和闭源模型完成用于人类患者的题目:学习一幅电脑渲染的四山峰景观,再从新角度展示的四幅相似景观中找出它。一名人类志愿者在旋转试验中约五次答对四次。多数模型不比猜测更好。
为什么重要
机器人工程师将视觉语言模型用作移动机器人的眼睛时,恰好需要这种能力:机器人转身后仍能认出房间。预印本发现,更大的模型和更详细的指令都无法提供这项能力。
识别仍然有效,旋转却失败
基准测试改编自 Four Mountains Test。临床医生使用这项测试,是因为海马体受损和阿尔茨海默病早期患者的分数会下降。每次试验中,学习图像与测试图像之间的颜色、纹理和光照都改变,因此即使没有旋转,也无法通过匹配像素解决。Frey 用未旋转试验的准确率,检查模型是否能够识别地点。
模型通过了这项检查,却在旋转上失败。OpenAI 的 GPT-5.6 Luna 答对所有未旋转试验,旋转试验却只答对 31%,而猜测会答对四分之一。汇总全部 16 个模型后,最差角度为 135 度,准确率明显低于随机水平。
最大变化是旋转半圈,即 180 度,其得分却高于 135 度。Frey 将这解读为模型使用图像捷径的迹象,例如与场景镜像比较,而非旋转内部地图。人类比较来自单一参与者,足以说明任务可解,却无法给出人类平均水平。
大模型识别更多,旋转没有改善
规模提升了识别能力,旋转表现却停留原处。在阿里巴巴 Qwen2.5-VL 家族中,从 30 亿到 720 亿参数,未旋转准确率从 30% 升至 75%,旋转准确率则保持在随机水平或以下。InternVL3.5 家族在 10 亿至 380 亿参数间重复了这一模式。在 14 个最高达 2350 亿参数的开放权重模型中,没有一个答对超过 31% 的旋转试验,“思考”版本与标准版本得分相同。
指令没有缩小差距。Frey 用六种提示词运行 Qwen2.5-VL-32B,包括明确要求想象正上方布局,或以最独特山峰为锚点。六种都让模型低于随机水平。
拉开错误答案的距离,暴露粗略地图
最有信息量的实验只改变错误答案。Frey 用米衡量两幅景观在最佳旋转后山峰之间的距离,再从距离更远的布局中重新绘制三个干扰选项,保持目标和角度相同。
将最近干扰选项从约 7 米拉远到约 31 米,使谷歌(Google)的 Gemini 3.8 Flash 在旋转试验上从 39% 升至 85%,GPT-5.6 Luna 从 31% 升至 55%。没有开放模型获得统计上显著的提升。
这是论文关于前沿模型拥有某种低分辨率布局感的证据。没有地图的模型无法从拉开干扰选项距离中获益,而拥有人类水平地图的模型不需要 30 米间隔。效果类似从飞机窗口认出城镇,却认不出街道。
错误也指向同样的结论。答错的人倾向选择布局最接近目标的干扰选项。模型的错误答案则几乎均匀分布在近、远干扰选项之间,仿佛布局没有参与选择。
单一作者的合成测试
景观是合成渲染图像,Frey 指出,在类似渲染场景上预训练可能有利于某些模型。闭源模型未披露参数量,因此规模证据仅依靠开放模型。预印本于 2026年9月30日发布到 arXiv,只有一位作者,没有链接代码或数据集。
Frey 称,正在测试更多人类参与者,这将为志愿者在旋转试验中 82% 的得分提供合适的比较组。
核实
| 说法 | 标签 | 一手来源 | 独立核实 |
|---|---|---|---|
| 4MT-VLM 改编自 Four Mountains Test;在 100 幅生成景观上开展 500 次试验,测试 16 个模型 | 已核实 | Frey 预印本 | 无;作者自己的基准测试 |
| 每个角度的学习和测试图像之间都会重新采样外观 | 已核实 | Frey 预印本 | 无;方法描述 |
| 一名人类参与者答对了 100% 的未旋转试验和 82% 的旋转试验 | 据公司称 | Frey 预印本 | 无;仅一名参与者 |
| GPT-5.6 Luna:未旋转 100%,旋转 31%;随机水平为 25% | 据公司称 | Frey 预印本 | 无 |
| 135 度时汇总准确率为 15.0%(48/320),低于随机水平;180 度时为 23% | 据公司称 | Frey 预印本 | 无 |
| 模型使用镜像匹配等图像捷径 | 分析 | Frey 预印本 | 作者对 135/180 度模式的解读 |
| Qwen2.5-VL 从 30 亿至 720 亿参数:未旋转从 30% 到 75%,旋转分别为 29%、31%、18%、20% | 据公司称 | Frey 预印本 | 无 |
| 没有开放权重模型(10 亿至 2350 亿参数)旋转准确率超过 31%;思考版本与指令版本的旋转准确率均为 19% | 据公司称 | Frey 预印本 | 无 |
| 六种指令风格让 Qwen2.5-VL-32B 得分在 13.8% 至 23.8%,均低于随机水平 | 据公司称 | Frey 预印本 | 无 |
| 最近干扰选项距离中位数从 6.8 m 到 31.4 m:Gemini 3.8 Flash 从 39% 到 85%,GPT-5.6 Luna 从 31% 到 55% | 据公司称 | Frey 预印本 | 无 |
| 拉大干扰选项间距没有让任何开放模型显著改变 | 据公司称 | Frey 预印本 | 无 |
| 模型错误在最近、中间和最远干扰选项间按 30/37/33 分布;人类在 14 次错误中的 10 次选择最近选项 | 据公司称 | Frey 预印本 | 无 |
| 前沿模型保留粗略的布局表征 | 分析 | Frey 预印本 | 根据干扰选项间距结果推断 |
| 单一作者预印本于 2026年9月30日发布;作者任职 Fraunhofer IAIS;未链接代码或数据 | 已核实 | arXiv 记录 | arXiv 元数据和作者电子邮箱域名 |
| 正在评测更多人类参与者 | 据公司称 | Frey 预印本 | 无 |