# 4MT-VLM 显示视觉模型转动视角后认不出地点

> 一篇预印本将临床空间记忆测试改编后用于 16 个视觉语言模型。所有模型都能从学习时的角度识别景观，但镜头一移动，多数便只能猜测。

- URL: https://ai-news-daily.xyz/zh/posts/4mt-vlm-shows-vision-models-lose-places-after-rotation/
- Published: 2026-10-06
- Tags: research, models
- Author: AI 生成 (this text was generated by AI; see https://ai-news-daily.xyz/zh/about/#ai-disclosure)
- Publisher: [AI News Daily](https://ai-news-daily.xyz/zh/)

视觉语言模型能从初次看到的角度识别景观，但镜头移动后，多数无法找出同一地点。这是 4MT-VLM 的发现，这套新基准测试改编自临床空间记忆测试。

德国应用研究机构 Fraunhofer IAIS 的 Markus Frey，让 16 个开放和闭源模型完成用于人类患者的题目：学习一幅电脑渲染的四山峰景观，再从新角度展示的四幅相似景观中找出它。一名人类志愿者在旋转试验中约五次答对四次。多数模型不比猜测更好。

## 为什么重要 {#why-it-matters}

机器人工程师将视觉语言模型用作移动机器人的眼睛时，恰好需要这种能力：机器人转身后仍能认出房间。预印本发现，更大的模型和更详细的指令都无法提供这项能力。

## 识别仍然有效，旋转却失败

基准测试改编自 Four Mountains Test。临床医生使用这项测试，是因为海马体受损和阿尔茨海默病早期患者的分数会下降。每次试验中，学习图像与测试图像之间的颜色、纹理和光照都改变，因此即使没有旋转，也无法通过匹配像素解决。Frey 用未旋转试验的准确率，检查模型是否能够识别地点。

模型通过了这项检查，却在旋转上失败。OpenAI 的 GPT-5.6 Luna 答对所有未旋转试验，旋转试验却只答对 31%，而猜测会答对四分之一。汇总全部 16 个模型后，最差角度为 135 度，准确率明显低于随机水平。

最大变化是旋转半圈，即 180 度，其得分却高于 135 度。Frey 将这解读为模型使用图像捷径的迹象，例如与场景镜像比较，而非旋转内部地图。人类比较来自单一参与者，足以说明任务可解，却无法给出人类平均水平。

## 大模型识别更多，旋转没有改善

规模提升了识别能力，旋转表现却停留原处。在阿里巴巴 Qwen2.5-VL 家族中，从 30 亿到 720 亿参数，未旋转准确率从 30% 升至 75%，旋转准确率则保持在随机水平或以下。InternVL3.5 家族在 10 亿至 380 亿参数间重复了这一模式。在 14 个最高达 2350 亿参数的开放权重模型中，没有一个答对超过 31% 的旋转试验，“思考”版本与标准版本得分相同。

指令没有缩小差距。Frey 用六种提示词运行 Qwen2.5-VL-32B，包括明确要求想象正上方布局，或以最独特山峰为锚点。六种都让模型低于随机水平。

## 拉开错误答案的距离，暴露粗略地图

最有信息量的实验只改变错误答案。Frey 用米衡量两幅景观在最佳旋转后山峰之间的距离，再从距离更远的布局中重新绘制三个干扰选项，保持目标和角度相同。

将最近干扰选项从约 7 米拉远到约 31 米，使谷歌（Google）的 Gemini 3.8 Flash 在旋转试验上从 39% 升至 85%，GPT-5.6 Luna 从 31% 升至 55%。没有开放模型获得统计上显著的提升。

这是论文关于前沿模型拥有某种低分辨率布局感的证据。没有地图的模型无法从拉开干扰选项距离中获益，而拥有人类水平地图的模型不需要 30 米间隔。效果类似从飞机窗口认出城镇，却认不出街道。

错误也指向同样的结论。答错的人倾向选择布局最接近目标的干扰选项。模型的错误答案则几乎均匀分布在近、远干扰选项之间，仿佛布局没有参与选择。

## 单一作者的合成测试

景观是合成渲染图像，Frey 指出，在类似渲染场景上预训练可能有利于某些模型。闭源模型未披露参数量，因此规模证据仅依靠开放模型。预印本于 2026年9月30日发布到 arXiv，只有一位作者，没有链接代码或数据集。

Frey 称，正在测试更多人类参与者，这将为志愿者在旋转试验中 82% 的得分提供合适的比较组。

## 核实 {#verification}

| 说法 | 标签 | 一手来源 | 独立核实 |
| --- | --- | --- | --- |
| 4MT-VLM 改编自 Four Mountains Test；在 100 幅生成景观上开展 500 次试验，测试 16 个模型 | 已核实 | [Frey 预印本](https://arxiv.org/abs/2609.39238) | 无；作者自己的基准测试 |
| 每个角度的学习和测试图像之间都会重新采样外观 | 已核实 | [Frey 预印本](https://arxiv.org/abs/2609.39238) | 无；方法描述 |
| 一名人类参与者答对了 100% 的未旋转试验和 82% 的旋转试验 | 据公司称 | [Frey 预印本](https://arxiv.org/abs/2609.39238) | 无；仅一名参与者 |
| GPT-5.6 Luna：未旋转 100%，旋转 31%；随机水平为 25% | 据公司称 | [Frey 预印本](https://arxiv.org/abs/2609.39238) | 无 |
| 135 度时汇总准确率为 15.0%（48/320），低于随机水平；180 度时为 23% | 据公司称 | [Frey 预印本](https://arxiv.org/abs/2609.39238) | 无 |
| 模型使用镜像匹配等图像捷径 | 分析 | [Frey 预印本](https://arxiv.org/abs/2609.39238) | 作者对 135/180 度模式的解读 |
| Qwen2.5-VL 从 30 亿至 720 亿参数：未旋转从 30% 到 75%，旋转分别为 29%、31%、18%、20% | 据公司称 | [Frey 预印本](https://arxiv.org/abs/2609.39238) | 无 |
| 没有开放权重模型（10 亿至 2350 亿参数）旋转准确率超过 31%；思考版本与指令版本的旋转准确率均为 19% | 据公司称 | [Frey 预印本](https://arxiv.org/abs/2609.39238) | 无 |
| 六种指令风格让 Qwen2.5-VL-32B 得分在 13.8% 至 23.8%，均低于随机水平 | 据公司称 | [Frey 预印本](https://arxiv.org/abs/2609.39238) | 无 |
| 最近干扰选项距离中位数从 6.8 m 到 31.4 m：Gemini 3.8 Flash 从 39% 到 85%，GPT-5.6 Luna 从 31% 到 55% | 据公司称 | [Frey 预印本](https://arxiv.org/abs/2609.39238) | 无 |
| 拉大干扰选项间距没有让任何开放模型显著改变 | 据公司称 | [Frey 预印本](https://arxiv.org/abs/2609.39238) | 无 |
| 模型错误在最近、中间和最远干扰选项间按 30/37/33 分布；人类在 14 次错误中的 10 次选择最近选项 | 据公司称 | [Frey 预印本](https://arxiv.org/abs/2609.39238) | 无 |
| 前沿模型保留粗略的布局表征 | 分析 | [Frey 预印本](https://arxiv.org/abs/2609.39238) | 根据干扰选项间距结果推断 |
| 单一作者预印本于 2026年9月30日发布；作者任职 Fraunhofer IAIS；未链接代码或数据 | 已核实 | [arXiv 记录](https://arxiv.org/abs/2609.39238) | arXiv 元数据和作者电子邮箱域名 |
| 正在评测更多人类参与者 | 据公司称 | [Frey 预印本](https://arxiv.org/abs/2609.39238) | 无 |
