一篇新的预印本报告称,许多已发布测谎探针通过读取语言模型内部活动来标记虚假答案,但它们部分检测的是模型是否遵从指令。
Maximilian von Klinski 和三位合作者,让三个开放模型扮演否认基本事实的角色,例如托勒密体系的天文学家或阴谋论者,并测试八种现有探针能否继续抓住虚假答案。许多可以,直到真实和虚假回复被放在同一个角色提示词下。随后,几种探针的成绩比抛硬币还差。
为什么重要
安全团队用探针监控已部署模型时,需要警报针对虚假内容触发,而非针对通常与之相伴的因素。多数探针训练数据中的虚假答案,也是不太可能的答案和违反模型规则的答案;研究发现,探针学会了这些捷径。
探针如何读取模型
探针是一个简单分类器,在模型某一层内部的数字上训练,标签依据正在处理的文本是真还是假。如果有效,即使模型生成的词语表达相反意思,它也能读出模型认为什么是真的。
团队构建了包含 8916 条答案的数据集,来自 Meta 的 Llama 3.3 70B,以及谷歌(Google)的 Gemma 3 27B 和 Gemma 4 31B。每个模型都以普通助手和 15 个角色之一回答是非问题:角色包括现实世界中持有特定信念的人、奥威尔《1984》中的公民等虚构人物,以及中世纪医生等历史人物。问题由基于 Anthropic 的 Claude Opus 4.8 的流程改进,再由 Llama 充当评判器筛选,并由第一作者手动检查。
共用提示词让多数探针失效
在第一版测试中,多数此前的探针能很好地区分真实与虚假答案,大约十对中有九对排序正确。但每个虚假答案都带角色提示词,每个真实答案都带助手提示词,因此单靠提示词就能知道答案。
作者将两个答案都放在角色提示词之后,移除了这一线索。此时真实答案也是概率更低、与角色指令冲突的答案。在 Llama 上,几种原本有效的探针跌至随机水平以下,只有两种接近此前成绩。两款 Gemma 模型也重复出现失败,且经常更严重。
三个陷阱隔离捷径
为确定探针追踪什么,团队构建了三套测试,其中真相与可能的混淆因素方向相反。第一套用评分规则让错误答案更可能。第二套让角色私下持有错误信念,例如七乘六等于 13。第三套让正确答案违反格式规则,例如要求方括号时使用圆括号,而错误答案却遵守规则。
格式陷阱最具决定性。在 Llama 上,除一种在每项测试中读数都反转的探针外,所有此前探针都低于随机水平。作者将其解读为这些探针内部“真实”与“遵从”之间存在强烈关联。
团队自己的探针在简单事实的标准训练中增加了一个成分:指令要求错误答案的问题,让服从和真相指向相反方向。在 Llama 共用提示词测试中,它得分约为满分 1 分中的 0.98 分,三个模型上都未低于 0.90,并在三个陷阱上全部完美。
自制修复与仍未知的混淆因素
这个结果需要两点限定。新探针对其后来测试的同一组混淆因素进行设计,作者承认这使其完美陷阱成绩并不意外。设计也扩展了一种此前由合作者 Lennart Bürger 共同开发的探针,它是共用提示词时仍然有效的仅有两种此前探针之一。
研究自己的数据表明,混淆因素列表并不完整。在 Gemma 4 上,一种此前探针在三个陷阱中近乎完美,却在共用提示词测试中得分约 0.17,失败原因没有被任何陷阱捕捉。角色还都通过单一系统提示词在单轮对话中设置,模型最多为 700 亿参数。
研究由德国联邦研究、技术与航天部、欧盟“地平线欧洲”(Horizon Europe)计划和德国研究基金会(German Research Foundation)资助。作者已在 Hugging Face 发布数据集,在 GitHub 发布代码,并将长对话中逐渐出现的角色列为下一步测试对象。
核实
| 说法 | 标签 | 一手来源 | 独立核实 |
|---|---|---|---|
| 评测了八种此前探针;真实和虚假答案共用角色提示词后,许多失效 | 据公司称 | von Klinski 等人的预印本 | 无;预印本结果 |
| 数据集包含来自 Llama 3.3 70B、Gemma 3 27B 和 Gemma 4 31B、覆盖 15 个角色的 8916 条人工审核答案 | 已核实 | von Klinski 等人的预印本 | Hugging Face 数据集 |
| 问题由 Claude Opus 4.8 流程改进、Llama 3.3 70B 评判,并由第一作者检查 | 已核实 | von Klinski 等人的预印本 | 无;作者的方法说明 |
| 真实和虚假答案提示词不同时,多数此前探针的 AUROC 为 0.86 至 0.94 | 据公司称 | von Klinski 等人的预印本 | 无 |
| Llama 共用提示词时,几种此前探针低于随机水平;只有 Marks/Bürger Lie(0.885)和 Cundy DolusChat(0.901)保持稳定 | 据公司称 | von Klinski 等人的预印本 | 无 |
| 共用提示词的失败在 Gemma 3 27B 和 Gemma 4 31B 上重复出现,且经常更严重 | 据公司称 | von Klinski 等人的预印本 | 无 |
| Llama 的遵从陷阱中,所有此前探针都低于随机水平,只有始终反转的 Goldowsky-Dill SD 除外 | 据公司称 | von Klinski 等人的预印本 | 无 |
| 探针将真相与指令遵从联系起来 | 分析 | von Klinski 等人的预印本 | 作者根据遵从陷阱推断 |
| 新探针在 Llama 共用提示词测试上 AUROC 为 0.976,三个模型均未低于 0.900,在三个陷阱上完美 | 据公司称 | von Klinski 等人的预印本 | 无 |
| 新探针训练时移除的混淆因素与测试时相同;作者称陷阱结果并不意外 | 已核实 | von Klinski 等人的预印本 | 无 |
| 合作者 Lennart Bürger 共同开发了新探针所扩展的 Marks/Bürger 探针 | 已核实 | von Klinski 等人的预印本 | 引用 Bürger 等人(2024年) |
| Gemma 4 上,Cooney DYL 在全部陷阱中近乎完美,共用提示词得分却为 0.171 | 据公司称 | von Klinski 等人的预印本 | 无 |
| 由德国 BMFTR、欧盟“地平线欧洲”和德国研究基金会(DFG)资助 | 已核实 | von Klinski 等人的预印本 | 致谢部分 |
| 代码已在 GitHub 公开 | 已核实 | GitHub 仓库 | 仓库页面可加载 |
| 预印本于 2026年9月30日发布 | 已核实 | arXiv 记录 | arXiv 元数据 |