告诉推理(reasoning)模型“我对答案有信心”,它向工具求助的概率便会降低。在同一段推理轨迹的相同位置,对同一模型说“我对答案没有把握”,它便更频繁地委托工具。令人关注的并非语言改变了行为,而是这种变化与模型能否独立解题关系很小。
Rohit Saxena 和 Utkarsh Upadhyay 将这一属性称为“可引导性”。预印本测试信心语言是否能引导模型决定直接回答还是调用工具,并另行测试这种引导是否落在工具真正有用的问题上。
这种区分对智能体(agent)很重要。系统可以对不确定性信号高度敏感,却仍在简单问题上浪费时间和金钱调用工具,同时自信地将难题留给自己。更多委托不一定是更好的委托。
一句话,两次反事实运行
实验以完全相同的问题、提示词和模型生成的推理前缀开始。在固定边界,研究者插入两句第一人称信心或怀疑表达之一。模型随后可以继续推理,再决定回答还是委托。插入句子之前的一切都保持相同,因此配对差异隔离了句子的作用。
研究在 MuSiQue 和 StrategyQA 上覆盖 Qwen、Gemma 和 GLM 家族的九个开放权重推理模型,还包括由服务商提供的更大深度求索(DeepSeek)和 MiniMax 模型。主要运行使用贪心解码,并辅以采样解码和对照实验。
在开放权重实验中,从信心切换到怀疑,使委托率变化的中位数达到 20.6 个百分点。更大的托管模型变化为 53–70 个点。不插入任何句子的截断后重新生成对照,中位效果几乎为零;在句子之后立即封闭推理块,仍保留了效果方向。
这些结果显示出强大的因果控制接口,却没有表明模型发现了自己的不确定性。
敏感性不等于自我认知
为测试行为翻转是否有用,作者将其与各模型不借助工具时的能力比较。好的翻转会把模型本来会答错的问题交给工具,或将它能解决的问题留给模型。诱导翻转中,针对正确需求的比例中位数只有 42%,比随机选择相同数量问题高两个点。
通俗地说,注入的信心线索更接近指令,而非自我认知的读数。它强力移动工具使用门控,但门控只能很弱地区分“我需要帮助”和“我能处理”。实验刻意从外部提供信心句子,没有测试模型能否自行产生校准良好的信号。
智能体开发者应测量什么
实际教训是,对任何反思式工具策略都应报告两个数字:策略改变行为的强度,以及变化针对实际需求的准确程度。只提高工具调用率的路由干预,可能看似成功却仅增加延迟。压低调用的干预可能看似高效,却保留自信的错误。
作者也提醒,任务和干预范围有限。论文没有确定生产智能体在工具众多、成本变化或对抗指令下的行为,代码也只是承诺发布,未随预印本提供。贡献是清晰的诊断方法:在相信模型声明的信心、以此控制更强工具的访问前,先检查这种信心是否预测能力,而非只是指挥行为。
核实
| 说法 | 标签 | 一手来源 | 独立核实 |
|---|---|---|---|
| 设计在相同推理前缀的同一边界插入信心或怀疑表达 | 已核实 | 预印本 | 无 |
| 覆盖 Qwen、Gemma 和 GLM 的九个开放权重推理模型,以及托管的深度求索和 MiniMax 模型 | 已核实 | 预印本 | 无 |
| 开放模型委托变化中位数为 20.6 个点,托管模型为 53–70 个点 | 据公司称 | 预印本 | 无;作者实验 |
| 针对正确需求的翻转比例中位数为 42%,比匹配数量的随机选择高两个点 | 据公司称 | 预印本 | 无;作者实验 |
| 信心语言更像控制输入,而非模型自我认知的证据 | 分析 | 预印本 | 解读与作者关于需求匹配的结果一致 |
| 代码尚未提供 | 已核实 | 预印本 | 可复现性声明称计划在发表时发布 |