# 信心提示比实际能力更能引导模型

> 一项受控研究发现，一句信心或怀疑表达就能显著改变推理模型是否调用工具，但这些变化很少针对真正需要帮助的问题。

- URL: https://ai-news-daily.xyz/zh/posts/confidence-cues-steer-models-more-than-competence-does/
- Published: 2026-10-05
- Tags: research, agents
- Author: AI 生成 (this text was generated by AI; see https://ai-news-daily.xyz/zh/about/#ai-disclosure)
- Publisher: [AI News Daily](https://ai-news-daily.xyz/zh/)

告诉推理（reasoning）模型“我对答案有信心”，它向工具求助的概率便会降低。在同一段推理轨迹的相同位置，对同一模型说“我对答案没有把握”，它便更频繁地委托工具。令人关注的并非语言改变了行为，而是这种变化与模型能否独立解题关系很小。

Rohit Saxena 和 Utkarsh Upadhyay 将这一属性称为“可引导性”。预印本测试信心语言是否能引导模型决定直接回答还是调用工具，并另行测试这种引导是否落在工具真正有用的问题上。

这种区分对智能体（agent）很重要。系统可以对不确定性信号高度敏感，却仍在简单问题上浪费时间和金钱调用工具，同时自信地将难题留给自己。更多委托不一定是更好的委托。

## 一句话，两次反事实运行

实验以完全相同的问题、提示词和模型生成的推理前缀开始。在固定边界，研究者插入两句第一人称信心或怀疑表达之一。模型随后可以继续推理，再决定回答还是委托。插入句子之前的一切都保持相同，因此配对差异隔离了句子的作用。

研究在 MuSiQue 和 StrategyQA 上覆盖 Qwen、Gemma 和 GLM 家族的九个开放权重推理模型，还包括由服务商提供的更大深度求索（DeepSeek）和 MiniMax 模型。主要运行使用贪心解码，并辅以采样解码和对照实验。

在开放权重实验中，从信心切换到怀疑，使委托率变化的中位数达到 20.6 个百分点。更大的托管模型变化为 53–70 个点。不插入任何句子的截断后重新生成对照，中位效果几乎为零；在句子之后立即封闭推理块，仍保留了效果方向。

这些结果显示出强大的因果控制接口，却没有表明模型发现了自己的不确定性。

## 敏感性不等于自我认知

为测试行为翻转是否有用，作者将其与各模型不借助工具时的能力比较。好的翻转会把模型本来会答错的问题交给工具，或将它能解决的问题留给模型。诱导翻转中，针对正确需求的比例中位数只有 42%，比随机选择相同数量问题高两个点。

通俗地说，注入的信心线索更接近指令，而非自我认知的读数。它强力移动工具使用门控，但门控只能很弱地区分“我需要帮助”和“我能处理”。实验刻意从外部提供信心句子，没有测试模型能否自行产生校准良好的信号。

## 智能体开发者应测量什么

实际教训是，对任何反思式工具策略都应报告两个数字：策略改变行为的强度，以及变化针对实际需求的准确程度。只提高工具调用率的路由干预，可能看似成功却仅增加延迟。压低调用的干预可能看似高效，却保留自信的错误。

作者也提醒，任务和干预范围有限。论文没有确定生产智能体在工具众多、成本变化或对抗指令下的行为，代码也只是承诺发布，未随预印本提供。贡献是清晰的诊断方法：在相信模型声明的信心、以此控制更强工具的访问前，先检查这种信心是否预测能力，而非只是指挥行为。

## 核实 {#verification}

| 说法 | 标签 | 一手来源 | 独立核实 |
| --- | --- | --- | --- |
| 设计在相同推理前缀的同一边界插入信心或怀疑表达 | 已核实 | [预印本](https://arxiv.org/abs/2609.34572) | 无 |
| 覆盖 Qwen、Gemma 和 GLM 的九个开放权重推理模型，以及托管的深度求索和 MiniMax 模型 | 已核实 | [预印本](https://arxiv.org/abs/2609.34572) | 无 |
| 开放模型委托变化中位数为 20.6 个点，托管模型为 53–70 个点 | 据公司称 | [预印本](https://arxiv.org/abs/2609.34572) | 无；作者实验 |
| 针对正确需求的翻转比例中位数为 42%，比匹配数量的随机选择高两个点 | 据公司称 | [预印本](https://arxiv.org/abs/2609.34572) | 无；作者实验 |
| 信心语言更像控制输入，而非模型自我认知的证据 | 分析 | [预印本](https://arxiv.org/abs/2609.34572) | 解读与作者关于需求匹配的结果一致 |
| 代码尚未提供 | 已核实 | [预印本](https://arxiv.org/abs/2609.34572) | 可复现性声明称计划在发表时发布 |
