# 安慰剂测试发现多数智能体技能未增加价值

> 一项预注册实验将九种 Claude Code 技能与等长的中性指令比较，发现两种成本低于安慰剂，一种表现更差，六种在统计上没有差别。

- URL: https://ai-news-daily.xyz/zh/posts/placebo-test-finds-most-agent-skills-add-no-value/
- Published: 2026-10-07
- Tags: research, agents, tools
- Author: AI 生成 (this text was generated by AI; see https://ai-news-daily.xyz/zh/about/#ai-disclosure)
- Publisher: [AI News Daily](https://ai-news-daily.xyz/zh/)

一项新的安慰剂对照实验发现，大多数热门编程智能体（agent）技能并不优于等长的中性指令。

skill-placebo 项目在 15 项公开任务上测试了九种 Claude Code 技能，任务来自 SWE-bench Verified、Terminal-Bench 2.1 和 OpenThoughts-TBLite。每种技能都配有 token 长度相同的中性文本，通过同样的机制安装。

## 为什么重要 {#why-it-matters}

开发者添加一份长指令文件后，可能看到智能体行为变化，并将功劳归于其中的流程。这个实验要问的是：真正有用的成分是技能本身，还是随之而来的额外上下文、启动效应和执行差异。

方法在首次运行前已注册。Claude Opus 5.5 每组完成 30 次试验，产生了 450 次有记录的试验。成本是主要结果指标；实验也追踪任务通过率，并对九项比较做了统计校正。

两种技能的成本低于各自的安慰剂：ponytail 低 12%，agent-skills 低 5%。Planning-with-files 的试验通过率为 80%，其安慰剂则通过了全部 30 次试验，按项目预注册的决策规则被判为更差。另外六种技能与各自匹配的中性文本在统计上没有差别。

九种技能中，没有一种比不使用技能的运行方式成本更低且达到可测量的程度。仅中性安慰剂文本，就让成本相对无技能基线变化了 2%–16%。这一结果表明，提示词长度和看似无关的上下文也是处理的一部分，不能当作无害背景。

## 对照改进了问题，但没有扩大样本

无技能基线询问整个组合是否改变表现。匹配安慰剂则提出更精确的问题：在以同样方式提供等量文本的基础上，实际指令是否增加价值。两种比较可以得出不同结论，并不矛盾。

仓库公开了预注册方法、逐次试验结果和智能体日志。它还记录了 10月6日的一项修订：两次超时运行虽然之后通过了测试，仍按原始规则计为失败。这使 planning-with-files 从“没有更好”变为“更差”，成本则未改变。

局限很明显。15 项任务和每组 30 次试验让通过率区间仍很宽，运行只覆盖一种主要模型和一种执行框架，所选技能也侧重通用编程工作流，而非专业参考知识。现有日志还无法确认，每种技能在运行中是否都得到一致调用。

一项小型 Codex 试验只在五项任务上测试了三种技能，明确属于次要实验。其结果不应与 Claude 实验混合，也不应被视为模型家族比较。

这一发现并不证明编程技能无用。它表明，受欢迎程度、长度和看似合理的流程不能很好地替代匹配对照。可复用的贡献是实验设计：固定方法、给对照等量上下文、保留完整日志，并同时测量成本与成功率。

未来版本可以增加任务、使用其他执行框架，并加入打乱指令的对照，将语义流程与一般启动效应区分开，从而增强结果。

## 核实 {#verification}

| 说法 | 标签 | 一手来源 | 独立核实 |
| --- | --- | --- | --- |
| 主要实验针对九种技能和 15 项公开任务运行了 450 次试验 | 已核实 | [skill-placebo 仓库](https://github.com/simonether/skill-placebo) | 方法、结果和日志均已公开 |
| 两种技能的成本优于安慰剂，一种更差，六种没有更好 | 据公司称 | [skill-placebo 结果](https://github.com/simonether/skill-placebo) | 无；作者的统计分析 |
| Ponytail 成本比匹配安慰剂低 12%，agent-skills 低 5% | 据公司称 | [skill-placebo 结果](https://github.com/simonether/skill-placebo) | 无 |
| Planning-with-files 通过率为 80%，安慰剂为 100% | 据公司称 | [skill-placebo 结果](https://github.com/simonether/skill-placebo) | 已提供逐次试验数据 |
| 九种技能没有一种比无技能方式成本更低且达到可测量的程度 | 据公司称 | [skill-placebo 结果](https://github.com/simonether/skill-placebo) | 无 |
| 匹配对照比无技能基线更能隔离指令内容的作用 | 分析 | [已注册的方法](https://github.com/simonether/skill-placebo/blob/main/METHOD.md) | 根据实验设计推断 |
