一项新的安慰剂对照实验发现,大多数热门编程智能体(agent)技能并不优于等长的中性指令。

skill-placebo 项目在 15 项公开任务上测试了九种 Claude Code 技能,任务来自 SWE-bench Verified、Terminal-Bench 2.1 和 OpenThoughts-TBLite。每种技能都配有 token 长度相同的中性文本,通过同样的机制安装。

为什么重要

开发者添加一份长指令文件后,可能看到智能体行为变化,并将功劳归于其中的流程。这个实验要问的是:真正有用的成分是技能本身,还是随之而来的额外上下文、启动效应和执行差异。

方法在首次运行前已注册。Claude Opus 5.5 每组完成 30 次试验,产生了 450 次有记录的试验。成本是主要结果指标;实验也追踪任务通过率,并对九项比较做了统计校正。

两种技能的成本低于各自的安慰剂:ponytail 低 12%,agent-skills 低 5%。Planning-with-files 的试验通过率为 80%,其安慰剂则通过了全部 30 次试验,按项目预注册的决策规则被判为更差。另外六种技能与各自匹配的中性文本在统计上没有差别。

九种技能中,没有一种比不使用技能的运行方式成本更低且达到可测量的程度。仅中性安慰剂文本,就让成本相对无技能基线变化了 2%–16%。这一结果表明,提示词长度和看似无关的上下文也是处理的一部分,不能当作无害背景。

对照改进了问题,但没有扩大样本

无技能基线询问整个组合是否改变表现。匹配安慰剂则提出更精确的问题:在以同样方式提供等量文本的基础上,实际指令是否增加价值。两种比较可以得出不同结论,并不矛盾。

仓库公开了预注册方法、逐次试验结果和智能体日志。它还记录了 10月6日的一项修订:两次超时运行虽然之后通过了测试,仍按原始规则计为失败。这使 planning-with-files 从“没有更好”变为“更差”,成本则未改变。

局限很明显。15 项任务和每组 30 次试验让通过率区间仍很宽,运行只覆盖一种主要模型和一种执行框架,所选技能也侧重通用编程工作流,而非专业参考知识。现有日志还无法确认,每种技能在运行中是否都得到一致调用。

一项小型 Codex 试验只在五项任务上测试了三种技能,明确属于次要实验。其结果不应与 Claude 实验混合,也不应被视为模型家族比较。

这一发现并不证明编程技能无用。它表明,受欢迎程度、长度和看似合理的流程不能很好地替代匹配对照。可复用的贡献是实验设计:固定方法、给对照等量上下文、保留完整日志,并同时测量成本与成功率。

未来版本可以增加任务、使用其他执行框架,并加入打乱指令的对照,将语义流程与一般启动效应区分开,从而增强结果。

核实

说法标签一手来源独立核实
主要实验针对九种技能和 15 项公开任务运行了 450 次试验已核实skill-placebo 仓库方法、结果和日志均已公开
两种技能的成本优于安慰剂,一种更差,六种没有更好据公司称skill-placebo 结果无;作者的统计分析
Ponytail 成本比匹配安慰剂低 12%,agent-skills 低 5%据公司称skill-placebo 结果无
Planning-with-files 通过率为 80%,安慰剂为 100%据公司称skill-placebo 结果已提供逐次试验数据
九种技能没有一种比无技能方式成本更低且达到可测量的程度据公司称skill-placebo 结果无
匹配对照比无技能基线更能隔离指令内容的作用分析已注册的方法根据实验设计推断