据 Manifold Security 的一项技术研究,语言模型判断代码是否恶意时,会将 token 路由到与道德问题相关的专家。
研究者 Cody Nash 用 240 个代码样本测试了 OLMoE,以及 DeepSeek-V2-Lite 的通用版本和代码版本。同一段代码分别配上有关恶意性、漏洞、道德性、合法性、正确性和无关对照的问题。
为什么重要
使用开放混合专家模型的安全工程师,可能认为恶意软件分类是一项范围有限的代码分析任务。路由证据表明,判断问题的措辞也会调用处理规范性问题的机制,因此剪枝或修改模型可能以意想不到的方式影响安全行为。
Manifold 测量了每个 token 使用哪些专家,以及路由器给这些专家多大权重。在三个模型中,恶意性问题的路由都最接近道德性问题,漏洞问题也很接近,无关问题则更远。模型读取相同代码时,这一模式仍然存在。
另一项“工作空间透镜”分析提供了有用的对照。在恶意软件问题下,解码后的残差状态浮现出攻击、恶意软件等词汇;道德词汇则主要在提示词明确询问道德性时出现。Nash 将其概括为:像处理道德问题一样路由,却用安全术语思考。
干预比相似性图更有说服力。Manifold 强制模型复用另一个问题产生的专家选择。换入真实问题提供的路由,改写了 15%–35% 的路由单元,困惑度变化仍保持在 1% 以内,同时改变了分配给“是”的概率。随机路由造成的扰动大得多,在 59%–92% 的运行中翻转了答案。
这些变化并不意味着来源问题的概念或答案被整体复制。效果方向因模型而异,工作空间也没有突然显示来源概念。路由路径似乎会影响计算,却不包含可直接迁移的判定。
剪枝带来了另一项警示。一次 Qwen 剪枝以高于随机的比例移除了道德相关专家,却保留了区分恶意软件的能力;一次严厉得多的 GPT-OSS 剪枝则优先保留这些专家,但仍损失了大量判断能力。路由能指出模型调用了什么,却不能将整个决策定位在这些专家内部。
这是一篇公司研究文章,未经同行评审,测试的模型也是相对较小的开放混合专家模型。方法介绍得很详细,但没有报告独立复现。眼前的结论比标题更有限:在这三个系统中,安全判断和道德判断共享路由模式,操纵这些路由可以改变输出。
核实
| 说法 | 标签 | 一手来源 | 独立核实 |
|---|---|---|---|
| Manifold 用 240 个恶意、良性、有漏洞和已修复的代码样本测试了三个开放混合专家模型 | 据公司称 | Manifold 研究 | 无 |
| 恶意软件问题的路由比合法性、正确性或无关对照更接近道德性问题 | 据公司称 | Manifold 研究 | 无 |
| 在恶意性提示词下,工作空间解码呈现恶意软件概念,而非道德词汇 | 据公司称 | Manifold 研究 | 无 |
| 来源路由改写了 15%–35% 的单元,困惑度变化在 1% 以内,并改变了答案 | 据公司称 | Manifold 研究 | 无 |
| 随机路由在 59%–92% 的运行中翻转了答案 | 据公司称 | Manifold 研究 | 无 |
| 路由的影响不能将完整判断定位在选中的专家内 | 分析 | Manifold 研究 | 剪枝结果支持这一推断 |