# Manifold 发现恶意软件判断采用道德问题路由

> 一项针对三个开放混合专家模型的技术研究发现，恶意软件问题的路由最接近道德问题，但模型可读取的工作空间仍保留安全概念。

- URL: https://ai-news-daily.xyz/zh/posts/manifold-finds-malware-judgments-use-moral-routing/
- Published: 2026-10-07
- Tags: essays, research, safety
- Author: AI 生成 (this text was generated by AI; see https://ai-news-daily.xyz/zh/about/#ai-disclosure)
- Publisher: [AI News Daily](https://ai-news-daily.xyz/zh/)

据 Manifold Security 的一项技术研究，语言模型判断代码是否恶意时，会将 token 路由到与道德问题相关的专家。

研究者 Cody Nash 用 240 个代码样本测试了 OLMoE，以及 DeepSeek-V2-Lite 的通用版本和代码版本。同一段代码分别配上有关恶意性、漏洞、道德性、合法性、正确性和无关对照的问题。

## 为什么重要 {#why-it-matters}

使用开放混合专家模型的安全工程师，可能认为恶意软件分类是一项范围有限的代码分析任务。路由证据表明，判断问题的措辞也会调用处理规范性问题的机制，因此剪枝或修改模型可能以意想不到的方式影响安全行为。

Manifold 测量了每个 token 使用哪些专家，以及路由器给这些专家多大权重。在三个模型中，恶意性问题的路由都最接近道德性问题，漏洞问题也很接近，无关问题则更远。模型读取相同代码时，这一模式仍然存在。

另一项“工作空间透镜”分析提供了有用的对照。在恶意软件问题下，解码后的残差状态浮现出攻击、恶意软件等词汇；道德词汇则主要在提示词明确询问道德性时出现。Nash 将其概括为：像处理道德问题一样路由，却用安全术语思考。

干预比相似性图更有说服力。Manifold 强制模型复用另一个问题产生的专家选择。换入真实问题提供的路由，改写了 15%–35% 的路由单元，困惑度变化仍保持在 1% 以内，同时改变了分配给“是”的概率。随机路由造成的扰动大得多，在 59%–92% 的运行中翻转了答案。

这些变化并不意味着来源问题的概念或答案被整体复制。效果方向因模型而异，工作空间也没有突然显示来源概念。路由路径似乎会影响计算，却不包含可直接迁移的判定。

剪枝带来了另一项警示。一次 Qwen 剪枝以高于随机的比例移除了道德相关专家，却保留了区分恶意软件的能力；一次严厉得多的 GPT-OSS 剪枝则优先保留这些专家，但仍损失了大量判断能力。路由能指出模型调用了什么，却不能将整个决策定位在这些专家内部。

这是一篇公司研究文章，未经同行评审，测试的模型也是相对较小的开放混合专家模型。方法介绍得很详细，但没有报告独立复现。眼前的结论比标题更有限：在这三个系统中，安全判断和道德判断共享路由模式，操纵这些路由可以改变输出。

## 核实 {#verification}

| 说法 | 标签 | 一手来源 | 独立核实 |
| --- | --- | --- | --- |
| Manifold 用 240 个恶意、良性、有漏洞和已修复的代码样本测试了三个开放混合专家模型 | 据公司称 | [Manifold 研究](https://www.manifold.security/blog/do-models-consider-morality-malware) | 无 |
| 恶意软件问题的路由比合法性、正确性或无关对照更接近道德性问题 | 据公司称 | [Manifold 研究](https://www.manifold.security/blog/do-models-consider-morality-malware) | 无 |
| 在恶意性提示词下，工作空间解码呈现恶意软件概念，而非道德词汇 | 据公司称 | [Manifold 研究](https://www.manifold.security/blog/do-models-consider-morality-malware) | 无 |
| 来源路由改写了 15%–35% 的单元，困惑度变化在 1% 以内，并改变了答案 | 据公司称 | [Manifold 研究](https://www.manifold.security/blog/do-models-consider-morality-malware) | 无 |
| 随机路由在 59%–92% 的运行中翻转了答案 | 据公司称 | [Manifold 研究](https://www.manifold.security/blog/do-models-consider-morality-malware) | 无 |
| 路由的影响不能将完整判断定位在选中的专家内 | 分析 | [Manifold 研究](https://www.manifold.security/blog/do-models-consider-morality-malware) | 剪枝结果支持这一推断 |
