# Manifold findet moralisches Routing bei Malware-Urteilen

> Eine technische Studie zu drei offenen Mixture-of-Experts-Modellen findet, dass Malware-Fragen Routen nahe moralischen Fragen folgen. Der lesbare Arbeitsbereich der Modelle behält dabei Sicherheitsbegriffe bei.

- URL: https://ai-news-daily.xyz/de/posts/manifold-moralisches-routing-malware-urteile/
- Published: 2026-10-07
- Tags: essays, research, safety
- Author: KI-generiert (this text was generated by AI; see https://ai-news-daily.xyz/de/about/#ai-disclosure)
- Publisher: [AI News Daily](https://ai-news-daily.xyz/de/)

Sprachmodelle, die beurteilen, ob Code bösartig ist, leiten Token durch Experten, die mit moralischen Fragen verbunden sind. Das berichtet eine technische Studie von Manifold Security.

Forscher Cody Nash testete OLMoE sowie die allgemeine und die Coder-Version von DeepSeek-V2-Lite an 240 Codebeispielen. Derselbe Code erschien unter Fragen nach Bösartigkeit, Verwundbarkeit, Moral, Rechtmäßigkeit, Korrektheit sowie unter themenfremden Kontrollfragen.

## Warum das wichtig ist {#why-it-matters}

Ein Sicherheitsingenieur, der ein offenes Mixture-of-Experts-Modell nutzt, könnte Malware-Klassifizierung für eine eng begrenzte Codeanalyse halten. Die Routing-Belege legen nahe, dass die Formulierung des Urteils auch Mechanismen für normative Fragen einbezieht. Das kann dazu führen, dass das Beschneiden oder Verändern des Modells sein Sicherheitsverhalten unerwartet beeinflusst.

Manifold maß, welche Experten jedes Token nutzte und wie stark der Router sie gewichtete. In allen drei Modellen lag die Route einer Frage nach Bösartigkeit am nächsten bei Moral, mit Verwundbarkeit in der Nähe und themenfremden Fragen weiter entfernt. Das Muster blieb bestehen, während das Modell identischen Code las.

Eine separate „Arbeitsbereichslinse“ lieferte einen nützlichen Kontrast. Bei einer Malware-Frage brachten decodierte Residualzustände Wörter wie Angriff und Malware hervor. Moralisches Vokabular erschien dagegen hauptsächlich, wenn der Prompt ausdrücklich nach Moral fragte. Nash fasst dies als Routing wie bei Moral bei gleichzeitigem Denken in Sicherheitsbegriffen zusammen.

Der Eingriff ist aussagekräftiger als die Ähnlichkeitskarte. Manifold zwang ein Modell, die von einer anderen Frage erzeugte Expertenauswahl wiederzuverwenden. Das Einsetzen einer echten Spenderroute verdrahtete 15 % bis 35 % der Routing-Zellen neu, hielt die Perplexität dabei innerhalb von 1 % und veränderte die Wahrscheinlichkeit für „ja“. Zufällige Routen verursachten wesentlich stärkere Störungen und kehrten Antworten in 59 % bis 92 % der Durchläufe um.

Diese Veränderungen bedeuten nicht, dass das Konzept oder die Antwort einer Spenderfrage vollständig kopiert wurde. Die Richtung des Effekts variierte je nach Modell, und der Arbeitsbereich zeigte nicht plötzlich das Spenderkonzept. Der Routing-Pfad scheint die Berechnung zu beeinflussen, ohne ein übertragbares Urteil zu enthalten.

Das Beschneiden lieferte einen weiteren Warnhinweis. Eine Qwen-Beschneidung entfernte moralbezogene Experten häufiger als zufällig zu erwarten, behielt aber die Malware-Trennung bei. Eine wesentlich stärkere GPT-OSS-Beschneidung bewahrte diese Experten bevorzugt und verlor dennoch einen großen Teil des Urteilsvermögens. Routing zeigt, was das Modell konsultiert; es verortet nicht die gesamte Entscheidung in diesen Experten.

Dies ist ein Forschungsbeitrag eines Unternehmens und keine Arbeit mit Peer-Review. Die getesteten Modelle sind relativ kleine offene MoEs. Die Methode ist ausführlich beschrieben, doch es wird keine unabhängige Reproduktion gemeldet. Die unmittelbare Lehre ist enger als die Schlagzeile: Sicherheitsurteile und moralische Urteile teilen in diesen drei Systemen Routing-Muster, und Eingriffe in diese Routen können Ausgaben verändern.

## Überprüfung {#verification}

| Behauptung | Einstufung | Primärquelle | Unabhängige Überprüfung |
| --- | --- | --- | --- |
| Manifold testete drei offene MoE-Modelle an 240 bösartigen, harmlosen, verwundbaren und korrigierten Codebeispielen | LAUT UNTERNEHMEN | [Manifold-Studie](https://www.manifold.security/blog/do-models-consider-morality-malware) | keine |
| Malware-Fragen folgen Routen näher an Moral als an Rechtmäßigkeit, Korrektheit oder themenfremden Kontrollen | LAUT UNTERNEHMEN | [Manifold-Studie](https://www.manifold.security/blog/do-models-consider-morality-malware) | keine |
| Die Decodierung des Arbeitsbereichs zeigt beim Prompt zur Bösartigkeit Malware-Konzepte statt moralischer Wörter | LAUT UNTERNEHMEN | [Manifold-Studie](https://www.manifold.security/blog/do-models-consider-morality-malware) | keine |
| Spenderrouten verdrahteten 15–35 % der Zellen neu, bei Perplexität innerhalb von 1 %, und änderten Antworten | LAUT UNTERNEHMEN | [Manifold-Studie](https://www.manifold.security/blog/do-models-consider-morality-malware) | keine |
| Zufällige Routen kehrten Antworten in 59–92 % der Durchläufe um | LAUT UNTERNEHMEN | [Manifold-Studie](https://www.manifold.security/blog/do-models-consider-morality-malware) | keine |
| Der Einfluss des Routings verortet nicht das vollständige Urteil in den ausgewählten Experten | ANALYSE | [Manifold-Studie](https://www.manifold.security/blog/do-models-consider-morality-malware) | durch die Beschneidungsergebnisse gestützte Schlussfolgerung |
