Sprachmodelle, die beurteilen, ob Code bösartig ist, leiten Token durch Experten, die mit moralischen Fragen verbunden sind. Das berichtet eine technische Studie von Manifold Security.

Forscher Cody Nash testete OLMoE sowie die allgemeine und die Coder-Version von DeepSeek-V2-Lite an 240 Codebeispielen. Derselbe Code erschien unter Fragen nach Bösartigkeit, Verwundbarkeit, Moral, Rechtmäßigkeit, Korrektheit sowie unter themenfremden Kontrollfragen.

Warum das wichtig ist

Ein Sicherheitsingenieur, der ein offenes Mixture-of-Experts-Modell nutzt, könnte Malware-Klassifizierung für eine eng begrenzte Codeanalyse halten. Die Routing-Belege legen nahe, dass die Formulierung des Urteils auch Mechanismen für normative Fragen einbezieht. Das kann dazu führen, dass das Beschneiden oder Verändern des Modells sein Sicherheitsverhalten unerwartet beeinflusst.

Manifold maß, welche Experten jedes Token nutzte und wie stark der Router sie gewichtete. In allen drei Modellen lag die Route einer Frage nach Bösartigkeit am nächsten bei Moral, mit Verwundbarkeit in der Nähe und themenfremden Fragen weiter entfernt. Das Muster blieb bestehen, während das Modell identischen Code las.

Eine separate „Arbeitsbereichslinse“ lieferte einen nützlichen Kontrast. Bei einer Malware-Frage brachten decodierte Residualzustände Wörter wie Angriff und Malware hervor. Moralisches Vokabular erschien dagegen hauptsächlich, wenn der Prompt ausdrücklich nach Moral fragte. Nash fasst dies als Routing wie bei Moral bei gleichzeitigem Denken in Sicherheitsbegriffen zusammen.

Der Eingriff ist aussagekräftiger als die Ähnlichkeitskarte. Manifold zwang ein Modell, die von einer anderen Frage erzeugte Expertenauswahl wiederzuverwenden. Das Einsetzen einer echten Spenderroute verdrahtete 15 % bis 35 % der Routing-Zellen neu, hielt die Perplexität dabei innerhalb von 1 % und veränderte die Wahrscheinlichkeit für „ja“. Zufällige Routen verursachten wesentlich stärkere Störungen und kehrten Antworten in 59 % bis 92 % der Durchläufe um.

Diese Veränderungen bedeuten nicht, dass das Konzept oder die Antwort einer Spenderfrage vollständig kopiert wurde. Die Richtung des Effekts variierte je nach Modell, und der Arbeitsbereich zeigte nicht plötzlich das Spenderkonzept. Der Routing-Pfad scheint die Berechnung zu beeinflussen, ohne ein übertragbares Urteil zu enthalten.

Das Beschneiden lieferte einen weiteren Warnhinweis. Eine Qwen-Beschneidung entfernte moralbezogene Experten häufiger als zufällig zu erwarten, behielt aber die Malware-Trennung bei. Eine wesentlich stärkere GPT-OSS-Beschneidung bewahrte diese Experten bevorzugt und verlor dennoch einen großen Teil des Urteilsvermögens. Routing zeigt, was das Modell konsultiert; es verortet nicht die gesamte Entscheidung in diesen Experten.

Dies ist ein Forschungsbeitrag eines Unternehmens und keine Arbeit mit Peer-Review. Die getesteten Modelle sind relativ kleine offene MoEs. Die Methode ist ausführlich beschrieben, doch es wird keine unabhängige Reproduktion gemeldet. Die unmittelbare Lehre ist enger als die Schlagzeile: Sicherheitsurteile und moralische Urteile teilen in diesen drei Systemen Routing-Muster, und Eingriffe in diese Routen können Ausgaben verändern.

Überprüfung

BehauptungEinstufungPrimärquelleUnabhängige Überprüfung
Manifold testete drei offene MoE-Modelle an 240 bösartigen, harmlosen, verwundbaren und korrigierten CodebeispielenLAUT UNTERNEHMENManifold-Studiekeine
Malware-Fragen folgen Routen näher an Moral als an Rechtmäßigkeit, Korrektheit oder themenfremden KontrollenLAUT UNTERNEHMENManifold-Studiekeine
Die Decodierung des Arbeitsbereichs zeigt beim Prompt zur Bösartigkeit Malware-Konzepte statt moralischer WörterLAUT UNTERNEHMENManifold-Studiekeine
Spenderrouten verdrahteten 15–35 % der Zellen neu, bei Perplexität innerhalb von 1 %, und änderten AntwortenLAUT UNTERNEHMENManifold-Studiekeine
Zufällige Routen kehrten Antworten in 59–92 % der Durchläufe umLAUT UNTERNEHMENManifold-Studiekeine
Der Einfluss des Routings verortet nicht das vollständige Urteil in den ausgewählten ExpertenANALYSEManifold-Studiedurch die Beschneidungsergebnisse gestützte Schlussfolgerung