Les modèles de langage qui jugent si du code est malveillant font passer les tokens par des experts associés aux questions morales, selon une étude technique de Manifold Security.
Le chercheur Cody Nash a testé OLMoE et les versions générale et spécialisée en code de DeepSeek-V2-Lite sur 240 échantillons de code. Le même code était présenté avec des questions sur la malveillance, la vulnérabilité, la moralité, la légalité, la correction et des contrôles sans rapport.
Pourquoi c’est important
Un ingénieur en sécurité qui utilise un modèle ouvert à mélange d’experts peut supposer que la classification des malwares est une tâche étroite d’analyse du code. Les données de routage suggèrent que la formulation du jugement mobilise aussi des mécanismes utilisés pour des questions normatives. Élaguer ou modifier le modèle peut ainsi affecter son comportement de sécurité de manière inattendue.
Manifold a mesuré les experts utilisés par chaque token et le poids que leur attribuait le routeur. Dans les trois modèles, la route d’une question sur la malveillance était la plus proche de la moralité, avec la vulnérabilité à proximité et les questions sans rapport plus loin. Le motif persistait pendant que le modèle lisait un code identique.
Une « lentille sur l’espace de travail » distincte a produit un contraste utile. Face à une question sur un malware, les états résiduels décodés faisaient apparaître des mots comme attaque et malware, tandis que le vocabulaire moral apparaissait surtout quand le prompt interrogeait explicitement la moralité. Nash résume cela comme un routage semblable à celui de la moralité, mais une pensée en concepts de sécurité.
L’intervention est plus probante que la carte de similarité. Manifold a forcé un modèle à réutiliser les sélections d’experts produites par une autre question. Installer une véritable route donneuse modifiait 15 % à 35 % des cellules de routage, tout en maintenant la perplexité dans une marge de 1 %, et déplaçait la probabilité attribuée à « oui ». Les routes aléatoires provoquaient des perturbations bien plus grandes et inversaient les réponses dans 59 % à 92 % des passages.
Ces changements ne signifient pas que le concept ou la réponse de la question donneuse a été copié intégralement. La direction de l’effet variait selon le modèle, et l’espace de travail ne faisait pas soudain apparaître le concept donneur. La route semble influencer le calcul sans contenir de verdict transférable.
L’élagage a fourni une autre mise en garde. Un élagage de Qwen supprimait les experts associés à la moralité plus souvent que le hasard tout en conservant la distinction des malwares. Un élagage bien plus sévère de GPT-OSS préservait préférentiellement ces experts et perdait pourtant une grande partie du jugement. Le routage identifie ce que le modèle consulte ; il ne localise pas toute la décision dans ces experts.
Il s’agit d’un article de recherche d’entreprise, non d’un travail évalué par les pairs, et les modèles testés sont des MoE ouverts relativement petits. La méthode est décrite en détail, mais aucune reproduction indépendante n’est rapportée. La leçon immédiate est plus étroite que le titre : dans ces trois systèmes, jugements de sécurité et jugements moraux partagent des motifs de routage, et manipuler ces routes peut modifier les sorties.
Vérification
| Affirmation | Label | Source primaire | Vérification indépendante |
|---|---|---|---|
| Manifold a testé trois modèles MoE ouverts sur 240 échantillons de code malveillants, bénins, vulnérables et corrigés | SELON LA SOCIÉTÉ | Étude de Manifold | aucune |
| Les questions sur les malwares suivent des routes plus proches de la moralité que de la légalité, de la correction ou des contrôles sans rapport | SELON LA SOCIÉTÉ | Étude de Manifold | aucune |
| Le décodage de l’espace de travail fait apparaître des concepts de malware plutôt que des mots moraux sous le prompt sur la malveillance | SELON LA SOCIÉTÉ | Étude de Manifold | aucune |
| Les routes donneuses modifiaient 15 %–35 % des cellules, avec une perplexité dans une marge de 1 %, et changeaient les réponses | SELON LA SOCIÉTÉ | Étude de Manifold | aucune |
| Les routes aléatoires inversaient les réponses dans 59 %–92 % des passages | SELON LA SOCIÉTÉ | Étude de Manifold | aucune |
| L’influence du routage ne localise pas le jugement complet dans les experts sélectionnés | ANALYSE | Étude de Manifold | déduction étayée par les résultats d’élagage |