Taalmodellen die beoordelen of code kwaadaardig is, sturen tokens door experts die met morele vragen samenhangen, volgens een technisch onderzoek van Manifold Security.
Onderzoeker Cody Nash testte OLMoE en de algemene en programmeerversies van DeepSeek-V2-Lite op 240 codevoorbeelden. Dezelfde code verscheen bij vragen over kwaadaardigheid, kwetsbaarheid, moraliteit, wettigheid, correctheid en ongerelateerde controles.
Waarom dit ertoe doet
Een beveiligingsengineer die een open mixture-of-experts-model gebruikt, kan aannemen dat malwareclassificatie een beperkte codeanalysetaak is. Het routeringsbewijs suggereert dat de formulering van het oordeel ook mechanismen inschakelt die voor normatieve vragen worden gebruikt. Daardoor kan het snoeien of aanpassen van het model het beveiligingsgedrag op onverwachte manieren beïnvloeden.
Manifold mat welke experts elk token gebruikte en welk gewicht de router eraan gaf. Bij alle drie de modellen lag de route voor een vraag over kwaadaardigheid het dichtst bij moraliteit, met kwetsbaarheid nabij en ongerelateerde vragen verder weg. Het patroon bleef bestaan terwijl het model identieke code las.
Een afzonderlijke “werkruimtelens” leverde een nuttig contrast op. Bij een malwarevraag brachten gedecodeerde residuele toestanden woorden zoals aanval en malware naar voren, terwijl morele woorden vooral verschenen wanneer de prompt expliciet naar moraliteit vroeg. Nash vat dit samen als routeren zoals bij moraliteit, maar denken in beveiligingstermen.
De ingreep is sterker dan de overeenkomstenkaart. Manifold dwong een model de expertselecties van een andere vraag opnieuw te gebruiken. Een echte donorroute installeren wijzigde 15 tot 35 procent van de routeringscellen, terwijl de perplexiteit binnen 1 procent bleef, en veranderde de kans die aan “ja” werd toegekend. Willekeurige routes veroorzaakten veel grotere verstoring en keerden antwoorden om bij 59 tot 92 procent van de uitvoeringen.
Die veranderingen betekenen niet dat het concept of antwoord van een donorvraag volledig werd gekopieerd. De richting van het effect verschilde per model, en de werkruimte toonde niet plotseling het donorconcept. Het routeringspad lijkt de berekening te beïnvloeden zonder een overdraagbaar oordeel te bevatten.
Snoeien leverde nog een waarschuwing op. Een snoei-ingreep bij Qwen verwijderde moraliteitsgebonden experts vaker dan bij willekeurige selectie, maar behield het onderscheiden van malware. Een veel ingrijpendere snoei-ingreep bij GPT-OSS behield die experts juist bij voorkeur en verloor toch een groot deel van de oordeelsvorming. Routering identificeert wat het model raadpleegt; ze lokaliseert niet de volledige beslissing in die experts.
Dit is een onderzoeksbijdrage van een bedrijf, geen werk dat peerreview heeft ondergaan, en de geteste modellen zijn relatief kleine open MoE’s. De methode wordt gedetailleerd beschreven, maar er wordt geen onafhankelijke reproductie gemeld. De directe les is beperkter dan de kop: beveiligingsoordelen en morele oordelen delen routeringspatronen in deze drie systemen, en het manipuleren van die routes kan de uitvoer veranderen.
Verificatie
| Bewering | Label | Primaire bron | Onafhankelijke verificatie |
|---|---|---|---|
| Manifold testte drie open MoE-modellen op 240 kwaadaardige, onschuldige, kwetsbare en herstelde codevoorbeelden | VOLGENS HET BEDRIJF | Onderzoek van Manifold | geen |
| Malwarevragen worden dichter bij moraliteit gerouteerd dan bij wettigheid, correctheid of ongerelateerde controles | VOLGENS HET BEDRIJF | Onderzoek van Manifold | geen |
| Decoderen van de werkruimte brengt bij de prompt over kwaadaardigheid malwareconcepten naar voren en geen morele woorden | VOLGENS HET BEDRIJF | Onderzoek van Manifold | geen |
| Donorroutes wijzigden 15%–35% van de cellen, met perplexiteit binnen 1%, en veranderden antwoorden | VOLGENS HET BEDRIJF | Onderzoek van Manifold | geen |
| Willekeurige routes keerden antwoorden om bij 59%–92% van de uitvoeringen | VOLGENS HET BEDRIJF | Onderzoek van Manifold | geen |
| Routeringsinvloed lokaliseert niet het volledige oordeel in geselecteerde experts | ANALYSE | Onderzoek van Manifold | gevolgtrekking ondersteund door de snoeiresultaten |