Jazykové modely pri hodnotení škodlivosti kódu smerujú tokeny cez expertov spojených s morálnymi otázkami, uvádza technická štúdia spoločnosti Manifold Security.
Výskumník Cody Nash testoval OLMoE a všeobecnú aj programátorskú verziu DeepSeek-V2-Lite na 240 vzorkách kódu. Rovnaký kód sa objavil pod otázkami o škodlivosti, zraniteľnosti, morálke, zákonnosti, správnosti a nesúvisiacimi kontrolnými témami.
Prečo na tom záleží
Bezpečnostný inžinier používajúci otvorený model so zmesou expertov môže predpokladať, že klasifikácia malvéru je úzka úloha analýzy kódu. Dáta o smerovaní naznačujú, že formulácia hodnotenia využíva aj mechanizmy pre normatívne otázky, takže prerezávanie alebo úprava modelu môže neočakávane zmeniť bezpečnostné správanie.
Manifold meral, ktorých expertov každý token používal a akú váhu im smerovač pridelil. Vo všetkých troch modeloch bola cesta otázky o škodlivosti najbližšie morálke, zraniteľnosť bola nablízku a nesúvisiace otázky ďalej. Vzor pretrvával pri čítaní rovnakého kódu.
Samostatná „šošovka pracovného priestoru“ ukázala užitočný kontrast. Pri otázke o malvéri dekódované reziduálne stavy zobrazovali slová ako útok a malvér, kým morálna slovná zásoba sa objavovala najmä vtedy, keď sa prompt výslovne pýtal na morálku. Nash to opisuje ako smerovanie podľa morálky pri uvažovaní v bezpečnostných pojmoch.
Zásah je silnejší než mapa podobnosti. Manifold prinútil model znovu použiť voľbu expertov vytvorenú inou otázkou. Dosadenie skutočnej darcovskej cesty zmenilo 15–35 % buniek smerovania, pričom perplexita zostala v rozmedzí 1 %, a posunulo pravdepodobnosť odpovede „áno“. Náhodné cesty spôsobili omnoho väčšie narušenie a zmenili odpoveď v 59–92 % behov.
Zmeny neznamenajú, že sa celý pojem alebo odpoveď darcovskej otázky preniesli. Smer účinku sa líšil podľa modelu a pracovný priestor zrazu nezobrazoval darcovský pojem. Cesta smerovania zrejme ovplyvňuje výpočet bez toho, aby obsahovala prenosný verdikt.
Prerezávanie pridalo ďalšie varovanie. Jedno prerezanie modelu Qwen odstraňovalo expertov spojených s morálkou častejšie než náhodne, no zachovalo rozlíšenie malvéru. Oveľa tvrdšie prerezanie GPT-OSS týchto expertov prednostne zachovalo, napriek tomu stratilo veľkú časť schopnosti hodnotiť. Smerovanie ukazuje, čo model konzultuje, nie miesto celého rozhodnutia.
Ide o firemný výskumný príspevok, nie recenzovanú prácu, a testované modely sú pomerne malé otvorené zmesi expertov. Metóda je podrobne opísaná, nezávislá reprodukcia však uvedená nie je. Bezprostredné ponaučenie je užšie než nadpis: bezpečnostné a morálne hodnotenia zdieľajú vzory smerovania v týchto troch systémoch a manipulácia s cestami môže meniť výstupy.
Overenie
| Tvrdenie | Označenie | Primárny zdroj | Nezávislé overenie |
|---|---|---|---|
| Manifold testoval tri otvorené modely MoE na 240 škodlivých, neškodných, zraniteľných a opravených vzorkách kódu | PODĽA SPOLOČNOSTI | Štúdia Manifold | žiadne |
| Otázky o malvéri smerujú bližšie k morálke než k zákonnosti, správnosti alebo nesúvisiacim kontrolám | PODĽA SPOLOČNOSTI | Štúdia Manifold | žiadne |
| Dekódovanie pracovného priestoru pri prompte o škodlivosti zobrazuje pojmy malvéru, nie morálne slová | PODĽA SPOLOČNOSTI | Štúdia Manifold | žiadne |
| Darcovské cesty zmenili 15–35 % buniek pri perplexite v rozmedzí 1 % a posunuli odpovede | PODĽA SPOLOČNOSTI | Štúdia Manifold | žiadne |
| Náhodné cesty zmenili odpovede v 59–92 % behov | PODĽA SPOLOČNOSTI | Štúdia Manifold | žiadne |
| Vplyv smerovania neurčuje miesto celého hodnotenia vo vybraných expertoch | ANALÝZA | Štúdia Manifold | záver podporujú výsledky prerezávania |