Jazykové modely pri hodnotení škodlivosti kódu smerujú tokeny cez expertov spojených s morálnymi otázkami, uvádza technická štúdia spoločnosti Manifold Security.

Výskumník Cody Nash testoval OLMoE a všeobecnú aj programátorskú verziu DeepSeek-V2-Lite na 240 vzorkách kódu. Rovnaký kód sa objavil pod otázkami o škodlivosti, zraniteľnosti, morálke, zákonnosti, správnosti a nesúvisiacimi kontrolnými témami.

Prečo na tom záleží

Bezpečnostný inžinier používajúci otvorený model so zmesou expertov môže predpokladať, že klasifikácia malvéru je úzka úloha analýzy kódu. Dáta o smerovaní naznačujú, že formulácia hodnotenia využíva aj mechanizmy pre normatívne otázky, takže prerezávanie alebo úprava modelu môže neočakávane zmeniť bezpečnostné správanie.

Manifold meral, ktorých expertov každý token používal a akú váhu im smerovač pridelil. Vo všetkých troch modeloch bola cesta otázky o škodlivosti najbližšie morálke, zraniteľnosť bola nablízku a nesúvisiace otázky ďalej. Vzor pretrvával pri čítaní rovnakého kódu.

Samostatná „šošovka pracovného priestoru“ ukázala užitočný kontrast. Pri otázke o malvéri dekódované reziduálne stavy zobrazovali slová ako útok a malvér, kým morálna slovná zásoba sa objavovala najmä vtedy, keď sa prompt výslovne pýtal na morálku. Nash to opisuje ako smerovanie podľa morálky pri uvažovaní v bezpečnostných pojmoch.

Zásah je silnejší než mapa podobnosti. Manifold prinútil model znovu použiť voľbu expertov vytvorenú inou otázkou. Dosadenie skutočnej darcovskej cesty zmenilo 15–35 % buniek smerovania, pričom perplexita zostala v rozmedzí 1 %, a posunulo pravdepodobnosť odpovede „áno“. Náhodné cesty spôsobili omnoho väčšie narušenie a zmenili odpoveď v 59–92 % behov.

Zmeny neznamenajú, že sa celý pojem alebo odpoveď darcovskej otázky preniesli. Smer účinku sa líšil podľa modelu a pracovný priestor zrazu nezobrazoval darcovský pojem. Cesta smerovania zrejme ovplyvňuje výpočet bez toho, aby obsahovala prenosný verdikt.

Prerezávanie pridalo ďalšie varovanie. Jedno prerezanie modelu Qwen odstraňovalo expertov spojených s morálkou častejšie než náhodne, no zachovalo rozlíšenie malvéru. Oveľa tvrdšie prerezanie GPT-OSS týchto expertov prednostne zachovalo, napriek tomu stratilo veľkú časť schopnosti hodnotiť. Smerovanie ukazuje, čo model konzultuje, nie miesto celého rozhodnutia.

Ide o firemný výskumný príspevok, nie recenzovanú prácu, a testované modely sú pomerne malé otvorené zmesi expertov. Metóda je podrobne opísaná, nezávislá reprodukcia však uvedená nie je. Bezprostredné ponaučenie je užšie než nadpis: bezpečnostné a morálne hodnotenia zdieľajú vzory smerovania v týchto troch systémoch a manipulácia s cestami môže meniť výstupy.

Overenie

TvrdenieOznačeniePrimárny zdrojNezávislé overenie
Manifold testoval tri otvorené modely MoE na 240 škodlivých, neškodných, zraniteľných a opravených vzorkách kóduPODĽA SPOLOČNOSTIŠtúdia Manifoldžiadne
Otázky o malvéri smerujú bližšie k morálke než k zákonnosti, správnosti alebo nesúvisiacim kontrolámPODĽA SPOLOČNOSTIŠtúdia Manifoldžiadne
Dekódovanie pracovného priestoru pri prompte o škodlivosti zobrazuje pojmy malvéru, nie morálne slováPODĽA SPOLOČNOSTIŠtúdia Manifoldžiadne
Darcovské cesty zmenili 15–35 % buniek pri perplexite v rozmedzí 1 % a posunuli odpovedePODĽA SPOLOČNOSTIŠtúdia Manifoldžiadne
Náhodné cesty zmenili odpovede v 59–92 % behovPODĽA SPOLOČNOSTIŠtúdia Manifoldžiadne
Vplyv smerovania neurčuje miesto celého hodnotenia vo vybraných expertochANALÝZAŠtúdia Manifoldzáver podporujú výsledky prerezávania