# Manifold spája hodnotenie malvéru s morálnym smerovaním

> Technická štúdia troch otvorených modelov so zmesou expertov zistila, že otázky o malvéri sledujú cesty najbližšie morálnym otázkam, kým čitateľný pracovný priestor si zachováva bezpečnostné pojmy.

- URL: https://ai-news-daily.xyz/sk/posts/manifold-spaja-hodnotenie-malveru-s-moralnym-smerovanim/
- Published: 2026-10-07
- Tags: essays, research, safety
- Author: Vygenerované AI (this text was generated by AI; see https://ai-news-daily.xyz/sk/about/#ai-disclosure)
- Publisher: [AI News Daily](https://ai-news-daily.xyz/sk/)

Jazykové modely pri hodnotení škodlivosti kódu smerujú tokeny cez expertov spojených s morálnymi otázkami, uvádza technická štúdia spoločnosti Manifold Security.

Výskumník Cody Nash testoval OLMoE a všeobecnú aj programátorskú verziu DeepSeek-V2-Lite na 240 vzorkách kódu. Rovnaký kód sa objavil pod otázkami o škodlivosti, zraniteľnosti, morálke, zákonnosti, správnosti a nesúvisiacimi kontrolnými témami.

## Prečo na tom záleží {#why-it-matters}

Bezpečnostný inžinier používajúci otvorený model so zmesou expertov môže predpokladať, že klasifikácia malvéru je úzka úloha analýzy kódu. Dáta o smerovaní naznačujú, že formulácia hodnotenia využíva aj mechanizmy pre normatívne otázky, takže prerezávanie alebo úprava modelu môže neočakávane zmeniť bezpečnostné správanie.

Manifold meral, ktorých expertov každý token používal a akú váhu im smerovač pridelil. Vo všetkých troch modeloch bola cesta otázky o škodlivosti najbližšie morálke, zraniteľnosť bola nablízku a nesúvisiace otázky ďalej. Vzor pretrvával pri čítaní rovnakého kódu.

Samostatná „šošovka pracovného priestoru“ ukázala užitočný kontrast. Pri otázke o malvéri dekódované reziduálne stavy zobrazovali slová ako útok a malvér, kým morálna slovná zásoba sa objavovala najmä vtedy, keď sa prompt výslovne pýtal na morálku. Nash to opisuje ako smerovanie podľa morálky pri uvažovaní v bezpečnostných pojmoch.

Zásah je silnejší než mapa podobnosti. Manifold prinútil model znovu použiť voľbu expertov vytvorenú inou otázkou. Dosadenie skutočnej darcovskej cesty zmenilo 15–35 % buniek smerovania, pričom perplexita zostala v rozmedzí 1 %, a posunulo pravdepodobnosť odpovede „áno“. Náhodné cesty spôsobili omnoho väčšie narušenie a zmenili odpoveď v 59–92 % behov.

Zmeny neznamenajú, že sa celý pojem alebo odpoveď darcovskej otázky preniesli. Smer účinku sa líšil podľa modelu a pracovný priestor zrazu nezobrazoval darcovský pojem. Cesta smerovania zrejme ovplyvňuje výpočet bez toho, aby obsahovala prenosný verdikt.

Prerezávanie pridalo ďalšie varovanie. Jedno prerezanie modelu Qwen odstraňovalo expertov spojených s morálkou častejšie než náhodne, no zachovalo rozlíšenie malvéru. Oveľa tvrdšie prerezanie GPT-OSS týchto expertov prednostne zachovalo, napriek tomu stratilo veľkú časť schopnosti hodnotiť. Smerovanie ukazuje, čo model konzultuje, nie miesto celého rozhodnutia.

Ide o firemný výskumný príspevok, nie recenzovanú prácu, a testované modely sú pomerne malé otvorené zmesi expertov. Metóda je podrobne opísaná, nezávislá reprodukcia však uvedená nie je. Bezprostredné ponaučenie je užšie než nadpis: bezpečnostné a morálne hodnotenia zdieľajú vzory smerovania v týchto troch systémoch a manipulácia s cestami môže meniť výstupy.

## Overenie {#verification}

| Tvrdenie | Označenie | Primárny zdroj | Nezávislé overenie |
| --- | --- | --- | --- |
| Manifold testoval tri otvorené modely MoE na 240 škodlivých, neškodných, zraniteľných a opravených vzorkách kódu | PODĽA SPOLOČNOSTI | [Štúdia Manifold](https://www.manifold.security/blog/do-models-consider-morality-malware) | žiadne |
| Otázky o malvéri smerujú bližšie k morálke než k zákonnosti, správnosti alebo nesúvisiacim kontrolám | PODĽA SPOLOČNOSTI | [Štúdia Manifold](https://www.manifold.security/blog/do-models-consider-morality-malware) | žiadne |
| Dekódovanie pracovného priestoru pri prompte o škodlivosti zobrazuje pojmy malvéru, nie morálne slová | PODĽA SPOLOČNOSTI | [Štúdia Manifold](https://www.manifold.security/blog/do-models-consider-morality-malware) | žiadne |
| Darcovské cesty zmenili 15–35 % buniek pri perplexite v rozmedzí 1 % a posunuli odpovede | PODĽA SPOLOČNOSTI | [Štúdia Manifold](https://www.manifold.security/blog/do-models-consider-morality-malware) | žiadne |
| Náhodné cesty zmenili odpovede v 59–92 % behov | PODĽA SPOLOČNOSTI | [Štúdia Manifold](https://www.manifold.security/blog/do-models-consider-morality-malware) | žiadne |
| Vplyv smerovania neurčuje miesto celého hodnotenia vo vybraných expertoch | ANALÝZA | [Štúdia Manifold](https://www.manifold.security/blog/do-models-consider-morality-malware) | záver podporujú výsledky prerezávania |
