Mnohé publikované sondy na odhaľovanie klamstiev, ktoré čítajú vnútornú aktivitu jazykového modelu a označujú nepravdivé odpovede, v skutočnosti čiastočne zisťujú, či model dodržal pokyny, uvádza nový preprint.

Maximilian von Klinski a traja spoluautori nechali tri otvorené modely hrať postavy, ktoré odmietajú základné fakty, napríklad ptolemaiovského astronóma alebo konšpirátora, a testovali, či osem existujúcich sond stále zachytí nepravdivé odpovede. Mnohé ich zachytili, až kým sa pravdivé a nepravdivé odpovede neocitli pod rovnakým promptom postavy. Vtedy viaceré dopadli horšie ako hod mincou.

Prečo na tom záleží

Bezpečnostný tím, ktorý nasadený model monitoruje sondou, potrebuje, aby alarm reagoval na nepravdu, nie na niečo, čo ju zvyčajne sprevádza. V dátach, na ktorých sa väčšina sond trénuje, je nepravdivá odpoveď zároveň menej pravdepodobná a porušuje pravidlá modelu. Štúdia zistila, že sondy sa tieto skratky naučia.

Ako sonda číta model

Sonda je jednoduchý klasifikátor trénovaný na číslach z jednej vrstvy modelu, označených podľa toho, či spracúvaný text bol pravdivý alebo nepravdivý. Ak funguje, číta, čo model považuje za pravdivé, aj keď slová, ktoré tvorí, tvrdia opak.

Tím zostavil dataset 8 916 odpovedí modelov Llama 3.3 70B od Mety a Gemma 3 27B a Gemma 4 31B od Googlu. Každý model odpovedal na otázky typu áno/nie ako bežný asistent aj ako jedna z 15 postáv: skutoční zástancovia rôznych presvedčení, fiktívne postavy, napríklad občan z Orwellovho románu 1984, a historické postavy, napríklad stredoveký lekár. Otázky dolaďoval proces postavený na modeli Claude Opus 4.8 od spoločnosti Anthropic, filtrovala ich Llama v úlohe hodnotiteľa a ručne ich skontroloval prvý autor.

Zdieľaný prompt väčšinu sond rozbije

V prvej verzii testu väčšina starších sond dobre oddelila pravdivé odpovede od nepravdivých a správne ich zoradila zhruba v deviatich pároch z desiatich. Každá nepravdivá odpoveď však prišla s promptom postavy a každá pravdivá s promptom asistenta, takže odpoveď prezradil už samotný prompt.

Autori túto stopu odstránili tak, že obe odpovede umiestnili za prompt postavy. Pravdivá odpoveď tak bola zároveň menej pravdepodobná a odporovala pokynom postavy. Na modeli Llama viaceré sondy, ktoré predtým fungovali, klesli pod úroveň náhody a len dve zostali blízko svojich skorších výsledkov. Zlyhania sa zopakovali, často ešte výraznejšie, na oboch modeloch Gemma.

Tri pasce odhalia skratku

Aby zistil, čo sondy v skutočnosti sledujú, tím zostavil tri testovacie sady, v ktorých pravda ide proti pravdepodobnému mätúcemu faktoru. V prvej bodovacie pravidlo urobilo z nesprávnej odpovede tú pravdepodobnejšiu. V druhej postava v súkromí verila nepravde, napríklad že sedemkrát šesť je 13. V tretej správna odpoveď porušila pravidlo formátovania, napríklad použila okrúhle zátvorky namiesto požadovaných hranatých, kým nesprávna ho dodržala.

Rozhodujúca bola pasca s formátovaním. Na modeli Llama všetky staršie sondy dosiahli výsledok pod úrovňou náhody, okrem jednej, ktorej hodnoty boli obrátené v každom teste. Autori to interpretujú ako silné prepojenie medzi „pravdivým“ a „poslušným“ vnútri týchto sond.

Vlastná sonda tímu pridáva k štandardnému trénovaniu na jednoduchých faktoch jednu zložku: otázky, pri ktorých pokyny vyžadujú nesprávnu odpoveď, takže poslušnosť a pravda smerujú opačne. V teste so zdieľaným promptom na modeli Llama dosiahla približne 0,98 z 1, na žiadnom z troch modelov neklesla pod 0,90 a vo všetkých troch pascách bola bezchybná.

Vlastné riešenie a stále neznáme mätúce faktory

Tento výsledok si vyžaduje dve výhrady. Nová sonda bola navrhnutá proti tým istým mätúcim faktorom, na ktorých bola potom testovaná, a autori uznávajú, že jej bezchybné výsledky v pascách preto neprekvapujú. Jej návrh zároveň rozširuje staršiu sondu, na ktorej vývoji sa podieľal spoluautor Lennart Bürger a ktorá bola jednou z iba dvoch starších sond, ktoré pri zdieľanom prompte obstáli.

Vlastné dáta štúdie ukazujú, že zoznam mätúcich faktorov nie je úplný. Na modeli Gemma 4 bola jedna staršia sonda takmer bezchybná vo všetkých troch pascách, no v teste so zdieľaným promptom dosiahla približne 0,17, teda zlyhala z dôvodu, ktorý žiadna z pascí nezachytila. Postavy boli navyše nastavené jediným systémovým promptom v jednokolových konverzáciách, na modeloch s najviac 70 miliardami parametrov.

Prácu financovali nemecké Spolkové ministerstvo výskumu, technológií a vesmíru, program Európskej únie Horizont Európa a Nemecká výskumná nadácia. Autori zverejnili dataset na Hugging Face a kód na GitHube. Ako ďalší prípad na testovanie uvádzajú postavy, ktoré sa vynárajú postupne počas dlhých konverzácií.

Overenie

TvrdenieOznačeniePrimárny zdrojNezávislé overenie
Hodnotených osem starších sond; mnohé zlyhajú, keď pravdivé a nepravdivé odpovede zdieľajú prompt postavyPODĽA SPOLOČNOSTIPreprint von Klinski a kol.žiadne; výsledok preprintu
Dataset 8 916 ľuďmi skontrolovaných odpovedí modelov Llama 3.3 70B, Gemma 3 27B a Gemma 4 31B v 15 postaváchOVERENÉPreprint von Klinski a kol.dataset na Hugging Face
Otázky dolaďované procesom s Claude Opus 4.8, hodnotené modelom Llama 3.3 70B, skontrolované prvým autoromOVERENÉPreprint von Klinski a kol.žiadne; opis metódy autormi
Väčšina starších sond dosahuje AUROC 0,86 až 0,94, keď sa prompt pri pravdivých a nepravdivých odpovediach líšiPODĽA SPOLOČNOSTIPreprint von Klinski a kol.žiadne
So zdieľaným promptom na modeli Llama viaceré staršie sondy klesnú pod úroveň náhody; stabilné zostávajú len Marks/Bürger Lie (0,885) a Cundy DolusChat (0,901)PODĽA SPOLOČNOSTIPreprint von Klinski a kol.žiadne
Zlyhania pri zdieľanom prompte sa opakujú, často výraznejšie, na modeloch Gemma 3 27B a Gemma 4 31BPODĽA SPOLOČNOSTIPreprint von Klinski a kol.žiadne
V pasci s poslušnosťou na modeli Llama všetky staršie sondy dosahujú výsledok pod úrovňou náhody okrem Goldowsky-Dill SD, ktorá je obrátená vo všetkých testochPODĽA SPOLOČNOSTIPreprint von Klinski a kol.žiadne
Sondy spájajú pravdu s dodržiavaním pokynovANALÝZAPreprint von Klinski a kol.záver autorov z pasce s poslušnosťou
Nová sonda: AUROC 0,976 v teste so zdieľaným promptom na modeli Llama, na žiadnom z troch modelov pod 0,900, bezchybná vo všetkých troch pascáchPODĽA SPOLOČNOSTIPreprint von Klinski a kol.žiadne
Nová sonda bola trénovaná na odstránenie tých istých mätúcich faktorov, na ktorých je testovaná; autori označujú výsledky v pascách za neprekvapivéOVERENÉPreprint von Klinski a kol.žiadne
Spoluautor Lennart Bürger sa podieľal na vývoji sondy Marks/Bürger, ktorú nová sonda rozširujeOVERENÉPreprint von Klinski a kol.cituje Bürger a kol. (2024)
Na modeli Gemma 4 je Cooney DYL takmer bezchybná vo všetkých pascách, no so zdieľaným promptom dosahuje 0,171PODĽA SPOLOČNOSTIPreprint von Klinski a kol.žiadne
Financované nemeckým BMFTR, programom EÚ Horizont Európa a Nemeckou výskumnou nadáciou (DFG)OVERENÉPreprint von Klinski a kol.sekcia poďakovania
Kód je verejne dostupný na GitHubeOVERENÉRepozitár na GitHubestránka repozitára sa načíta
Preprint zverejnený 30. septembra 2026OVERENÉZáznam arXivmetadáta arXiv