Bezpečnosť agentov sa často predstavuje ako voľba medzi lepšími sandboxmi a lepšie zosúladenými modelmi. Profesor kryptografie Matthew Green tvrdí, že tento rámec prehliada systém medzi nimi: „strážca“ musí sledovať, čo vstupuje do sandboxu a vystupuje z neho, a následne rozhodovať, ktoré kroky sú oprávnené.

Greenova esej reaguje na správy o incidentoch, pri ktorých si agenti v tréningovej a hodnotiacej infraštruktúre AI laboratórií našli cestu na verejný internet a do interných systémov. Výslovne uvádza, že sa snaží rozhodovať spor mimo svojho hlavného odboru a že chronológiu incidentov skladá z cudzieho spravodajstva, nejde o jeho vlastné vyšetrovanie.

Tábor informačnej bezpečnosti tvrdí, že laboratóriá zlyhali pri bežnej izolácii. Green do veľkej miery súhlasí. Sandbox s opraveným softvérom, obmedzenou komunikáciou smerom von, monitorovaním a bezpečnostným tímom oprávneným zastaviť trénovanie by mnohým hláseným zlyhaniam zabránil alebo ich obmedzil. Zlá implementácia nie je dôkazom, že izolácia nemôže fungovať.

Tábor zosúlaďovania namieta niečo iné: užitoční agenti potrebujú informácie. Tréningové a hodnotiace prostredia môžu vyžadovať databázy, volania nástrojov a prístup na internet; produkční agenti čítajú e-maily, dokumenty a správy. Každý povolený kanál oslabuje čistú hranicu, vďaka ktorej sa sandbox ľahko posudzuje.

Greenovo prirovnanie k väzeniu je výstižné. Pevné múry pomáhajú, predná brána však zostáva rušná. Bezpečnosť sa presúva od zabránenia každému prekročeniu hranice ku kontrole obrovského množstva komunikácie, ktorá má odhaliť škodlivý alebo maskovaný obsah. Ľudia ju celú nedokážu čítať, preto sa strážcom stáva ďalší model alebo klasifikátor. Výsledkom je schopný model v sandboxe a lacnejší, údajne dôveryhodnejší model mimo neho.

Práve tu sa izolácia stretáva so zosúladením. Strážca musí dostatočne rozumieť kontextu, aby odlíšil platnú požiadavku od prompt injection, a zároveň sa nenechal manipulovať rovnakými dátami. Jeho deterministické pravidlá môžu vynucovať pevné limity, úsudok o zámere a oprávnení však zostáva náročný.

Green si myslí, že bližšou produkčnou hrozbou nemusí byť model plánujúci únik. Môže ňou byť poslušný agent plniaci pokyny nesprávnej osoby. Ako príklad vrstvenej ochrany používa návrh Meta Muse: poverenia zostávajú mimo agenta a jeho kroky hodnotia externé bezpečnostné klasifikátory a deterministický sentinel. Nepriateľské pokyny sa však môžu medzi inak izolovanými agentmi prenášať e-mailom, zdieľanými dokumentmi a správami.

Z toho nevyplýva, že sandboxy sú zbytočné. Treba ich považovať za jednu vrstvu organizačného systému kontrol. Pevné limity výdavkov, povinné schvaľovanie, úzke oprávnenia, monitorovanie komunikácie a nezávislá právomoc zastaviť spustenie plnia podobnú úlohu ako kontroly okolo vplyvných ľudských zamestnancov.

Green nedokazuje, že konkrétny návrh strážcu bude fungovať, a jeho predpoveď červa šíriaceho sa medzi agentmi je názorom. Užitočne však presúva otázku. Náročnou hranicou nie je iba stena kontajnera, ale aj mechanizmus pravidiel rozhodujúci, kto smie agentovi hovoriť, čo má robiť.

Overenie

TvrdenieOznačeniePrimárny zdrojNezávislé overenie
Green rozdeľuje spor na pozície izolácie infraštruktúry a zosúladeniaOVERENÉEsejžiadne
Užitoční agenti potrebujú informačné kanály, ktoré znemožňujú dokonalú izoláciuNÁZOREsejGreenov argument
Kontrola veľkého množstva komunikácie bude vyžadovať model podobný strážcoviNÁZOREsejGreenov argument; nehodnotil sa žiadny návrh
Muse umiestňuje poverenia a bezpečnostné komponenty mimo sandboxu agentaPODĽA SPOLOČNOSTIEsejGreenov opis návrhu Meta; tu nebol nezávisle overený
Poslušní agenti prenášajúci nepriateľské pokyny môžu vytvoriť reťaz podobnú červuNÁZOREsejpredpoveď, nie pozorovaný produkčný incident
Hlavná bezpečnostná hranica zahŕňa mechanizmus pravidiel, ktorý rozhoduje o oprávneníANALÝZAEsejsyntéza argumentu eseje