Nový doplnok pre Hermes Agent komprimuje dlhé konverzácie tak, že hlavný model požiada o zhrnutie predpony promptu, ktorú už inferenčný server uložil do cache.

Warm Compaction znova odošle poslednú požiadavku agenta, pridá iba novšie riadky konverzácie a pokyn na odovzdanie kontextu. Model vráti štruktúrované zhrnutie v Markdowne, ktoré nahradí staršiu históriu, kým nedávna časť zostane doslovná.

Prečo na tom záleží: Kompresia kontextu zvyčajne vyžaduje ďalšie úplné načítanie konverzácie. Vývojárovi dlhých relácií agentov môže opätovné využitie cache predpony servera skrátiť čakanie a znížiť riziko, že menší samostatný sumarizátor vynechá dôležitý pokyn.

Doplnok používa zdokumentované rozhrania Hermes Agent a nevyžaduje úpravu hostiteľského systému. Podporuje manuálnu aj automatickú kompresiu, funguje s Pythonom 3.10 alebo novším a je vydaný pod licenciou Apache 2.0. Inštalácia pozostáva z príkazu pre doplnok Hermes a následného výberu warm_compaction ako kontextového enginu.

Výhoda rýchlosti závisí od rovnakého hlavného modelu a inferenčného servera, ktorý dokáže znovu použiť bloky promptu v cache. Autor uvádza hostované API s cacheovaním promptov, vLLM, SGLang, TensorRT-LLM, llama.cpp, MLX, Ollama a LM Studio ako možné cesty, no priame testovanie hlási iba na systéme NVIDIA DGX a v LM Studio. Požiadavka odoslaná napríklad do iného slotu llama.cpp môže cache minúť.

Projekt obsahuje dôkazové súbory pre desať syntetických relácií s približne 105 000 tokenmi. V týchto testoch bol medián času zhrnutia Warm Compaction 16,8 sekundy oproti 43,5 sekundy pri hermes-lcm a 78,5 sekundy pri vstavanom kompresore. Zachoval 59 zo 60 testovaných faktov; porovnávané riešenia zachovali 43 a 50. Ide o výsledky autora z jedného syntetického typu úlohy a tri enginy používali odlišné modely.

Návrh obsahuje spracovanie zlyhaní. Ak sa požiadavka s cache nedá vykonať alebo neprejde kontrolou výstupu, doplnok zavolá pomocnú sumarizačnú cestu Hermesu. Ak zlyhá aj tá, vytvorí zhrnutie v pevnom formáte a zachová najnovšie skoršie zhrnutie ako citovaný text. Zrušený pokus ponechá históriu bez zmeny.

Budúce verzie Hermesu môžu ponúknuť natívnu možnosť warm handoff. Doplnok kontroluje túto funkciu a môže na ňu používateľov nasmerovať, no zostáva samostatne voliteľný. Repozitár, nastavenia a dôkazy sú dostupné na GitHube.

Overenie

TvrdenieOznačeniePrimárny zdrojNezávislé overenie
Warm Compaction znova odosiela predponu z cache a pridáva nové riadky s pokynom na odovzdanieOVERENÉRepozitáržiadne
Doplnok používa zdokumentované API Hermesu a licenciu Apache 2.0OVERENÉRepozitáržiadne
Zrýchlenie vyžaduje rovnaký model a funkčnú cache predponyOVERENÉRepozitáržiadne
Medián kompresie bol v desiatich syntetických reláciách 16,8 sekundyPODĽA SPOLOČNOSTIRepozitáržiadne
Doplnok zachoval 59 zo 60 testovaných faktovPODĽA SPOLOČNOSTIRepozitáržiadne
Neúspešné požiadavky s cache používajú pomocnú a potom pevnú zálohuOVERENÉRepozitáržiadne