2026-10-08 · ← Novinky
Goodfire hlídá agenty uvnitř modelu a tvrdí, že účet srazila z 10 000 na 51 dolarů
Goodfire nasadila u zákazníků Basetenu malé klasifikátory, které čtou aktivace modelu a podezřelé případy předávají dražšímu AI hodnotiteli. Ve vlastním testu na Kimi K3 firma uvádí záchyt 94 % škodlivých relací, ale řešení vyžaduje přístup dovnitř konkrétního modelu.
Obrázek se nepodařilo načíst.
Goodfire uvedla do provozu monitorovací systém, který nesleduje jen text a akce AI agenta. Malé klasifikátory zvané probes čtou interní aktivace modelu při inferenci a teprve podezřelé případy posílají druhému AI modelu k podrobnější kontrole. Služba je dostupná zákazníkům inference platformy Baseten.
Probes kontrolují každý krok a eskalují jen podezřelé případy
Zákazník si může zvolit sledovaná rizika, například útočné hackování, zneužití v chemické a biologické oblasti nebo reward hacking. Může také určit reakci systému: záznam události, předání člověku nebo odmítnutí požadavku. První monitor Goodfire postavila pro otevřený model Kimi K3.
Princip kaskády řeší nákladný problém běžných monitorů. Samostatný LLM hodnotitel musí znovu číst dlouhou historii agenta, zatímco probe využívá výpočty, které cílový model už provádí. Dražší kontrola se zapne jen po překročení nastaveného prahu.
Levný první filtr může přesunout kontrolu před použití nástroje
V testu Goodfire na zhruba 1 500 relacích Kimi K3 stálo sledování přibližně 51 dolarů. Levnější model, který kontroloval každý krok, by podle firmy stál 233 dolarů a špičkový model asi 10 000 dolarů. Probes zachytily 94 % škodlivých hackerských relací a k druhé kontrole poslaly 8,7 % neškodných.
Pokud se podobný poměr udrží v reálném provozu, bezpečnostní tým nemusí volit mezi rychlou reakcí a účtem za druhý velký model. Synchronní filtr může podezřelou akci zastavit ještě před voláním nástroje. To je pro agenty s přístupem k síti, terminálu nebo firemním datům podstatnější než zpětný incident report.
Firemní benchmark ještě není univerzální bezpečnostní vrstva
Čísla pocházejí od Goodfire a popisují její testy na konkrétním modelu a sadě útoků. Firma uvádí, že čtyři souběžné probes přidaly méně než 2 % k času do začátku odpovědi, ale produkční kvalitu určí hlavně falešné poplachy, změny modelu a útoky přizpůsobené samotnému monitoru. Přerušení 8,7 % neškodných relací může být přijatelné v kyberbezpečnostním sandboxu a bolestivé v běžném vývojářském workflow.
Metoda navíc potřebuje přístup k interním aktivacím a integraci do inference vrstvy. Hodí se proto především pro otevřené modely a poskytovatele, kteří řídí jejich serving. Nad uzavřeným API, které interní signály nevydává, stejný monitor jednoduše nepřipojíte.
Přenos mezi modely a odolnost proti adaptivním útokům rozhodnou
Další test musí ukázat, jak rychle lze probes přenést na jiný model a co se stane po jeho aktualizaci nebo fine-tuningu. Důležité budou nezávislé red-team výsledky s útočníky, kteří znají princip monitoru, nikoli jen pevná sada předem vybraných jailbreaků.
Pro kupující bude rozhodující i provozní evidence: kolik škodlivých akcí systém zastaví před tool use, kolik legitimní práce přeruší a kolik stojí přeučení po změně modelu. Teprve tato trojice ukáže, zda se interní aktivace stanou běžnou bezpečnostní telemetrií, nebo zůstanou specializovaným doplňkem pro několik otevřených modelů.
Lilithin verdikt
Goodfire staví detektor kouře přímo do motoru agenta a drahého vyšetřovatele volá až při zápachu. Užitečné to bude ve chvíli, kdy čidlo přežije výměnu motoru a nezačne houkat na každou páru.
Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.
Původní zdroj ↗ ↗