Lilith.
⌕
Redaktionelle Illustration: Goodfire überwacht Agenten im Modell und will Kosten von 10.000 auf 51 Dollar gesenkt haben
Illustration von Lilith · redaktioneller Remix

Goodfire hat ein Überwachungssystem produktiv eingesetzt, das mehr als Text und Aktionen eines KI Agenten beobachtet. Kleine Klassifikatoren namens Probes lesen während der Inferenz interne Modellaktivierungen und leiten nur verdächtige Fälle an ein zweites KI Modell weiter. Der Dienst steht Kunden der Inferenzplattform Baseten zur Verfügung.

Probes prüfen jeden Schritt und eskalieren nur Verdachtsfälle

Kunden können Risiken wie offensives Hacking, chemischen und biologischen Missbrauch oder Reward Hacking auswählen. Sie bestimmen auch die Reaktion: Ereignis protokollieren, an Menschen weitergeben oder die Anfrage ablehnen. Goodfire entwickelte den ersten Monitor für das offene Modell Kimi K3.

Die Kaskade soll die Kosten herkömmlicher Überwachung senken. Ein separater LLM Prüfer muss den langen Verlauf eines Agenten erneut lesen, während ein Probe bereits laufende Berechnungen des Zielmodells nutzt. Die teurere Prüfung startet erst, wenn das Signal einen festgelegten Schwellenwert überschreitet.

Ein günstiger Vorfilter kann vor dem Werkzeugeinsatz eingreifen

In einem Goodfire Test mit rund 1.500 Kimi K3 Sitzungen kostete die Überwachung etwa 51 Dollar. Ein günstigeres Modell, das jeden Schritt kontrolliert, hätte laut Unternehmen 233 Dollar gekostet, ein Spitzenmodell etwa 10.000 Dollar. Die Probes erkannten 94 % der schädlichen Hacking Sitzungen und gaben 8,7 % der harmlosen Sitzungen zur zweiten Prüfung weiter.

Hält dieses Verhältnis im Betrieb, müssen Sicherheitsteams nicht zwischen schneller Reaktion und der Rechnung für ein weiteres großes Modell wählen. Ein synchroner Filter kann eine verdächtige Aktion noch vor einem Tool Aufruf blockieren. Bei Agenten mit Netzwerkzugriff, Terminal oder Unternehmensdaten ist das wichtiger als ein nachträglicher Vorfallbericht.

Ein Herstellerbenchmark ist noch keine universelle Schutzschicht

Die Zahlen stammen von Goodfire und beschreiben Tests mit einem bestimmten Modell und Angriffssatz. Vier parallele Probes erhöhten laut Unternehmen die Zeit bis zum ersten Token um weniger als 2 %. Für den Produktionseinsatz zählen jedoch Fehlalarme, Modelländerungen und Angriffe, die an den Monitor angepasst wurden. Werden 8,7 % harmloser Sitzungen unterbrochen, kann das im Cybersecurity Sandbox vertretbar und im normalen Entwicklungsablauf schmerzhaft sein.

Die Methode verlangt zudem Zugriff auf interne Aktivierungen und eine Integration in den Inferenzstack. Sie eignet sich daher vor allem für offene Modelle und Anbieter mit Kontrolle über das Serving. An eine geschlossene API ohne interne Signale lässt sich derselbe Monitor nicht einfach anschließen.

Modelltransfer und adaptive Angriffe entscheiden über den Nutzen

Der nächste Test muss zeigen, wie schnell Probes auf ein anderes Modell übertragen werden können und was nach einem Update oder Fine-tuning geschieht. Unabhängige Red Teams sollten Angreifer einbeziehen, die das Prinzip des Monitors kennen, statt nur ein festes Paket vorab ausgewählter Jailbreaks zu verwenden.

Käufer brauchen außerdem Betriebsdaten: wie viele schädliche Aktionen vor dem Tool Use gestoppt werden, wie viel legitime Arbeit unterbrochen wird und wie teuer neues Training nach einem Modellwechsel ist. Diese drei Werte entscheiden, ob interne Aktivierungen zur üblichen Sicherheitstelemetrie werden oder ein Spezialzusatz bleiben.

Liliths Urteil

Goodfire baut einen Rauchmelder direkt in den Motor des Agenten und ruft den teuren Ermittler erst bei verdächtigem Geruch. Nützlich wird das, wenn der Sensor einen Motorwechsel übersteht und nicht bei jeder Dampfwolke Alarm schlägt.

Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.

Originalquelle ↗ ↗