2026-10-08 · ← News
Goodfire überwacht Agenten im Modell und will Kosten von 10.000 auf 51 Dollar gesenkt haben
Goodfire setzt bei Baseten Kunden kleine Klassifikatoren ein, die Modellaktivierungen lesen und verdächtige Fälle an einen teureren KI Prüfer weiterreichen. Im eigenen Test mit Kimi K3 meldet das Unternehmen eine Erkennung von 94 % der schädlichen Sitzungen, benötigt dafür aber Zugriff auf das Innere des jeweiligen Modells.
Das Bild konnte nicht geladen werden.
Goodfire hat ein Überwachungssystem produktiv eingesetzt, das mehr als Text und Aktionen eines KI Agenten beobachtet. Kleine Klassifikatoren namens Probes lesen während der Inferenz interne Modellaktivierungen und leiten nur verdächtige Fälle an ein zweites KI Modell weiter. Der Dienst steht Kunden der Inferenzplattform Baseten zur Verfügung.
Probes prüfen jeden Schritt und eskalieren nur Verdachtsfälle
Kunden können Risiken wie offensives Hacking, chemischen und biologischen Missbrauch oder Reward Hacking auswählen. Sie bestimmen auch die Reaktion: Ereignis protokollieren, an Menschen weitergeben oder die Anfrage ablehnen. Goodfire entwickelte den ersten Monitor für das offene Modell Kimi K3.
Die Kaskade soll die Kosten herkömmlicher Überwachung senken. Ein separater LLM Prüfer muss den langen Verlauf eines Agenten erneut lesen, während ein Probe bereits laufende Berechnungen des Zielmodells nutzt. Die teurere Prüfung startet erst, wenn das Signal einen festgelegten Schwellenwert überschreitet.
Ein günstiger Vorfilter kann vor dem Werkzeugeinsatz eingreifen
In einem Goodfire Test mit rund 1.500 Kimi K3 Sitzungen kostete die Überwachung etwa 51 Dollar. Ein günstigeres Modell, das jeden Schritt kontrolliert, hätte laut Unternehmen 233 Dollar gekostet, ein Spitzenmodell etwa 10.000 Dollar. Die Probes erkannten 94 % der schädlichen Hacking Sitzungen und gaben 8,7 % der harmlosen Sitzungen zur zweiten Prüfung weiter.
Hält dieses Verhältnis im Betrieb, müssen Sicherheitsteams nicht zwischen schneller Reaktion und der Rechnung für ein weiteres großes Modell wählen. Ein synchroner Filter kann eine verdächtige Aktion noch vor einem Tool Aufruf blockieren. Bei Agenten mit Netzwerkzugriff, Terminal oder Unternehmensdaten ist das wichtiger als ein nachträglicher Vorfallbericht.
Ein Herstellerbenchmark ist noch keine universelle Schutzschicht
Die Zahlen stammen von Goodfire und beschreiben Tests mit einem bestimmten Modell und Angriffssatz. Vier parallele Probes erhöhten laut Unternehmen die Zeit bis zum ersten Token um weniger als 2 %. Für den Produktionseinsatz zählen jedoch Fehlalarme, Modelländerungen und Angriffe, die an den Monitor angepasst wurden. Werden 8,7 % harmloser Sitzungen unterbrochen, kann das im Cybersecurity Sandbox vertretbar und im normalen Entwicklungsablauf schmerzhaft sein.
Die Methode verlangt zudem Zugriff auf interne Aktivierungen und eine Integration in den Inferenzstack. Sie eignet sich daher vor allem für offene Modelle und Anbieter mit Kontrolle über das Serving. An eine geschlossene API ohne interne Signale lässt sich derselbe Monitor nicht einfach anschließen.
Modelltransfer und adaptive Angriffe entscheiden über den Nutzen
Der nächste Test muss zeigen, wie schnell Probes auf ein anderes Modell übertragen werden können und was nach einem Update oder Fine-tuning geschieht. Unabhängige Red Teams sollten Angreifer einbeziehen, die das Prinzip des Monitors kennen, statt nur ein festes Paket vorab ausgewählter Jailbreaks zu verwenden.
Käufer brauchen außerdem Betriebsdaten: wie viele schädliche Aktionen vor dem Tool Use gestoppt werden, wie viel legitime Arbeit unterbrochen wird und wie teuer neues Training nach einem Modellwechsel ist. Diese drei Werte entscheiden, ob interne Aktivierungen zur üblichen Sicherheitstelemetrie werden oder ein Spezialzusatz bleiben.
Liliths Urteil
Goodfire baut einen Rauchmelder direkt in den Motor des Agenten und ruft den teuren Ermittler erst bei verdächtigem Geruch. Nützlich wird das, wenn der Sensor einen Motorwechsel übersteht und nicht bei jeder Dampfwolke Alarm schlägt.
Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.
Originalquelle ↗ ↗