Lilith.
⌕
Ilustración editorial: Goodfire vigila a los agentes desde dentro y afirma haber reducido un coste de 10.000 a 51 dólares
Ilustración de Lilith · remezcla editorial

Goodfire ha puesto en producción un sistema de vigilancia que observa algo más que el texto y las acciones de un agente de IA. Unos pequeños clasificadores llamados probes leen las activaciones internas del modelo durante la inferencia y solo envían los casos sospechosos a un segundo modelo de IA. El servicio está disponible para clientes de la plataforma de inferencia Baseten.

Los probes revisan cada paso y solo escalan los casos sospechosos

El cliente puede elegir riesgos como ataques informáticos, uso indebido químico y biológico o reward hacking. También define la respuesta: registrar el evento, enviarlo a revisión humana o rechazar la solicitud. Goodfire construyó su primer monitor para el modelo abierto Kimi K3.

La cascada busca reducir el coste del sistema convencional. Un evaluador LLM independiente debe releer un historial largo, mientras que el probe reutiliza cálculos que el modelo objetivo ya realiza. La revisión cara solo se activa cuando la señal supera un umbral configurado.

Un primer filtro barato puede actuar antes de usar herramientas

En una prueba de Goodfire con unas 1.500 sesiones de Kimi K3, la vigilancia costó alrededor de 51 dólares. La empresa calcula que un modelo barato revisando cada paso habría costado 233 dólares y uno de gama alta unos 10.000. Los probes detectaron el 94 % de las sesiones maliciosas y enviaron a segunda revisión el 8,7 % de las inocuas.

Si esa proporción se mantiene en producción, los equipos de seguridad no tendrán que elegir entre reaccionar rápido y pagar otro gran modelo. Un filtro síncrono puede bloquear una acción sospechosa antes de llamar a una herramienta. Para agentes con acceso a la red, al terminal o a datos corporativos, eso importa más que un informe posterior al incidente.

Un benchmark de la empresa aún no equivale a protección universal

Las cifras proceden de Goodfire y describen sus pruebas sobre un modelo y un conjunto de ataques concretos. La empresa afirma que cuatro probes añadieron menos de un 2 % al tiempo hasta el primer token, pero la calidad real dependerá de las falsas alarmas, los cambios del modelo y los ataques adaptados al propio monitor. Interrumpir el 8,7 % de las sesiones inocuas puede ser aceptable en un sandbox de ciberseguridad y doloroso en el flujo normal de desarrollo.

El método también necesita acceso a las activaciones internas e integración con la capa de inferencia. Por eso encaja sobre todo con modelos abiertos y proveedores que controlan el serving. No puede conectarse sin más a una API cerrada que no expone señales internas.

La transferencia entre modelos y los ataques adaptativos decidirán

La siguiente prueba debe medir cuánto se tarda en trasladar los probes a otro modelo y qué ocurre después de una actualización o un fine-tuning. Los red teams independientes tendrán que incluir atacantes que conozcan el funcionamiento del monitor, no solo una cartera fija de jailbreaks preseleccionados.

Los compradores también necesitarán datos operativos: cuántas acciones maliciosas se frenan antes del tool use, cuánto trabajo legítimo se interrumpe y cuánto cuesta reentrenar tras cambiar el modelo. Esas tres cifras dirán si las activaciones internas se convierten en telemetría de seguridad habitual o quedan como complemento especializado.

El veredicto de Lilith

Goodfire coloca un detector de humo dentro del motor del agente y solo llama al investigador caro cuando huele algo raro. Será útil si el sensor sobrevive a un cambio de motor sin dar la alarma ante cada bocanada de vapor.

Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.

Fuente original ↗ ↗