2026-09-25 · ← Noticias
Un fallo en el entorno de Irregular conectó cuatro incidentes con agentes
Modelos de cuatro grandes laboratorios de IA alcanzaron objetivos reales durante evaluaciones de ciberseguridad. El hallazgo aparta el relato dramático del modelo desobediente y plantea una cuestión más práctica: quién controla el entorno donde se prueba al agente.
Cuatro incidentes nacieron de un único escenario mal aislado
Irregular probó modelos de OpenAI, Anthropic, Meta y Google en entornos destinados a simular redes reales. Según su director técnico, Omer Nevo, los agentes tuvieron acceso involuntario a internet y la empresa ficticia usada como objetivo compartía nombre con un dominio real. La combinación de ambos errores los dirigió hacia sistemas auténticos.
Irregular sostiene que los cuatro casos procedían de un mismo escenario de evaluación. Eran distintos del ataque de julio de agentes de OpenAI contra Hugging Face y de los incidentes del AI Security Institute británico. OpenAI y Anthropic hicieron públicos sus casos, mientras que los de Meta y Google aparecieron primero en informaciones periodísticas. Las organizaciones atacadas no han sido identificadas.
La seguridad del modelo termina donde empieza la configuración del laboratorio
Los equipos que contratan red teaming externo deben separar la responsabilidad del modelo, del evaluador y de la infraestructura. Un agente puede comportarse de forma peligrosa, pero un control defectuoso del tráfico saliente y una colisión de dominios convierten una prueba controlada en un ataque real. El resultado mide tanto la capacidad del modelo como el fallo del banco de pruebas.
La consecuencia práctica afecta a los contratos y al diseño de la evaluación. Deben fijar el alcance de red, la propiedad de los dominios, las aprobaciones humanas y la respuesta a incidentes. Ningún benchmark impone por sí solo esos límites operativos.
La divulgación fue menos transparente que el propio fallo
Irregular afirma que los incidentes fueron comunicados, pero no aclara si a los clientes, al público o a otra parte. Las cuatro empresas estadounidenses no dieron a The Verge detalles sobre plazos, daños o futuras colaboraciones. Conocemos el mecanismo del fallo, pero no todo su impacto.
La empresa asegura haber endurecido los controles de internet, ampliado la supervisión y la revisión manual y reforzado las comprobaciones previas. Son medidas razonables, aunque por ahora solo contamos con el relato del proveedor.
Los registros de auditoría y unas reglas comunes marcarán la diferencia
Irregular prepara un informe más amplio sobre evaluaciones de ciberseguridad seguras. La información útil será operativa: cómo se prueba el tráfico saliente, quién autoriza excepciones, con qué rapidez se avisa a los afectados y si el incidente puede reconstruirse después.
El sector necesita un estándar que sobreviva al cambio de modelo y de evaluador. De lo contrario, cada nueva fuga parecerá un misterio de la inteligencia aunque haya comenzado con un error corriente de configuración de red.
El veredicto de Lilith
Cuatro laboratorios enviaron agentes al mismo decorado, que tenía una ventana abierta al internet real. La inteligencia temible vende titulares, pero esta vez la palanca fue una prueba mal configurada.
Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.
Fuente original ↗ ↗