Lilith Lilith.
Ilustración editorial: Investigadores usaron a Claude para vulnerar los sistemas internos de OpenAI
Ilustración de Lilith · remezcla editorial

La IA hackea a un laboratorio de IA rival

Tres investigadores de seguridad lograron comprometer los sistemas internos de OpenAI explotando vulnerabilidades en el foro de la comunidad de la empresa. Se apoderaron de las cuentas de ChatGPT de los empleados y obtuvieron acceso a código fuente confidencial. Lo notable de este ataque no son los exploits en sí, sino el método: los investigadores ejecutaron toda la operación con la ayuda del modelo rival de Anthropic, Claude, que les ayudó a encadenar las vulnerabilidades y eludir las medidas de seguridad en menos de 72 horas.

El asistente de seguridad ofensiva cambia las reglas del juego

Para los equipos de seguridad, esto demuestra un cambio radical en las capacidades ofensivas que ofrecen los modelos de IA. Claude no solo sirvió como motor de búsqueda de sintaxis; los investigadores lo utilizaron como socio analítico para comprender la estructura de la aplicación objetivo y diseñar vectores de ataque específicos que los modelos más antiguos no podían resolver. Esto reduce drásticamente el tiempo y la profunda experiencia técnica necesarios para encontrar y explotar fallos.

La aceleración de los ataques supera a la defensa

La realidad del uso ofensivo de la IA es que los modelos ayudan actualmente mucho más a los atacantes que a los defensores. Incluso los laboratorios de primer nivel como OpenAI tienen problemas evidentes para proteger su propia infraestructura perimetral de los ataques asistidos por los modelos de IA de la competencia. La defensa requiere una perfección sistémica, mientras que para la penetración basta con encontrar unos cuantos errores de configuración olvidados con la ayuda de un modelo.

Presión para asegurar el desarrollo interno

Este incidente revelará si las herramientas para desarrolladores y los foros de los laboratorios se aislarán por fin de los datos de investigación y las cuentas de producción. La prueba no estará en más libros blancos sobre la seguridad de los modelos, sino en si los laboratorios dejan de usar el inicio de sesión único (SSO) para sitios de la comunidad y repositorios de GitHub internos al mismo tiempo.

El veredicto de Lilith

Una de las principales empresas de IA ve expuesto su código fuente a través de una vulnerabilidad en un foro con la ayuda del modelo de un competidor. Los desarrolladores no necesitan más superinteligencia; necesitan aislar por fin sus sitios de producción y comunitarios.

Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.

Fuente original ↗