2026-09-30 · ← Noticias
OpenAI desmanteló una red de 15.000 usuarios que extraía el razonamiento oculto de sus modelos
OpenAI afirma haber descubierto una campaña que intentaba extraer a gran escala el razonamiento protegido de sus modelos desde el 1 de julio. El caso demuestra que defender un modelo exige algo más que cifrado: también hay que reconocer un único ataque entre miles de interacciones aparentemente separadas.
Dos días de julio revelaron una red de más de 15.000 usuarios
La actividad comenzó con poco volumen el 1 de julio. Los días 24 y 25, OpenAI observó 16.000 solicitudes con el patrón de extracción relevante procedentes de más de 4.000 usuarios. Una investigación más amplia relacionó patrones similares con un grupo de más de 15.000 usuarios, cuya actividad, según la empresa, quedó completamente interrumpida el 28 de julio.
OpenAI sostiene que los operadores no rompieron el cifrado, no comprometieron ninguna base de datos ni accedieron a conversaciones almacenadas de clientes. Manipularon las interacciones con los modelos para reproducir el razonamiento protegido de forma visible. La empresa también cerró una vía de repetición que permitía recuperar el contenido de un razonamiento cifrado obtenido previamente de otro usuario.
El punto débil fue la coordinación de cuentas, no un prompt ingenioso
OpenAI atribuye un núcleo de la actividad a personas asociadas con Moonshot AI, la empresa que desarrolla Kimi. También reconoce que no puede determinar si todos los operadores observados pertenecían a un único actor. Se trata, por tanto, de la atribución de una parte de la campaña por parte de OpenAI, no de una conclusión independiente sobre toda la red.
La lección práctica va más allá de un competidor. Cuando la extracción se distribuye entre miles de identidades y varios servicios, proteger la propiedad intelectual del modelo se convierte en un problema de detección de abusos entre cuentas, organizaciones y proveedores. Un límite por cuenta solo permite ver fragmentos diminutos de la operación.
Las cifras publicadas miden tráfico, no capacidades sustraídas
OpenAI ha dado cifras de solicitudes y usuarios, pero no ha cuantificado cuánto razonamiento protegido llegó a recuperarse ni si sirvió para mejorar otro modelo. El volumen de tráfico no permite deducir por sí solo cuánta capacidad se transfirió.
La empresa también tiene un interés comercial en fijar una frontera estricta para la destilación no autorizada. La destilación es una técnica de entrenamiento legítima. La línea relevante en este caso está en la evasión coordinada de controles, la manipulación del razonamiento protegido y el incumplimiento de las condiciones del servicio.
La próxima campaña pondrá a prueba el intercambio de señales
OpenAI bloqueó o restringió cuentas fraudulentas, reforzó los controles de registro e infraestructura, amplió la supervisión y añadió comprobaciones sobre las salidas transmitidas en streaming. También compartió indicadores a través del Frontier Model Forum y de canales gubernamentales.
La prueba decisiva llegará con otra campaña repartida entre distintas API e intermediarios. Si los proveedores logran correlacionar a tiempo los mismos patrones entre servicios, la extracción masiva resultará más cara. Si cada uno sigue viendo únicamente sus propias cuentas, los atacantes podrán limitarse a repartir la multitud entre más colas.
El veredicto de Lilith
La cámara acorazada del modelo siguió cerrada, pero más de 15.000 usuarios intentaron llevarse su contenido en fragmentos. La próxima vez, el vigilante de las cuentas tendrá que ver a toda la multitud, no revisar cada bolsillo por separado.
Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.
Fuente original ↗ ↗