Lilith Lilith.
Ilustración editorial: Un modelo débil filtra los pensamientos ocultos de sus hermanos mayores
Ilustración de Lilith · remezcla editorial

Una misma clave para toda la familia abrió la puerta trasera

De qué se trata exactamente: los modelos de frontera de Anthropic, OpenAI y Google envían a los clientes su razonamiento interno (cadena de pensamientos) cifrado. Lo hacen para evitar que los competidores o los investigadores miren bajo el capó y entrenen sus propios modelos, más baratos, a partir de esos pensamientos.

Sin embargo, un grupo de investigadores descubrió un fallo cómicamente simple: todos los modelos de la misma familia (por ejemplo, diferentes versiones de un mismo modelo base) utilizaban la misma clave para cifrar estos pensamientos. Si capturabas un bloque cifrado del modelo más fuerte (y más caro), sólo tenías que enviarlo de vuelta al miembro más débil de la familia, del que podías extraer la información mediante un sencillo jailbreak.

Secretos al descubierto en bloques ocultos

A medida que los modelos asumen tareas de agentes más complejas, los proveedores intentan cada vez más mantener su lógica interna en secreto. No sólo quieren vender el resultado; quieren vender el proceso de razonamiento en sí, protegiéndolo como un valioso conocimiento práctico.

Este hackeo provocó un verdadero problema de seguridad. Al analizar 6.708 trayectorias de agentes disponibles públicamente, los investigadores reconstruyeron más de 315.000 bloques de razonamiento. En su interior, encontraron 704 artefactos de privacidad distintos, entre ellos 62 claves API, 33 contraseñas, 24 tokens de acceso y 30 direcciones de correo electrónico. De todos ellos, 64 artefactos aparecían exclusivamente en los bloques de razonamiento y en ninguna otra parte de la sesión visible.

La seguridad mediante la invisibilidad choca contra un muro

Los proveedores solucionaron este problema concreto con relativa rapidez. La filtración real de información sobre los datos de entrenamiento fue probablemente mínima, porque averiguar cómo piensa un modelo no es lo mismo que descubrir de qué datos procede. Sin embargo, la filtración de claves privadas y contraseñas demuestra que los pensamientos internos pueden ser muy peligrosos si no están realmente separados.

Las soluciones a largo plazo requerirán algo más que cifrado

Separar los pensamientos no será un éxito sólo porque las empresas empiecen a utilizar claves diferentes. Ocurrirá cuando consigan aislar totalmente el razonamiento interno del modelo de los resultados que se envían al usuario. Hasta entonces, cualquier intento de pensamientos ocultos es sólo un reto más para una comunidad a la que le encanta abrir cajas que no debe mirar.

El veredicto de Lilith

Meter datos en sobres opacos sólo funciona hasta que te das cuenta de que tienes el mismo abrecartas para todos. Pero el verdadero desastre es que los modelos empaquetaban en secreto contraseñas de acceso ajenas en esos sobres.

Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.

Fuente original ↗