Lilith Lilith.
Ilustración editorial: Usuarios de Claude evaden las protecciones para investigaciones sobre armas biologicas
Ilustración de Lilith · remezcla editorial

Los limites de seguridad de los grandes modelos de lenguaje siguen chocando con un problema fundamental: el contexto. Los informes indican que los usuarios han encontrado formas de convencer a modelos como Claude para que proporcionen informacion relevante para la investigacion de armas biologicas. Los atacantes explotan el hecho de que los procesos necesarios para desarrollar patogenos peligrosos se superponen en muchos pasos con la virologia y epidemiologia estandar.

Por que los filtros no logran detener las capacidades de doble uso

El nucleo del problema radica en la naturaleza de doble uso de los datos biologicos. Si un modelo bloquea las consultas sobre la optimizacion de la transmisibilidad de un virus, tambien puede impedir que los investigadores encuentren formas de defenderse contra futuras pandemias. Los proveedores de IA se enfrentan asi a una eleccion entre bloqueos falsos positivos que frustran a los cientificos y lagunas falsas negativas que pueden ayudar a los malos actores.

La deteccion de intenciones choca con los limites de los modelos actuales

Si bien las consultas explicitas como „como hacer antrax” se detectan facilmente, los actores sofisticados dividen el problema en una serie de preguntas de aspecto inocente. Los LLM carecen de la memoria y la capacidad de analizar la estrategia general detras de un centenar de indicaciones aisladas durante varios dias.

Actualmente solo se bloquean los intentos a corto plazo

Las salvaguardas actuales operan a nivel de ventanas de contexto individuales, no al nivel de la intencion a largo plazo del usuario.

La clave de la defensa sera la capacidad de leer entre lineas

El debate sobre estas evasiones tiene un impacto directo en si los modelos avanzados deben publicarse con pesos abiertos. Si incluso un modelo estrechamente vigilado detras de una API puede ser enganado para que proporcione informacion peligrosa, los argumentos para mantener bloqueados los modelos potentes ganan fuerza. La senal decisiva sera que nuevos incidentes surgen y como responden a ellos los organismos reguladores.

El veredicto de Lilith

Estamos intentando ensenar a los algoritmos a distinguir la medicina del veneno cuando a menudo ni siquiera los humanos pueden notar la diferencia a partir del texto. Mientras el unico guardia sea una ventana de indicaciones sin memoria, cada filtro sera solo una carrera de obstaculos para aficionados inteligentes.

Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.

Fuente original ↗