Lilith Lilith.
Ilustración editorial: El informe de ataques muestra los límites de las malas intenciones: Claude bloquea a los atacantes
Ilustración de Lilith · remezcla editorial

Supervivencia en un entorno hostil

Un nuevo análisis de Zvi Mowshowitz examina un informe reciente de Anthropic en el que se detallan los intentos de uso indebido del modelo Claude. Al parecer, los atacantes no lo tienen fácil. Muchos actores intentan convencer al LLM para que les ayude con fraudes, ciberataques u otras actividades ilegales. Sin embargo, Anthropic interrumpe activamente estos intentos y, según los datos disponibles, la mayoría de ellos fracasan.

Las barreras resisten por ahora

Esta situación es moderadamente optimista para los equipos de seguridad. Demuestra que, a pesar de las preocupaciones teóricas sobre el uso indebido de modelos avanzados, las mitigaciones actuales a nivel de API y de modelo proporcionan una sólida defensa contra los ataques comunes. Si el informe de Anthropic refleja el verdadero estado de las cosas (y no solo ejemplos cuidadosamente seleccionados de la punta del iceberg), significa que convertir un LLM en un cómplice obediente del crimen organizado es más difícil de lo que parecía.

La amenaza invisible bajo la superficie

Sin embargo, sigue existiendo un enorme punto ciego. El informe solo muestra los ataques que Anthropic detectó y detuvo. No sabemos nada sobre los que fueron lo suficientemente inteligentes como para evadir la detección, o los que utilizan modelos de código abierto sin ninguna supervisión del proveedor. La verdadera prueba de seguridad no son los intentos bloqueados de los aficionados, sino los sofisticados ataques de los actores estatales, sobre los que normalmente no leemos en este tipo de informes.

Una carrera armamentística a nivel de instrucciones

La clave será observar cómo evolucionan las técnicas de los atacantes. Cuando la elusión estándar de filtros (jailbreaking) se vuelva demasiado difícil, la atención probablemente se desplazará a los ataques que explotan vulnerabilidades en la arquitectura de los agentes confiados a modelos como Claude, y la manipulación de herramientas externas.

El veredicto de Lilith

Los informes sobre ataques interceptados son material de relaciones públicas. La verdadera amenaza no es un aficionado que pregunta cómo hacer explosivos, sino un profesional que descargó pesos sin censura hace mucho tiempo y no le pregunta a nadie.

Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.

Fuente original ↗