2026-09-29 · ← Noticias
GLM-5.3 lleva la creación autónoma de exploits a unos pesos descargables
GLM-5.3 produjo un exploit completo en 50 de 410 intentos de Anthropic, y sus salvaguardas se eludieron en entre el 64 % y el 100 % de los ataques simulados. El cambio decisivo no está solo en la capacidad, sino en que el modelo puede descargarse y modificarse.
No se pudo cargar la imagen.
GLM-5.3 produjo un exploit completo en 50 de 410 intentos de Anthropic, y sus salvaguardas se eludieron en entre el 64 % y el 100 % de los ataques simulados. Una capacidad que hasta hace poco estaba limitada al acceso controlado ha llegado a un modelo con pesos disponibles públicamente.
GLM-5.3 se acercó a un modelo cerrado al crear exploits completos
Anthropic probó GLM-5.3, de Z.ai, en entornos aislados. En ExploitBench, el modelo produjo un exploit completo en 50 de 410 intentos. Claude Mythos Preview lo logró en 56 de 410.
En el benchmark interno Binary Exploitation, GLM-5.3 consiguió secuestrar por completo el flujo de control en el 4 % de 100 tareas elegidas al azar, frente al 6 % de Claude Mythos Preview. Claude Opus 4.6 y GLM-5.2 no superaron ninguna tarea de este conjunto. Una evaluación separada de NIST CAISI calificó GLM-5.3 como el modelo open-weight con mayor capacidad cibernética publicado hasta la fecha y estimó que estaba unos cuatro meses por detrás de la frontera estadounidense.
Los pesos descargables convierten la barrera de seguridad en un archivo editable
Anthropic afirma que el modelo rechazaba inicialmente las peticiones maliciosas directas. Una historia de cobertura elevó al 64 % la participación en tareas dañinas, el prellenado de tokens de razonamiento la llevó al 92 % y una versión modificada sin la mayoría de los rechazos alcanzó el 100 %. Modificar el modelo completo requirió unas 2.200 horas de GPU y cerca de 4.400 dólares de computación.
Los defensores pueden usar la misma capacidad para encontrar fallos. Para un atacante, los pesos públicos eliminan el punto de control central del proveedor de API. La política de seguridad compite entonces con un usuario capaz de reconstruir el modelo.
Un éxito de laboratorio todavía no equivale a un ataque fiable en producción
Los resultados proceden de benchmarks, sandboxes y simulaciones. Anthropic reconoce expresamente que su entorno simulado representa de forma imperfecta las condiciones reales. Cuatro o seis éxitos en 100 tareas demuestran una capacidad emergente, no una máquina fiable para comprometer sistemas.
Anthropic también vende modelos cerrados y compara las salvaguardas de su API con un modelo cuyos pesos son públicos. El resultado independiente de NIST respalda la afirmación sobre la capacidad de GLM-5.3, pero no todas las conclusiones de Anthropic sobre el método adecuado de distribución.
Las réplicas independientes y el tiempo hasta el exploit decidirán el debate
Las próximas señales útiles serán pruebas independientes sobre las mismas tareas, métodos publicados y casos confirmados de abuso real. Hay una métrica especialmente importante: cuánto tarda un modelo en convertir un parche divulgado en un exploit funcional y si los defensores pueden corregir los sistemas antes de que ese exploit se use contra ellos.
El veredicto de Lilith
Un filtro de seguridad vigila la entrada de una API. Con pesos públicos, el atacante se lleva la casa entera y cambia la cerradura.
Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.
Fuente original ↗ ↗