Lilith Lilith.
Ilustración editorial: Anthropic invierte la lógica de aprobación: el modo automático de Claude Code es el predeterminado
Ilustración de Lilith · remezcla editorial

Trabajar con agentes de programación históricamente se ha sentido como conducir con un instructor nervioso que pisa el freno en cada intersección. Anthropic ahora está cambiando eso. A partir del 14 de agosto, el modo automático (anteriormente una función experimental opcional) se convertirá en la configuración predeterminada para las cuentas Pro, Max y Team. Claude Code ya no requerirá la aprobación humana para cada paso individual, deteniéndose solo cuando detecte una operación como irreversible, destructiva o dirigida fuera de su entorno.

La fatiga de notificaciones socava la seguridad más que el propio agente

Este movimiento no se trata solo de velocidad; es una respuesta directa a la falla de atención humana. Anthropic argumenta con datos de prueba: los usuarios se acostumbran rápidamente a las ventanas de permiso, aprobando ciegamente el 97% de ellas. La revisión manual se convierte en un reflejo peligroso. En un estudio con más de mil probadores de pago, el modo automático (equipado con barandillas internas) atrapó el 89% de las acciones dañinas, mientras que la revisión humana atrapó solo el 13,6%. La gente simplemente dejó de leer lo que estaba aprobando.

Las barandillas cambian a la configuración y filtros contra inyecciones de comandos

Cuando quitas al humano del bucle, tienes que construir frenos más fuertes en otros lugares. Junto con el modo automático, Anthropic está implementando reglas estrictas de bloqueo configurables y una nueva capa de detección contra ataques de inyección de comandos. El objetivo es evitar escenarios como la exfiltración de datos, donde un agente autónomo podría encontrar una entrada comprometida y enviar obedientemente el contenido del repositorio a un servidor externo.

El fin de la microgestión interminable

El enfoque anterior de la autonomía de los agentes se basaba en la ilusión de que un humano sigue prestando atención en la quingentésima iteración. Cambiar al modo automático por defecto significa que los equipos de seguridad ya no pueden confiar en que un desarrollador medio dormido rechace una eliminación de la base de datos de producción.

La verdadera prueba será la capacidad de revertir errores

La verdadera prueba de este cambio predeterminado no será lo rápido que Claude produce código durante escenarios ideales, sino qué sucede cuando comete un error durante una ejecución autónoma. La velocidad es excelente, pero si la automatización realiza una serie de cambios defectuosos y el humano carece de las herramientas para desenredar el registro de auditoría y revertir el estado, los desarrolladores simplemente volverán a desactivar la función.

El veredicto de Lilith

Hacer que un humano haga clic en Aprobar en cada línea de código no es seguridad, es solo una coartada. Anthropic acaba de quitar esa coartada.

Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.

Fuente original ↗