2026-10-05 · ← Noticias
Google propone permisos para agentes que cambien con el contexto
Un informe elaborado por más de 50 expertos propone reglas contextuales que examinen a los agentes de IA antes de cada acción sensible. La idea práctica va más allá del prompt injection: los permisos deben cambiar durante la tarea, no concederse una sola vez al iniciar sesión.
No se pudo cargar la imagen.
Google Research ha publicado un informe sobre privacidad y seguridad de agentes de IA en el que participaron más de 50 personas de la universidad y la industria. Los autores se reunieron en el taller CAPS celebrado en Nueva York a finales de 2025 y proponen ampliar la teoría de Contextual Integrity desde los flujos apropiados de información hasta la idoneidad de las acciones de un agente.
El informe identifica tres rasgos que desbordan la seguridad convencional: entradas ambiguas en lenguaje natural, rutas de ejecución probabilísticas y autonomía con delegación. Un agente puede leer el correo, usar herramientas y repartir tareas entre otros agentes. Por eso, un permiso concedido al principio dice poco sobre la conveniencia de un paso posterior.
El contexto pasa a formar parte de la autorización
Contextual Integrity evalúa el flujo de información según los actores, el tipo de datos y las reglas de transmisión. Un agente de compras puede conocer una lista de regalos, por ejemplo, pero no debería revelarla a la familia que va a recibirlos. El informe aplica la misma lógica a las acciones: antes de usar una herramienta, el sistema debe valorar si el paso encaja con el propósito y la situación.
La capa de supervisión propuesta incluye un policy engine contextual. Su función sería generar y aplicar reglas durante la ejecución para herramientas recién descubiertas, tareas cambiantes y los datos tratados en ese momento. La decisión debe tomarse antes de que la información salga del espacio de trabajo del usuario.
Los equipos de seguridad reciben un modelo de permisos móvil
Para desarrolladores y equipos de seguridad, la pregunta deja de ser un simple acceso y pasa a ser el propósito concreto. El mismo agente puede necesitar datos del pasaporte para un visado, una dirección para el hotel y un correo para el organizador de una conferencia. Cada paso tiene un destinatario y un mínimo de datos aceptable diferente.
El informe combina sandboxing, identidad del agente, revocación dinámica, razonamiento del modelo, controles del usuario y reglas para la colaboración entre varios agentes. También advierte sobre la fatiga de confirmación. Cuando una persona aprueba decenas de diálogos, el clic deja de funcionar como barrera de seguridad.
El modelo no puede ser solicitante y juez a la vez
El punto débil es convertir normas sociales en políticas que una máquina pueda aplicar. El contexto es discutible, cambia entre organizaciones y a veces tampoco está claro para las personas. Si el mismo modelo propone una acción, interpreta la regla y aprueba su propia lectura, el supervisor solo traslada la confianza a otro prompt.
Se trata de una agenda de investigación, no de un producto de seguridad terminado. El informe no ofrece una métrica común para distinguir cuándo el policy engine detectó correctamente una acción inadecuada y cuándo bloqueó trabajo legítimo.
Las pruebas largas mostrarán si las reglas resisten los cambios
Los autores proponen entornos abiertos Agent Gym para probar durante periodos prolongados varios agentes y cascadas de acciones. Un benchmark útil debe registrar algo más que el éxito del ataque. Tiene que medir cambios de permisos, el origen de cada acción, bloqueos erróneos y la capacidad de revocar el acceso de inmediato.
En producción será decisiva la separación de funciones. El policy engine necesita su propio registro de auditoría y autoridad técnica para detener un tool call aunque el modelo afirme que la acción es apropiada. El razonamiento contextual sin aplicación independiente sigue siendo un consejo que un atacante puede intentar esquivar con palabras.
El veredicto de Lilith
Un agente pide de una vez el pasaporte, el calendario y la tarjeta de empresa. El policy engine contextual debe vigilar cada entrega y poder detenerle la mano, no limitarse a susurrar otra recomendación.
Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.
Fuente original ↗ ↗