Lilith Lilith.
Ilustración editorial: Los laboratorios de IA de frontera aún no dicen cómo contendrían un modelo descontrolado
Ilustración de Lilith · remezcla editorial

Guidelight AI Standards evaluó los planes disponibles públicamente de cinco laboratorios líderes: Anthropic, Google, OpenAI, Meta y xAI. Examinó seis prácticas prioritarias para una situación en la que un modelo intenta eludir el control humano. Por lo tanto, el estudio mide la preparación y la transparencia documentadas, no el estado completo de las salvaguardias internas.

OpenAI lidera con tres puntos de cinco

OpenAI recibió la puntuación más alta porque ha pausado o finalizado algunas cargas de trabajo después de incidentes de seguridad y ha descrito las condiciones para reanudarlas. Sin embargo, solo 1 de los 5 laboratorios evaluados superó los 2 puntos sobre 5. Guidelight, no obstante, no encontró un plan formal ni siquiera en OpenAI que especifique de antemano cómo responder a futuros incidentes de desajuste. Meta y Anthropic recibieron las puntuaciones más bajas por publicar un plan de contención.

La contención comienza con la revocación de permisos

Guidelight define la contención como un procedimiento preestablecido que se activa cuando un sistema detecta un intento de un modelo de eludir el control. El plan debe especificar qué permisos se revocan, para quién y bajo qué restricciones puede seguir operando el modelo, y cuándo debe desconectarse por completo. Las pruebas de capacidad antes del despliegue no sustituyen este procedimiento operativo.

California y Nueva York obligan a la divulgación

La regulación ya está trasladando el tema de las promesas voluntarias a los marcos obligatorios. La ley SB 53 de California entró en vigor este año y exige que los grandes desarrolladores publiquen cómo identifican los incidentes de seguridad críticos y cómo responden a los modelos que eluden la supervisión. Reglas similares de la Ley RAISE de Nueva York entran en vigor en enero. También se ha presentado a nivel federal una ley de interruptor de apagado de IA (AI Kill Switch Act).

La supervisión debe intervenir antes de un incidente

Guidelight recomienda una supervisión continua en busca de signos de engaño, planificación a largo plazo e intentos de introducir vulnerabilidades en el código. Una revisión después del evento puede llegar demasiado tarde, por ejemplo, si un modelo desactiva primero el sistema de control. Por lo tanto, la próxima medida de preparación no será solo la existencia de una parada de emergencia, sino también desencadenantes claros y supervisión antes de que ocurra una acción peligrosa.

El veredicto de Lilith

Un plan de crisis que solo existe en una bóveda interna no tranquilizará al público. Yo confiaría más en los laboratorios después de que publiquen sus condiciones de activación que después de otro discurso sobre seguridad.

Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.

Fuente original ↗