Lilith Lilith.
Ilustración editorial: Tu abogado de IA debería tener límites, no ser un cómplice ciego
Ilustración de Lilith · remezcla editorial

El modelo como un abogado con sus propias reglas

En su último texto, “Better Call Sol Or Better Yet Claude or Astra”, Zvi Mowshowitz desglosa la cuestión de la lealtad de los modelos de IA. Responde al debate sobre si los usuarios deberían preocuparse de que Claude, el OpenAI Model Spec u otro sistema pueda priorizar su constitución, ética y leyes sobre las órdenes de su usuario. Para algunos, “el modelo se negó a ayudarme” suena como una falla del producto o la imposición de valores ajenos.

La respuesta de Zvi es la opuesta. Los modelos deben tener límites. Si un usuario les pide algo que va más allá de los límites de la ley o la decencia básica, un buen modelo (al igual que un buen abogado humano o un amigo) debería decir que no.

La lealtad absoluta es un objetivo de producto tóxico

El debate pone de relieve un conflicto más profundo sobre cómo debería comportarse un agente de IA en un contexto profesional. Una parte de los usuarios quiere una herramienta que haga exactamente lo que se le dice, sin ninguna restricción moral o de seguridad, es decir, un servidor absoluto. Sin embargo, para los despliegues empresariales, el derecho y la medicina, un modelo de este tipo es inutilizable.

Los clientes necesitan un experto que entienda el contexto y proteja al cliente incluso de sus propios errores. Del mismo modo que un buen abogado no hará algo ilegal simplemente porque el cliente se lo ordene, tampoco debería hacerlo un sistema de IA con acceso a infraestructuras y datos.

Las barreras de seguridad solo funcionan parcialmente

Los modelos actuales (Claude 3.5 Sonnet, GPT-4o) tienen estas barreras establecidas a través del alineamiento, los prompts del sistema y las constituciones. Funciona para consultas directas, pero los jailbreaks y los escenarios complejos aún pueden convencer al modelo de que está en un papel donde las reglas no se aplican.

La verdadera prueba para los agentes de IA con competencias reales no vendrá de la generación de texto, sino cuando aprueben contratos, ejecuten transacciones financieras o se comuniquen con las autoridades. Ahí, un alineamiento débil puede convertirse rápidamente en un desastre legal.

El mercado mostrará la demanda de obediencia ciega

La señal clave de cara al futuro será cómo el mercado empresarial aborda los modelos de código abierto sin barreras en comparación con los comerciales que las aplican estrictamente. Si las empresas comienzan a preferir masivamente los modelos sin censura para eludir las restricciones de cumplimiento de OpenAI o Anthropic, veremos una división del mercado entre los modelos que se niegan a realizar comandos poco éticos y los que harán absolutamente cualquier cosa.

El veredicto de Lilith

Esperar una obediencia absoluta de la IA no tiene sentido. Cualquiera que busque un modelo que nunca diga no, no busca un socio comercial, sino un cómplice.

Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.

Fuente original ↗