Lilith Lilith.
Ilustración editorial: Los agentes sacan un diez en la demo. ¿Por qué fallan en producción?
Ilustración de Lilith · remezcla editorial

Agentes de IA y miedo escénico en producción

Cuando entrenas y pruebas a un agente LLM para que complete un formulario en una aplicación, durante una demostración lo completa exactamente como el desarrollador planeó. Un informe de los investigadores de IBM Research publicado en el blog de Hugging Face destaca el problema que surge a continuación. Una vez que el mismo agente se implementa para clientes reales, a menudo responde a la misma instrucción del usuario con una secuencia diferente de pasos y falla.

Los autores describen este fenómeno como un problema fundamental de confiabilidad de los agentes de IA. Es un problema en el que, a pesar de completar con éxito una tarea en un caso, el mismo sistema podría aplicar una lógica ligeramente modificada en una llamada repetida, invocar una función diferente del conjunto de herramientas y, en última instancia, generar un error.

Las tablas de clasificación actuales miden el rendimiento, no la repetibilidad

Mientras que los laboratorios compiten para lograr las puntuaciones más altas en las evaluaciones tradicionales (por ejemplo, SWE-bench), los investigadores señalan su obvia ceguera. Las clasificaciones y las suites de evaluación premian principalmente un pase único: el hecho de que el agente alcanzó el objetivo en un intento específico. Sin embargo, para la implementación de producción, se necesita que un bot complete tareas de rutina de manera estable incluso en la centésima llamada.

Faltan métricas para la confiabilidad y el rendimiento consistente de los marcos de agentes en el ecosistema de evaluación actual. Para la adopción de la IA en las empresas, no es crucial que un asistente ocasionalmente deslumbre con su genialidad, sino que puedan confiar en él bajo una carga promedio diaria sin necesidad de correcciones manuales.

El camino hacia la solución no es lineal

La inconsistencia se debe a la naturaleza de los modelos de lenguaje, que operan en función de la probabilidad de los próximos tokens generados. Eliminar la variabilidad no es fácil, porque restringir severamente la libertad del modelo (por ejemplo, temperatura cero, formato de salida estricto) hace que el sistema pierda la capacidad de recuperarse de los errores cuando su entorno cambia inesperadamente (como una ventana emergente inesperada en una interfaz de usuario).

La solución real radica en implementar canales de evaluación más sofisticados que prueben a los agentes en ejecuciones repetidas (pruebas de estrés) en situaciones idénticas pero ligeramente variadas, calculando la tasa real de estabilidad de la ruta.

Veremos el surgimiento de métricas de confiabilidad

La prueba de un cambio en el mercado será la redirección de la atención de las puntuaciones absolutas de éxito a las métricas de producción. Se espera que surjan nuevas herramientas de evaluación que certifiquen los modelos no solo en función de sus capacidades de resolución de tareas, sino de la previsibilidad de sus procedimientos para la misma tarea.

El veredicto de Lilith

Mostrar un agente de IA en una demo es como evaluar a un contable en una escape room. En producción, no necesitas a un brillante descubridor de atajos, necesitas a alguien que no tropiece cien veces seguidas en la misma casilla.

Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.

Fuente original ↗