2026-10-03 · ← Noticias
ThinkingBox evalúa a los agentes por la base de datos, no por su seguridad al responder
Microsoft y Hugging Face han publicado ThinkingBox, un benchmark de 507 tareas empresariales con estado que ejecuta cada tarea 20 veces y comprueba el resultado real en el backend. Demuestra por qué una llamada correcta a una herramienta o una respuesta convincente no equivalen a terminar el trabajo.
No se pudo cargar la imagen.
Microsoft y Hugging Face han publicado ThinkingBox, que evalúa a un agente según los registros y efectos secundarios que deja en el backend. El benchmark desplaza la atención desde una conversación convincente hacia un resultado verificable.
Las 507 tareas terminan examinando el estado real
ThinkingBox reúne 507 tareas ejecutables de comercio minorista, seguros de automóvil, viajes, neobanca y soporte de consultoría. Cada intento parte del mismo estado limpio. Un usuario simulado aporta los datos que faltan y las pruebas comparan la base final con el resultado esperado.
Los autores repiten cada tarea 20 veces. En un análisis de 121 680 pruebas válidas con 12 modelos, fallaron 79 853 ejecuciones. Aun así, el 67,24 % de esos fallos terminó sin un error de herramienta declarado e incluyó una modificación de estado. El agente solía parecer eficaz justo cuando la base de datos decía lo contrario.
Los equipos de producción deben medir resultado y repetibilidad
Para quien despliega agentes, capacidad y fiabilidad son preguntas distintas. Un modelo puede resolver una tarea una vez y fallar al procesar cientos de casos. Por eso ThinkingBox presenta pass@1 junto con las tareas que superan los 20 intentos.
La consecuencia práctica es concreta. Los evals deben revisar el registro correcto, los efectos prohibidos y el estado posterior a un fallo de herramienta. El transcript sirve para diagnosticar el recorrido, pero no demuestra que una transacción acabara bien.
Un sandbox controlado sigue simplificando la producción
El benchmark utiliza datos sintéticos, herramientas MCP acotadas y un estado inicial conocido. Así puede atribuir cambios a una ejecución, aunque deja fuera parte del desorden de los sistemas vivos, como escrituras simultáneas e integraciones imprevistas. Su puntuación es una medida, no una garantía para un despliegue.
Las estimaciones de coste usan los tokens registrados y precios de catálogo sin descuento de OpenRouter. Los autores las presentan como índice comparativo, no como factura de producción.
Su valor dependerá de los errores detenidos antes de llegar al cliente
La siguiente señal útil llegará de equipos que incorporen comprobaciones del estado final a sus propios evals. Importará si las ejecuciones repetidas detectan reembolsos erróneos, tickets cerrados antes de tiempo y escrituras no deseadas antes del despliegue.
ThinkingBox está disponible en dos repositorios que separan el runtime de los datos, los registros sintéticos y los servidores MCP. Es una base aprovechable, pero el trabajo real empieza al escribir assertions para cada proceso propio.
El veredicto de Lilith
Un agente que declara el éxito antes de revisar la base de datos se parece a un repartidor con el albarán firmado y el paquete aún en la furgoneta. ThinkingBox por fin evalúa el paquete, no la firma.
Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.
Fuente original ↗ ↗