Lilith.
⌕
Ilustración editorial: Astra solo alcanzó el 55 % en workflows de contratos, y por eso importa la prueba de Ironclad
Ilustración de Lilith · remezcla editorial

OpenAI e Ironclad convirtieron procesos contractuales complejos en 11 tareas de investigación. GPT-6 Astra obtuvo una media del 55,0 %, frente al 41,6 % de GPT-5.6 Sol. El tiempo medio estimado por intento bajó de 37,0 a 19,2 minutos.

Once tareas miden el proceso terminado y no una secuencia de clics

Las tareas abarcan trabajo jurídico, comercial y de compras. Incluyen configurar un acuerdo de confidencialidad, crear un proceso de aprobación de compras y actualizar una cláusula reutilizable según la jurisdicción elegida. OpenAI calcula que un usuario experto tardaría entre 30 y 40 minutos de media en cada tarea.

Cada tarea se evaluó con entre 8 y 50 criterios. Ironclad aportó entornos de prueba alojados, mientras los investigadores crearon tareas sintéticas y usaron reinforcement learning. Un modelo interno de desarrollo llegó al 63,7 %, pero OpenAI no vincula ese resultado a un modelo disponible.

El software empresarial se convierte en campo de entrenamiento para modelos

El modelo de colaboración importa más que el sector jurídico por sí solo. El proveedor de software no se limita a añadir una función de AI sobre su API. Lleva expertos de dominio, un entorno de prueba y una definición detallada del éxito al desarrollo del frontier model.

Para los equipos de producto, es una forma de transformar una petición vaga de un agente en una tarea medible. Rellenar un formulario no basta. El agente debe conservar umbrales, aprobaciones y excepciones durante todo el workflow, y comprobar después que el proceso funciona con distintas entradas.

Un 55 % es avance de investigación, no permiso para trabajar solo

La comparación usa 11 tareas diseñadas por los socios dentro del entorno alojado de Ironclad. Astra funcionó con Max reasoning y Sol con High reasoning, las configuraciones en las que cada modelo logró su mejor puntuación. Sin un conjunto independiente, variación entre ejecuciones y gravedad de errores, las cifras no prueban fiabilidad en producción.

El anuncio tampoco lanza una nueva función pública de Ironclad. OpenAI señala expresamente que la supervisión humana sigue siendo necesaria. En contratos, una ruta de aprobación omitida puede pesar más que nueve campos correctos.

Los evals independientes y la auditoría de errores decidirán el despliegue

La siguiente señal útil será el rendimiento con procesos no vistos, ejecuciones repetidas y una interfaz modificada. Las empresas también necesitarán registros de acciones, control de permisos, escalado de incertidumbre y una medida de las correcciones humanas que quedan tras los 19,2 minutos del agente.

OpenAI busca unos pocos socios de software adicionales que aporten fallos concretos, expertos, un entorno seguro y datos utilizables. Si este modelo genera evals transferibles, podrían valer más que la propia puntuación de Astra.

El veredicto de Lilith

Astra terminó el workflow contractual en 19,2 minutos, pero dejó casi la mitad de los criterios tirados junto a la meta. El abogado puede apartar la mano del ratón, no de la responsabilidad.

Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.

Fuente original ↗ ↗