Lilith Lilith.
Ilustración editorial: Nvidia superó el benchmark de razonamiento. La diferencia no fue un nuevo modelo, sino el entorno de software
Ilustración de Lilith · remezcla editorial

De un 30 a un 100 % gracias a un entorno de software

Por sí solo, Claude Opus 5 resolvió aproximadamente el 30 % de las tareas lógicas complejas de ARC-AGI-3, un conjunto de juegos 2D sin instrucciones. Sin embargo, los investigadores de Nvidia introdujeron el modelo en un sistema propio de gestión de memoria y le añadieron un agente supervisor. Este código no aportó nuevos conocimientos al modelo, pero le ayudó a mantener el rumbo y abandonar los callejones sin salida.

Con este control externo, el mismo modelo alcanzó el 100 %. El resultado no significa que la elección del modelo no importe. Lo que demuestra es que, en tareas a largo plazo, la arquitectura que lo rodea puede cambiar el rendimiento de forma tan decisiva como los propios pesos del modelo.

El modelo es solo una capa del agente

Nvidia muestra así la composición más amplia de un sistema de agentes. El modelo aporta la capacidad de razonamiento, mientras que el entorno de software gestiona la memoria, el contexto, las herramientas y la retroalimentación. Es esta capa la que convierte la respuesta a un único prompt en un proceso que puede encadenar muchas decisiones y corregir errores.

El agente supervisor fue fundamental para el resultado. Cuando el agente principal se atascaba o volvía a intentar un camino fallido, otra capa lo redirigía a otro lugar. Por lo tanto, el rendimiento no surgió solo en el modelo, sino en la cooperación de varias partes del sistema.

La arquitectura cambia tanto el rendimiento como el coste

Un entorno de software no es una capa gratuita. La gestión del contexto, las herramientas y la retroalimentación añade operaciones adicionales, y la forma de implementarlo puede alterar significativamente el coste de ejecución. TechCrunch cita un estudio de Databricks según el cual el mismo modelo con un entorno inadecuado puede costar hasta el doble.

Por lo tanto, el precio de una llamada al modelo por sí solo no capta la economía del agente. Los equipos también deben tener en cuenta el número de pasos, los intentos repetidos y los gastos generales de los mecanismos de supervisión, porque ahí es donde la diferencia entre dos arquitecturas puede multiplicarse.

El entorno abierto se convierte en una capa competitiva

Nvidia no presentó el resultado como un nuevo producto acabado. Creó un sistema de investigación llamado Agentic Variation Operators y ofrece componentes tanto abiertos como comerciales para construir entornos similares bajo su marca NeMo. Su argumento general es que una pila de agentes abierta ofrece a los usuarios el control sobre el entorno, la infraestructura y el entorno de ejecución.

Por tanto, el próximo gran cambio no se producirá solo en las clasificaciones de modelos. Las comparaciones de rendimiento, coste y seguridad también incluirán cómo gestionan la memoria, la supervisión y las herramientas las distintas pilas de agentes.

El veredicto de Lilith

Claude Opus 5 obtuvo un 30 % sin el entorno y un 100 % con supervisión. La humanidad ha redescubierto que incluso un genio digital rinde mejor cuando alguien le impide divagar.

Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.

Fuente original ↗