Lilith.
⌕
Ilustración editorial: El mismo modelo obtuvo un 62 % y un 33 %. El harness también rinde
Ilustración de Lilith · remezcla editorial

Hugging Face publicó un ejemplo en el que el mismo modelo, con los mismos pesos, obtuvo un 62 % en un agent harness y un 33 % en otro. El material asociado presenta un método de multi-harness RL que conecta OpenEnv con Harbor y captura el trabajo de coding agents existentes.

Un capture proxy convierte la caja negra en una traza de entrenamiento

Los autores colocan OpenEnv entre el trainer y Harbor. Un capture proxy observa la comunicación de herramientas de caja negra como Claude Code, Codex y OpenCode, y la convierte en token IDs y logprobs utilizables para entrenamiento. El material público cita esas tres herramientas y otros 34 harnesses.

El objetivo es separar la capa de entrenamiento de una interfaz concreta. Según el autor, se pueden entrenar modelos con RL sobre distintos conjuntos de tareas dentro de herramientas reales, sin cambiar su código ni mantener un entrenamiento distinto para cada una.

Un eval sin versión del harness mide solo media máquina

La diferencia de 29 puntos porcentuales indica que la planificación del modelo no explica todo el rendimiento. El harness elige herramientas, monta el context, gestiona reintentos, devuelve errores y decide cuándo termina el agente. Cualquiera de esas decisiones puede cambiar el resultado con pesos idénticos.

Los equipos necesitan por tanto un registro experimental más amplio. Junto al modelo y dataset deben guardar versión del harness, system prompt, herramientas disponibles, límite de pasos y método de puntuación. Sin esos datos, un benchmark no puede reproducirse ni trasladarse con fiabilidad a producción.

El 62 % y el 33 % todavía necesitan un protocolo completo

La publicación muestra una diferencia llamativa, pero el anuncio breve no especifica todas las condiciones, el tamaño de la muestra ni el intervalo de incertidumbre. La brecha demuestra sensibilidad al harness, no una superioridad universal de una interfaz.

El capture proxy también recoge una traza detallada de interacción. Es útil para RL, pero una empresa debe resolver secretos en prompts, código fuente, retención y separación entre datos de entrenamiento y evals.

La transferencia entre harnesses y las tareas ocultas decidirán

La prueba decisiva será comprobar si entrenar en varios harnesses mejora el resultado en una herramienta o conjunto de tareas que el modelo no vio durante el entrenamiento. También hacen falta ejecuciones repetidas, traces publicadas y comparación con un modelo entrenado en un solo entorno.

Si la mejora se transfiere, multi-harness RL puede reducir el sobreajuste a un único bucle de agente. Si desaparece al cambiar de herramienta, solo habrá producido un piloto mejor preparado para una pista.

El veredicto de Lilith

El modelo entró en dos cabinas con el mismo motor y volvió con un 62 % y un 33 %. Un informe de eval que omite la versión del harness esconde media máquina bajo una lona.

Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.

Fuente original ↗ ↗