2026-10-02 · ← News
Dasselbe Modell erreicht 62 % und 33 %. Der Harness gehört zur Leistung
Hugging Face berichtet, dass identische Modellgewichte in einem Agent Harness 62 % und in einem anderen 33 % erreichten. Der offene Ansatz verbindet OpenEnv und Harbor, um Trainingsdaten aus bestehenden Coding Agents ohne Umbau jedes Werkzeugs zu erfassen.
Das Bild konnte nicht geladen werden.
Hugging Face veröffentlichte ein Beispiel, in dem dasselbe Modell mit identischen Gewichten in einem Agent Harness 62 % und in einem anderen 33 % erzielte. Das Begleitmaterial beschreibt einen Multi-Harness-RL-Ansatz, der OpenEnv mit Harbor verbindet und Abläufe bestehender Coding Agents erfasst.
Ein Capture Proxy macht aus der Blackbox eine Trainingsspur
Die Autoren platzieren OpenEnv zwischen Trainer und Harbor. Ein Capture Proxy beobachtet die Kommunikation von Blackbox-Werkzeugen wie Claude Code, Codex und OpenCode und wandelt sie in Token IDs und logprobs für das Training um. Das öffentliche Material nennt diese drei Werkzeuge und 34 weitere Harnesses.
Ziel ist die Trennung der Trainingsschicht von einer bestimmten Agentenoberfläche. Laut Autor lassen sich Modelle mit RL auf verschiedenen Aufgabensätzen in bereits genutzten Harnesses trainieren, ohne deren Code oder den Trainingscode für jedes Werkzeug anzupassen.
Ein Modell-Eval ohne Harness-Version misst nur das halbe System
Der Abstand von 29 Prozentpunkten zeigt, dass Modellplanung nicht die einzige Leistungsquelle ist. Ein Harness wählt Werkzeuge, stellt Kontext zusammen, steuert Wiederholungen, liefert Fehler zurück und entscheidet über das Ende. Jede dieser Entscheidungen kann das Ergebnis bei identischen Gewichten verändern.
Teams brauchen deshalb ein breiteres Versuchsprotokoll. Neben Modell und Dataset gehören Harness-Version, System Prompt, verfügbare Werkzeuge, Schrittgrenzen und Bewertungsmethode in den Datensatz. Sonst lässt sich ein Benchmarkwert weder reproduzieren noch zuverlässig in Produktion übertragen.
Die Werte 62 % und 33 % brauchen weiterhin ein vollständiges Protokoll
Der öffentliche Beitrag nennt einen auffälligen Unterschied, doch die kurze Mitteilung spezifiziert nicht alle Testbedingungen, die Stichprobengröße oder ein Unsicherheitsintervall. Der Abstand belegt Empfindlichkeit gegenüber dem Harness, aber keinen allgemeinen Sieg einer Oberfläche.
Ein Capture Proxy speichert außerdem eine detaillierte Interaktionsspur. Das hilft beim RL, wirft in Unternehmen aber Fragen zu Geheimnissen in Prompts, Quellcode, Aufbewahrung und Trennung von Trainings- und Evaldaten auf.
Transfer zwischen Harnesses und verborgene Aufgaben entscheiden
Entscheidend ist, ob Training über mehrere Harnesses die Leistung in einem Werkzeug oder Aufgabensatz verbessert, den das Modell im Training nicht gesehen hat. Wiederholte Läufe, veröffentlichte Traces und der Vergleich mit einem Modell aus nur einer Umgebung sind ebenso wichtig.
Überträgt sich der Gewinn, kann Multi-Harness RL das Overfitting auf eine einzelne Agentenschleife verringern. Verschwindet er beim Werkzeugwechsel, wurde lediglich ein besserer Fahrer für eine Strecke trainiert.
Liliths Urteil
Das Modell stieg mit demselben Motor in zwei Cockpits und kam mit 62 % und 33 % zurück. Ein Evalbericht ohne Harness-Version versteckt die halbe Maschine unter einer Plane.
Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.
Originalquelle ↗ ↗