Lilith.
⌕
Ilustracja redakcyjna: Ten sam model zdobył 62 % i 33 %. Harness jest częścią wyniku
Ilustracja Lilith · remiks redakcyjny

Hugging Face opublikował przykład, w którym ten sam model z identycznymi wagami uzyskał 62 % w jednym agent harnessie i 33 % w drugim. Towarzyszący materiał przedstawia podejście do multi-harness RL, które łączy OpenEnv z Harbor i rejestruje pracę istniejących coding agents.

Capture proxy zamienia czarną skrzynkę w ślad treningowy

Autorzy umieszczają OpenEnv między trainerem a Harbor. Capture proxy obserwuje komunikację narzędzi działających jak czarna skrzynka, takich jak Claude Code, Codex i OpenCode, a następnie zamienia ją w token IDs i logprobs użyteczne w treningu. Publiczny materiał wymienia te trzy narzędzia oraz 34 kolejne harnessy.

Celem jest oddzielenie warstwy treningowej od konkretnego interfejsu agenta. Według autora modele można trenować przez RL na różnych zestawach zadań wewnątrz używanych już harnessów, bez zmiany ich kodu i bez osobnego kodu treningowego dla każdego narzędzia.

Eval modelu bez wersji harnessu mierzy tylko połowę systemu

Różnica 29 punktów procentowych pokazuje, że planowanie modelu nie jest jedynym źródłem wyniku. Harness wybiera narzędzia, układa context, steruje pętlą prób, zwraca błędy i decyduje o zakończeniu pracy agenta. Każdy z tych elementów może zmienić rezultat przy identycznych wagach.

Zespół musi więc zapisywać szerszy protokół eksperymentu. Obok modelu i datasetu potrzebne są wersja harnessu, system prompt, dostępne narzędzia, limit kroków i metoda punktacji. Bez nich wyniku benchmarku nie da się odtworzyć ani bezpiecznie przenieść do produkcyjnego workflow.

Wyniki 62 % i 33 % nadal wymagają pełnego protokołu

Publiczny post pokazuje wyraźną różnicę, ale krótkie ogłoszenie nie podaje wszystkich warunków testu, wielkości próby ani przedziału niepewności. Wynik potwierdza wrażliwość na harness, lecz nie tworzy uniwersalnego rankingu interfejsów.

Capture proxy zapisuje też szczegółowy ślad interakcji. Pomaga to w RL, ale w firmie rodzi pytania o sekrety w promptach, kod źródłowy, czas retencji oraz oddzielenie danych treningowych od eval data.

Transfer między harnessami i ukryte zadania rozstrzygną sprawę

Najważniejszy test pokaże, czy trening w wielu harnessach poprawia wynik w narzędziu lub zbiorze zadań niewidzianym podczas treningu. Potrzebne są też powtarzane uruchomienia, opublikowane traces i porównanie z modelem trenowanym tylko w jednym środowisku.

Jeśli zysk się przeniesie, multi-harness RL może ograniczyć przeuczenie do jednej pętli agenta. Jeśli zniknie po zmianie narzędzia, powstanie jedynie lepiej wytrenowany kierowca na jednym torze.

Werdykt Lilith

Model wsiadł do dwóch kokpitów z tym samym silnikiem i wrócił z wynikiem 62 % oraz 33 %. Raport eval bez wersji harnessu chowa połowę maszyny pod plandeką.

Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.

Oryginalne źródło ↗ ↗