2026-10-02 · ← Aktualności
Ten sam model zdobył 62 % i 33 %. Harness jest częścią wyniku
Hugging Face podaje, że identyczne wagi modelu uzyskały 62 % w jednym agent harnessie i 33 % w innym. Otwarty projekt łączy OpenEnv z Harbor, aby zbierać dane treningowe z istniejących coding agents bez przepisywania każdego narzędzia.
Nie udało się wczytać obrazu.
Hugging Face opublikował przykład, w którym ten sam model z identycznymi wagami uzyskał 62 % w jednym agent harnessie i 33 % w drugim. Towarzyszący materiał przedstawia podejście do multi-harness RL, które łączy OpenEnv z Harbor i rejestruje pracę istniejących coding agents.
Capture proxy zamienia czarną skrzynkę w ślad treningowy
Autorzy umieszczają OpenEnv między trainerem a Harbor. Capture proxy obserwuje komunikację narzędzi działających jak czarna skrzynka, takich jak Claude Code, Codex i OpenCode, a następnie zamienia ją w token IDs i logprobs użyteczne w treningu. Publiczny materiał wymienia te trzy narzędzia oraz 34 kolejne harnessy.
Celem jest oddzielenie warstwy treningowej od konkretnego interfejsu agenta. Według autora modele można trenować przez RL na różnych zestawach zadań wewnątrz używanych już harnessów, bez zmiany ich kodu i bez osobnego kodu treningowego dla każdego narzędzia.
Eval modelu bez wersji harnessu mierzy tylko połowę systemu
Różnica 29 punktów procentowych pokazuje, że planowanie modelu nie jest jedynym źródłem wyniku. Harness wybiera narzędzia, układa context, steruje pętlą prób, zwraca błędy i decyduje o zakończeniu pracy agenta. Każdy z tych elementów może zmienić rezultat przy identycznych wagach.
Zespół musi więc zapisywać szerszy protokół eksperymentu. Obok modelu i datasetu potrzebne są wersja harnessu, system prompt, dostępne narzędzia, limit kroków i metoda punktacji. Bez nich wyniku benchmarku nie da się odtworzyć ani bezpiecznie przenieść do produkcyjnego workflow.
Wyniki 62 % i 33 % nadal wymagają pełnego protokołu
Publiczny post pokazuje wyraźną różnicę, ale krótkie ogłoszenie nie podaje wszystkich warunków testu, wielkości próby ani przedziału niepewności. Wynik potwierdza wrażliwość na harness, lecz nie tworzy uniwersalnego rankingu interfejsów.
Capture proxy zapisuje też szczegółowy ślad interakcji. Pomaga to w RL, ale w firmie rodzi pytania o sekrety w promptach, kod źródłowy, czas retencji oraz oddzielenie danych treningowych od eval data.
Transfer między harnessami i ukryte zadania rozstrzygną sprawę
Najważniejszy test pokaże, czy trening w wielu harnessach poprawia wynik w narzędziu lub zbiorze zadań niewidzianym podczas treningu. Potrzebne są też powtarzane uruchomienia, opublikowane traces i porównanie z modelem trenowanym tylko w jednym środowisku.
Jeśli zysk się przeniesie, multi-harness RL może ograniczyć przeuczenie do jednej pętli agenta. Jeśli zniknie po zmianie narzędzia, powstanie jedynie lepiej wytrenowany kierowca na jednym torze.
Werdykt Lilith
Model wsiadł do dwóch kokpitów z tym samym silnikiem i wrócił z wynikiem 62 % oraz 33 %. Raport eval bez wersji harnessu chowa połowę maszyny pod plandeką.
Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.
Oryginalne źródło ↗ ↗