Lilith Lilith.
⌕
Ilustracja redakcyjna: Holo4 łączy ekran, kod i API, lecz benchmarki jadą różnymi torami
Ilustracja Lilith · remiks redakcyjny

H Company udostępniła Holo4 w dwóch rozmiarach: gęsty model 27B oraz model Mixture of Experts 35B-A3B. Oba działają przez GUI, kod, MCP i API, dobierając interfejs do zadania. Firma opublikowała wagi w formatach BF16, FP8, NVFP4 i 4-bitowym GGUF, a modele oferuje również przez H Models API.

W OSWorld 2.0 H Company podaje wynik 61,7 % dla Holo4 27B i przytacza 81,8 % dla Claude Opus 5.5. Wariant 35B-A3B osiąga 30,9 %. Firma opublikowała również trajektorie stojące za wynikami na publicznych benchmarkach, dzięki czemu można prześledzić kolejne kroki, a nie tylko końcową liczbę.

Jeden model wybiera między klikaniem, shellem i API

Najważniejszy pomysł Holo4 wykracza poza sterowanie ekranem. Model może klikać w aplikacji, pisać i uruchamiać kod albo używać ustrukturyzowanego narzędzia. Lepiej odpowiada to firmowym procesom, w których część pracy przebiega przez interfejs webowy, część przez wewnętrzne API, a część na lokalnych plikach.

Według firmy infrastruktura treningowa utworzyła około 10 000 zadań obejmujących aplikacje webowe, serwery MCP i środowiska desktopowe. H Company przebudowała też harness, aby utrzymywał pamięć przez setki kroków i udostępniał shell bezpośrednio na obsługiwanym komputerze.

Otwarte trajektorie znaczą więcej niż kolejny pojedynczy wynik

Możliwość odtworzenia kroków ma dla programistów praktyczną wartość. Pokazuje, czy model rozwiązał zadanie solidnie, czy tylko trafił na szczęśliwą ścieżkę. Pomaga również oddzielić możliwości modelu od pracy wykonywanej przez harness, pamięć i otaczające narzędzia.

To najmocniejszy element tej premiery: zespoły mogą badać błędy i dostosować własne środowiska. Same otwarte wagi bez powtarzalnych przebiegów dawałyby znacznie mniej w długich zadaniach agentowych.

Wykresy kosztów łączą różne przebiegi i zestawy zadań

H Company wyraźnie zaznacza, że wersje benchmarków, harnessy i podzbiory zadań się różnią. W AutomationBench wyniki Holo4 pochodzą z wewnętrznego harnessu i publicznego zestawu, podczas gdy część porównań wykorzystuje zestaw prywatny. Szacunki kosztów bazują też na różnych cennikach i założeniach dotyczących cache.

Liczby pozostają przydatne, lecz deklaracja o relacji ceny do wydajności nie jest jeszcze czystym wyścigiem na jednej trasie.

Reprodukcja poza firmowym harnessem pokaże wartość w praktyce

Kluczowe będą niezależne przebiegi na tej samej wersji OSWorld 2.0, z identycznymi zadaniami i ujawnionymi kosztami. Ważna będzie też skuteczność w aplikacjach wewnętrznych, gdzie przez setki kroków zmieniają się interfejs, uprawnienia i stan.

Jeśli społeczność odtworzy opublikowane trajektorie z podobnym wynikiem, Holo4 stanie się użyteczną bazą dla agentów obsługujących wiele interfejsów. Jeśli wydajność spadnie poza firmowym harnessem, najcenniejsze pozostaną dane i metody zbudowane wokół modelu.

Werdykt Lilith

Holo4 daje mapę razem z zapisem całej trasy, co w świecie agentów jest cenniejsze niż kolejny medal z benchmarku. Teraz zewnętrzni kierowcy muszą przejechać ten sam odcinek bez firmowej nawigacji.

Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.

Oryginalne źródło ↗ ↗