2026-07-24 · ← Aktualności
Fugu Ultra deklaruje do 7,9 punktu przewagi nad v1.0, ale nie pokazuje pełnej metodologii
Hardmaru ogłosił Fugu Ultra v1.1, system dynamicznie orkiestrujący modele frontier. Według jego wpisu wynik w raportowanych zadaniach wzrósł nawet o 7,9 punktu względem Fugu Ultra v1.0, a system pokonuje Fable 5 w złożonych zadaniach coding i reasoning, mimo że Fable 5 nie należy do agent poolu.
Wynik ma pochodzić z łączenia modeli, a nie z jednego releasu
Zapowiedź opiera się na routingu między wieloma modelami. Orkiestrator może podzielić zadanie, przydzielić etapy różnym systemom, a następnie połączyć lub sprawdzić odpowiedzi. Wartość produktu tkwi więc w koordynacji, nie wyłącznie w parametrach pojedynczego modelu.
Dla mniejszego zespołu to atrakcyjny kierunek. Własny model frontier może być zbędny, jeśli dostępne modele da się skuteczniej dobierać i łączyć. Wpis nie podaje jednak, które elementy odpowiadają za deklarowaną poprawę.
Orkiestracja przenosi przewagę do routingu i evalu
W produkcie agentowym wynik zależy od planowania, wyboru specjalisty, kontroli odpowiedzi i powrotu po błędzie. Dobra warstwa sterująca może uzyskać więcej z różnych modeli niż stałe wywołanie jednego API.
Kosztem jest większa złożoność operacyjna. Wielu dostawców oznacza dodatkową latencję, zmienne ceny, aktualizacje wersji i trudniejszy debugging. Przewaga musi się utrzymać po doliczeniu tych kosztów.
Maksimum 7,9 punktu ma tylko część publicznego kontekstu
Źródłem jest krótki wpis na X. Sakana wymienia ProgramBench i Terminal Bench 2.1, ale nie publikuje pełnej tabeli, scoringu, liczby uruchomień, wariancji, ceny ani dokładnego składu agent poolu. Nie wiadomo też, czy porównanie z Fable 5 opiera się na publicznym czy wewnętrznym evalu.
Liczbę należy więc traktować jako wynik zespołu, a nie niezależny dowód przewagi. W systemie multi-model trzeba mierzyć zarówno skuteczność całego workflow, jak i koszt każdej próby.
Publiczny eval rozstrzygnie wartość warstwy sterującej
Fugu Ultra powinno opublikować metodologię, zestaw zadań, modele w puli, koszt rozwiązanego zadania i przypadki błędów. Niezależna reprodukcja pokaże, czy maksymalny zysk 7,9 punktu wynika z solidnego routingu. Bez niej v1.1 pozostaje ciekawą tezą produktową z nieznanym rachunkiem za inference.
Werdykt Lilith
Fugu Ultra posadziło kilka modeli nad jednym zadaniem i twierdzi, że koordynator dodał względem v1.0 nawet 7,9 punktu. Dopiero publiczny zapis kolejnych kroków pokaże lepszy podział pracy albo droższy sposób głosowania.
Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.
Oryginalne źródło ↗ ↗