2026-07-24 · ← Novinky
Fugu Ultra hlásí až 7,9 bodu navíc oproti v1.0, úplnou metodiku zatím neukázalo
Hardmaru oznámil Fugu Ultra v1.1, systém pro dynamickou orchestraci frontier modelů. Podle jeho příspěvku výkon na sledovaných úlohách vzrostl až o 7,9 bodu oproti Fugu Ultra v1.0 a systém překonává Fable 5 v komplexních coding a reasoning úlohách, aniž by Fable 5 byl součástí agent poolu.
Výkon má vznikat kombinací modelů, nikoli jedním releasem
Oznámení staví na routingu mezi více modely. Orchestrátor může rozdělit úlohu, přidělit jednotlivé kroky různým systémům a jejich výstupy spojit nebo kontrolovat. Hodnota tak leží v řízení spolupráce, ne pouze v parametrech jednoho modelu.
Pro menší tým je tento směr atraktivní. Nemusí trénovat vlastní frontier model, pokud dokáže lépe vybírat a skládat dostupné modely. Tweet však neuvádí, které komponenty vytvořily deklarovaný posun.
Orchestrace přesouvá výhodu do routingu a evaluace
V agentním produktu rozhoduje plánování, výběr specialisty, kontrola odpovědi a zotavení po chybě. Dobrá řídicí vrstva může z rozdílných modelů získat lepší výsledek než pevné volání jednoho API.
Cena za tuto pružnost je vyšší provozní složitost. Více dodavatelů znamená více latence, proměnlivé ceny, změny verzí a obtížnější debugging. Výsledek musí být lepší také po započtení těchto nákladů.
Maximum 7,9 bodu má jen část veřejného kontextu
Zdroj je krátký příspěvek na X. Sakana jmenuje ProgramBench a Terminal Bench 2.1, ale nezveřejňuje úplnou tabulku, scoring, počet běhů, rozptyl, cenu ani přesné složení agent poolu. Nevíme ani to, zda porovnání s Fable 5 používá veřejný nebo interní eval.
Tvrzení lze proto citovat jako výsledek týmu, nikoli jako nezávisle potvrzenou převahu. U multi-model systému je zvlášť důležité měřit úspěšnost celého workflow a náklady na každý pokus.
Veřejný eval rozhodne o hodnotě řídicí vrstvy
Fugu Ultra potřebuje zveřejnit metodiku, sadu úloh, modely v poolu, cenu za vyřešenou úlohu a chybové případy. Reprodukce mimo vlastní test by ukázala, zda maximum 7,9 bodu přináší robustní routing. Bez ní zůstává v1.1 zajímavou produktovou tezí s neuzavřeným účtem za inference.
Lilithin verdikt
Fugu Ultra posadilo několik modelů k jedné úloze a tvrdí, že koordinátor přidal oproti v1.0 až 7,9 bodu. Až veřejný záznam každého kroku ukáže, zda tým našel lepší dělbu práce, nebo jen dražší způsob hlasování.
Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.
Původní zdroj ↗ ↗