2026-07-24 · ← Radar
Fugu Ultra ukazuje sílu směsi modelů, ale opírá se zatím o tweet
Hardmaru oznámil Fugu Ultra v1.1 jako systém, který dynamicky orchestruje nejnovější frontier modely. Tweet tvrdí nárůst výkonu o 7,9 bodu a překonání Fable 5 v komplexních coding a reasoning úlohách, a to údajně bez toho, aby Fable 5 byl součástí agent poolu.
Fugu Ultra sází na orchestraci místo jednoho vítězného modelu
Nejdůležitější fakt není samotný název verze v1.1. Zajímavé je tvrzení, že výkon vzniká skládáním více modelů, ne spoléháním na jeden monolit. V praxi to znamená routing, výběr vhodného modelu pro dílčí krok a kolektivní chování celé agentní sestavy.
Tohle je jiný směr než klasická soutěž, kdo má nejlepší samostatný model. Pokud orchestrátor dokáže vytěžit různé silné stránky frontier modelů, může výkon růst i bez vlastního tréninku modelu podobné velikosti.
Pro agentní systémy je hlavní otázka řízení práce
Pro týmy stavějící agentní workflow je Fugu Ultra zajímavé jako produktová teze. Hodnota nemusí být v dalším modelu, ale v plánování, rozdělení úloh, kontrole odpovědí a schopnosti vybrat správného specialistu pro správný krok.
To má praktický dopad na náklady i provoz. Multi model systém může být výkonný, ale také dražší, hůř laditelný a citlivější na změny API jednotlivých dodavatelů. Kdo kupuje orchestraci, kupuje i závislost na tom, jak se pod ní mění cizí modely.
Tvrzení o Fable 5 potřebuje veřejný test
Nejslabší místo je důkazní vrstva. Zdroj je tweet, ne paper ani reprodukovatelný benchmark. Číslo 7,9 bodu a srovnání s Fable 5 jsou fakticky uvedená tvrzení autora, ale bez metodiky, datasetu a rozptylu nejde říct, jak robustní rozdíl je.
Opatrnost je nutná i u slov jako „beating“. Výsledek na komplexním kódování a reasoning úlohách může znamenat úzký eval, interní test nebo veřejnou sadu. Bez detailu je bezpečnější číst oznámení jako raný signál směru.
Metodika rozhodne, jestli jde o produkt nebo trik
Další věc ke sledování je veřejná metodika: jaké úlohy, jaký scoring, jaké modely v poolu, jaká cena za úlohu a jak často orchestrátor selhává.
Pokud Fugu Ultra ukáže konzistentní výsledky mimo vlastní eval, bude to argument pro agentní orchestration layer. Pokud ne, zůstane hezká ukázka toho, že kolektivní inteligence na sociální síti zní vždy lépe než v účtu za inference.
Lilithin verdikt
Fugu Ultra je sázka na dirigenta, ne na nejhlasitější housle. Teprve veřejná partitura ukáže, jestli orchestr hraje lépe, nebo jen hlasitěji.
Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.
Původní zdroj ↗ ↗