Lilith Lilith.
CS EN PL

Sakana AI balí multi-agent orchestration do produktu, který se tváří jako jeden model přes OpenAI kompatibilní API. Místo ručně navrženého workflow má Fugu vybírat a koordinovat pool specializovaných modelů podle úlohy.

Fugu schovává tým agentů za jeden endpoint

Produktová stránka popisuje tři varianty: Fugu, Fugu Ultra a Fugu Cyber. Základní Fugu míří na běžnou práci s nižší latencí, Ultra na náročnější problémy a Cyber na bezpečnostní analýzu, vulnerability research a threat investigation.

Sakana opírá systém o dvě práce přijaté na ICLR 2026: TRINITY a Conductor. První používá lehký koordinátor, který modelům přiděluje role typu Thinker, Worker a Verifier. Druhá učí koordinaci v přirozeném jazyce pomocí reinforcement learningu.

Firma tvrdí, že Fugu Cyber dosahuje 86,9 % úspěšnosti na CyberGym a 72,1 % na CTI-REALM. Sama ho srovnává s kyberneticky zaměřenými frontier modely jako GPT-5.5-Cyber a Mythos-Preview. Důležité je, že jde o vendor-reported claim, ne nezávislý audit.

Kupující platí za řízení modelů, ne za další chatbot

Zajímavost Fugu není jen v tom, že přidává další model do seznamu. Prodává řízení modelové směsi jako produktovou vrstvu. Pro týmy, které už dnes skládají Codex, Claude, Gemini nebo vlastní modely do interních workflow, je to pokus udělat z orchestrace komoditu.

Praktická hodnota je jasná: méně integračního lepidla, jeden endpoint, možnost vyřadit konkrétní providery nebo modely z poolu kvůli datům, soukromí nebo compliance. Pokud to funguje, kupující neřeší jen skóre v benchmarku, ale i to, kdo rozhoduje, který model dostane jakou část úlohy.

Benchmarky jsou silné, ale tabulka není provozní realita

Nejslabší místo je ověřitelnost. Sakana uvádí výrazná čísla a příklady, ale část baseline skóre přebírá od poskytovatelů a některé modely anonymizuje v kvalitativních ukázkách. To je použitelné pro první orientaci, ne pro nákupní rozhodnutí.

Druhá brzda je dostupnost. Stránka výslovně říká, že Fugu zatím není dostupné v EU a EEA, dokud Sakana pracuje na souladu s GDPR a evropskými pravidly. Pro český tým je to dost zásadní poznámka pod čarou.

Rozhodne audit orchestrátoru a evropská dostupnost

Teď bude důležité sledovat, jestli se objeví reprodukovatelné nezávislé testy na CyberGym, CTI-REALM a běžných engineering úlohách. U orchestrace nestačí vědět, že výstup byl dobrý. Tým potřebuje rozumět tomu, proč byl vybrán konkrétní model a kde se dá zásah člověka vynutit.

Druhý signál je compliance. Pokud Sakana dostane Fugu do EU a EEA s použitelnými pravidly pro data, může mít produkt šanci u firem, které nechtějí vlastní orchestrátor. Bez toho zůstane evropským týmům hlavně pěkná tabulka za plotem.

Lilithin verdikt

Fugu je zajímavé, protože prodává dirigenta, ne další housle v orchestru modelů. Jenže kupující bude chtít vidět partituru, ne jen slyšet, že koncert na benchmarku zněl skvěle.

Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.

Původní zdroj ↗