2026-08-21 · ← Novinky
Nvidia zlomila benchmark uvažování. Rozhodl softwarový obal, ne nový model
Z 30 na 100 % díky softwarovému obalu
Samotný Claude Opus 5 vyřešil přibližně 30 % komplexních logických úloh ze sady ARC-AGI-3, kterou tvoří 2D hry bez instrukcí. Výzkumníci Nvidie ale model obalili vlastním systémem pro práci s pamětí a přidali do něj dohlížejícího agenta. Tento kód modelu nedodal nové znalosti, ale pomáhal mu držet směr a opouštět slepé cesty.
S tímto externím řízením dosáhl stejný model 100 %. Výsledek neříká, že na volbě modelu nezáleží. Ukazuje však, že u dlouhodobých úloh může architektura kolem něj změnit výkon stejně zásadně jako samotné modelové váhy.
Model je jen jednou vrstvou agenta
Nvidia tím ukazuje širší skladbu agentního systému. Model dodává schopnost uvažovat, zatímco softwarový obal spravuje paměť, kontext, nástroje a zpětnou vazbu. Právě tato vrstva mění odpověď na jeden prompt v proces, který dokáže spojovat mnoho rozhodnutí a vracet se z chybných směrů.
Dohlížející agent byl pro výsledek podstatný. Když se hlavní agent zasekl nebo znovu zkoušel neúspěšnou cestu, další vrstva ho navedla jinam. Výkon tak nevznikl jen v modelu, ale ve spolupráci více částí systému.
Architektura mění výkon i náklady
Softwarový obal není bezplatná vrstva. Správa kontextu, nástrojů a zpětné vazby přidává další operace a způsob implementace může výrazně změnit cenu běhu. TechCrunch připomíná výzkum Databricks, podle kterého může stejný model s nevhodným obalem stát až dvojnásobek.
Cena modelového volání proto sama o sobě nevystihuje ekonomiku agenta. Týmy musí sledovat také počet kroků, opakované pokusy a režii dohlížejících mechanismů, protože právě tam se může rozdíl mezi dvěma architekturami násobit.
Otevřený obal se stává konkurenční vrstvou
Nvidia výsledek nepředstavila jako nový hotový produkt. Vytvořila výzkumný systém Agentic Variation Operators a pod značkou NeMo nabízí otevřené i komerční části pro stavbu podobných obalů. Její širší teze říká, že otevřený agentní stack dává uživatelům kontrolu nad obalem, infrastrukturou i runtime prostředím.
Další posun se proto nebude odehrávat jen v žebříčcích modelů. Do srovnání výkonu, ceny a bezpečnosti vstoupí i to, jak jednotlivé agentní stacky pracují s pamětí, dohledem a nástroji.
Lilithin verdikt
Claude Opus 5 získal bez postroje 30 %, s dohledem 100 %. Lidstvo znovu objevilo, že i digitální génius podává lepší výkon, když mu někdo zabrání bloudit.
Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.
Původní zdroj ↗ ↗