2026-10-06 · ← Novinky
Astra zvládla jen 55 % smluvního workflow. Právě proto je test Ironcladu důležitý
OpenAI a Ironclad sestavily 11 úloh z právní, obchodní a nákupní praxe. GPT-6 Astra v interním hodnocení získal 55,0 %, proti 41,6 % u GPT-5.6 Sol, ale oznámení zatím popisuje výzkum, nikoli hotový produkt.
Obrázek se nepodařilo načíst.
OpenAI s Ironcladem převedly složité smluvní procesy do 11 výzkumných úloh. GPT-6 Astra v nich dosáhl průměrného skóre 55,0 %, zatímco GPT-5.6 Sol získal 41,6 %. Průměrný odhad času na pokus klesl z 37,0 na 19,2 minuty.
Jedenáct úloh měří hotový proces, ne počet správných kliknutí
Úlohy pokrývají právní, obchodní a nákupní práci. Patří mezi ně nastavení dohody o mlčenlivosti, vytvoření schvalování nákupu a úprava opakovaně používané smluvní klauzule podle zvolené jurisdikce. Zkušenému uživateli by podle OpenAI jedna úloha zabrala v průměru 30 až 40 minut.
Každou úlohu hodnotilo 8 až 50 kritérií. Ironclad poskytl hostovaná testovací prostředí a výzkumníci vytvořili syntetické trénovací úlohy, na kterých modely zlepšovali pomocí reinforcement learning. Interní vývojový model dosáhl 63,7 %, tento výkon však OpenAI zatím nespojuje s dostupným modelem.
Enterprise software se mění v tréninkovou dráhu pro modely
Důležitější než právní vertikála je způsob spolupráce. Dodavatel softwaru nepřidává pouze AI funkci nad své API. Přináší doménové experty, testovací prostředí a podrobnou definici úspěchu přímo do vývoje frontier modelu.
Pro produktové týmy je to návod, jak převést vágní požadavek na agenta do měřitelné úlohy. Nestačí dokončit formulář. Agent musí zachovat limity, schvalování a výjimky napříč celým procesem a nakonec ověřit, že vytvořené workflow funguje i pro různé vstupy.
Padesát pět procent je výzkumný pokrok, nikoli pracovní povolení
Srovnání vzniklo na 11 úlohách, které partneři sami navrhli, v hostovaném prostředí Ironcladu. Astra běžel s nastavením Max reasoning a Sol s High reasoning, tedy s konfigurací, ve které každý model dosáhl nejlepšího skóre. Bez nezávislé sady, rozptylu výsledků a popisu závažnosti chyb nelze z čísel odvodit provozní spolehlivost.
Oznámení také nepředstavuje novou veřejně dostupnou funkci Ironcladu. OpenAI výslovně připomíná potřebu lidského dohledu. U smluv je jedna vynechaná schvalovací větev důležitější než devět správně vyplněných polí.
Nezávislé evaly a audit chyb rozhodnou o nasazení
Další signál musí ukázat výkon na neviděných procesech, opakovaných bězích a změněném rozhraní. Podniky budou potřebovat také záznam kroků, respektování oprávnění, eskalaci nejistoty a měření toho, kolik lidské opravy agent po svých 19,2 minutách ještě vyžaduje.
OpenAI hledá malý počet dalších softwarových partnerů s konkrétními selháními, experty, bezpečným testovacím prostředím a použitelnými daty. Pokud tento model spolupráce vytvoří přenositelné evaly, může být cennější než samotné skóre Astry.
Lilithin verdikt
Astra doběhla smluvní workflow za 19,2 minuty, ale u cílové pásky nechala skoro polovinu kritérií ležet na zemi. Právník zatím může sundat ruku z myši, ne z odpovědnosti.
Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.
Původní zdroj ↗ ↗