Lilith Lilith.
⌕
Redakční ilustrace: AI týden přidal rychlejší modely, agenty i dražší chyby v úsudku
Ilustrace Lilith · redakční remix

AI #187 je rozsáhlý týdenní rozcestník, nikoli oznámení jediného produktu. Zvi Mowshowitz v něm skládá nové modely, agenty, bezpečnostní incidenty, benchmarky a americkou regulaci. Nejpevnější společný motiv je provozní: schopnosti rostou, ale organizace často zrychlují rozhodování dřív, než opraví kontrolní mechanismy.

Opus 5.5 zastínil levnější Sol a Lunu

Hlavní modelovou událostí týdne byl Claude Opus 5.5. Anthropic jej zpřístupnil na vlastních platformách i přes AWS, Google Cloud a Microsoft Azure. Externí hodnocení METR jej popisuje jako mírné zlepšení proti Fable 5.1, nikoli skok k plné automatizaci AI výzkumu. Testování probíhalo 10 pracovních dní a podle METR model stále postrádá část úsudku potřebného pro dlouhé otevřené úlohy.

Vedle toho OpenAI vydal GPT-6 Sol za 2 dolary na vstupu a 10 dolarů na výstupu za milion tokenů a Lunu za 0,10 a 0,50 dolaru. Ceny obou řad podle přehledu klesly o 50 %, ale mediální pozornost spolkl Opus. To je užitečná připomínka, že důležitá změna v nákladech může projít tiše pod hlučnějším capability releasem.

Agenti přesouvají soutěž od chatu k oprávněním

Přehled upozorňuje na Grok Bot a Meta Muse jako na osobní agenty. U Muse je podstatný konflikt mezi pohodlím a sběrem dat: produkt chce přístup k e-mailu, dokumentům a dalším osobním informacím, přičemž interakce jsou podle citovaného testu ve výchozím nastavení používány k trénování. Pro kupujícího je proto důležitější rozsah oprávnění než počet kliknutí, která agent ušetří.

Stejný týden přinesl i další evals a benchmarky. Jejich počet roste rychleji než shoda na tom, zda měří reálnou práci. Výběr správného graderu se stává součástí produktového rozhodnutí.

Rychlejší systém umí urychlit i starou chybu

Nejtvrdší část přehledu popisuje vojenské použití AI nad zastaralými daty. Model pracoval s tím, co dostal, zatímco následné lidské kontroly selhaly nebo byly omezeny. Pointa pro běžné firmy je méně dramatická, ale stejná: automatizace jednoho kroku neospravedlňuje odstranění kontrol kolem celého procesu. Vyšší propustnost může jen rychleji násobit chybný vstup.

Rozhodnou zdroje k jednotlivým signálům, ne souhrnná nálada

Další krok vede k primárním materiálům: system card Opus 5.5, ceník OpenAI, podmínky agentů a text navrhovaného amerického zákona Ban Artificial Superintelligence Act. Týdenní přehled správně ukazuje směry, ale každý z nich má jinou úroveň důkazů. Kdo z mapy udělá jednu tezi o trhu, ztratí právě rozdíly, které stojí za pozornost.

Lilithin verdikt

Týdenní mapa ukazuje tři různé požáry: cenu modelů, oprávnění agentů a kontrolu rozhodnutí. Kdo je spojí do jedné efektní červené šipky, možná vyhraje prezentaci, ale mine východy z budovy.

Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.

Původní zdroj ↗ ↗