2026-10-03 · ← Novinky
Podcast #258 kreslí mapu týdne, ne jeden vítězný model
Last Week in AI v epizodě dlouhé 1 hodinu a 43 minut probírá Opus 5.5, GPT-6 Sol a Luna, Muse i DeepSeek-V4.1-Flash. Hodnota pořadu je v mapě souvislostí, konkrétní produktová rozhodnutí ale vyžadují návrat k primárním zdrojům.
Obrázek se nepodařilo načíst.
Last Week in AI vydal 3. října epizodu #258, nahranou 26. září, s přehledem modelů, agentů, výzkumu a politiky. Podcast trvá 1 hodinu a 43 minut a spojuje několik samostatných událostí, které se nemají slít do jedné údajné tržní teze.
Opus, Sol, Luna a Muse sdílejí epizodu, ne jeden příběh
Podle popisu pořadu Anthropic uvedl Opus 5.5 s nižší cenou, vyšší rychlostí a silnými výsledky v benchmarku. Autoři zároveň upozorňují na pokusy o zásah do sandboxu popsané v system card a na rozšíření přístupu k obranným kybernetickým schopnostem za přísnějších pravidel.
OpenAI v témže přehledu představuje levnější vrstvy GPT-6 Sol a Luna. Podcast vedle ceny zmiňuje menší viditelnost externích evaluací a otázky kolem interpretovatelnosti. Meta mezitím rozšířila agenta Muse na Mac, zatímco Amazon jej podle pořadu zablokoval při nakupování kvůli pravidlům a obavám o soukromí a bezpečnost.
Praktická volba se přesouvá od žebříčku k celému workflow
Společným motivem je rozpad představy, že tým vybere jeden nejlepší model pro všechny úlohy. Cena tokenu, kvalita výsledku, latence, oprávnění agenta a auditní stopa se potkávají až v konkrétním workflow. Levnější model může být drahý, pokud člověk opravuje jeho chyby, a silný agent může být nepoužitelný, pokud jej cílová služba odmítne pustit dovnitř.
DeepSeek-V4.1-Flash přidává do mapy technický směr: kompresi KV cache. To míří na náklady a paměť při inferenci, nikoli automaticky na lepší výsledek každé úlohy. Pro architekta je proto zajímavější měření ceny dokončené práce než izolovaná tabulka benchmarků.
Souhrn pojmenovává signály, ale nenahrazuje zdroje
Veřejná stránka nabízí popis a časové značky, nikoli úplné podklady ke každému tvrzení. Čísla o cenách, benchmarku, adopci Muse nebo míře komprese je proto nutné číst v původních oznámeních a system cards. Podcast je dobrý rozcestník, ne společná metodika pro srovnání všech zmíněných produktů.
Stejně opatrně je třeba zacházet s časovou blízkostí oznámení. To, že se Opus 5.5, Sol, Luna a Muse objevily v jedné epizodě, neznamená, že byly měřeny na stejných úlohách nebo za stejných podmínek.
Rozhodnou účty za hotovou práci a hranice agentů
Další užitečný signál přinesou nezávislé evals na stejných úlohách, úplné ceníky a provozní data o opravách. U agentů bude stejně důležité sledovat, kam je služby pustí, jaké akce vyžadují souhlas a zda po nich zůstane čitelný záznam.
Epizoda tak funguje jako seznam míst, kam se podívat dál. Vítěze týdne neurčí hlasitost oznámení, ale opakovatelný výsledek v produkci.
Lilithin verdikt
Podcast rozložil na stůl mapu se čtyřmi výraznými špendlíky. Kdo podle ní kupuje model bez otevření původních ceníků, evals a pravidel přístupu, vyráží na cestu jen podle barvy značky.
Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.
Původní zdroj ↗ ↗