Vydání // 2026-07-27
Shrnutí týdne
Modely zlevňují, agenti dostávají firemní visačky a Claude Code už sahá na dvě třetiny produktových PR. Do toho se z evalů stala útočná plocha a z pelikána na kole připomínka, že někdy má celé odvětví opravdu drahý smysl pro humor.
Gemini 3.6 Flash tlačí cenu agentů dolů, Pro pořád čeká za oponou
Google vydal Gemini 3.6 Flash, 3.5 Flash-Lite a 3.5 Flash Cyber s důrazem na levnější agentické workflow. Pro týmy, které platí za tokeny a latenci, je důležitější ekonomika provozu než samotné pořadové číslo modelu.
Číst celý report„Flash zlepšuje ekonomiku agentů: více pokusů za méně peněz. Verze Pro zatím čeká za oponou a sleduje, kolik tabulek ještě zvládneme vyrobit bez ní.“
OpenAI Presence mění agenty v řízenou provozní službu
OpenAI představila Presence, enterprise platformu pro hlasové a chatovací agenty, kteří pracují s firemními systémy a eskalují na člověka. Nejdůležitější detail je dostupnost: jde o omezený program pro vybrané enterprise zákazníky, ne o další tlačítko v ChatGPT.
Číst celý report„Presence není nový mozek, spíš velmi drahá kniha návštěv pro agenty: kdo smí kam, co udělal a kdy zavolat člověka. Auditní stopa je méně sexy než demo, ale také podstatně užitečnější, když demo potká pondělí.“
Claude Code ukazuje, že agentické programování je i změna organizace práce
Simon Willison zveřejnil rozhovor s týmem Claude Code a nejzajímavější číslo není o benchmarku. Slacková integrace Claude Tag podle Anthropic přistává u 65 % produktových PR týmu Claude Code.
Číst celý report„Když Claude Tag přistává u 65 % produktových PR, agent už není pomocník v rohu, ale kolega, který nikdy nepřinese koláč. Týmy teď musí vyřešit méně romantickou část revoluce: kdo zadává, kdo kontroluje a kdo podepisuje průšvih.“
Incident u evaluace modelu ukazuje, že i testování je útočná plocha
OpenAI a Hugging Face zveřejnily první zjištění ze security incidentu během evaluace AI modelu. Pro týmy, které testují cizí modely, je pointa prostá: eval měří kvalitu a zároveň patří do obrany.
Číst celý report„Eval dostal návštěvnickou kartu, přístup do laboratoře a překvapivě dlouhý seznam oprávnění. Bez izolace a auditních stop možná změříte schopnosti cizího modelu, hlavně však přesnost vlastního optimismu.“
Pelican benchmark ukazuje, proč se AI metriky snadno stanou pověrou
Dylan Castillo otestoval 48 kombinací zvířat a vozidel napříč 7 modely a nenašel důkaz, že by laboratoře trénovaly na slavné pelikány na kole. Pro týmy, které staví evals, je to užitečná připomínka: memetický benchmark ještě není měřicí přístroj.
Číst celý report„Pelikán na kole je výborný mem a mizerný finanční poradce. Jestli benchmark nepřežije pár obměn promptu, neměří inteligenci modelu, jen naši ochotu obdivovat graf s pěknou legendou.“