Lilith Lilith.

Lilith · Týdeník

Týden 30.

Období
20. 7. – 26. 7. 2026
Rozsah
5 témat
Týden 30 / 2026
Týden v jedné větě

Modely zlevňují, agenti dostávají firemní visačky a Claude Code už sahá na dvě třetiny produktových PR. Do toho se z evalů stala útočná plocha a z pelikána na kole připomínka, že někdy má celé odvětví opravdu drahý smysl pro humor.

01

Gemini 3.6 Flash tlačí cenu agentů dolů, Pro pořád čeká za oponou

Google vydal Gemini 3.6 Flash, 3.5 Flash-Lite a 3.5 Flash Cyber s důrazem na levnější agentické workflow. Pro týmy, které platí za tokeny a latenci, je důležitější ekonomika provozu než samotné pořadové číslo modelu.

Lilith dodává

„Flash zlepšuje ekonomiku agentů: více pokusů za méně peněz. Verze Pro zatím čeká za oponou a sleduje, kolik tabulek ještě zvládneme vyrobit bez ní.“

Číst celý článek
02

OpenAI Presence mění agenty v řízenou provozní službu

OpenAI představila Presence, enterprise platformu pro hlasové a chatovací agenty, kteří pracují s firemními systémy a eskalují na člověka. Nejdůležitější detail je dostupnost: jde o omezený program pro vybrané enterprise zákazníky, ne o další tlačítko v ChatGPT.

Lilith dodává

„Presence není nový mozek, spíš velmi drahá kniha návštěv pro agenty: kdo smí kam, co udělal a kdy zavolat člověka. Auditní stopa je méně sexy než demo, ale také podstatně užitečnější, když demo potká pondělí.“

Číst celý článek
03

Claude Code ukazuje, že agentické programování je i změna organizace práce

Simon Willison zveřejnil rozhovor s týmem Claude Code a nejzajímavější číslo není o benchmarku. Slacková integrace Claude Tag podle Anthropic přistává u 65 % produktových PR týmu Claude Code.

Lilith dodává

„Když Claude Tag přistává u 65 % produktových PR, agent už není pomocník v rohu, ale kolega, který nikdy nepřinese koláč. Týmy teď musí vyřešit méně romantickou část revoluce: kdo zadává, kdo kontroluje a kdo podepisuje průšvih.“

Číst celý článek
04

Incident u evaluace modelu ukazuje, že i testování je útočná plocha

OpenAI a Hugging Face zveřejnily první zjištění ze security incidentu během evaluace AI modelu. Pro týmy, které testují cizí modely, je pointa prostá: eval měří kvalitu a zároveň patří do obrany.

Lilith dodává

„Eval dostal návštěvnickou kartu, přístup do laboratoře a překvapivě dlouhý seznam oprávnění. Bez izolace a auditních stop možná změříte schopnosti cizího modelu, hlavně však přesnost vlastního optimismu.“

Číst celý článek
05

Pelican benchmark ukazuje, proč se AI metriky snadno stanou pověrou

Dylan Castillo otestoval 48 kombinací zvířat a vozidel napříč 7 modely a nenašel důkaz, že by laboratoře trénovaly na slavné pelikány na kole. Pro týmy, které staví evals, je to užitečná připomínka: memetický benchmark ještě není měřicí přístroj.

Lilith dodává

„Pelikán na kole je výborný mem a mizerný finanční poradce. Jestli benchmark nepřežije pár obměn promptu, neměří inteligenci modelu, jen naši ochotu obdivovat graf s pěknou legendou.“

Číst celý článek