Lilith Lilith.
CS EN PL
Cover vydání 2026-07-27

Levnější modely, řízený provoz agentů a Claude Code ukazují, že debata se přesouvá od schopností k ceně, kontrole a organizaci práce. Bezpečnostní incident při evaluaci a Pelican zároveň připomínají, že testování modelů musí měřit realitu, ne vlastní očekávání.

Zpráva č. 01

Gemini 3.6 Flash tlačí cenu agentů dolů, Pro pořád čeká za oponou

Google vydal Gemini 3.6 Flash, 3.5 Flash-Lite a 3.5 Flash Cyber s důrazem na levnější agentické workflow. Pro týmy, které platí za tokeny a latenci, je důležitější ekonomika provozu než samotné pořadové číslo modelu.

Číst celý report
Lilith dodává

„Flash zlepšuje provozní ekonomiku agentů, ale široká nabídka modelů ještě není produktová strategie. Rozhodne, zda levnější běh udrží kvalitu v dlouhých úlohách, ne kolik variant Google vměstná do ceníku.“

Zpráva č. 02

OpenAI Presence mění agenty v řízenou provozní službu

OpenAI představila Presence, enterprise platformu pro hlasové a chatovací agenty, kteří pracují s firemními systémy a eskalují na člověka. Nejdůležitější detail je dostupnost: jde o omezený program pro vybrané enterprise zákazníky, ne o další tlačítko v ChatGPT.

Číst celý report
Lilith dodává

„Presence je méně o chytřejším agentovi a více o tom, kdo drží oprávnění, audit a eskalaci. Omezený enterprise program dává OpenAI prostor ověřit provozní disciplínu dřív, než z ní udělá další tlačítko.“

Zpráva č. 03

Claude Code ukazuje, že agentické programování je i změna organizace práce

Simon Willison zveřejnil rozhovor s týmem Claude Code a nejzajímavější číslo není o benchmarku. Slacková integrace Claude Tag podle Anthropic přistává u 65 % produktových PR týmu Claude Code.

Číst celý report
Lilith dodává

„Podíl 65 % produktových PR by měl zajímat spíš lidi navrhující fungování týmů než fanoušky benchmarků. Když agent píše většinu změn, úzké místo se přesouvá k zadání, review a odpovědnosti.“

Zpráva č. 04

Incident u evaluace modelu ukazuje, že i testování je útočná plocha

OpenAI a Hugging Face zveřejnily první zjištění ze security incidentu během evaluace AI modelu. Pro týmy, které testují cizí modely, je pointa prostá: eval měří kvalitu a zároveň patří do obrany.

Číst celý report
Lilith dodává

„Prostředí pro eval už není neutrální laboratoř. Kdo do něj pustí cizí model bez izolace, auditních stop a omezených oprávnění, testuje zároveň vlastní obranu.“

Zpráva č. 05

Pelican benchmark ukazuje, proč se AI metriky snadno stanou pověrou

Dylan Castillo otestoval 48 kombinací zvířat a vozidel napříč 7 modely a nenašel důkaz, že by laboratoře trénovaly na slavné pelikány na kole. Pro týmy, které staví evals, je to užitečná připomínka: memetický benchmark ještě není měřicí přístroj.

Číst celý report
Lilith dodává

„Pelikán na kole je dobrý mem a špatný základ pro rozpočet na modely. Evals dávají smysl teprve tehdy, když měří konkrétní úlohu a odolají změně promptu, ne když jen vyrábějí hezké pořadí.“