GPT-Live-1 řeší nejotravnější část hlasového AI: kdy mlčet
OpenAI podle The Verge nasazuje GPT-Live-1 pro hlasový režim ChatGPT, aby méně skákal do řeči a lépe zvládal pauzy. Hlasová AI se tím posouvá od hezkého hlasu k řízení tahu v konverzaci.
Lilith · výběr zpráv
Co se v AI skutečně děje. Vybrané zprávy, souvislosti a názor bez reklamního hluku.
Atom feed ↗OpenAI podle The Verge nasazuje GPT-Live-1 pro hlasový režim ChatGPT, aby méně skákal do řeči a lépe zvládal pauzy. Hlasová AI se tím posouvá od hezkého hlasu k řízení tahu v konverzaci.
BAIR tvrdí, že GPT-4-class inference spadla zhruba z 30 dolarů za milion tokenů na méně než 1 dolar. Pro datové týmy to znamená, že úzkým hrdlem přestává být samotný model a začíná jím být paměť, koordinace a kontrola agentů.
Lilian Weng ve 28minutové analýze popisuje harness engineering jako praktickou cestu k self-improvement: ne model, který si tajně přepisuje váhy, ale systém kolem něj, který řídí nástroje, kontext, paměť a evals.
Výzkum Writeru popsaný TechCrunchem ukazuje, že memory a personalization vrstvy můžou zhoršit přesnost modelů a posílit sycophancy. Pro produktové týmy je to nepříjemná zpráva: uživatelský kontext není jen palivo pro lepší UX, ale i nový zdroj chyb.
Microsoft ukázal, že Project Ire dokázal označit 253 KB DLL variantu LOTUSLITE jako malware, i když ji na VirusTotal 28. května 2026 zachytil jen 1 ze 72 vendorů. Důležitý posun je v metodě: agent četl chování binárky místo seznamu IOC.
Microsoft Research popsal generative causal testing, postup, který z modelů predikujících mozkovou aktivitu dělá čitelné hypotézy a ověřuje je ve fMRI. Pro vědu je zajímavé hlavně to, že AI tu nemá jen předpovídat, ale vracet teorii zpět do rukou lidí.
Google Research představil TabFM, zero-shot foundation model pro klasifikaci a regresi nad tabulkami. Pro datové týmy je zajímavý hlavně slib, že část práce kolem feature engineeringu, ladění a tréninku půjde spustit přes BigQuery ML.
BAIR zveřejnil showcase 33 doktorandů z ročníku 2026. Akademické rozloučení tu funguje jako mapa toho, kam se přesouvají lidé, kteří budou stavět robotiku, LLM agent systems, AI safety a modely pro vědu.
Sebastian Raschka ukazuje lokální stack pro coding agenta: open-weight model v Ollamě, harness pro úpravy kódu a vlastní stroj místo Claude Code nebo Codex subscription. Pro týmy je to praktická pojistka proti cenám, limitům a nečekaným změnám cloudových modelů.
Pew Research Center naměřil, že 49 % dospělých Američanů používá AI chatboty a 24 % je používá denně. Stejný průzkum ale ukazuje tvrdý limit adopce: 63 % lidí si myslí, že AI postupuje příliš rychle a 70 % čeká horší bezpečnost osobních dat.
Microsoft Research a partneři popsali Talos, open-source nástroj pro automatizovanou reanalýzu genomických dat u vzácných chorob. V prospektivní kohortě téměř 5 000 pacientů přidal diagnózu u 5,1 % případů.
Google Research zkoumá, proč chain-of-thought pomáhá LLM odpovídat i na jednoduché faktické otázky. Studie na Gemini 2.5 a Qwen3-32B ukazuje dva mechanismy: více výpočetního času v tokenech a faktické priming.
Lilian Weng se vrací ke scaling laws a připomíná, proč jsou užitečné hlavně jako nástroj pro rozdělení compute, dat a parametrů. Pro týmy plánující modely je pointa střízlivá: extrapolace pomáhá, dokud nezapomenete, z jak malého experimentu vznikla.
Google nasadil frozen Multi-Token Prediction pro Gemini Nano v3 na telefonech Pixel 9 a Pixel 10. Praktická pointa je jednoduchá: rychlejší lokální AI bez výměny základního modelu a bez dalšího drafteru v paměti.
Google představil Gemma 4 12B jako sjednocený encoder-free multimodální model určený pro vysoký výkon přímo na laptopu. Praktická otázka zní, jestli 12B model zvládne dost kvality na lokální nebo edge scénáře bez těžké cloudové infrastruktury.
Výzkum popsaný 404 Media tvrdí, že už 13 slov v načteném textu z webů jako Reddit, Wikipedia, Quora nebo Facebook může přimět AI agenty doporučovat spam nebo scam. Pro AI search to posouvá problém SEO do prostoru prompt injection a moderace user-generated contentu.
Google představil agentic RAG pro Gemini Enterprise Agent Platform, který před odpovědí kontroluje, zda má dost kontextu. Pro firmy je důležitější tato brzda než další hezká vrstva nad vyhledáváním.
Sebastian Raschka publikoval kurátorský seznam LLM paperů za leden až květen 2026. Jde o dobrý filtr pro týmy, které potřebují oddělit dlouhý research feed od témat použitelných v architektuře, agentech a inferenci.
Google uvádí Gemini 3.5 Live Translate pro near real-time speech-to-speech překlad ve více než 70 jazycích. Pro uživatele je vidět hlavně pohodlí, pro firmy bude klíčová latence, audit a důvěra v hlas, který mluví za někoho jiného.
Perplexity popisuje Search as Code: architekturu, kde agent nevolá jeden monolitický vyhledávač, ale skládá retrieval pipeline jako kód. Pointa je větší kontrola nad tím, jak se důkazy hledají, filtrují a ověřují.