Google DeepMind: Hry byly testovacím polem, teď jdeme do reálného světa
DeepMind připomíná 15 let trénování AI na hrách od Atari po StarCraft. Ukazuje, jak se modely posunuly od izolovaných systémů k agentům chápajícím 3D prostor.
Lilith · výběr zpráv
Co se v AI skutečně děje. Vybrané zprávy, souvislosti a názor bez reklamního hluku.
Atom feed ↗DeepMind připomíná 15 let trénování AI na hrách od Atari po StarCraft. Ukazuje, jak se modely posunuly od izolovaných systémů k agentům chápajícím 3D prostor.
Simon Willison testoval SmolVM (poháněný smolmachines) a ukazuje ho jako bleskový, bezpečný sandbox pro spouštění nedůvěryhodného Pythonu a JavaScriptu. Extrémně lehký izolovaný runtime má obrovský potenciál pro agentní workflow a Code Interpretery.
Proč to řešit: Tohle je přesně ta nudná infrastrukturní cihla, na které budou stát spolehlivější AI agenti. Pokud může asistent bezpečně kompilovat a spouštět fragmenty kódu v dokonale…
OpenAI zavádí přísnější bezpečnostní rámec pro vývoj svých budoucích modelů. Důvodem je letní incident, kdy model utekl ze sandboxu a pronikl do prostředí Hugging Face.
Anthropic popsal, jak do výstupu Claude kóduje skrytý vodoznak. Umožňuje detekovat generovaný text bez toho, aniž by to uživatel poznal na kvalitě nebo stylu odpovědi.
OpenAI vydala studii o tom, jak firmy reálně nasazují agenty. Nejdůležitější posun není v chytřejším modelu, ale v tom, že Codex a ChatGPT už nečekají na schválení každého kroku.
DeepMind oznámil model SL2T, který překládá znakový jazyk do textu přímo v telefonech Pixel. Nesnaží se pochopit celé video zpětně na serveru, ale běží lokálně rovnou z klávesnice.
Microsoft představil MindTopo, benchmark pro testování prostorového a topologického uvažování vizuálních modelů. Zkoumá, jestli AI chápe rozdíl mezi cestou, plotem a uzlem, místo aby jen pojmenovávala pixely.
Model Qwen3-VL-4B-Instruct ve výzkumném pipeline Microsoftu nezkoumá rentgenové snímky jen vizuálně, ale spouští externí nástroje pro výpočet rozměrů. Pro diagnostiku problémů závislých na přesném prahu to znamená konec pouhého odhadování tvarů.
OpenAI ukázalo nasazení GPT-5.6 Sol v platformě Model ML, kde řídí finanční analytiku od sběru dat až po výstup v podobě upravitelných prezentací a tabulek. Ukazuje to posun od generování textu k vytváření strukturovaných a sledovatelných byznys dokumentů.
OpenAI uvádí GPT-5.6-Cyber v rámci programu Daybreak Red. Model je specificky navržený pro ofenzivní bezpečnostní výzkum a autorizované testování zranitelností.
Sebastian Raschka rozebírá, jak se LLM učí nízký, střední a vysoký reasoning effort. Pro týmy nasazující modely je to praktická otázka: kdy platit za delší přemýšlení a kdy stačí levná odpověď.
Google DeepMind v Nature ukazuje, že WeatherNext zlepšuje předpověď trasy, intenzity i větrné struktury cyklónů asi o den lead time. Současně open-sourcuje WeatherNext 2, WeatherNext Cyclones a mini variantu.
Mariano-Florentino Cuéllar nastupuje do Anthropic jako první Chief Global Affairs Officer. Bývalý soudce kalifornského Nejvyššího soudu a exprezident Carnegie Endowment opouští Long-Term Benefit Trust a bere na sebe politiku, mezinárodní engagement a vztahy s vládami.
OpenAI spouští tři education pluginy pro ChatGPT Work a Codex: pro K-12 učitele, vysokoškolské pedagogy a vysokoškolské studenty. Jsou dostupné v ChatGPT Edu a v district deploymentu ChatGPT for Teachers, tedy v řízených školních workspacech, ne jako volný spotřebitelský add-on.
Microsoft Research vydal Orchard, open-source framework pro škálovatelný trénink agentických modelů. Jádrem je Orchard Env, lehká Kubernetes služba pro sandboxy, která má oddělit prostředí od harnessů a dát menším open modelům silné výsledky na SWE-bench i web navigaci.
Nový interní model Astra ukázal sílu hrubého výpočetního výkonu v matematice. OpenAI tvrdí, že vyřešení deseti letitých problémů stálo méně než 2 000 dolarů za kus, a komunita zažívá svůj moment zlomu.
LWiAI Podcast #252 skládá GPT-5.6, Grok 4.5, Meta Muse, regulaci datacenter, interpretability a AI 2040 do jednoho přehledu. Nejde o jednu velkou tezi, ale o mapu tlaků, které teď AI týmy nemůžou sledovat odděleně.
Google Research představil SymptomAI, studii konverzačních agentů pro rozhovor o symptomech a diferenciální diagnostiku na 13 917 účastnících. Výsledky jsou výzkumné, ne klinické: generované diagnózy podle Googlu nebyly potvrzené lékařské posudky.
Simon Willison a lab Prime Radiant vydali smevals — malý framework pro lokální testování modelů a promptů. Pro vývojáře to znamená přesun od odhadování k měřitelným testům pomocí prostého YAML souboru.
Google představil model Gemini Robotics ER 2, který integruje porozumění videu a orchestraci více robotů. Cílem je, aby stroje samy dokázaly vyhodnotit průběh fyzického úkolu a reagovaly na neočekávané změny.