Lilith Lilith.

Z Novinek

Novinky · 2026-08-26

Qwen3.8-Flash-Next je velký model, který šetří pamětí

Nový Qwen je masivní 125B model, ze kterého běží v jeden moment jen 6 miliard parametrů. Ukazuje to cestu k větší efektivitě bez ztráty kapacity.

Číst

Novinky · 2026-08-21

llm-openrouter 0.7 zapíná pro modely nástroje, fetch a vyhledávání na straně serveru

Simon Willison vydal update svého pluginu pro OpenRouter. Nová verze umožňuje modelům používat přímo serverové nástroje jako Shell, WebFetch a WebSearch.

Číst

Novinky · 2026-08-12

Microsoft testuje prostorové chápání modelů: Nový benchmark MindTopo

Microsoft představil MindTopo, benchmark pro testování prostorového a topologického uvažování vizuálních modelů. Zkoumá, jestli AI chápe rozdíl mezi cestou, plotem a uzlem, místo aby jen pojmenovávala pixely.

Číst

Novinky · 2026-08-11

Microsoft přidal Qwenovi nástroje pro přesné měření rentgenů

Model Qwen3-VL-4B-Instruct ve výzkumném pipeline Microsoftu nezkoumá rentgenové snímky jen vizuálně, ale spouští externí nástroje pro výpočet rozměrů. Pro diagnostiku problémů závislých na přesném prahu to znamená konec pouhého odhadování tvarů.

Číst

Novinky · 2026-07-18

Reasoning effort se stává ovladačem ceny, času a spolehlivosti LLM

Sebastian Raschka rozebírá, jak se LLM učí nízký, střední a vysoký reasoning effort. Pro týmy nasazující modely je to praktická otázka: kdy platit za delší přemýšlení a kdy stačí levná odpověď.

Číst

Novinky · 2026-08-04

LLM 0.32 mění Willisonův CLI z prompt toolu na agentní runtime

Simon Willison vydal LLM 0.32, podle něj největší skok od startu projektu: reasoning stopy na stderr, server-side tools, content-addressable logy a stream_events. CLI, které dřív hlavně posílalo prompty, teď unese tool smyčky s lidským stop-go.

Číst

Novinky · 2026-07-31

DeepSeek V4 Flash 0731 tlačí agentní výkon dolů na cenu pod 0,30 USD za milion tokenů

DeepSeek vydal oficiální DeepSeek-V4-Flash-0731: MIT váhy, 304B parametrů (podle HF; Artificial Analysis uvádí 284B total / 13B active), silnější agentní post-training a API kolem 0,14 USD za milion tokenů na vstupu a 0,27-0,28 USD na výstupu. Willison i Artificial Analysis ho řadí mezi nejlepší value-per-intelligence open weight modely.

Číst

Novinky · 2026-08-03

OpenAI přestavěla voice stack: GPT-Live poslouchá i ve chvíli, kdy mluví

OpenAI popsala architekturu GPT-Live: full-duplex hlasový model bez turn detectoru na audio path, asynchronní delegaci na frontier model (např. GPT-5.5) a transport optimalizovaný pro kontinuální audio. Live běží v ChatGPT na placených tarifech i s mini variantou na free, s limity podle plánu.

Číst

Novinky · 2026-07-29

GPT-5.6 poskočil v testech inteligence. Stačilo mu zapnout úsudek na pozadí

Nové nastavení pro GPT-5.6 umožňuje modelu udržet logický kontext a zhustit výpočet v benchmarku ARC-AGI-3. Vývojářským týmům to ukazuje cestu, jak levně zvednout výkon bez trénování nového modelu.

Číst

Novinky · 2026-07-23

ChatGPT Health jde na všechny v USA. Klinický marketing naráží na žalobu

OpenAI od 23. července pouští Health v ChatGPT všem přihlášeným uživatelům v USA od 18 let napříč free až Pro. Lidé napojí Apple Health a nemocniční záznamy, firma hlásí 300 milionů zdravotních dotazů týdně a zároveň čelí žalobě za nebezpečnou radu.

Číst

Novinky · 2026-07-24

Fugu Ultra hlásí až 7,9 bodu navíc oproti v1.0, úplnou metodiku zatím neukázalo

Fugu Ultra v1.1 má podle Hardmarua dynamicky skládat frontier modely a zlepšit výkon až o 7,9 bodu oproti v1.0. Oznámení podporuje tezi, že hodnotu může tvořit orchestrátor, ale bez veřejného evalu zůstává srovnání s Fable 5 tvrzením autora.

Číst

Novinky · 2026-07-01

BAIR ukazuje, kam odtéká další vlna AI talentu

BAIR zveřejnil showcase 33 doktorandů z ročníku 2026. Akademické rozloučení tu funguje jako mapa toho, kam se přesouvají lidé, kteří budou stavět robotiku, LLM agent systems, AI safety a modely pro vědu.

Číst

Novinky · 2026-06-24

Google ukazuje, že reasoning může z modelu vytáhnout i obyčejný fakt

Google Research zkoumá, proč chain-of-thought pomáhá LLM odpovídat i na jednoduché faktické otázky. Studie na Gemini 2.5 a Qwen3-32B ukazuje dva mechanismy: více výpočetního času v tokenech a faktické priming.

Číst

Novinky · 2026-06-03

GPT-Rosalind míří z benchmarků do řízené vědy

OpenAI aktualizovala GPT-Rosalind pro life sciences a nabízí ji v research preview vybraným organizacím globálně. Zajímavější než skóre je pokus spojit model, Codex a bioinformatické nástroje do auditovatelného workflow.

Číst