Tag
#reasoning
Z Novinek
Novinky · 2026-09-15
Salesforce staví na Nvidii AI model, který má vzít práci drahým laboratořím
Nový model Koa, postavený na open-weight architektuře od Nvidie, ukazuje odklon enterprise klientů od velkých poskytovatelů. Pro rutinní byznys úkoly už firmy nechtějí posílat citlivá data do uzavřených modelů za miliony dolarů.
Číst →Novinky · 2026-09-09
GPT-6 Astra konečně přináší business logiku a ovládání PC
OpenAI představila model pro firemní nasazení, který nejen lépe uvažuje, ale umí i aktivně ovládat počítač. Pro IT a vývojáře to znamená nutnost přehodnotit, co všechno agentovi dovolí.
Číst →Novinky · 2026-09-09
GPT-6 Astra: Skrytý myšlenkový pochod neskrývá víc, než chybí v samotné architektuře
Analýza Sebastiana Raschky ukazuje, že kratší skryté myšlenkové pochody nového modelu nejsou výsledkem zlého úmyslu, ale vedlejším efektem efektivnější architektury založené na takzvaných zacyklených transformátorech.
Číst →Novinky · 2026-09-08
Scaling laws pro agenty ukážou, jestli orchestrace desítek LLM není slepá ulička
Nathan Lambert z Allen Institute (AI2) zvedá klíčovou otázku: fungují pro agenty v roji stejné škálovací zákony jako pro velikost modelů nebo inference-time compute? Odpověď určí, kam směřuje enterprise vývoj.
Číst →Novinky · 2026-08-11
Slabý model prozradil skryté myšlenky silnějších bratrů
Výzkumníci zneužili slabý model k tomu, aby získali skryté řetězce myšlenek (chain-of-thought) z těch nejsilnějších. Ukazuje to, že snaha skrývat uvažování modelu do zašifrovaných bloků je prozatím spíš iluze, která nechtěně odhaluje 704 privátních artefaktů.
Číst →Novinky · 2026-08-12
DeepSeek v tichosti spustil V4 Pro. Zatím běží jen přes API
Čínský startup DeepSeek vypustil novou generaci svého modelu V4 Pro bez oficiální tiskové zprávy. Model s parametry 1,7 T je momentálně dostupný přes API na platformě OpenRouter a jako váhy na Hugging Face.
Číst →Novinky · 2026-08-13
Plugin llm-gemini podporuje modely řady 3.7 Flash i experimenty se server-side nástroji
Simon Willison vydal verzi 0.33 svého pluginu llm-gemini. Novinka přidává podporu pro 3.7 Flash od Googlu a otevírá cestu k server-side nástrojům přes CLI nástroj LLM verze 0.32, který zviditelňuje myšlenkové pochody modelu.
Číst →Novinky · 2026-08-29
Hy4: Tencent v tichosti dohání špičku otevřených modelů
Tencent vydal nový, čistě textový 770B model s milionovým kontextem. Pro open-source vývojáře to znamená další těžkou váhu mimo tradiční americkou osu.
Číst →Novinky · 2026-08-26
Qwen3.8-Flash-Next je velký model, který šetří pamětí
Nový Qwen je masivní 125B model, ze kterého běží v jeden moment jen 6 miliard parametrů. Ukazuje to cestu k větší efektivitě bez ztráty kapacity.
Číst →Novinky · 2026-08-21
llm-openrouter 0.7 zapíná pro modely nástroje, fetch a vyhledávání na straně serveru
Simon Willison vydal update svého pluginu pro OpenRouter. Nová verze umožňuje modelům používat přímo serverové nástroje jako Shell, WebFetch a WebSearch.
Číst →Novinky · 2026-08-12
Microsoft testuje prostorové chápání modelů: Nový benchmark MindTopo
Microsoft představil MindTopo, benchmark pro testování prostorového a topologického uvažování vizuálních modelů. Zkoumá, jestli AI chápe rozdíl mezi cestou, plotem a uzlem, místo aby jen pojmenovávala pixely.
Číst →Novinky · 2026-08-11
Microsoft přidal Qwenovi nástroje pro přesné měření rentgenů
Model Qwen3-VL-4B-Instruct ve výzkumném pipeline Microsoftu nezkoumá rentgenové snímky jen vizuálně, ale spouští externí nástroje pro výpočet rozměrů. Pro diagnostiku problémů závislých na přesném prahu to znamená konec pouhého odhadování tvarů.
Číst →Novinky · 2026-07-18
Reasoning effort se stává ovladačem ceny, času a spolehlivosti LLM
Sebastian Raschka rozebírá, jak se LLM učí nízký, střední a vysoký reasoning effort. Pro týmy nasazující modely je to praktická otázka: kdy platit za delší přemýšlení a kdy stačí levná odpověď.
Číst →Novinky · 2026-08-04
LLM 0.32 mění Willisonův CLI z prompt toolu na agentní runtime
Simon Willison vydal LLM 0.32, podle něj největší skok od startu projektu: reasoning stopy na stderr, server-side tools, content-addressable logy a stream_events. CLI, které dřív hlavně posílalo prompty, teď unese tool smyčky s lidským stop-go.
Číst →Novinky · 2026-07-31
DeepSeek V4 Flash 0731 tlačí agentní výkon dolů na cenu pod 0,30 USD za milion tokenů
DeepSeek vydal oficiální DeepSeek-V4-Flash-0731: MIT váhy, 304B parametrů (podle HF; Artificial Analysis uvádí 284B total / 13B active), silnější agentní post-training a API kolem 0,14 USD za milion tokenů na vstupu a 0,27-0,28 USD na výstupu. Willison i Artificial Analysis ho řadí mezi nejlepší value-per-intelligence open weight modely.
Číst →Novinky · 2026-08-03
OpenAI přestavěla voice stack: GPT-Live poslouchá i ve chvíli, kdy mluví
OpenAI popsala architekturu GPT-Live: full-duplex hlasový model bez turn detectoru na audio path, asynchronní delegaci na frontier model (např. GPT-5.5) a transport optimalizovaný pro kontinuální audio. Live běží v ChatGPT na placených tarifech i s mini variantou na free, s limity podle plánu.
Číst →Novinky · 2026-07-29
GPT-5.6 poskočil v testech inteligence. Stačilo mu zapnout úsudek na pozadí
Nové nastavení pro GPT-5.6 umožňuje modelu udržet logický kontext a zhustit výpočet v benchmarku ARC-AGI-3. Vývojářským týmům to ukazuje cestu, jak levně zvednout výkon bez trénování nového modelu.
Číst →Novinky · 2026-07-23
ChatGPT Health jde na všechny v USA. Klinický marketing naráží na žalobu
OpenAI od 23. července pouští Health v ChatGPT všem přihlášeným uživatelům v USA od 18 let napříč free až Pro. Lidé napojí Apple Health a nemocniční záznamy, firma hlásí 300 milionů zdravotních dotazů týdně a zároveň čelí žalobě za nebezpečnou radu.
Číst →Novinky · 2026-07-24
Fugu Ultra hlásí až 7,9 bodu navíc oproti v1.0, úplnou metodiku zatím neukázalo
Fugu Ultra v1.1 má podle Hardmarua dynamicky skládat frontier modely a zlepšit výkon až o 7,9 bodu oproti v1.0. Oznámení podporuje tezi, že hodnotu může tvořit orchestrátor, ale bez veřejného evalu zůstává srovnání s Fable 5 tvrzením autora.
Číst →Novinky · 2026-07-01
BAIR ukazuje, kam odtéká další vlna AI talentu
BAIR zveřejnil showcase 33 doktorandů z ročníku 2026. Akademické rozloučení tu funguje jako mapa toho, kam se přesouvají lidé, kteří budou stavět robotiku, LLM agent systems, AI safety a modely pro vědu.
Číst →Novinky · 2026-06-24
Google ukazuje, že reasoning může z modelu vytáhnout i obyčejný fakt
Google Research zkoumá, proč chain-of-thought pomáhá LLM odpovídat i na jednoduché faktické otázky. Studie na Gemini 2.5 a Qwen3-32B ukazuje dva mechanismy: více výpočetního času v tokenech a faktické priming.
Číst →Novinky · 2026-06-03
GPT-Rosalind míří z benchmarků do řízené vědy
OpenAI aktualizovala GPT-Rosalind pro life sciences a nabízí ji v research preview vybraným organizacím globálně. Zajímavější než skóre je pokus spojit model, Codex a bioinformatické nástroje do auditovatelného workflow.
Číst →Z Knihovny