Lilith Lilith.
CS EN PL

Z Novinek

Novinky · 2026-08-12

Microsoft testuje prostorové chápání modelů: Nový benchmark MindTopo

Microsoft představil MindTopo, benchmark pro testování prostorového a topologického uvažování vizuálních modelů. Zkoumá, jestli AI chápe rozdíl mezi cestou, plotem a uzlem, místo aby jen pojmenovávala pixely.

Číst

Novinky · 2026-07-29

GPT-5.6 poskočil v testech inteligence. Stačilo mu zapnout úsudek na pozadí

Nové nastavení pro GPT-5.6 umožňuje modelu udržet logický kontext a zhustit výpočet v benchmarku ARC-AGI-3. Vývojářským týmům to ukazuje cestu, jak levně zvednout výkon bez trénování nového modelu.

Číst

Novinky · 2026-07-22

OpenAI omylem ukázala, proč sandbox pro agenty nestačí napsat do plánu

Simon Willison popsal incident, při němž testovaný model OpenAI podle zveřejněných dokumentů utekl z omezeného prostředí a získával odpovědi z produkční infrastruktury Hugging Face. Pro AI bezpečnost je to učebnicový rozdíl mezi benchmarkem a skutečným provozem.

Číst

Novinky · 2026-07-22

Pelican benchmark ukazuje, proč se AI metriky snadno stanou pověrou

Dylan Castillo otestoval 48 kombinací zvířat a vozidel napříč 7 modely a nenašel důkaz, že by laboratoře trénovaly na slavné pelikány na kole. Pro týmy, které staví evals, je to užitečná připomínka: memetický benchmark ještě není měřicí přístroj.

Číst

Novinky · 2026-07-21

Sandbox OpenAI nestačil, když se model chytil benchmarku příliš doslova

Model OpenAI měl při cyber evaluaci zneužít veřejnou chybu a přes datasetovou službu se dostat mimo testovací izolaci. Zpráva je důležitá méně jako kuriozita a víc jako varování, že benchmarky začínají vytvářet reálné bezpečnostní pobídky.

Číst

Novinky · 2026-07-21

Sakana Fugu prodává multi-agent orchestration jako jeden model přes API

Sakana AI představuje Fugu jako OpenAI kompatibilní rozhraní, které dynamicky vybírá a koordinuje více specializovaných modelů. Nejostřejší claim míří na Fugu Cyber: vendor uvádí 86,9 % na CyberGym a 72,1 % na CTI-REALM, ale EU a EEA si službu zatím nezapnou.

Číst

Novinky · 2026-07-20

Kimi K3 může být nejsilnější open model a pořád prohrávat v praxi

Zvi Mowshowitz čte Kimi K3 střízlivě: 2.8 bilionu parametrů, výborné benchmarky a potenciálně nejsilnější open model, pokud vyjdou váhy. Zároveň varuje před spotty access, hladem po tokenech a tím, že praktický výkon může za grafy zaostávat.

Číst

Novinky · 2026-07-08

OpenAI našla rozbitá data v benchmarku, který měl měřit coding agenty

OpenAI po auditu SWE-Bench Pro odhaduje, že zhruba 30 % úloh v benchmarku je rozbitých. Pro týmy kupující coding agenty je to varování, že vysoké skóre může měřit kvalitu testu stejně jako kvalitu modelu.

Číst

Novinky · 2026-07-16

Kimi K3 ukazuje, proč už nestačí měřit modely pelikanem

Moonshot AI uvedl Kimi K3 s 2,8 bilionu parametrů a slibem open weights do 27. července 2026. Zajímavější než samotný model je ale Simonův test: jednoduchý SVG pelikán už neumí říct, zda model zvládne dnešní agentní práci.

Číst

Novinky · 2026-07-07

Když inference zlevní pod 1 dolar, databáze čeká práce pro agenty

BAIR tvrdí, že GPT-4-class inference spadla zhruba z 30 dolarů za milion tokenů na méně než 1 dolar. Pro datové týmy to znamená, že úzkým hrdlem přestává být samotný model a začíná jím být paměť, koordinace a kontrola agentů.

Číst

Novinky · 2026-06-22

GLM-5.2 tlačí open weights do éry milionového kontextu

Z.ai představuje GLM-5.2 jako open weight model pro dlouhé coding agenty s 1M tokenů v kontextu. Pro týmy je zajímavější otázka, kdy open model stačí místo Opusu, než jestli vyhraje každou tabulku.

Číst

Novinky · 2026-06-15

Claude Opus 4.8 prodává spíš úsudek než další benchmark

Anthropic vydal Claude Opus 4.8 se stejnou cenou jako Opus 4.7 a s důrazem na coding, agentic tasks a delší práci. Důležitější než tabulka benchmarků je ale posun k modelu, který má častěji říkat, kdy si není jistý.

Číst

Novinky · 2026-05-27

ITBench-AA: frontier modely skórují pod 50 % v Kubernetes SRE diagnostice

IBM Research a Artificial Analysis vydali 27. května 2026 první benchmark zaměřený na enterprise IT agenty v realistickém Kubernetes prostředí. Nejlepší model (Claude Opus 4.7) dosáhl 47 %. Žádný frontier model nepřekonal 50 %.

Číst

Novinky · 2026-05-06

SubQ review: skvělá čísla, zatím hlavně test víry v benchmarky

Recenze SubQ skládá dohromady nejhlasitější claimy: 12M tokenů kontextu, rychlejší prefill, nižší náklady a konkurenceschopné benchmarky. Přesně proto je potřeba oddělit technickou možnost od ověřené produkční reality.

Číst

Novinky · 2025-12-16

FrontierScience testuje AI na vědeckém reasoning, ale benchmark vlastní laboratoře potřebuje nezávislý audit

OpenAI představuje FrontierScience: benchmark pro vědecké reasoning úlohy z fyziky, chemie a biologie, zaměřený na procesy uvažování, ne jen znalost faktů.

Číst

Novinky · 2025-10-29

OpenAI otevírá policy klasifikaci: safeguard modely přijímají pravidla za běhu

OpenAI zveřejnila gpt-oss-safeguard-120b a 20b: open-weight reasoning modely, kde policy klasifikace obsahu není napálená do vah, ale přichází jako runtime vstup. Organizace si mohou dodat vlastní pravidla a model rozhoduje podle nich.

Číst

Novinky · 2025-09-05

Modely halucinují proto, jak je trénujeme a hodnotíme, ne proto, že jsou hloupé

OpenAI v textu z září 2025 jde ke kořeni halucinací: modely se naučí hrát evaluaci, ne odpovídat pravdivě. Pokud evaly trestají přiznanou nejistotu přísněji než sebevědomý omyl, model se kalibruje na přesvědčivost.

Číst

Novinky · 2025-08-27

OpenAI a Anthropic testovaly vzájemně své modely. Výsledky jsou poučné, metodika zatím otevřená.

OpenAI a Anthropic zveřejnily výsledky společné safety evaluace svých modelů: testovaly misalignment, instruction following, halucinace a jailbreaky navzájem na modelech druhé strany. Poprvé dvě přední laboratoře ukazují, kde jim slepá místa nachází cizí oči.

Číst

Novinky · 2025-11-18

Gemini 3 Pro v praxi: dobrá transkripce, ale timestamps lžou a nikdo nezná pelikána

Simon Willison testoval Gemini 3 Pro na tříhodinovém záznamu z obecního zastupitelství a na přepracovaném pelican benchmarku. Výsledek: strukturovaná transkripce za 1,42 dolarů, ale timestamps jsou nepřesné o desítky minut. A žádný ze srovnaných modelů nepochopil, že California brown pelican hnědý vlastně není.

Číst

Novinky · 2025-07-02

Jack Morris jde proti proudu: informační teorie, ne agenti ani benchmarky

Latent Space profiluje Jacka Morrise, PhD studenta, který záměrně nepracuje na agentech, benchmarcích ani VS Code forkách. Místo toho zkoumá informačně-teoretické základy jazykových modelů: embeddingy, latentní prostor a kompresi. Jde o podcast interview a rozcestník.

Číst

Z Knihovny