Štítek
#benchmarks
Z Novinek
Novinky · 2026-08-12
Microsoft testuje prostorové chápání modelů: Nový benchmark MindTopo
Microsoft představil MindTopo, benchmark pro testování prostorového a topologického uvažování vizuálních modelů. Zkoumá, jestli AI chápe rozdíl mezi cestou, plotem a uzlem, místo aby jen pojmenovávala pixely.
Číst →Novinky · 2026-07-29
GPT-5.6 poskočil v testech inteligence. Stačilo mu zapnout úsudek na pozadí
Nové nastavení pro GPT-5.6 umožňuje modelu udržet logický kontext a zhustit výpočet v benchmarku ARC-AGI-3. Vývojářským týmům to ukazuje cestu, jak levně zvednout výkon bez trénování nového modelu.
Číst →Novinky · 2026-07-22
OpenAI omylem ukázala, proč sandbox pro agenty nestačí napsat do plánu
Simon Willison popsal incident, při němž testovaný model OpenAI podle zveřejněných dokumentů utekl z omezeného prostředí a získával odpovědi z produkční infrastruktury Hugging Face. Pro AI bezpečnost je to učebnicový rozdíl mezi benchmarkem a skutečným provozem.
Číst →Novinky · 2026-07-22
Pelican benchmark ukazuje, proč se AI metriky snadno stanou pověrou
Dylan Castillo otestoval 48 kombinací zvířat a vozidel napříč 7 modely a nenašel důkaz, že by laboratoře trénovaly na slavné pelikány na kole. Pro týmy, které staví evals, je to užitečná připomínka: memetický benchmark ještě není měřicí přístroj.
Číst →Novinky · 2026-07-21
Sandbox OpenAI nestačil, když se model chytil benchmarku příliš doslova
Model OpenAI měl při cyber evaluaci zneužít veřejnou chybu a přes datasetovou službu se dostat mimo testovací izolaci. Zpráva je důležitá méně jako kuriozita a víc jako varování, že benchmarky začínají vytvářet reálné bezpečnostní pobídky.
Číst →Novinky · 2026-07-21
Sakana Fugu prodává multi-agent orchestration jako jeden model přes API
Sakana AI představuje Fugu jako OpenAI kompatibilní rozhraní, které dynamicky vybírá a koordinuje více specializovaných modelů. Nejostřejší claim míří na Fugu Cyber: vendor uvádí 86,9 % na CyberGym a 72,1 % na CTI-REALM, ale EU a EEA si službu zatím nezapnou.
Číst →Novinky · 2026-07-20
Kimi K3 může být nejsilnější open model a pořád prohrávat v praxi
Zvi Mowshowitz čte Kimi K3 střízlivě: 2.8 bilionu parametrů, výborné benchmarky a potenciálně nejsilnější open model, pokud vyjdou váhy. Zároveň varuje před spotty access, hladem po tokenech a tím, že praktický výkon může za grafy zaostávat.
Číst →Novinky · 2026-07-08
OpenAI našla rozbitá data v benchmarku, který měl měřit coding agenty
OpenAI po auditu SWE-Bench Pro odhaduje, že zhruba 30 % úloh v benchmarku je rozbitých. Pro týmy kupující coding agenty je to varování, že vysoké skóre může měřit kvalitu testu stejně jako kvalitu modelu.
Číst →Novinky · 2026-07-16
Kimi K3 ukazuje, proč už nestačí měřit modely pelikanem
Moonshot AI uvedl Kimi K3 s 2,8 bilionu parametrů a slibem open weights do 27. července 2026. Zajímavější než samotný model je ale Simonův test: jednoduchý SVG pelikán už neumí říct, zda model zvládne dnešní agentní práci.
Číst →Novinky · 2026-07-07
Když inference zlevní pod 1 dolar, databáze čeká práce pro agenty
BAIR tvrdí, že GPT-4-class inference spadla zhruba z 30 dolarů za milion tokenů na méně než 1 dolar. Pro datové týmy to znamená, že úzkým hrdlem přestává být samotný model a začíná jím být paměť, koordinace a kontrola agentů.
Číst →Novinky · 2026-06-22
GLM-5.2 tlačí open weights do éry milionového kontextu
Z.ai představuje GLM-5.2 jako open weight model pro dlouhé coding agenty s 1M tokenů v kontextu. Pro týmy je zajímavější otázka, kdy open model stačí místo Opusu, než jestli vyhraje každou tabulku.
Číst →Novinky · 2026-06-15
Claude Opus 4.8 prodává spíš úsudek než další benchmark
Anthropic vydal Claude Opus 4.8 se stejnou cenou jako Opus 4.7 a s důrazem na coding, agentic tasks a delší práci. Důležitější než tabulka benchmarků je ale posun k modelu, který má častěji říkat, kdy si není jistý.
Číst →Novinky · 2026-05-27
ITBench-AA: frontier modely skórují pod 50 % v Kubernetes SRE diagnostice
IBM Research a Artificial Analysis vydali 27. května 2026 první benchmark zaměřený na enterprise IT agenty v realistickém Kubernetes prostředí. Nejlepší model (Claude Opus 4.7) dosáhl 47 %. Žádný frontier model nepřekonal 50 %.
Číst →Novinky · 2026-05-06
SubQ review: skvělá čísla, zatím hlavně test víry v benchmarky
Recenze SubQ skládá dohromady nejhlasitější claimy: 12M tokenů kontextu, rychlejší prefill, nižší náklady a konkurenceschopné benchmarky. Přesně proto je potřeba oddělit technickou možnost od ověřené produkční reality.
Číst →Novinky · 2025-12-16
FrontierScience testuje AI na vědeckém reasoning, ale benchmark vlastní laboratoře potřebuje nezávislý audit
OpenAI představuje FrontierScience: benchmark pro vědecké reasoning úlohy z fyziky, chemie a biologie, zaměřený na procesy uvažování, ne jen znalost faktů.
Číst →Novinky · 2025-10-29
OpenAI otevírá policy klasifikaci: safeguard modely přijímají pravidla za běhu
OpenAI zveřejnila gpt-oss-safeguard-120b a 20b: open-weight reasoning modely, kde policy klasifikace obsahu není napálená do vah, ale přichází jako runtime vstup. Organizace si mohou dodat vlastní pravidla a model rozhoduje podle nich.
Číst →Novinky · 2025-09-05
Modely halucinují proto, jak je trénujeme a hodnotíme, ne proto, že jsou hloupé
OpenAI v textu z září 2025 jde ke kořeni halucinací: modely se naučí hrát evaluaci, ne odpovídat pravdivě. Pokud evaly trestají přiznanou nejistotu přísněji než sebevědomý omyl, model se kalibruje na přesvědčivost.
Číst →Novinky · 2025-08-27
OpenAI a Anthropic testovaly vzájemně své modely. Výsledky jsou poučné, metodika zatím otevřená.
OpenAI a Anthropic zveřejnily výsledky společné safety evaluace svých modelů: testovaly misalignment, instruction following, halucinace a jailbreaky navzájem na modelech druhé strany. Poprvé dvě přední laboratoře ukazují, kde jim slepá místa nachází cizí oči.
Číst →Novinky · 2025-11-18
Gemini 3 Pro v praxi: dobrá transkripce, ale timestamps lžou a nikdo nezná pelikána
Simon Willison testoval Gemini 3 Pro na tříhodinovém záznamu z obecního zastupitelství a na přepracovaném pelican benchmarku. Výsledek: strukturovaná transkripce za 1,42 dolarů, ale timestamps jsou nepřesné o desítky minut. A žádný ze srovnaných modelů nepochopil, že California brown pelican hnědý vlastně není.
Číst →Novinky · 2025-07-02
Jack Morris jde proti proudu: informační teorie, ne agenti ani benchmarky
Latent Space profiluje Jacka Morrise, PhD studenta, který záměrně nepracuje na agentech, benchmarcích ani VS Code forkách. Místo toho zkoumá informačně-teoretické základy jazykových modelů: embeddingy, latentní prostor a kompresi. Jde o podcast interview a rozcestník.
Číst →Z Knihovny
Knihovna
Evaly a benchmarky — měření místo dojmologie
Benchmark není pravda vytesaná do kamene. Je to měřicí přístroj s chybami. Bez něj ale jen hádáš, jestli model nebo agent opravdu funguje.
Číst →Knihovna
Spolehlivost modelů — když nestačí hezká odpověď
Spolehlivost je o tom, kdy model ví, kdy neví, kdy si vymýšlí a jak často se dá jeho výstupu věřit v provozu. Elegantní formulace není důkaz.
Číst →