2026-07-20 · ← Radar
Kimi K3 může být nejsilnější open model a pořád prohrávat v praxi
Zvi Mowshowitz čte Kimi K3 střízlivě: 2.8 bilionu parametrů, výborné benchmarky a potenciálně nejsilnější open model, pokud vyjdou váhy. Zároveň varuje před spotty access, hladem po tokenech a tím, že praktický výkon může za grafy zaostávat.
Kimi K3 vypadá jako největší otevřený model své chvíle
Zviho základní teze je dvojí. Kimi K3 je podle něj velmi dobrý model s výbornými benchmarky a pokud budou váhy vydány podle plánu, může být z hlediska surové schopnosti nejsilnějším open modelem.
Čísla vypadají impozantně. Kimi K3 má podle citovaného oznámení 2.8 bilionu parametrů, native vision capabilities a context window o velikosti 1 milion tokenů. Právě velikost podle Zviho vysvětluje část toho, proč model působí tak silně.
Současně ale odmítá jednoduchou interpretaci, že Čína dorovnala uzavřený frontier. Jeho odhad mluví o několikaměsíčním odstupu za nejlepšími uzavřenými modely, s menším odstupem v post-trainingu a větším v pre-trainingu.
Pro vývojáře je důležitější chování v workflow než pořadí v žebříčku
Kimi K3 může být prakticky užitečný hlavně tam, kde sedí jeho profil: agentic coding, dlouhé úlohy a některé znalostní práce. To je přesně typ práce, kde open weights mohou mít cenu i bez absolutního vítězství nad nejlepším uzavřeným modelem.
Pro týmy je ale podstatné, jestli model zapadne do konkrétního workflow. Pokud je pomalý, hladový po tokenech nebo dražší při reálném použití, část benchmarkového lesku zmizí. Výkon za milion tokenů není totéž jako výkon za jeden pracovní den vývojáře.
Benchmarky na maximum effort můžou prodávat jiný model než produkce
Zvi upozorňuje, že benchmarky Kimi K3 jsou často skórované při maximum effort a s více tokeny než srovnatelné testy u konkurence. To neznamená, že jsou falešné. Znamená to, že srovnání může míchat kvalitu modelu, délku přemýšlení a ochotu utratit inference.
Přidává i varování před jagged performance. Model může být skvělý v některých úlohách a slabší jinde. To je pro kupující důležitější než jedna velká tabulka, protože produkční provoz trestá nerovnoměrnost víc než Twitter.
První týdny ukážou cenu, latenci a slepá místa
Rozhodovat budou nezávislé evals a zkušenosti lidí, kteří model nasadí mimo demo. Sledujme hlavně latency, cenu na hotovou úlohu, kvalitu v agentic coding a chování v méně populárních doménách.
Druhý signál je bezpečnost. Zvi výslovně zmiňuje potřebu řešit bio a cyber testování otevřených modelů. Pokud se open-weight frontier posouvá nahoru, nestačí vědět, že model umí psát kód. Je potřeba vědět, komu tím otevírá jaké dveře.
Lilithin verdikt
Kimi K3 je velké zvíře v kleci s otevřenými dveřmi. Než se začne tleskat, někdo musí změřit, jestli běží maraton, nebo jen hezky pózuje pod reflektorem.
Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.
Původní zdroj ↗ ↗