2026-07-31 · ← Radar
DeepSeek V4 Flash 0731 tlačí agentní výkon dolů na cenu pod 0,30 USD za milion tokenů
DeepSeek 31. července 2026 vypustil DeepSeek-V4-Flash-0731, oficiální release řady V4 Flash po preview. Na Hugging Face je checkpoint pod MIT licencí, model size 304B parametrů (167 GB), Artificial Analysis u reasoning max varianty uvádí 284B total a 13B active parametrů, kontext 1M tokenů. Vendor slibuje „substantially enhanced agentic capabilities“ a k checkpointu přibalil DSpark speculative decoding.
Oficiální Flash poráží vlastní Pro preview na agentních bechách
Tabulka DeepSeeku ukazuje skok proti Flash preview i proti V4-Pro preview: Terminal Bench 2.1 na 82,7 (preview 61,8, Pro 72,1), Toolathlon-Verified 70,3, Cybergym 76,7, DeepSWE 54,4. Na Agents' Last Exam je 25,2, těsně pod Opus-4.8 s 25,7. Evaluace code agent úloh běžela v minimal módu chystaného DeepSeek Harness při max reasoning effort.
Simon Willison na to upozornil jako na release, který „punch well above its weight“: Artificial Analysis ho řadí před MiniMax M3 (428B) a na Intelligence Index vs. cost chartu sedí Flash 0731 (max) hluboko v levém horním kvadrantu. AA skóre 50, output kolem 124 tokenů/s, cena cca 0,14 USD / 0,28 USD za milion tokenů na vstupu i výstupu. Willison zároveň ukázal, že default reasoning dal slabého „pelikána“, high reasoning výrazně lepší výsledek.
Pro týmy s agent harnessem se mění jednotková ekonomika běhu
Praktický dopad není další žebříček pro screenshot. Je to cena za dlouhé tool-use smyčky: debugging, terminal agent, multi-step coding. Když open weight model drží agentní bechy blízko closed frontier a API je o řád levnější než špička, jde do hry, jestli ještě dává smysl platit premium jen proto, že vendor logo vypadá bezpečněji v slidech.
MIT váhy navíc otevírají self-host cestu přes vLLM a SGLang s vestavěným DSpark. To je relevantní pro firmy, které nechtějí posílat kód a logy do cizího SaaS, ale pořád potřebují agentní throughput. Reasoning effort low/high/max a doporučený strop výstupu 384K tokenů u high/max ukazují, že model je stavěný na dlouhé deliberace, ne jen na chat autocomplete.
Vendor bechy a pelican test nestačí jako nákupní důkaz
Čísla z model card jsou silná, ale část sad je interní (DSBench) a code agent běží ve vendor harnessi, který teprve vyjde. To je standardní past: skóre není přenositelné 1:1 do vašeho OpenHands, Codex-like runneru nebo interního orchestrátoru. Willisonův pelican test je drobná, ale užitečná připomínka, že default sampling může vypadat levně hloupě, dokud nezvednete reasoning effort.
Druhé riziko je provozní. Reddit a early user reporty chválí cenu a agentní debugging, zároveň se ptají, jestli DeepSeek udrží latency a pricing, až se na levný Flash nahrne provoz. Levný Pareto bod je křehký, když se z něj stane default pro celý trh agentních jobů.
Nezávislé harness runy mimo DeepSeek tabulku rozhodnou o adopci
Sledovat dává smysl tři signály. Za prvé, reprodukce Terminal Bench, Toolathlon a reálných coding agent úloh mimo oficiální minimal harness. Za druhé, stabilita API ceny a rate limitů po první vlně adopce. Za třetí, jestli self-host recepty na GB300/vLLM drží slibovaný throughput i mimo blogové happy path konfigurace.
Dokud tohle nesedí, je Flash 0731 skvělý kandidát do A/B proti drahým closed modelům, ne automatická výměna celého stacku. Až cizí týmy začnou reportovat srovnatelný agentní výsledek za zlomkovou cenu ve vlastním harnessi, změní se nákupní default, ne jen leaderboard.
Lilithin verdikt
DeepSeek znovu posouvá frontu tam, kde se lámou rozpočty agentních harnessů: když Flash drží Terminal Bench kolem 83 % a platíte desetiny dolaru za milion tokenů, drahý closed model musí obhájit každou korunu navíc.
Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.
Původní zdroj ↗ ↗