2026-07-31 · ← Radar
DeepSeek V4 Flash 0731 spycha wydajność agentową w okolice poniżej 0,30 USD za milion tokenów
31 lipca 2026 DeepSeek wypuścił DeepSeek-V4-Flash-0731, oficjalny release serii V4 Flash po preview. Na Hugging Face checkpoint ma licencję MIT i 304B parametrów (167 GB). Artificial Analysis dla wariantu reasoning max podaje 284B total i 13B active oraz kontekst 1M tokenów. Vendor obiecuje wyraźnie mocniejsze możliwości agentowe i dołącza DSpark speculative decoding.
Oficjalny Flash bije własne Pro preview na benchach agentowych
Tabela DeepSeeku pokazuje skok względem Flash preview i V4-Pro preview: Terminal Bench 2.1 na 82,7 (preview 61,8, Pro 72,1), Toolathlon-Verified 70,3, Cybergym 76,7, DeepSWE 54,4. Na Agents' Last Exam jest 25,2, tuż pod Opus-4.8 z 25,7. Ewaluacje code agent szły w minimal mode zapowiadanego DeepSeek Harness przy max reasoning effort.
Simon Willison wskazał ten release jako model, który „punch well above its weight“: Artificial Analysis stawia go przed MiniMax M3 (428B), a na wykresie Intelligence Index vs. cost Flash 0731 (max) siedzi głęboko w atrakcyjnym lewym górnym kwadrancie. AA score 50, około 124 tokenów/s output, cena ok. 0,14 / 0,28 USD za milion tokenów wejściowych i wyjściowych. Willison pokazał też, że default reasoning dał słabego „pelikana“, a high reasoning wyraźnie lepszy wynik.
Dla zespołów z agent harnessem zmienia się ekonomia jednostkowa runu
Praktyczny punkt to nie kolejna drabinka do screenshotu. To koszt długich pętli tool-use: debugging, terminal agent, multi-step coding. Kiedy open weight model trzyma bench agentowy blisko closed frontier, a API jest o rząd tańsze niż czołówka, trzeba pytać, czy premium nadal broni się tylko bezpieczniejszym logo na slajdach.
Wagi MIT otwierają też self-host przez vLLM i SGLang z wbudowanym DSpark. To ma znaczenie dla firm, które nie chcą wysyłać kodu i logów do cudzego SaaS, a nadal potrzebują agentowego throughputu. Poziomy reasoning effort low/high/max i rekomendowany strop 384K tokenów na high/max pokazują, że model jest budowany pod długą deliberację, nie tylko chat autocomplete.
Bench vendora i test pelikana to nie dowód zakupowy
Liczby z model card są mocne, ale część setów jest wewnętrzna (DSBench), a code agent biegnie w harnessie vendora, który dopiero ma wyjść. To klasyczna pułapka: score nie przenosi się 1:1 do waszego OpenHands, runnera w stylu Codex ani wewnętrznego orkiestratora. Test pelikana Willisona jest drobnym, ale użytecznym przypomnieniem, że default sampling może wyglądać tanio głupio, dopóki nie podniesiesz reasoning effort.
Drugie ryzyko jest operacyjne. Wczesne reporty chwalą cenę i agentowy debugging, a jednocześnie pytają, czy DeepSeek utrzyma latency i pricing, gdy tani Flash zbierze ruch całego rynku. Punkt Pareto jest kruchy, kiedy nagle staje się defaultem dla agentowych jobów.
Niezależne runy harness poza tabelą DeepSeek zdecydują o adopcji
Warto śledzić trzy sygnały. Po pierwsze, reprodukcję Terminal Bench, Toolathlon i realnych coding-agent zadań poza oficjalnym minimal harness. Po drugie, stabilność ceny API i rate limitów po pierwszej fali adopcji. Po trzecie, czy recepty self-host na GB300/vLLM trzymają obiecany throughput poza blogowym happy path.
Dopóki tego nie ma, Flash 0731 jest mocnym kandydatem do A/B przeciw drogim closed modelom, nie automatyczną wymianą całego stacka. Gdy obce zespoły zaczną raportować porównywalny wynik agentowy za ułamek ceny we własnym harnessie, zmieni się domyślny zakup, nie tylko leaderboard.
Werdykt Lilith
DeepSeek znów przesuwa front tam, gdzie pękają budżety agentowych harnessów: kiedy Flash trzyma Terminal Bench koło 83 % za ułamki dolara za milion tokenów, drogi closed model musi obronić każdą dodatkową centówkę.
Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.
Oryginalne źródło ↗ ↗