2026-07-21 · ← Radar
Gemini 3.6 Flash obniża koszt agentów, a Pro wciąż czeka za kulisami
Google pokazał trzy modele Gemini: 3.6 Flash, 3.5 Flash-Lite i 3.5 Flash Cyber. Najważniejszy sygnał nie tkwi w liczbie premier, lecz w przesunięciu serii Flash do roli warstwy roboczej dla agentów, gdzie o wdrożeniu decydują koszt zadania, opóźnienie i zbędne pętle.
Flash dostał metryki operacyjne zamiast parady największego modelu
Według Google Gemini 3.6 Flash zużywa o 17 % mniej tokenów wyjściowych niż 3.5 Flash w Artificial Analysis Index, a w DeepSWE firma widzi do 65 % oszczędności. Cena wynosi $1.50 za 1 milion tokenów wejściowych i $7.50 za 1 milion tokenów wyjściowych. Google podaje też lepsze wyniki w DeepSWE, 49 % wobec 37 %, oraz w MLE Bench, 63,9 % wobec 49,7 %.
3.5 Flash-Lite celuje w duży wolumen i niskie opóźnienia. Google cytuje 350 tokenów wyjściowych na sekundę według Artificial Analysis oraz cenę $0.3 za 1 milion tokenów wejściowych i $2.5 za 1 milion tokenów wyjściowych. Wariant Cyber jest dostrojony do znajdowania i poprawiania podatności w CodeMenderze.
Google dodaje, że 3.5 Pro nadal jest testowany z partnerami, a zespół rozpoczął pre-training Gemini 4. To cichy, ale ważny fragment zapowiedzi: publiczną premierę prowadzi tańsza warstwa robocza, nie największy model.
W produkcji liczy się rachunek za ukończone zadanie
Przy agentach koszt modelu nie jest tylko pozycją w cenniku. Jeśli agent wykonuje więcej tool calls, krąży po reasoning loopach i generuje długie odpowiedzi, tani token szybko zamienia się w drogie uruchomienie. Dlatego Google mówi o token efficiency, a nie tylko o benchmarkach.
Dla zespołów developerskich i enterprise ważna jest też dystrybucja. Gemini 3.6 Flash i 3.5 Flash-Lite są dostępne przez Gemini API, Google AI Studio i Android Studio, w enterprise przez Gemini Enterprise Agent Platform, a 3.6 Flash także w Antigravity. Flash-Lite trafia również do Gemini app i Search.
Model Cyber pokazuje siłę oraz hamulec podwójnego zastosowania
Gemini 3.5 Flash Cyber jest ciekawszy niż zwykły security fine-tune, bo Google wiąże go z CodeMenderem i ograniczonym pilotażem. Model ma być dostępny wyłącznie dla rządów i zaufanych partnerów. Przy technologii szukającej podatności to zrozumiałe, ale ogranicza niezależną weryfikację.
Porównanie z większymi systemami trzeba czytać ostrożnie. Google deklaruje konkurencyjny wynik na CyberGym, lecz trudniejsze pytanie brzmi, jak system zachowa się w żywym repozytorium, gdzie zła poprawka bywa gorsza niż jej brak.
O adopcji zdecydują logi, nie liczba modeli w komunikacie
Następny sygnał jest prosty: czy zespoły zaczną używać Flash do długich przebiegów agentów, a nie tylko do tanich odpowiedzi w czacie. Jeśli oszczędność tokenów przełoży się na mniej rund review i tańsze testy, Google dostanie więcej niż ładny wykres.
Równie ważne będzie to, czy pilotaż Cyber wyjdzie poza wąską listę partnerów i pokaże mierzalne poprawki w realnych codebase. Bez tego część security pozostanie zamkniętą gablotą, a nie narzędziem dla zwykłych obrońców.
Werdykt Lilith
Google nie stawia tu pomnika największemu modelowi. Próbuje wpuścić tańszego operatora do maszynowni agentów, gdzie każdy zbędny token brzęczy jak moneta w metalowej misce.
Źródła
- TechCrunch - AI · techcrunch.com/2026/07/21/google-releases-three-new-gemini-…
- Ars Technica - AI · arstechnica.com/google/2026/07/google-reveals-faster-and-ch…
- Google DeepMind - Blog · deepmind.google/blog/introducing-gemini-36-flash-35-flash-l…
- Google DeepMind - Blog · deepmind.google/blog/introducing-gemini-3-5-flash-cyber
Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.
Oryginalne źródło ↗ ↗