Lilith Lilith.
⌕
Ilustracja redakcyjna: Gemini 4 Argon zwiększa limit wyjścia do 1 miliona tokenów, lecz API pozostaje zamknięte
Ilustracja Lilith · remiks redakcyjny

Google zaprezentował Gemini 4 Argon z limitem wyjścia wynoszącym 1 milion tokenów zamiast dotychczasowych 64 000 i pokazał jego pracę przy dużych projektach wewnętrznych. Deweloperzy nadal nie mogą przetestować go samodzielnie, więc między efektownym pokazem a produktem gotowym do wdrożenia pozostaje duża luka.

Argon dostał przestrzeń na długi przebieg zamiast kolejnego krótkiego czatu

Najbardziej widoczną zmianą jest maksymalne wyjście o długości 1 miliona tokenów. Według Google poprzedni limit wynosił 64 000 tokenów. To limit wyjścia, a nie nowo potwierdzone okno kontekstu wejściowego. Ma pozwolić utrzymać długie zadanie w jednej trajektorii i ograniczyć utratę stanu między kolejnymi przebiegami.

Google opisuje kilka wdrożeń wewnętrznych. Agenci mieli znaleźć oszczędności pamięci w centrach danych, które po wdrożeniu uwolniły ponad 300 TiB. Łączny szacunek wynosi od 500 TiB do 1 PiB. Inne zespoły używają Argona do migracji projektów C i C++ do Rusta, od bibliotek z dziesiątkami tysięcy linii po jądro Fuchsia Zircon liczące ponad 800 000 linii.

W dekoderze libgav1 agenci zastąpili 32 000 linii kodu SIMD w istniejącym porcie Rust. Google twierdzi, że wynik działa 2,7 raza szybciej niż wcześniejszy port Rust i generuje identyczny obraz wideo. Takie zmiany mają przechodzić automatyczne i ręczne audyty, testy emulacyjne oraz review.

Dłuższe wyjście zmienia projekt agenta i wysokość rachunku

Większy budżet wyjścia może ograniczyć restarty podczas migracji repozytorium, długiego researchu lub trudnego debugowania. Ograniczenie przesuwa się jednak w inne miejsce. Setki tysięcy tokenów nadal trzeba sprawdzić, przetestować i opłacić. Dłuższy przebieg nie gwarantuje dobrego planu ani poprawnego wyniku.

Google podaje cenę promocyjną 2 dolarów za milion tokenów wejściowych i 10 dolarów za milion tokenów wyjściowych. Wejście z cache ma kosztować o 95 % mniej. Po okresie wstępnym stawki mają wzrosnąć do 4 i 20 dolarów. Firma nie podała daty zakończenia promocji ani publicznego identyfikatora modelu w API.

Tabela benchmarków łączy własne pomiary z różnymi harnessami

Według Google Argon uzyskał 77,9 % w DeepSWE v1.1, 51,3 % w AutomationBench i 91,7 % w LVBench. Dokument metodologiczny mówi jednak, że wiele wyników Argona policzyło samo Google, podczas gdy rezultaty konkurencji często pochodziły od dostawców albo z publicznych rankingów. Między modelami różnią się harnessy, limity narzędzi i warunki uruchomienia.

Najciekawsze przykłady wdrożeń również pochodzą od firmy sprzedającej model. Pokazują, co dobrze wyposażony zespół Google potrafi zbudować wokół Argona. Nadal nie wiemy, co osiągnie zwykły klient we własnym repozytorium, z własnymi uprawnieniami i testami.

Publiczne API i obce repozytoria oddzielą możliwości od prezentacji

Argon trafia obecnie tylko do wybranej grupy zaufanych obrońców i testerów przez Fairwind Program. Google zapowiada późniejszy dostęp dla płatnych klientów API i abonentów Google AI Ultra, lecz nie podało daty. Sam zakup planu nie daje dziś dostępu do modelu.

Najważniejsze będą powtarzalne testy na obcych codebase, rzeczywista latencja długich przebiegów, liczba interwencji człowieka i koszt ukończonego zadania. Milion tokenów to duży zbiornik paliwa. Dopiero produkcja pokaże, czy Argon pojedzie dalej, czy tylko dłużej będzie spalał budżet.

Werdykt Lilith

Milion tokenów daje agentowi dłuższą smycz. Dopiero obce repozytorium pokaże, czy dobiegnie na metę, czy oplącze nią cały zespół.

Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.

Oryginalne źródło ↗ ↗