Lilith Lilith.
⌕
Redakční ilustrace: Gemini 4 Argon zvedá výstup na 1 milion tokenů, ale do API zatím nejde
Ilustrace Lilith · redakční remix

Google představil Gemini 4 Argon s výstupním limitem 1 milion tokenů místo dosavadních 64 000 a ukázal jeho práci na velkých interních projektech. Vývojáři ho ale zatím nemohou sami otestovat, takže propast mezi působivou ukázkou a nasaditelným produktem zůstává otevřená.

Argon dostal prostor na dlouhý běh místo dalšího krátkého chatu

Nejvýraznější změnou je maximální výstup 1 milion tokenů. Google uvádí, že předchozí limit činil 64 000 tokenů. Jde o délku výstupu, nikoli o nově potvrzené vstupní kontextové okno. Smyslem je udržet dlouhou úlohu v jedné trajektorii a omezit předávání stavu mezi navazujícími běhy.

Google popisuje nasazení uvnitř firmy. Agenti podle něj hledali úspory paměti v datových centrech a po zavedení uvolnili více než 300 TiB. Celkový odhad úspor je 500 TiB až 1 PiB. Další týmy používají Argon při převodu C a C++ projektů do Rustu, od knihoven s desítkami tisíc řádků po jádro Fuchsia Zircon s více než 800 000 řádky.

U dekodéru libgav1 agenti nahradili 32 000 řádků SIMD kódu v existujícím Rust portu. Google tvrdí, že výsledek běží 2,7krát rychleji než původní Rust port a dává shodný video výstup. Takové změny podle firmy procházejí automatickými i ručními audity, emulačními testy a review.

Dlouhý výstup mění návrh agentů i jejich účet

Pro vývojářský tým může větší výstupní rozpočet snížit počet restartů při migraci repozitáře, dlouhém výzkumu nebo složitém ladění. Zároveň přenáší problém jinam. Stovky tisíc tokenů musí někdo kontrolovat, testovat a účtovat. Delší běh sám o sobě nezaručí správný plán ani kvalitní výsledek.

Google uvádí zaváděcí cenu 2 dolary za milion vstupních tokenů a 10 dolarů za milion výstupních tokenů. Cacheovaný vstup má být o 95 % levnější. Po skončení úvodního období mají sazby vzrůst na 4 a 20 dolarů. Firma zatím neuvedla konec tohoto období ani veřejné API model ID.

Tabulka benchmarků míchá vlastní měření s různými harnessy

Argon podle Googlu dosáhl 77,9 % na DeepSWE v1.1, 51,3 % na AutomationBench a 91,7 % na LVBench. Metodický dokument však říká, že řadu výsledků pro Argon počítal Google sám, zatímco skóre konkurence často převzal od poskytovatelů nebo z veřejných žebříčků. U jednotlivých modelů se liší harnessy, limity nástrojů i podmínky běhu.

Nejzajímavější interní příklady také pocházejí od stejné firmy, která model prodává. Ukazují, co může dobře vybavený tým v Googlu postavit kolem Argonu. Neříkají zatím, jak si poradí běžný zákazník se svým repozitářem, oprávněními a testy.

Veřejné API a cizí repozitáře oddělí schopnost od prezentace

Argon se nyní dostává jen k vybrané skupině důvěryhodných obránců a testerů přes Fairwind Program. Google slibuje další přístup placeným zákazníkům API a předplatitelům Google AI Ultra, ale neoznámil datum. V Česku ani jinde tedy zatím nestačí koupit tarif a model zapnout.

Rozhodující budou reprodukovatelné testy na cizích codebase, skutečná latence dlouhých běhů, počet nutných zásahů člověka a cena dokončené úlohy. Milion tokenů je velká nádrž. Teprve provoz ukáže, zda Argon dojede dál, nebo jen déle spaluje rozpočet.

Lilithin verdikt

Milion tokenů dá agentovi delší vodítko. Teprve cizí repozitář ukáže, zda po něm doběhne k cíli, nebo kolem něj zamotá celý tým.

Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.

Původní zdroj ↗ ↗