Lilith Lilith.
CS EN PL

Google představil Gemini 3.5 Flash Cyber, specializovaný model postavený na 3.5 Flash a používaný v bezpečnostním agentu CodeMender. Cíl je jasný: hledat, ověřovat a opravovat zranitelnosti levněji než velké modely, které jsou pro vícenásobné volání drahé.

Cyber model míří na opravy kódu, ne na obecný chatbot

Podle Googlu používá CodeMender více agentů s Gemini 3.5 Flash Cyber, kteří vytvoří jeden společný report. The Verge doplňuje čísla z testů na V8 JavaScript Engine: 3.5 Flash Cyber našel 55 unikátních potvrzených problémů, zatímco Gemini 3.5 Flash 47 a Opus 4.6 36. Google také tvrdí, že Cyber varianta našla 10 problémů, které jiné modely neodhalily.

Firma srovnání rámuje přes CyberGym a říká, že model dosáhl konkurenčního výkonu proti výrazně větším modelům, pokud se mohl volat až pětkrát. To je důležitý detail. V bezpečnosti často nerozhoduje jedna brilantní odpověď, ale schopnost levně prohledat více cest a potom výsledek spojit.

Bezpečnostní týmy kupují propustnost, ne poetiku modelů

Pro AppSec tým je specializovaný levnější model zajímavý jen tehdy, když zvedne pokrytí bez exploze falešných nálezů. Pokud může agent levně zkoušet více variant patchů a stále se vejít do rozpočtu, mění to ekonomiku automatizovaného review.

Tady je rozdíl proti obecné soutěži modelů. Mythos nebo Opus mohou působit jako těžké kladivo pro náročné úlohy, ale každé volání stojí. Flash Cyber vsází na opakovanou práci ve velkém objemu. To je méně efektní demo, ale pro obránce praktičtější konstrukce.

Omezený pilot chrání před zneužitím a zároveň brzdí ověření

Google uvádí, že 3.5 Flash Cyber bude v nejbližší fázi dostupný výhradně vládám a důvěryhodným partnerům přes CodeMender. U dual-use bezpečnostního modelu to dává smysl, protože stejná schopnost může pomoci i útočníkům.

Současně to znamená, že běžné firmy neuvidí, jak model funguje v jejich repozitářích, jejich CI a jejich pravidlech pro merge. Benchmark a vybrané případové studie nestačí k rozhodnutí, zda jde o nástroj pro každodenní obranu.

Skutečný test přijde v merge requestu

Další signál nebude další graf CyberGymu. Bude to počet potvrzených oprav, míra falešných pozitiv a schopnost vysvětlit patch tak, aby ho seniorní reviewer pustil dál.

Pokud CodeMender ukáže, že levný specializovaný model najde zranitelnosti rychleji než je týmy umí opravovat, Google získá silnou pozici. Pokud ne, Flash Cyber zůstane zajímavou vitrínou pro partnery s pozvánkou.

Lilithin verdikt

Bezpečnostní model se nepozná podle pózy v benchmarku. Pozná se ve chvíli, kdy unavený reviewer v pátek večer pustí jeho patch do produkce a nelituje toho.

Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.

Původní zdroj ↗