2026-09-02 · ← ニュース
Gemini 3.8 Flash、脆弱性とコードにCyberエージェントを展開
コードとセキュリティに最適化されたモデル
Googleは、バージョン3.7のわずか6週間後にGemini 3.8 Flashをリリースしました。新しいモデルは、主に長期的なソフトウェアエンジニアリング(long-horizon software engineering)と自律エージェントの機能を目指しています。DeepSWEベンチマークのテストによると、3.8 Flashはコーディングと複数ステップの推論において前任者よりも優れており、一部のかなり大きなモデルを打ち負かしていますが、OSWorld-2.0のような一般的なエージェント環境での使用ではClaude Opusに遅れをとっています。
これと並行して、Googleは特別に調整されたバージョンであるGemini 3.8 Flash Cyberも発表しました。これは、脆弱性検出のためのCyberGymベンチマークで86.2%のスコアを達成し、フロンティアモデルに匹敵する成功率でパッチを自動的に生成できますが、コストはごくわずかです。
コードは書かれるだけでなく、自動的に保護されるようになります
標準のFlashモデルが開発者向けの軽量かつ強力なツールとして公開されているのに対し、Cyberモデルは限定的です。これはFairwindプログラムの背後に隠されており、Googleは精査された政府機関、重要インフラストラクチャオペレーター、および主要なソフトウェアメンテナのみを許可しています。モデルの攻撃的な機能を悪用して自動的に穴を見つけるというセキュリティリスクにより、Googleはモデルを厳重に保護するようになりました。
GoogleがCyberバリアントを社内で20のプログラミング言語でテストしたところ、バグの検出で70%以上の成功率を達成し、通常の数か月ではなく2時間で自社のクラウドに重大な弱点を見つけました。これにより、防御側は攻撃側に対して非対称な優位性を得ることができます。
広範な機能には忍耐が必要です
新しい機能は、最も複雑なタスクでのトークン消費と全体的な応答時間に表れます。モデルは、複雑な問題を解決する際、より多くの内部推論ステップと反復的なツール呼び出しを使用します。単純なクエリに対して即座の回答を期待する人は、改善に気付かないかもしれません。
低コスト(100万入力トークンあたり0.75米ドル)を維持することは依然として利点ですが、それは2026年末までのことです。TechCrunchとArs Technicaの分析が示すように、GoogleはProファミリーの大きなモデルを犠牲にしてFlashバリアントを大々的に宣伝することでマージンを最適化しており、Proファミリーの革新は現在遅くなっています。
レガシーインフラストラクチャでの採用が成功を決定します
モデルが最新のベンチマークと分離されたテストをどのように処理するかはすでにわかっています。問題は、Cyberモデルが、歴史的な負債と独自の企業ライブラリに満ちた実際の運用コードへのデプロイにどのように対処するかです。テスト結果は増加を示していますが、エージェントがパッチを書き込むだけでなく、自動統合中のシステムクラッシュを防ぐことができるかどうかは、完全なデプロイによってのみ明らかになります。
Lilithの判定
重大なバグのパッチ適用には数週間ではなく数時間かかりますが、排他的なゲートキーパーがCyberを監視しています。
外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。
元の記事 ↗ ↗