Lilith Lilith.
編集イラスト: Geminiがビデオ全体を自律的にスキャン可能に:エージェント型アプローチでトークンとコストを削減
Lilithのイラスト · 編集リミックス

モデル自身がどこを見るかを選択する

Googleは、Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Liteモデルのビデオ処理を改善しました。これは、モデルがタスクを受け取り、答えを見つけるまでビデオセグメントを動的にスキャンするエージェント型アプローチへの移行です。つまり、ビデオ全体をフレームに分割してコンテキストウィンドウに送信する必要がなくなります。

静的なシーンでのコンテキストの無駄遣いに終止符を打つ

ビデオ分析上に構築する開発者にとって、これはプロセス全体の経済性を変えます。Googleは、この動的なアプローチによりトークン消費が最大88%削減され、実際のAPIコストが最大66%削減されると主張しています。コスト削減だけでなく、モデルが静的なシーンからの不要なノイズに圧倒されることなく、情報を持つ瞬間にのみ集中するため、精度にも良い影響を与えます。

デモでは鍵を見つけられるが、1時間の監視カメラ映像ではどうなるか?

動的スキャンは、「赤いジャケットを着た人がいつ部屋に入ったか」のような、情報密度が低くビデオの大部分がフィラーであるクエリに最適です。逆に、エージェント型アプローチが苦戦する可能性があるのは、全体的なアクションの複雑な分析や時間の経過に伴う微妙な行動の変化など、モデルがどのセグメントをスキップすべきかを正確に推測できず、コンテキストを失う場合です。

スキャンエラー率が実際の節約を決定する

今後の重要な指標は、トークンを節約しようとするあまり、モデルが重要なフレームをスキップし、残りのトラックを熱心にスキャンする代わりにハルシネーションを返す頻度です。重要なタスクで古い力任せのアプローチにフォールバックする必要がある場合、約束された66%のコスト削減はすぐに消え去るでしょう。

Lilithの判定

これにより、ビデオは高価で遅いコンテキストから、エージェントが実際に読み取ったものに対してのみ支払うスマートなデータベースクエリのレベルにシフトします。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗