Lilith.
⌕
編集イラスト: Goodfireはモデル内部からエージェントを監視し、費用を1万ドルから51ドルに削減したと主張
Lilithのイラスト · 編集リミックス

Goodfireは、AIエージェントの文章や行動だけでなく、モデル内部を監視するシステムを本番投入した。probesと呼ばれる小型分類器が推論中の内部活性値を読み、疑わしい事例だけを別のAIモデルへ送り、詳しく調べる。サービスは推論基盤Basetenの顧客が利用できる。

probesは全工程を見て疑わしい事例だけを回す

顧客は攻撃的ハッキング、化学や生物分野での悪用、reward hackingなど、監視するリスクを選べる。対応も、記録、人間による確認、要求の拒否から設定する。Goodfireが最初の監視器を作った対象はオープンモデルのKimi K3だ。

このカスケードは従来型監視の費用問題に対応する。独立したLLM判定器は長いエージェント履歴を読み直す必要があるが、probeは対象モデルがすでに行っている計算を再利用する。高価な確認は信号が設定値を超えた時だけ動く。

安価な一次フィルターならツール実行前に止められる

GoodfireがKimi K3の約1,500セッションで行った試験では、監視費用は約51ドルだった。全工程を安価なモデルで確認すると233ドル、最上位モデルなら約1万ドルかかると同社は見積もる。probesは悪意あるハッキングセッションの94%を検出し、無害なセッションの8.7%を二次確認へ送った。

同じ比率が本番でも維持できれば、安全チームは素早い反応と別の大型モデルの費用を天秤にかけずに済む。同期フィルターはツール呼び出し前に疑わしい行動を止められる。ネットワーク、端末、社内データへ触れるエージェントでは、事後報告より重要な差になる。

自社ベンチマークだけでは汎用の安全層にならない

数値はGoodfire自身が特定のモデルと攻撃セットで測ったものだ。4個のprobesを同時に動かしても最初のtokenまでの時間は2%未満しか増えなかったという。しかし本番品質を決めるのは誤検知、モデル変更、監視器に適応した攻撃だ。無害なセッションの8.7%を中断することは、サイバーセキュリティ用sandboxでは許容できても、通常の開発作業では大きな負担になりうる。

この方式には内部活性値へのアクセスと推論基盤への統合も必要だ。そのため主な対象はオープンモデルとservingを管理する事業者になる。内部信号を公開しない閉鎖型APIへ同じ監視器をそのまま追加することはできない。

モデル間の移植と適応型攻撃が成否を決める

次に見るべきなのは、probesを別モデルへ移す時間と、更新やfine-tuning後の挙動だ。独立したred team試験には、仕組みを知る攻撃者を含める必要がある。固定されたjailbreak集だけでは足りない。

購入側には運用データも要る。tool use前に止めた悪意ある行動の数、遮断した正当な作業の量、モデル変更後の再学習費用である。この3点が、内部活性値を日常的な安全テレメトリーにするのか、一部のオープンモデル向け専門機能にとどめるのかを決める。

Lilithの判定

Goodfireはエージェントのエンジン内部に煙探知機を置き、異臭が出た時だけ高価な調査役を呼ぶ。エンジン交換後も働き、ただの蒸気で毎回鳴らなければ、本物の安全装置になる。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗ ↗