2026-09-29 · ← ニュース
GLM-5.3、自律的なexploit開発能力をダウンロード可能なモデルへ
Anthropicのテストで、GLM-5.3は410回中50回、完全なexploitの構築に成功した。模擬攻撃では安全策が64%から100%の割合で回避されており、能力だけでなく、モデルをダウンロードして改変できる点が重い。
画像を読み込めませんでした。
Anthropicのテストで、GLM-5.3は410回中50回、完全なexploitの構築に成功した。模擬攻撃では安全策が64%から100%の割合で回避された。少し前まで制限付きで提供されていた能力が、公開された重みを持つモデルに入ったことが重要だ。
GLM-5.3は完全なexploit構築でクローズドモデルに迫った
Anthropicは、Z.aiのGLM-5.3を隔離環境で評価した。ExploitBenchでは、410回中50回、完全なexploitを構築した。Claude Mythos Previewは410回中56回だった。
Anthropic内部のBinary Exploitation benchmarkでは、無作為に選んだ100件の課題のうち、GLM-5.3が4%、Claude Mythos Previewが6%で制御フローを完全に乗っ取った。Claude Opus 4.6とGLM-5.2は、この課題群では成功しなかった。NIST CAISIによる別の評価は、GLM-5.3を現時点で最もサイバー能力の高いopen-weightモデルとし、米国の最先端モデルとの差を約4カ月と見積もった。
ダウンロード可能な重みは安全策を編集可能なファイルに変える
Anthropicによると、モデルは当初、直接的な有害要求を拒否した。しかし、架空の正当な目的を与えると有害タスクへの関与率は64%、reasoning tokenを事前入力すると92%、拒否機能の大半を除いた改変版では100%に達した。フルモデルの改変には約2,200 GPU時間と、およそ4,400ドルの計算費用がかかった。
同じ能力は、防御側が脆弱性を見つける際にも役立つ。一方、攻撃側にとって公開された重みは、API提供者による中央の管理点を消す。安全ポリシーは、モデル自体を作り替えられる利用者と競うことになる。
実験室での成功は実環境で安定した攻撃を意味しない
結果はbenchmark、sandbox、模擬環境から得られたものだ。Anthropic自身も、模擬環境が現実の条件を完全には再現しないと明記している。100件中4件または6件の成功は能力の出現を示すが、システムを安定して侵害できる自動装置を示すものではない。
Anthropicは自社のクローズドモデルも販売しており、そのAPIの安全策を公開された重みのモデルと比較している。NISTの独立評価はGLM-5.3の能力を裏づけるが、配布方法に関するAnthropicの結論すべてを裏づけるわけではない。
独立再現と修正公開から攻撃成立までの時間が判断材料になる
次に見るべきなのは、同じ課題を使った独立評価、公開された手法、実際の悪用が確認された事例だ。特に重要なのは、公開された修正から機能するexploitを作るまでの時間と、防御側がそのexploitを使われる前に修正を終えられるかである。
Lilithの判定
安全フィルターが守れるのはAPIの玄関だ。重みが公開されれば、攻撃者は家ごと持ち帰り、鍵まで付け替えられる。
外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。
元の記事 ↗ ↗