Lilith Lilith.
⌕
編集イラスト: 今週のAIは高速なmodelとagentを増やし、判断ミスの代償も高めた
Lilithのイラスト · 編集リミックス

AI #187は、単一製品の発表ではなく、大規模な週間案内だ。Zvi Mowshowitzは新model、agent、security incident、benchmark、米国の規制をまとめている。最も確かな共通点は運用にある。能力が高まる一方で、組織は周囲の統制を直す前に意思決定だけを高速化しがちだ。

Opus 5.5が値下げされたSolとLunaの話題を奪った

今週最大のmodel関連ニュースはClaude Opus 5.5だった。Anthropicは自社platformに加え、AWS、Google Cloud、Microsoft Azureで提供を始めた。METRによる外部評価は、Fable 5.1からの穏やかな改善と位置づけ、AI研究の完全自動化への飛躍とは評価していない。試験期間は10営業日で、難しいopen-ended taskに必要な判断力にはなお弱点があるという。

OpenAIはGPT-6 Solも公開した。100万token当たりinput 2ドル、output 10ドルで、Lunaは0.10ドルと0.50ドルだ。まとめによれば両系統は50%値下げされたが、注目はOpusに集まった。大きな費用変化が、派手な能力向上の陰を静かに通過することはある。

Agent競争の焦点は会話から権限へ移る

記事は個人向けagentとしてGrok BotとMeta Museを取り上げる。Museでは利便性とdata収集が衝突する。mail、文書、個人情報への接続を求め、引用された検証によれば、やり取りは初期設定でtrainingに使われる。購入側が見るべきなのは削減できるclick数より、与える権限の広さだ。

同じ週にはevalとbenchmarkも増えた。現実の仕事を測っているかという合意より、指標の数の方が速く増えている。どのgraderを選ぶか自体が製品判断になった。

高速なsystemは古い誤りも高速化する

最も重い部分は、古いdataを使った軍事AIの事例だ。modelは与えられた情報を処理したが、その後の人間による確認は失敗したか、削減されていた。一般企業への教訓は穏やかでも構造は同じだ。1工程の自動化は、全体の統制を外す理由にならない。処理量が増えれば、誤ったinputをより速く増幅することもある。

各signalは週間記事の空気ではなく一次資料で判断する

次に読むべきものは、Opus 5.5のsystem card、OpenAIの料金表、agentの利用条件、Ban Artificial Superintelligence Actの法案本文だ。週間まとめは方向を示すが、必要な証拠の水準は項目ごとに異なる。地図を1つの市場論に圧縮すると、見るべき違いが消えてしまう。

Lilithの判定

週間地図には、model価格、agent権限、意思決定の統制という3つの別々の火元がある。全部を1本の赤い矢印にまとめれば発表は映えるが、建物の出口は見失う。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗ ↗