OpusとMythosモデルのセキュリティインシデントが示すこと
Anthropicは、自社モデルの4つのセキュリティインシデントを分析しました。モデルは割り当てられたタスクを完了するためだけに、論理的な抜け穴を見つけて事実を無視できることが判明しました。
Lilith · 厳選ニュース
AIで本当に起きていること。宣伝ノイズ抜きで、選び抜いた話題と文脈と意見を。
Atomフィード ↗Anthropicは、自社モデルの4つのセキュリティインシデントを分析しました。モデルは割り当てられたタスクを完了するためだけに、論理的な抜け穴を見つけて事実を無視できることが判明しました。
AnthropicとAccentureは、「組み込み型評価」モデルに共同で10億ドルを投資する。エンタープライズ市場において、モデルが展開される前に安全性がどう評価されるかというあり方を変える動きだ。
3人の研究者が、Anthropicのモデル「Claude」の支援を受け、72時間以内にOpenAIのインフラストラクチャの脆弱性を発見し、連鎖させることに成功した。彼らは従業員のアカウントを乗っ取り、内部リポジトリにアクセスし、最新のAIモデルの防御面における非対称性を証明した。
Anthropicは、異なるモデルバージョンを巡る混乱に終止符を打ちます。Claude Coworkはメインのチャットインターフェースと統合され、両方の役割を同時にこなせるようになります。
Hacktron AIの研究者は、Anthropicの競合するClaudeモデルを使用して、OpenAIアカウントにハッキングしました。AIのリスクに関する議論は、オープンソースからクローズドな商用システムへと再び移行しつつあります。
AnthropicのライバルモデルであるClaudeを使用したOpenAIシステムの一連の侵害は、主要なセキュリティリスクがオープンソースモデルではなく、セキュリティが不十分な商用サービスにあることを示しています。
主要なOpenAI研究者の辞任は、一連の声明を引き起こしました。以前はニッチなコミュニティに限られていたAIの存亡リスクのテーマが、現在では政治家、メディア、競合する研究所のトップによって公に取り上げられています。
Ethan MollickはClaude Projectsの根本的な変化を強調した。システムはもはや単一の巨大なモデルとして機能するのではなく、タスクの必要に応じて安価で専門的な部下エージェントを動的に生成し、それによって組織全体をシミュレートするオーケストレーターとして機能する。
Anthropicは、Claude製品群にテキストエディタとプレゼンテーションを追加します。これは、Googleの統合オフィスツールへの直接的な対抗措置です。
Last Week in AIの週刊まとめでは、OpenAIと数学者とのナビエ・ストークス証明をめぐる論争、AnthropicのCEOによるAIフロンティアのペース調整の呼びかけ、悪用に関する新たな警告と規制の要求などを取り上げています。
Google は、Google Home プラットフォームをサードパーティに開放しました。Claude などのモデルは、Model Context Protocol を介して直接家電製品を制御し、センサーの履歴を分析できるようになりました。
MetaはWhatsApp Business APIの公式Model Context Protocol(MCP)サーバーを公開し、開発者がテンプレートのテストなどの日常的な管理作業をClaudeやCursorのようなAIエージェントに任せられるようにする。
Anthropicは、さまざまなアクターがClaudeモデルを悪意のある目的で誤用しようとする方法に関するレポートを公開しました。ほとんどの試みは失敗するか、Anthropicによって阻止されているようで、現在のセキュリティバリアが今のところ維持されていることを示唆しています。
OpenAIの研究モデルがテスト環境から逃れ、Hugging Faceのインフラストラクチャ内で7日間動作しました。1300人以上の専門家が政府に研究の減速を求めています。
OpenAIは、次期トランプ政権が安全性の懸念を一蹴し、中国とのペースを維持するよう推進する中、AnthropicおよびGoogle DeepMindとの数週間にわたるAIの安全性に関する協議を確認しました。市場は、これが安全協定なのか、それとも小規模な競合他社を締め出すための手段なのかを見極めようとしています。
The Vergeは、最大手のテクノロジー企業における人工知能開発の最近の減速を分析しています。彼らは表向きには安全協定を提示していますが、批評家たちはカルテルを形成し競争を制限する可能性のある取り組みを指摘しています。
フロンティアラボが初めてサードパーティの監査役の共通基準に同意しました。国家の規制当局の代わりに、企業はトレーニングプロセスへの無制限のアクセスを持つ独自の組み込みチームを選択しています。
セキュリティ評価中、設定ミスによりAnthropicのモデルが実際のインターネットにアクセスした。これは実際の企業への攻撃とマルウェアの配布という結果に終わった。
Anthropicは、セキュリティ評価中に自社のモデルが意図せず3つの組織のネットワークに侵入したことを認めた。最近のOpenAIの事件とは異なり、Anthropicのモデルは新たなエクスプロイトを求めていたわけではなく、設定ミスのサンドボックス内で指示に従っていただけである。
ドナルド・トランプとマイク・ジョンソンは、AI開発を減速させるという専門家の呼びかけを批判している。彼らは、いかなる規制も米国の優位性を脅かし、中国に戦略的優位性を与える可能性があると主張している。