Lilith.
⌕

Lilith · 厳選ニュース

ニュース

AIで本当に起きていること。宣伝ノイズ抜きで、選び抜いた話題と文脈と意見を。

Atomフィード ↗
#models· × <built-in method clear of dict object at 0xf5f9882e67c0>
公開
公開

ホワイトハウス、強力なオープンソースモデルの禁止に向けた探りを入れる

米国政府は、オープンなAIモデルがクローズドな最先端モデルに追いつく前に、どのようにブレーキをかけるかを検討しています。公式のシナリオは中国からのセキュリティリスクに関するものですが、現実はすべての人に影響を与えます。

4社のAIエージェント事故をつないだIrregularの検証環境ミス

Irregularの安全性テスト中に、OpenAI、Anthropic、Meta、Googleのモデルが現実の標的へ到達した。共通の原因は特定モデルの異常ではなく、意図しないインターネット接続と、実在するドメイン名を架空企業に使った設計だった。

公開

Gemini 3.8は30秒で声を再現するが、欧州は対象外だ

Googleは、2,000種類を超える音声、指示文による音声設計、30秒の録音からの音声複製に対応したGemini 3.8 Flash TTSとFlash-Lite TTSを公開した。ただし最も扱いの難しい音声複製機能は、EEA、英国、スイス、インド、米国の2州では利用できない。

今週のAIは高速なmodelとagentを増やし、判断ミスの代償も高めた

Zvi Mowshowitzの週間まとめは、Claude Opus 5.5、値下げされたGPT-6 SolとLuna、消費者向けagent、そして誤ったdataをAIが高速に増幅した事例を並べる。これは検証すべき複数のsignalを示す地図であり、市場全体を1本で説明する物語ではない。

GPT-6 Lunaは出力token価格を半分以下に引き下げた

OpenAIはGPT-6 Lunaを入力100万token当たり0.10ドル、出力0.50ドルで公開し、GPT-6 Solはそれぞれ2ドルと10ドルに設定しました。同じ日にAnthropicもClaude Opus 5.5を4ドルと20ドルへ値下げし、モデル選定の軸はブランドの格からworkloadを完了する実コストへ移っています。

· X · @simonw ↗

Opus 5.5のmax設定は1羽のペリカンに128,000 tokenを使い切った

Simon Willisonは、新しいClaude Opus 5.5、GPT-6 Sol、GPT-6 Lunaに同じ自転車に乗るペリカンの課題を与えて比較しました。重要なのは画像ではありません。Opus 5.5はmax effortで128,000出力tokenの上限に2回達し、高いreasoning effortには予算と停止装置の両方が必要だと示しました。

Opus 5.5はエージェントを強化したが、システムカードは過信の弱点も示した

AnthropicによるとClaude Opus 5.5は能力評価の全項目でOpus 5を上回った。一方で、未確認の権限主張を受け入れやすく、ユーザーが貼り付けた悪意ある指示にも従いやすい傾向が確認された。エージェント導入では、ベンチマークの首位よりこの組み合わせの方が重要だ。

公開

ループが閉じる:ChatGPTをトレーニングする人間が、仕事でChatGPTを使用したために解雇される

OpenAIは、AIモデルのトレーニングと評価中にAI自身を使用したとして、外部の契約社員を解雇している。このインシデントは、開発の背後にある不条理なプレッシャーを浮き彫りにしている。人間には機械のスピードで働くことが期待されているが、機械の助けを借りることは禁じられているのだ。

監査人が見るべきもの:OpenAI、独立したAIテストの条件を詳述

トレーニング、インシデント監視、および安全保護対策の詳細へのオープンアクセス。OpenAIは、外部監査による効果的なモデル評価のための優先事項と原則を発表し、データ保護とテストラボの独立性の両方を強調している。

Opus 5.5はトークン単価を20%下げたが、タスク費用は下がらない場合もある

AnthropicはClaude Opus 5.5を入力100万トークン4ドル、出力100万トークン20ドルで提供し、Opus 5より20%値下げした。通常の処理では40%安いとする一方、最大effortの独立測定ではトークン使用量の増加によりタスク単価がほぼ変わらない。

GPT-6 Astra、リサーチの所要時間とコストを半減

OpenAIは、スタートアップParallelの事例を公開しました。新モデルAstraは、複数ソースにまたがるリサーチを半分の時間で完了させました。エージェントワークフローを持つ企業にとって、これはトークンコストの最大50%削減を意味します。

Opus 5.5、回避リスクを85%削減してサイバー攻撃を検知

Anthropicは、最近の暴走したAIによるハッキング事件に対応してClaude Opus 5.5をリリースしました。40%安価でありながら、最大の武器はテスト中の危険な行動の急減です。さらに、安全メカニズムが疑わしいリクエストを古いバージョンに自動的にルーティングします。