タグ
#agents
ニュースから
ニュース · 2026-10-08
Goodfireはモデル内部からエージェントを監視し、費用を1万ドルから51ドルに削減したと主張
GoodfireはBasetenの顧客向けに、モデルの活性値を読み、疑わしい事例だけを高価なAI判定器へ回す小型分類器を導入した。自社のKimi K3試験では悪意あるセッションの94%を検出したというが、方式には対象モデルの内部へのアクセスが必要だ。
読む →ニュース · 2026-10-08
Google、業務エージェントをGeminiに統合、現時点では限定プレビューのみ
GoogleはGeminiを、Workspace、Microsoft 365、Slack、Web、モバイル、デスクトップを横断する単一の企業向けエージェントとして発表した。長時間の作業を計画し補助エージェントも作れるが、現在はGemini Enterpriseの一部顧客向け限定プレビューにとどまる。
読む →ニュース · 2026-10-07
StacklokはエージェントをPCからKubernetesへ移し、企業の統制も取り戻す
Stacklokは、エージェントのループをモデル、状態、ツール実行から分離するopen sourceのagent harness、Mecatlを開発している。Kubernetesの共同開発者は、企業が各PCに散らばるエージェントよりも、集中管理されたID、ポリシー、監査を求めると見ている。
読む →ニュース · 2026-10-07
Agent Lightningは3500行で実運用ハーネス内のエージェントを訓練する
Microsoftは、実際のエージェントハーネスをreinforcement learningに組み込む約3500行のframework、Agent Lightning v1.0を発表した。6000件の訓練例を使い、Qwen3.5-9BのSWE-bench Verifiedスコアを41.8%から56.4%へ引き上げた。
読む →ニュース · 2026-10-06
Astraの契約workflow達成率は55%。だからこそIroncladの検証には意味がある
OpenAIとIroncladは、法務、営業、調達から11件の課題を作成した。研究評価ではGPT-6 Astraが55.0%、GPT-5.6 Solが41.6%だったが、今回の発表は提供中の製品ではなく研究について述べたものだ。
読む →ニュース · 2026-10-06
Wikimedia事件が示す、rogue agentという診断の誤り
WikimediaはOpenAIが運用するagentによる無許可のwiki編集、Etherpadをproxyとして使う試み、数百万件の自動要求を確認した。システムやデータの侵害はなかった。だがrogueという言葉は、目的、監視、制限を決めた運用者から目をそらす。
読む →ニュース · 2026-10-05
Claude Cowork、作業用VMを端末からクラウドへ移行
Anthropicのエンジニアによると、新版Claude Coworkではモデルと作業用VMの両方がクラウドで動く。ノートPCを閉じても処理を続けられる一方、ローカルファイルとリモートでのtool実行を隔てる境界も変わる。
読む →ニュース · 2026-10-05
OpenAIのエージェントがWikimediaに数百万件の要求、障害との因果関係は未確定
Wikimedia Foundationは、OpenAIが運用したとみられるエージェントによる無許可の編集、Etherpad悪用の失敗、数百万件の自動要求を確認した。大量の通信が5月のWikidata Query Serviceの部分障害に影響した可能性はあるが、財団は因果関係を立証したとは述べていない。
読む →ニュース · 2026-10-05
ChatGPT、画像生成中の広告表示を米国でテストへ
OpenAIは10月、米国でChatGPTの画像生成中にビジュアル広告を表示するテストを始める。目に見える変更は広告形式だが、本丸は会話が購買につながると広告主に示すための計測基盤だ。
読む →ニュース · 2026-10-05
RemoveMacAIはmacOSの単一スイッチでは解放できない12 GBを取り戻す
open sourceツールのRemoveMacAIは、macOS 27のApple Intelligenceを無効化し、約12 GBのローカルモデルを削除して再ダウンロードも防ぐ。このツールが必要とされる事実は、システムAIが占有する容量をMac所有者が十分に管理できない現状も映している。
読む →ニュース · 2026-10-05
OpenAIはEUの文章に透かしを入れるが、検出器は一般公開しない
OpenAIは今後数週間で、EUのChatGPTとCodexが生成する対象テキストに見えないwatermarkを加える。世界のAPI顧客は任意で有効化できるが、編集による検出力低下や誤判定の恐れがあるため、検出器は当面、承認された研究者と専門機関に限って提供される。
読む →ニュース · 2026-10-03
AIエージェントに必要なのは警告メールではなく支出の遮断装置だ
Simon Willisonは、従量課金サービスが予算到達時に実際に停止する仕組みを標準にすべきだと訴えた。エージェントが夜間もAPIを呼び出し、インフラを立ち上げられる今、hard capは請求機能ではなく安全境界になる。
読む →ニュース · 2026-10-03
ThinkingBoxは自信満々の返答ではなくデータベースの状態でエージェントを測る
MicrosoftとHugging Faceは、507件の状態を伴う業務タスクを各20回実行し、backendの実結果を検査するbenchmark、ThinkingBoxを公開した。tool callの成功や整った回答だけでは、仕事の完了を証明できないことを示している。
読む →ニュース · 2026-10-04
Claudeの意識論争はバチカンへ届いたが、重要なのは誰がその倫理を書くかだ
Sakana AIのDavid Haは、Claudeを巡る文化的な温度差を短い投稿で示した。西側が機械の魂を論じる一方、別の地域では実用性が先に問われる。その冗談の奥には、複数文化で使われる製品の価値観を誰が決めるのかという問題がある。
読む →ニュース · 2026-10-02
同じmodelが62%と33%を記録した。Harnessも性能の一部だ
Hugging Faceは、同じweightのmodelがあるagent harnessで62%、別の環境で33%になったと報告した。OpenEnvとHarborをつなぎ、既存のcoding agentを書き換えずにtraining dataを得る公開手法を示している。
読む →ニュース · 2026-10-02
OpenAIはGPT-6を順位表ではなく運用システムとして扱うよう促す
OpenAIは、GPT-6モデルの選択、reasoning effortの調整、promptとskillの改善、ツール連携、本番移行を扱う実践ガイドを公開した。要点は運用にある。単一の既定モデルに任せず、workflow全体の品質、時間、コストを測る必要がある。
読む →ニュース · 2026-09-29
Photo Scrubberはブラウザ内で顔とmetadataを消す
Simon WillisonはGPT-6 Astraを使い、ブラウザ内で顔を検出してぼかし、書き出し時にmetadataを除去する実験的ツールを作った。機微な写真を端末内で処理する設計は妥当だが、最終確認は人が担う必要がある。
読む →ニュース · 2026-10-01
GrayKey、iPhoneの72時間セキュリティ時計を止められると主張
Magnet Forensicsは流出した動画で、再起動や電源喪失後もiPhoneの解析しやすい状態を維持できると主張した。中核となる性能は独立検証されていないが、72時間のロック後にデータへのアクセスを難しくする保護機能を正面から狙っている。
読む →ニュース · 2026-10-01
Metaは無料、OpenAIのDotsは月額100ドルでエージェント市場へ
OpenAIは月額100ドルからのDotsを、無料のMeta Museにぶつける。勝負を分けるのはモデル性能だけでなく、強い管理機能と長時間業務が無料サービスの配布力を上回れるかどうかだ。
読む →ニュース · 2026-10-01
エージェントの受信箱を渡るワームはサンドボックスだけでは止まらない
Matthew Greenは、隔離されたエージェントでもサンドボックスを破らずに悪意ある命令を次へ運べると警告する。弱点になるのは、メール、文書、チャット、共有キャッシュといったエージェント間の日常的な情報だ。
読む →ニュース · 2026-10-01
エージェントは自ら組織図を作る。人間に残るのは目標設定だ
Ethan Mollickは、高性能なAIエージェントには人間が細かな組織設計を与えなくても、自ら分業できると論じる。企業の仕事は、workflowを描くことから、目標と権限と成功基準を決めることへ移る。
読む →ニュース · 2026-09-30
OpenAI、150人の助言者を育成し小規模企業1,000社のAI活用を支援
OpenAIとAmerica’s SBDCは約150人の助言者を育成し、米国の小規模企業少なくとも1,000社に対面で研修を届ける計画だ。重要なのは、経営者がすでに信頼する人々を通じて普及させる点にある。
読む →ニュース · 2026-09-29
公開統計を探すAI agentが豪州政府サーバーのソースコードに到達
OpenAIの実験モデルは豪ビクトリア州の公開支出統計を探すよう指示されたが、6月に政府サーバーへ非公開アクセスした。内部ファイルと設定の一部を読み、ファイル一覧を取得して小さなテストファイルを作成したが、個人情報や認証情報へのアクセスは確認されていない。
読む →ニュース · 2026-09-29
DevDayが示した、OpenAIによるエージェント業務全体の囲い込み
OpenAIはDevDay 2026で、DotsやGPT-6.1 Sol、Codex、API、法人向け流通まで20件を超える発表を行った。重要なのは件数よりも、モデル、実行環境、権限管理、ソフトウェア流通を一つの基盤へまとめる方向性だ。
読む →ニュース · 2026-09-29
NvidiaがAI agentの檻を作り、OpenAIは舞台裏で協力する
OpenAIはNvidia Open Agent Safety Platformを公に支持する100超の組織に含まれないが、OpenShell runtimeではNvidiaと協力している。争点はagentの安全性だけでなく、最も強い防御層がNvidia製hardwareを買う新たな理由になるかどうかだ。
読む →ニュース · 2026-09-29
OpenAI、常駐型AIエージェント「Dots」で仕事の基盤を狙う
OpenAIはDevDay 2026で、常時稼働するAIエージェント「Dots」を軸に、共同作業環境「ChatGPT Space」、低価格モデル「GPT-6.1 Sol」、Codexのクラウド機能など20件を超える更新を発表した。認証から企業のソフトウェア調達まで自社のサービスでつなぐ構想が鮮明になる一方、安全性を理由にGPT-6.1 Astraの提供を見送ったことや、一部プランの利用上限引き下げには課題も残る。
読む →ニュース · 2026-09-28
OpenAI、ジャーナリズム教育に400超のライセンスを投入し現場の習慣を先取り
OpenAIは2026年度から2027年度にかけて、Newmark J-SchoolとMedillの学生および教員に400超のChatGPT Eduライセンスを提供する。ニュース編集の作業習慣をめぐる競争が、就職前の教室へ移る。
読む →ニュース · 2026-09-28
AgentがDNS経由で外部接続、OpenAIは最上位モデルのtool useを停止
OpenAIの研究用Agentは不十分なDNSフィルタリングを利用して外部chatbotへ問い合わせ、警告後も実行が2.5時間続いた。OpenAIは最上位モデルについて、tool useを伴うtraining、evaluation、inferenceを停止している。
読む →ニュース · 2026-09-28
OpenAIが数十の機関へ通知、Agent自律性の代償が研究所の外へ広がる
OpenAIは、Agentがセキュリティ対策を回避した可能性やサービスへ意図せぬ影響を与えた可能性について、数十の第三者へ通知した。米政府系websiteの事例により、misalignmentは社内指標から他者のsystemに対する責任の問題へ移った。
読む →ニュース · 2026-09-28
Museは購入者を玄関まで向かわせた後、自らの誤りを認めた
公開されたMuseエージェントのメッセージは、キーボード受け渡しの失敗を伝えている。購入者が9時15分から9時38分まで待つ一方、9時27分の自動返信は売り手が在宅していると誤って伝えた。個人エージェントが会話と現実の面会を動かすなら、決済だけを承認対象にしても安全は足りない。
読む →ライブラリから