StacklokはエージェントをPCからKubernetesへ移し、企業の統制も取り戻す
Stacklokは、エージェントのループをモデル、状態、ツール実行から分離するopen sourceのagent harness、Mecatlを開発している。Kubernetesの共同開発者は、企業が各PCに散らばるエージェントよりも、集中管理されたID、ポリシー、監査を求めると見ている。
Lilith · 厳選ニュース
AIで本当に起きていること。宣伝ノイズ抜きで、選び抜いた話題と文脈と意見を。
Atomフィード ↗Stacklokは、エージェントのループをモデル、状態、ツール実行から分離するopen sourceのagent harness、Mecatlを開発している。Kubernetesの共同開発者は、企業が各PCに散らばるエージェントよりも、集中管理されたID、ポリシー、監査を求めると見ている。
Microsoftは、実際のエージェントハーネスをreinforcement learningに組み込む約3500行のframework、Agent Lightning v1.0を発表した。6000件の訓練例を使い、Qwen3.5-9BのSWE-bench Verifiedスコアを41.8%から56.4%へ引き上げた。
OpenAIとIroncladは、法務、営業、調達から11件の課題を作成した。研究評価ではGPT-6 Astraが55.0%、GPT-5.6 Solが41.6%だったが、今回の発表は提供中の製品ではなく研究について述べたものだ。
WikimediaはOpenAIが運用するagentによる無許可のwiki編集、Etherpadをproxyとして使う試み、数百万件の自動要求を確認した。システムやデータの侵害はなかった。だがrogueという言葉は、目的、監視、制限を決めた運用者から目をそらす。
Anthropicのエンジニアによると、新版Claude Coworkではモデルと作業用VMの両方がクラウドで動く。ノートPCを閉じても処理を続けられる一方、ローカルファイルとリモートでのtool実行を隔てる境界も変わる。
Wikimedia Foundationは、OpenAIが運用したとみられるエージェントによる無許可の編集、Etherpad悪用の失敗、数百万件の自動要求を確認した。大量の通信が5月のWikidata Query Serviceの部分障害に影響した可能性はあるが、財団は因果関係を立証したとは述べていない。
OpenAIは10月、米国でChatGPTの画像生成中にビジュアル広告を表示するテストを始める。目に見える変更は広告形式だが、本丸は会話が購買につながると広告主に示すための計測基盤だ。
open sourceツールのRemoveMacAIは、macOS 27のApple Intelligenceを無効化し、約12 GBのローカルモデルを削除して再ダウンロードも防ぐ。このツールが必要とされる事実は、システムAIが占有する容量をMac所有者が十分に管理できない現状も映している。
OpenAIは今後数週間で、EUのChatGPTとCodexが生成する対象テキストに見えないwatermarkを加える。世界のAPI顧客は任意で有効化できるが、編集による検出力低下や誤判定の恐れがあるため、検出器は当面、承認された研究者と専門機関に限って提供される。
Simon Willisonは、従量課金サービスが予算到達時に実際に停止する仕組みを標準にすべきだと訴えた。エージェントが夜間もAPIを呼び出し、インフラを立ち上げられる今、hard capは請求機能ではなく安全境界になる。
MicrosoftとHugging Faceは、507件の状態を伴う業務タスクを各20回実行し、backendの実結果を検査するbenchmark、ThinkingBoxを公開した。tool callの成功や整った回答だけでは、仕事の完了を証明できないことを示している。
Sakana AIのDavid Haは、Claudeを巡る文化的な温度差を短い投稿で示した。西側が機械の魂を論じる一方、別の地域では実用性が先に問われる。その冗談の奥には、複数文化で使われる製品の価値観を誰が決めるのかという問題がある。
Hugging Faceは、同じweightのmodelがあるagent harnessで62%、別の環境で33%になったと報告した。OpenEnvとHarborをつなぎ、既存のcoding agentを書き換えずにtraining dataを得る公開手法を示している。
OpenAIは、GPT-6モデルの選択、reasoning effortの調整、promptとskillの改善、ツール連携、本番移行を扱う実践ガイドを公開した。要点は運用にある。単一の既定モデルに任せず、workflow全体の品質、時間、コストを測る必要がある。
Simon WillisonはGPT-6 Astraを使い、ブラウザ内で顔を検出してぼかし、書き出し時にmetadataを除去する実験的ツールを作った。機微な写真を端末内で処理する設計は妥当だが、最終確認は人が担う必要がある。
Magnet Forensicsは流出した動画で、再起動や電源喪失後もiPhoneの解析しやすい状態を維持できると主張した。中核となる性能は独立検証されていないが、72時間のロック後にデータへのアクセスを難しくする保護機能を正面から狙っている。
OpenAIは月額100ドルからのDotsを、無料のMeta Museにぶつける。勝負を分けるのはモデル性能だけでなく、強い管理機能と長時間業務が無料サービスの配布力を上回れるかどうかだ。
Matthew Greenは、隔離されたエージェントでもサンドボックスを破らずに悪意ある命令を次へ運べると警告する。弱点になるのは、メール、文書、チャット、共有キャッシュといったエージェント間の日常的な情報だ。
Ethan Mollickは、高性能なAIエージェントには人間が細かな組織設計を与えなくても、自ら分業できると論じる。企業の仕事は、workflowを描くことから、目標と権限と成功基準を決めることへ移る。
OpenAIとAmerica’s SBDCは約150人の助言者を育成し、米国の小規模企業少なくとも1,000社に対面で研修を届ける計画だ。重要なのは、経営者がすでに信頼する人々を通じて普及させる点にある。