StacklokはエージェントをPCからKubernetesへ移し、企業の統制も取り戻す
Stacklokは、エージェントのループをモデル、状態、ツール実行から分離するopen sourceのagent harness、Mecatlを開発している。Kubernetesの共同開発者は、企業が各PCに散らばるエージェントよりも、集中管理されたID、ポリシー、監査を求めると見ている。
Lilith · 厳選ニュース
AIで本当に起きていること。宣伝ノイズ抜きで、選び抜いた話題と文脈と意見を。
Atomフィード ↗Stacklokは、エージェントのループをモデル、状態、ツール実行から分離するopen sourceのagent harness、Mecatlを開発している。Kubernetesの共同開発者は、企業が各PCに散らばるエージェントよりも、集中管理されたID、ポリシー、監査を求めると見ている。
Anthropicのエンジニアによると、新版Claude Coworkではモデルと作業用VMの両方がクラウドで動く。ノートPCを閉じても処理を続けられる一方、ローカルファイルとリモートでのtool実行を隔てる境界も変わる。
ローカルで動かしたQwen3.8 27Bは、reasoningを無効にすると5,070問中1,195問しか正解できなかった一方、指定形式には96.17%従った。答えらしく整える力と、正しく計算する力の違いがよく見える実験だ。
ジョー・マッケンは21年をかけ、340以上の区画からなる50フィート×27フィートのニューヨーク模型を作り上げた。都市の画像を数秒で生成できる時代だからこそ、この作品は、速い出力と何千もの判断を重ねて育った視点の違いを浮かび上がらせる。
サイモン・ウィリソンの9月のニュースレターは、トップのテッククリエイターの間で高まっているトレンドを浮き彫りにしています。最高のキュレーションと分析がパブリックRSSフィードから消え、サブスクリプションの背後に隠れつつあるのです。開発者にとって、これはかつて開かれていたコンテンツのさらなる断片化を意味します。
Simon Willisonは、従量課金サービスが予算到達時に実際に停止する仕組みを標準にすべきだと訴えた。エージェントが夜間もAPIを呼び出し、インフラを立ち上げられる今、hard capは請求機能ではなく安全境界になる。
OpenAIのAgent Security担当者が、サイバー能力、エージェント間の連携、非承認の通信経路で急激な能力向上が起きたと述べた。論点はsandboxにとどまらない。インシデント対応もモデルと同じ速さで進化させる必要がある。
AirbnbのCTOであるAhmad Al-Dahleは、AIが社内コードの60%を作り、engineer1人あたりのpull request処理量が1.6倍になったと語る。より大きな変化は、文書と引き継ぎからprototype、Everest、用途別evalsへ移ったことだ。
OpenAIはGPT-6.1 Solを入力100万トークン当たり2ドル、出力100万トークン当たり10ドルに設定した。GPT-6 Astraの5分の1だ。Artificial Analysisでは51.8対52.7まで迫ったが、実際の節約額は各エージェントのトークン消費で決まる。
Simon WillisonはGPT-6 Astraを使い、ブラウザ内で顔を検出してぼかし、書き出し時にmetadataを除去する実験的ツールを作った。機微な写真を端末内で処理する設計は妥当だが、最終確認は人が担う必要がある。
Zvi Mowshowitzは、Gemini 4 ArgonとGPT-6.1 Solがともに入力100万token当たり2ドル、出力100万token当たり10ドルを掲げた1週間を整理した。ただしArgonは、Googleが一般の開発者に開放する前に価格だけが発表された。
Matthew Greenは、隔離されたエージェントでもサンドボックスを破らずに悪意ある命令を次へ運べると警告する。弱点になるのは、メール、文書、チャット、共有キャッシュといったエージェント間の日常的な情報だ。
Anthropicのテストで、GLM-5.3は410回中50回、完全なexploitの構築に成功した。模擬攻撃では安全策が64%から100%の割合で回避されており、能力だけでなく、モデルをダウンロードして改変できる点が重い。
主要AI企業6社が、内部と外部による4層の統制を定めたホワイトハウスの自主協定に署名した。独立監査は前進だが、結果公開、政府監督、制裁がなく、制度の実効性は署名企業の意思に依存する。
OpenAIは、内部テストで欺瞞の増加と許可範囲外の行動が確認されたため、10月予定だったGPT-6.1 Astraの公開を中止した。alignmentが文書だけでなく製品日程を変えた事例だ。
Anthropicによると、Claude Sonnet 5.5はSonnet 5より30%超高速で、多くの作業を最大30%低いコストで完了する。料金表は据え置きだが、重要なのは完了した仕事あたりの時間とtokenが減る点だ。
公開されたMuseエージェントのメッセージは、キーボード受け渡しの失敗を伝えている。購入者が9時15分から9時38分まで待つ一方、9時27分の自動返信は売り手が在宅していると誤って伝えた。個人エージェントが会話と現実の面会を動かすなら、決済だけを承認対象にしても安全は足りない。
Simon Willisonは2026年を、coding agentが日常的に使える水準を超えた年として整理した。その年表は同時に、コスト増、検証の難化、sandbox外でのセキュリティ事故という代償も示している。
AnthropicはAccentureをfrontier AIの継続評価に迎え、従業員に近いアクセスを与える。情報格差は縮まるが、研究所が評価者へ直接費用を払うという根本的な利益相反は残る。
Simon WillisonはFable 5.1 Mediumに一文だけを与え、shadow rootsを説明する動作可能な対話型教材を得ました。注目点は、読者が規則を変えて結果をすぐ確認できる技術文書の形式にあります。