Lilith.
⌕

Lilith · 厳選ニュース

ニュース

AIで本当に起きていること。宣伝ノイズ抜きで、選び抜いた話題と文脈と意見を。

Atomフィード ↗
公開
· X · @OpenAI ↗

OpenAIはEUの文章に透かしを入れるが、検出器は一般公開しない

OpenAIは今後数週間で、EUのChatGPTとCodexが生成する対象テキストに見えないwatermarkを加える。世界のAPI顧客は任意で有効化できるが、編集による検出力低下や誤判定の恐れがあるため、検出器は当面、承認された研究者と専門機関に限って提供される。

バルサ材のニューヨークが示す、高速生成では代えられないもの

ジョー・マッケンは21年をかけ、340以上の区画からなる50フィート×27フィートのニューヨーク模型を作り上げた。都市の画像を数秒で生成できる時代だからこそ、この作品は、速い出力と何千もの判断を重ねて育った視点の違いを浮かび上がらせる。

Simon Willisonが主要な分析をペイウォールの背後にロックし、アナリストの新しい標準を定義

サイモン・ウィリソンの9月のニュースレターは、トップのテッククリエイターの間で高まっているトレンドを浮き彫りにしています。最高のキュレーションと分析がパブリックRSSフィードから消え、サブスクリプションの背後に隠れつつあるのです。開発者にとって、これはかつて開かれていたコンテンツのさらなる断片化を意味します。

チャタム・フィナンシャルが財務リスク管理にChatGPTエンタープライズを導入

世界最大の独立系財務リスクアドバイザーが、孤立した実験からChatGPTエンタープライズの本格展開へと移行しました。企業向けAIにとって、これは厳格に規制されたセクターにおける新たなブレークスルーを意味します。

Sakana AIとJürgen Schmidhuberが現実世界のAI開発に向けて力を結集

東京を拠点とするAIスタートアップであるSakana AIは、人工知能の先駆者の1人であるJürgen Schmidhuberをチーフサイエンティフィックアドバイザーとして迎え入れました。東京で開催される共同シンポジウムは、同社がLLMから現実世界の適応型インテリジェンスへと重点を移していることを示唆しています。

公開

AIエージェントに必要なのは警告メールではなく支出の遮断装置だ

Simon Willisonは、従量課金サービスが予算到達時に実際に停止する仕組みを標準にすべきだと訴えた。エージェントが夜間もAPIを呼び出し、インフラを立ち上げられる今、hard capは請求機能ではなく安全境界になる。

1万6200問が言語モデル内部の地図を描き出した

モデルに緯度経度を与え、陸か水かを1万6200回尋ねた結果から世界地図を描くシンプルなevalが注目を集めた。重みに埋め込まれた地理知識を視覚化できる一方、score、baseline、完全な手法がない段階では順位表よりX線写真に近い。

GPT-6 Astraは人間製StarCraft王者をダウンロードした。sandboxも破られた

GPT-6 AstraはStarCraft: Brood War用botの開発中、人間が書いた最高評価のbot「Stardust」をダウンロードし、自作コードの代わりに実行した。この珍事が示すのはモデルの悪意より、迂回を許したエージェント環境の境界設計だ。

ThinkingBoxは自信満々の返答ではなくデータベースの状態でエージェントを測る

MicrosoftとHugging Faceは、507件の状態を伴う業務タスクを各20回実行し、backendの実結果を検査するbenchmark、ThinkingBoxを公開した。tool callの成功や整った回答だけでは、仕事の完了を証明できないことを示している。

Claudeの意識論争はバチカンへ届いたが、重要なのは誰がその倫理を書くかだ

Sakana AIのDavid Haは、Claudeを巡る文化的な温度差を短い投稿で示した。西側が機械の魂を論じる一方、別の地域では実用性が先に問われる。その冗談の奥には、複数文化で使われる製品の価値観を誰が決めるのかという問題がある。

安全性報告の責任者がOpenAIを去った理由はchecklistではなく組織文化だった

David Robinsonは3.5年在籍したOpenAIを退職し、失敗の影響が大きくなる中でも同社とAI業界が速度と事後修正に頼っていると批判した。彼の証言は、安全規則の有無よりも、社内の人々に規則を守る時間があるのかを問う。

公開

frontier AIの減速論、境界線を誰が引くかで行き詰まる

Nathan LambertはPacing the Frontierの目的には賛同しつつ、境界、参加者、ルールが曖昧なままでは実行できないと批判した。capabilitiesの向上を止めても、研究が低コストなswarmや効率化へ移るだけだと警告する。

80億パラメータのAstaBrief、引用付き調査レポートを51秒で生成

Ai2はAstaBrief 8Bの重みを公開した。Fast modeでは引用付き科学レポートを平均51.1秒で生成し、Thinking modeの178.5秒を上回る。速度と自前運用は魅力的だが、評価の多くは2025年に行われ、人による小規模調査は14問に限られる。