Lilith.
⌕

ニュースから

ニュース · 2026-10-02

OpenAIはGPT-6を順位表ではなく運用システムとして扱うよう促す

OpenAIは、GPT-6モデルの選択、reasoning effortの調整、promptとskillの改善、ツール連携、本番移行を扱う実践ガイドを公開した。要点は運用にある。単一の既定モデルに任せず、workflow全体の品質、時間、コストを測る必要がある。

読む →

ニュース · 2026-09-30

OpenAI、モデルの秘匿推論を抽出した1万5000ユーザー規模のネットワークを遮断

OpenAIは、1万5000人を超えるユーザー群がモデルの保護された推論を抽出しようとした組織的な活動を公表した。活動の中核はMoonshot AI関係者に結び付けられているが、同社自身も帰属判断の範囲を限定している。

読む →

ニュース · 2026-09-22

Opus 5.5のmax設定は1羽のペリカンに128,000 tokenを使い切った

Simon Willisonは、新しいClaude Opus 5.5、GPT-6 Sol、GPT-6 Lunaに同じ自転車に乗るペリカンの課題を与えて比較しました。重要なのは画像ではありません。Opus 5.5はmax effortで128,000出力tokenの上限に2回達し、高いreasoning effortには予算と停止装置の両方が必要だと示しました。

読む →

ニュース · 2026-09-15

Salesforce、Nvidiaをベースにエンタープライズの仕事を奪うAIモデルを構築

Nvidiaのオープンウェイトアーキテクチャで構築された新しいKoaモデルは、フロンティアAIラボからのエンタープライズの離脱を浮き彫りにしています。日常業務のために、企業はもはや数百万ドルをかけて機密データをクローズドなモデルに送信したくありません。

読む →

ニュース · 2026-09-09

GPT-6 AstraがついにビジネスロジックとPC制御をもたらす

OpenAIは、推論が優れているだけでなく、コンピューターをアクティブに制御できる企業展開向けのモデルを導入しました。ITや開発者にとって、これはエージェントに何を許可するかを再考する必要があることを意味します。

読む →

ニュース · 2026-09-09

GPT-6 Astra:隠された思考の連鎖は、アーキテクチャに欠けている以上のものを隠さない

セバスチャン・ラシュカの分析によると、新しいモデルの短縮された隠れた思考の連鎖は悪意の結果ではなく、いわゆるループトランスフォーマーに基づくより効率的なアーキテクチャの副作用であることが示されています。

読む →

ニュース · 2026-09-08

エージェントのスケーリング則は、多数のLLMを調整することが行き止まりであるかを示すだろう

Allen Institute(AI2)のNathan Lambert氏は重要な疑問を投げかけています。エージェントの群れには、モデルサイズや推論時の計算量と同じスケーリング則が適用されるのでしょうか?その答えが、エンタープライズAI開発の方向性を決定づけるでしょう。

読む →

ニュース · 2026-08-11

弱いモデルがより強力な兄弟モデルの隠された思考を漏洩させる

研究者たちは弱いモデルを悪用して、最も強力なモデルから隠された推論プロセスの痕跡を抽出した。これは、モデルの推論を暗号化されたブロックに隠す試みが今のところほとんど幻想であり、意図せず704件のプライバシー関連の記録を暴露していることを示している。

読む →

ニュース · 2026-08-12

DeepSeek、ひそかにV4 Proをリリース。現在はAPI経由のみで稼働

中国のスタートアップDeepSeekが、公式なプレスリリースなしに新世代モデルV4 Proをリリースしました。1.7Tパラメータのモデルは現在、OpenRouterプラットフォーム上のAPI経由、およびHugging Face上のウェイトとして利用可能です。

読む →

ニュース · 2026-08-13

llm-geminiプラグイン、3.7 Flashモデルとサーバーサイドツール実験をサポート

Simon Willisonがllm-geminiプラグインのバージョン0.33をリリースした。このアップデートにより、Googleの3.7 Flashのサポートが追加され、モデルの推論プロセスを可視化するLLM CLIツールバージョン0.32を介したサーバーサイドツールへの道が開かれる。

読む →

ニュース · 2026-08-29

Hy4:Tencentがオープンモデルのトップに静かに追いつく

Tencentは、100万コンテキストのテキスト専用770Bモデルを新たにリリースした。オープンソース開発者にとって、これは米国の伝統的な軸外からの新たな強力な選択肢となる。

読む →

ニュース · 2026-08-26

Qwen3.8-Flash-Nextはスパース活性化で大規模な処理能力をもたらす

新しいQwenは125Bという大規模なモデルですが、推論時にアクティブになるパラメータはわずか6Bです。能力を落とさずに効率を向上させる道筋を示しています。

読む →

ニュース · 2026-08-21

llm-openrouter 0.7、モデル向けにサーバー側ツール、fetch、ウェブ検索を有効化

Simon WillisonがOpenRouterプラグインのアップデートを公開した。新バージョンでは、モデルがShell、WebFetch、WebSearchなどのサーバー側ツールを直接利用できる。

読む →