Lilith.
⌕

Lilith · 厳選ニュース

ニュース

AIで本当に起きていること。宣伝ノイズ抜きで、選び抜いた話題と文脈と意見を。

Atomフィード ↗
#agents· × <built-in method clear of dict object at 0xf5f98879d6c0>
公開
公開

Nvidiaが推論ベンチマークを突破。決定打は新しいモデルではなくソフトウェアの環境だった

Nvidiaの研究者たちは、論理テストARC-AGI-3において、Claude Opus 5モデルで100%の正解率を達成しました。彼らはより良いトレーニングによってではなく、モデルを包む巧妙なソフトウェア環境によってこれを実現したのです。

公開
公開

スタートアップInherentのエージェントが、10分の1のサイズのモデルで研究の複製においてClaudeとGPTを上回りました

イギリスのスタートアップInherentは、科学研究の結果を独立して複製できるFaradayエージェントを披露しました。AnthropicとOpenAIは、同様のタスクに最大のフロンティアシステムであるOpusとGPT-5.5を使用していますが、Faradayはわずか270億パラメータの特殊なQwen 3.6モデルでそれらを上回りました。

LinkdazeのスマートカレンダーがAI献立計画を追加、しかし真のニュースはそのビジネスモデルにある

Linkdazeは紙のレシピをデジタルプランと買い物リストに変換するAIを統合している。しかし機能自体よりも重要なのは、ハードウェアが必須のサブスクリプションなしで市場に食い込もうとしている点だ。

Fable 5、7月のAnthropicモデル支出に占める割合はわずか8%

7万社の請求データに基づく7月のRamp AI Indexによると、Anthropicモデルへの支出のうちFable 5が占めたのはわずか8%で、Opus 4.8が28%で首位だった。Anthropicは急成長しているが、同社で最も高性能なモデルは依然として顧客の価格感応度という壁に直面している。

公開

エージェントフレームワークの進化、インターフェースが守るのはモデルではなく人間の注意力

Latent Spaceは、エージェントアーキテクチャの変化を分析している。かつて外部のソフトウェアラッパーが担っていた機能は、モデルの重みに直接取り込まれつつある。残るインフラも役割を変え、AIを制御するのではなく、人間とAIのやり取りを選別するものになっている。

公開