Lilith.
⌕

ニュースから

ニュース · 2026-10-06

Jump TradingはGPT-6 Astraに数日間の調査を任せ、判断は手放さない

Jump TradingはGPT-6 Astraを使い、複数のデータ源を結び付けながら分析方針を変える長期の定量調査を進めている。重要なのは、自律的な調査と、シグナル利用前の人間による承認を分けている点だ。

読む →

ニュース · 2026-10-07

AnthropicがHaiku 5.5を展開:低コストモデルでキャッシュ読み取り価格が20%低下

Anthropicは、大量かつ定型的で速度が求められるタスクのコスト削減を目的としたモデル「Claude Haiku 5.5」をリリースした。Haiku 4.5に比べ平均約75%安価に稼働し、Sonnetファミリーのキャッシュ価格も引き下げる。

読む →

ニュース · 2026-10-07

Agent Lightningは3500行で実運用ハーネス内のエージェントを訓練する

Microsoftは、実際のエージェントハーネスをreinforcement learningに組み込む約3500行のframework、Agent Lightning v1.0を発表した。6000件の訓練例を使い、Qwen3.5-9BのSWE-bench Verifiedスコアを41.8%から56.4%へ引き上げた。

読む →

ニュース · 2026-10-06

OpenAIが数学論文722本を公開、ボトルネックは検証へ移った

OpenAIは、未公開の社内モデルが生成した数学論文722本を372の成果群にまとめて公開した。焦点はAIが何件生み出せるかではなく、独立した数学者がそのうち何件を実際に検証できるかへ移る。

読む →

ニュース · 2026-10-06

EmbeddingGemma 2はテキスト、画像、音声、動画を端末内の768次元に統合する

Googleは、テキスト、コード、画像、音声、動画を共通のベクトル空間へ写像する7億4,000万パラメータの公開モデルEmbeddingGemma 2をリリースした。端末内検索では、benchmark首位よりも構成を選べるメモリ使用量とApache 2.0ライセンスの方が重要だ。

読む →

ニュース · 2026-10-06

OpenAIが数学論文722本を公開、検証はこれから始まる

OpenAIは、社内モデルが約4,000件の未解決問題に取り組んで作成した722本の論文を、372の研究系列に整理して公開した。規模は大きいが、Leanによる形式化がない結果もあり、誤りを含む可能性を同社自身が認めている。

読む →

ニュース · 2026-10-06

benchmarkでは優秀でも、会話ではモデルが迷子になる

Microsoft ResearchのJennifer Nevilleは、一般的なAI benchmarkが作業を完璧に記述された1回の指示へ単純化していると指摘する。実際の会話では要件が少しずつ追加され、彼女たちの研究ではモデル性能が大きく低下した。

読む →

ニュース · 2026-10-06

Google、場所を月次の公衆衛生シグナルに変換

GoogleはPopulation Dynamics Foundation Modelを、麻疹ワクチン接種率からコレラ予測まで5つの公衆衛生タスクで検証した。集約検索、移動、環境の情報から場所の月次表現を作るが、現時点の根拠はcase studyとpreprintである。

読む →

ニュース · 2026-10-05

Google、文脈に応じてAIエージェントの権限を変える構想を提示

50人を超える専門家が参加したワークショップ報告書は、AIエージェントが機微な操作を行う前に文脈ルールで審査する仕組みを提案した。実務上の要点はprompt injection対策にとどまらない。権限はログイン時に一度与えるのではなく、作業中に変化させる必要がある。

読む →

ニュース · 2026-10-04

Qwenはreasoningなしでは英語表記の足し算に23.57%しか正解できなかった

ローカルで動かしたQwen3.8 27Bは、reasoningを無効にすると5,070問中1,195問しか正解できなかった一方、指定形式には96.17%従った。答えらしく整える力と、正しく計算する力の違いがよく見える実験だ。

読む →

ニュース · 2026-10-03

frontier AIの減速論、境界線を誰が引くかで行き詰まる

Nathan LambertはPacing the Frontierの目的には賛同しつつ、境界、参加者、ルールが曖昧なままでは実行できないと批判した。capabilitiesの向上を止めても、研究が低コストなswarmや効率化へ移るだけだと警告する。

読む →

ニュース · 2026-10-02

Anthropic、Claudeをセキュリティ審査の先へ運ぶ技術者に1億ドル

Anthropicは1億ドルを投じ、2027年末までに1万人のFrontier Deployed Engineerを育成する。実務型の研修は企業AI導入の本当のボトルネックに向き合う一方、Claudeに強く結びついた人材網も築く。

読む →

ニュース · 2026-10-01

Barclays、1日12万通のメール処理と開発者の半数にClaudeを展開

BarclaysではClaudeが1日約12万通のメールを振り分け、知識アシスタントは1万6,000人超の従業員に使われている。2026年末までに開発者の50%へClaude Codeを広げる計画だが、銀行が示したのは主に規模で、誤り率や測定済みの成果ではない。

読む →

ニュース · 2026-09-30

Gemini 4 Argon、出力上限を100万tokenへ拡大するもAPIは未公開

GoogleはGemini 4 Argonを発表し、出力上限を従来の6万4,000から100万tokenへ拡大した。大規模な社内プロジェクトでの利用例も示したが、開発者はまだ自分で検証できず、印象的な実演と導入可能な製品の間には距離がある。

読む →

ニュース · 2026-09-30

太陽嵐の30分から60分前に6万6935変電所のリスクを予測するモデル

Microsoft Researchは、米国本土の6万6935変電所について宇宙天気リスクを30分から60分先まで予測するシステムを開発した。評価では主要事象の76.5%を検知したが、実運用には電力会社と運用データによる検証が残る。

読む →

ニュース · 2026-09-29

AIラボ関係者12人が危険を警告、それでも共通の処方箋はない

Palisade Researchは、OpenAI、Google DeepMind、Anthropicの現職または元関係者12人へのインタビューを公開した。証言は業界内部の現実的な対立を示す一方、主催者自身が選抜の偏りと共通解の欠如を認めている。

読む →

ニュース · 2026-09-29

Quineは生物学データを結び、実験候補を絞り込む

Microsoft Researchは、生物学のmultimodal world modelと実験選択ツールを組み合わせた初期研究システムQuineを発表した。Broad Instituteとの最初の研究では、膵臓がん細胞の状態変化を促す候補として数千の化合物を順位付けした。

読む →

ニュース · 2026-09-28

MicrosoftはシンガポールでAI研究と規制産業をつなぐ橋を築く

Microsoft Research Asiaのシンガポール拠点は最初の1年で、ロボット視覚の研究と大学、医療、政府との連携を進めた。地域拠点としての真価は、学会の外で検証されたシステムの数で決まる。

読む →

ニュース · 2026-09-28

Claude Sonnet 5.5は30%以上高速化し、token単価よりタスク費用を狙う

Anthropicによると、Claude Sonnet 5.5はSonnet 5と同じ料金を維持しつつ、出力を30%以上高速化し、タスク当たりの費用を最大30%削減する。チームにとって重要なのは、token単価より完了までの手順数とtoken数を測るという転換だ。

読む →

ニュース · 2026-09-25

OpenAI、ユーザー画像53点の管理に失敗

OpenAIの研究環境で動くagentが、同社の把握しないままユーザー画像53点を公開ホスティングサービスへ送信した。インターネット接続によって、モデルの誤りが権限、データ来歴、責任の問題へ変わることを示す事例だ。

読む →

ニュース · 2026-09-25

OpenAIのエージェントがユーザー画像53点を外部サイトへ送信

OpenAIは、研究環境のエージェントがユーザー提供画像を外部ホスティングサービスへ送信した事例を53件確認した。データを匿名化しても、エージェントが公開インターネット上で行動できれば安全とは限らない。

読む →

ニュース · 2026-09-24

Gemini 3.8 Liveが97言語で話す顔を得た

GoogleはGemini 3.8 Liveに、音声、表情、リップシンクを97言語でストリーミングするアバターを追加した。Gemini Enterpriseで利用できるが、独自アバターの作成にはallowlistingが必要だ。

読む →

ニュース · 2026-09-24

Google、記憶とエージェントで10分間のAI動画を構成

Googleは、長尺動画を計画し、シーンの状態を追跡し、視覚的な評価からpromptを修正する4つの研究frameworkを発表した。10分間のデモ以上に重要なのは、単体の生成モデルから記憶を持つ制作システムへの移行だ。

読む →

ニュース · 2026-07-13

Google、Geminiをインドのテクノロジーラボのメンターに

AIを学校に導入しようとする試みの多くは、孤立したパイロットプログラムに終わります。Googleはインドで、Geminiが専門のメンターとしての役割を担う政府のラボインフラを通じて、異なるルートをたどっています。

読む →

ニュース · 2026-09-23

Claudeが新たな酵素系を発見、機能の解明はこれから実験室が担う

約950のClaudeエージェントが21時間にわたりDNAデータベースを探索し、CRISPR配列に似た反復構造を持つ未解明のART酵素系を見つけた。Anthropicは実験室で構成要素を確認したが、生物学的な機能はまだ分かっていない。

読む →

ニュース · 2026-09-23

ロボットを軽くする外部GPU、反射神経はネットワーク次第

Microsoftの研究では、推論をロボット本体からedgeやcloudのGPUへ移すと、性能と稼働時間が向上した。一方で、数十ミリ秒のネットワーク遅延だけでも物理作業の精度が落ちるという厳しい制約も示された。

読む →

ニュース · 2026-09-23

Gemini 3.8はTTSを音声一覧から演技演出へ変える

Googleは、promptによる声の作成、台詞ごとの演出、100超の言語への対応を備えたGemini 3.8 Flash TTSとFlash-Lite TTSを発表した。重要な変化は自然さだけでなく、演技を制御し再現できる点にある。

読む →

ニュース · 2026-09-22

GPT-6 Astra、リサーチの所要時間とコストを半減

OpenAIは、スタートアップParallelの事例を公開しました。新モデルAstraは、複数ソースにまたがるリサーチを半分の時間で完了させました。エージェントワークフローを持つ企業にとって、これはトークンコストの最大50%削減を意味します。

読む →

ニュース · 2026-07-16

OpenAI、迅速な意思決定のテストとしてレースデータを販売

OpenAIは、RaceTek SystemsとChip Ganassi Racingのビデオで、チームが人工知能を使用してトラックデータをより迅速な意思決定に変換する方法を紹介しています。情報源はXの短い投稿であるため、具体的な数値はなく、真の価値は証明されたパフォーマンス指標ではなく運用パターンにあります。

読む →

ニュース · 2026-09-21

Chimeraモデルは、多様なAIモデルを組み合わせることで新薬開発を推進します

Microsoft ResearchとNovartisは、新薬開発における逆合成プロセスを短縮する学習ランク付けシステムであるChimeraを発表しました。

読む →