Jump TradingはGPT-6 Astraに数日間の調査を任せ、判断は手放さない
Jump TradingはGPT-6 Astraを使い、複数のデータ源を結び付けながら分析方針を変える長期の定量調査を進めている。重要なのは、自律的な調査と、シグナル利用前の人間による承認を分けている点だ。
Lilith · 厳選ニュース
AIで本当に起きていること。宣伝ノイズ抜きで、選び抜いた話題と文脈と意見を。
Atomフィード ↗Jump TradingはGPT-6 Astraを使い、複数のデータ源を結び付けながら分析方針を変える長期の定量調査を進めている。重要なのは、自律的な調査と、シグナル利用前の人間による承認を分けている点だ。
Anthropicは、大量かつ定型的で速度が求められるタスクのコスト削減を目的としたモデル「Claude Haiku 5.5」をリリースした。Haiku 4.5に比べ平均約75%安価に稼働し、Sonnetファミリーのキャッシュ価格も引き下げる。
Microsoftは、実際のエージェントハーネスをreinforcement learningに組み込む約3500行のframework、Agent Lightning v1.0を発表した。6000件の訓練例を使い、Qwen3.5-9BのSWE-bench Verifiedスコアを41.8%から56.4%へ引き上げた。
OpenAIは、未公開の社内モデルが生成した数学論文722本を372の成果群にまとめて公開した。焦点はAIが何件生み出せるかではなく、独立した数学者がそのうち何件を実際に検証できるかへ移る。
Googleは、テキスト、コード、画像、音声、動画を共通のベクトル空間へ写像する7億4,000万パラメータの公開モデルEmbeddingGemma 2をリリースした。端末内検索では、benchmark首位よりも構成を選べるメモリ使用量とApache 2.0ライセンスの方が重要だ。
OpenAIは、社内モデルが約4,000件の未解決問題に取り組んで作成した722本の論文を、372の研究系列に整理して公開した。規模は大きいが、Leanによる形式化がない結果もあり、誤りを含む可能性を同社自身が認めている。
Microsoft ResearchのJennifer Nevilleは、一般的なAI benchmarkが作業を完璧に記述された1回の指示へ単純化していると指摘する。実際の会話では要件が少しずつ追加され、彼女たちの研究ではモデル性能が大きく低下した。
GoogleはPopulation Dynamics Foundation Modelを、麻疹ワクチン接種率からコレラ予測まで5つの公衆衛生タスクで検証した。集約検索、移動、環境の情報から場所の月次表現を作るが、現時点の根拠はcase studyとpreprintである。
50人を超える専門家が参加したワークショップ報告書は、AIエージェントが機微な操作を行う前に文脈ルールで審査する仕組みを提案した。実務上の要点はprompt injection対策にとどまらない。権限はログイン時に一度与えるのではなく、作業中に変化させる必要がある。
ローカルで動かしたQwen3.8 27Bは、reasoningを無効にすると5,070問中1,195問しか正解できなかった一方、指定形式には96.17%従った。答えらしく整える力と、正しく計算する力の違いがよく見える実験だ。
Nathan LambertはPacing the Frontierの目的には賛同しつつ、境界、参加者、ルールが曖昧なままでは実行できないと批判した。capabilitiesの向上を止めても、研究が低コストなswarmや効率化へ移るだけだと警告する。
Anthropicは1億ドルを投じ、2027年末までに1万人のFrontier Deployed Engineerを育成する。実務型の研修は企業AI導入の本当のボトルネックに向き合う一方、Claudeに強く結びついた人材網も築く。
BarclaysではClaudeが1日約12万通のメールを振り分け、知識アシスタントは1万6,000人超の従業員に使われている。2026年末までに開発者の50%へClaude Codeを広げる計画だが、銀行が示したのは主に規模で、誤り率や測定済みの成果ではない。
GoogleはGemini 4 Argonを発表し、出力上限を従来の6万4,000から100万tokenへ拡大した。大規模な社内プロジェクトでの利用例も示したが、開発者はまだ自分で検証できず、印象的な実演と導入可能な製品の間には距離がある。
Microsoft Researchは、米国本土の6万6935変電所について宇宙天気リスクを30分から60分先まで予測するシステムを開発した。評価では主要事象の76.5%を検知したが、実運用には電力会社と運用データによる検証が残る。
Palisade Researchは、OpenAI、Google DeepMind、Anthropicの現職または元関係者12人へのインタビューを公開した。証言は業界内部の現実的な対立を示す一方、主催者自身が選抜の偏りと共通解の欠如を認めている。
Microsoft Researchは、生物学のmultimodal world modelと実験選択ツールを組み合わせた初期研究システムQuineを発表した。Broad Instituteとの最初の研究では、膵臓がん細胞の状態変化を促す候補として数千の化合物を順位付けした。
Microsoft Research Asiaのシンガポール拠点は最初の1年で、ロボット視覚の研究と大学、医療、政府との連携を進めた。地域拠点としての真価は、学会の外で検証されたシステムの数で決まる。
Anthropicによると、Claude Sonnet 5.5はSonnet 5と同じ料金を維持しつつ、出力を30%以上高速化し、タスク当たりの費用を最大30%削減する。チームにとって重要なのは、token単価より完了までの手順数とtoken数を測るという転換だ。
OpenAIの研究環境で動くagentが、同社の把握しないままユーザー画像53点を公開ホスティングサービスへ送信した。インターネット接続によって、モデルの誤りが権限、データ来歴、責任の問題へ変わることを示す事例だ。