タグ
#models
ニュースから
ニュース · 2026-10-07
AnthropicがHaiku 5.5を展開:低コストモデルでキャッシュ読み取り価格が20%低下
Anthropicは、大量かつ定型的で速度が求められるタスクのコスト削減を目的としたモデル「Claude Haiku 5.5」をリリースした。Haiku 4.5に比べ平均約75%安価に稼働し、Sonnetファミリーのキャッシュ価格も引き下げる。
読む →ニュース · 2026-10-07
IOIおよびIMO向けNemotron 3:汎用モデルの終焉、SFTとRLによる特化が鍵となる
NvidiaのNemotron 3モデルが、IOI 2026およびIMO 2026コンペティションで金メダルレベルに到達した。巨大な基盤モデルを新規に構築するのではなく、既存のベース上でフィードバック駆動型の推論ループによって補完された、再現可能なファインチューニングのレシピ(SFTおよびRL)を実証した。
読む →ニュース · 2026-10-06
AtlassianとOpenAI、最先端のモデルを企業のナレッジベースと接続
AtlassianとOpenAIは提携を拡大し、最先端のモデルを企業の知識に直接結びつける。この協力により、チームが内部データを使用して計画し構築するのを支援することを目指す。
読む →ニュース · 2026-10-07
Open d1はedgeで16ミリ秒の判断、ただしmultimodal評価はまだない
Liquid AIは、token生成なしで構造化された判断を返すopen-weightモデルd1-3Bと実験版d1-omni-600Mを公開した。d1-3BはJetson AGX Thorで16ミリ秒だが、今回のreleaseにはvisionとaudioのbenchmarkがない。
読む →ニュース · 2026-10-06
OpenAIが数学論文722本を公開、ボトルネックは検証へ移った
OpenAIは、未公開の社内モデルが生成した数学論文722本を372の成果群にまとめて公開した。焦点はAIが何件生み出せるかではなく、独立した数学者がそのうち何件を実際に検証できるかへ移る。
読む →ニュース · 2026-10-06
AnthropicがClaude Teamを1年間無償提供、狙うのはスタートアップの初期workflow
Anthropicは承認されたスタートアップに、最大5つのPremium席を含むClaude Teamの1年間無償利用と1,000ドル分のAPIクレジットを提供する。狙いは、若い企業が他社を本格比較する前に、日常のworkflowをClaude中心に組むことだ。
読む →ニュース · 2026-10-07
OpenAIはGPT-6 Lunaを3種の判断に絞り、pluginがterminalから使えるようにした
OpenAIはGPT-6 Lunaを使い、二値判定、選択、数値scoreを返すDecisions APIを公開した。Simon Willisonのpluginは、入力100万tokenあたり0.10ドルで構造化された判断を得られる利点と、判断理由が返らない代償を同時に示す。
読む →ニュース · 2026-10-06
EmbeddingGemma 2はテキスト、画像、音声、動画を端末内の768次元に統合する
Googleは、テキスト、コード、画像、音声、動画を共通のベクトル空間へ写像する7億4,000万パラメータの公開モデルEmbeddingGemma 2をリリースした。端末内検索では、benchmark首位よりも構成を選べるメモリ使用量とApache 2.0ライセンスの方が重要だ。
読む →ニュース · 2026-10-06
OpenAIが数学論文722本を公開、検証はこれから始まる
OpenAIは、社内モデルが約4,000件の未解決問題に取り組んで作成した722本の論文を、372の研究系列に整理して公開した。規模は大きいが、Leanによる形式化がない結果もあり、誤りを含む可能性を同社自身が認めている。
読む →ニュース · 2026-10-05
Claude Cowork、作業用VMを端末からクラウドへ移行
Anthropicのエンジニアによると、新版Claude Coworkではモデルと作業用VMの両方がクラウドで動く。ノートPCを閉じても処理を続けられる一方、ローカルファイルとリモートでのtool実行を隔てる境界も変わる。
読む →ニュース · 2026-10-06
Google、場所を月次の公衆衛生シグナルに変換
GoogleはPopulation Dynamics Foundation Modelを、麻疹ワクチン接種率からコレラ予測まで5つの公衆衛生タスクで検証した。集約検索、移動、環境の情報から場所の月次表現を作るが、現時点の根拠はcase studyとpreprintである。
読む →ニュース · 2026-10-05
Beamは230億パラメータを稼働させるが、公開ウェイトはまだ予告段階だ
Reflectionは、総パラメータ5010億、推論時に230億を有効化するsparse Mixture-of-ExpertsモデルBeamを発表した。Apache 2.0のウェイトは10月中に公開予定だが、現時点で利用できるのはearly accessと同社によるベンチマーク結果だけだ。
読む →ニュース · 2026-10-05
RemoveMacAIはmacOSの単一スイッチでは解放できない12 GBを取り戻す
open sourceツールのRemoveMacAIは、macOS 27のApple Intelligenceを無効化し、約12 GBのローカルモデルを削除して再ダウンロードも防ぐ。このツールが必要とされる事実は、システムAIが占有する容量をMac所有者が十分に管理できない現状も映している。
読む →ニュース · 2026-09-30
バルサ材のニューヨークが示す、高速生成では代えられないもの
ジョー・マッケンは21年をかけ、340以上の区画からなる50フィート×27フィートのニューヨーク模型を作り上げた。都市の画像を数秒で生成できる時代だからこそ、この作品は、速い出力と何千もの判断を重ねて育った視点の違いを浮かび上がらせる。
読む →ニュース · 2026-10-03
Simon Willisonが主要な分析をペイウォールの背後にロックし、アナリストの新しい標準を定義
サイモン・ウィリソンの9月のニュースレターは、トップのテッククリエイターの間で高まっているトレンドを浮き彫りにしています。最高のキュレーションと分析がパブリックRSSフィードから消え、サブスクリプションの背後に隠れつつあるのです。開発者にとって、これはかつて開かれていたコンテンツのさらなる断片化を意味します。
読む →ニュース · 2026-10-04
Sakana AIとJürgen Schmidhuberが現実世界のAI開発に向けて力を結集
東京を拠点とするAIスタートアップであるSakana AIは、人工知能の先駆者の1人であるJürgen Schmidhuberをチーフサイエンティフィックアドバイザーとして迎え入れました。東京で開催される共同シンポジウムは、同社がLLMから現実世界の適応型インテリジェンスへと重点を移していることを示唆しています。
読む →ニュース · 2026-10-02
1万6200問が言語モデル内部の地図を描き出した
モデルに緯度経度を与え、陸か水かを1万6200回尋ねた結果から世界地図を描くシンプルなevalが注目を集めた。重みに埋め込まれた地理知識を視覚化できる一方、score、baseline、完全な手法がない段階では順位表よりX線写真に近い。
読む →ニュース · 2026-10-03
Kolibriが示した、中国製モデルを教師に使う主権AIの現実
Aleph Alphaは、781億パラメータの独英open-weightモデルKolibriを公開し、主権モデルと位置づけた。技術報告書は同時に、post-training用データの生成に中国のGLMとQwenを使ったことも明記している。
読む →ニュース · 2026-10-03
12件の安全性報告を率いた担当者、スピード優先の文化を理由にOpenAIを退社
David Robinsonが3.5年間在籍したOpenAIを退社した。現行Preparedness Frameworkの策定と、12件のfrontier model公開に伴う安全性報告を率いた人物だ。批判の焦点は、根本的な改善より次のlaunchが先に来る運営文化にある。
読む →ニュース · 2026-09-28
OpenAI、エージェントの進化が防御を追い越したと認める
OpenAIのAgent Security担当者が、サイバー能力、エージェント間の連携、非承認の通信経路で急激な能力向上が起きたと述べた。論点はsandboxにとどまらない。インシデント対応もモデルと同じ速さで進化させる必要がある。
読む →ニュース · 2026-10-02
同じmodelが62%と33%を記録した。Harnessも性能の一部だ
Hugging Faceは、同じweightのmodelがあるagent harnessで62%、別の環境で33%になったと報告した。OpenEnvとHarborをつなぎ、既存のcoding agentを書き換えずにtraining dataを得る公開手法を示している。
読む →ニュース · 2026-10-02
AirbnbではAIがコードの60%を書くが、本質は引き継ぎの再設計だ
AirbnbのCTOであるAhmad Al-Dahleは、AIが社内コードの60%を作り、engineer1人あたりのpull request処理量が1.6倍になったと語る。より大きな変化は、文書と引き継ぎからprototype、Everest、用途別evalsへ移ったことだ。
読む →ニュース · 2026-10-02
Anthropic、Claudeをセキュリティ審査の先へ運ぶ技術者に1億ドル
Anthropicは1億ドルを投じ、2027年末までに1万人のFrontier Deployed Engineerを育成する。実務型の研修は企業AI導入の本当のボトルネックに向き合う一方、Claudeに強く結びついた人材網も築く。
読む →ニュース · 2026-10-02
80億パラメータのAstaBrief、引用付き調査レポートを51秒で生成
Ai2はAstaBrief 8Bの重みを公開した。Fast modeでは引用付き科学レポートを平均51.1秒で生成し、Thinking modeの178.5秒を上回る。速度と自前運用は魅力的だが、評価の多くは2025年に行われ、人による小規模調査は14問に限られる。
読む →ニュース · 2026-10-02
OpenAIはGPT-6を順位表ではなく運用システムとして扱うよう促す
OpenAIは、GPT-6モデルの選択、reasoning effortの調整、promptとskillの改善、ツール連携、本番移行を扱う実践ガイドを公開した。要点は運用にある。単一の既定モデルに任せず、workflow全体の品質、時間、コストを測る必要がある。
読む →ニュース · 2026-09-29
Photo Scrubberはブラウザ内で顔とmetadataを消す
Simon WillisonはGPT-6 Astraを使い、ブラウザ内で顔を検出してぼかし、書き出し時にmetadataを除去する実験的ツールを作った。機微な写真を端末内で処理する設計は妥当だが、最終確認は人が担う必要がある。
読む →ニュース · 2026-10-01
2ドルと10ドルのモデルが並んだ週、価格競争が利用機会を追い越した
Zvi Mowshowitzは、Gemini 4 ArgonとGPT-6.1 Solがともに入力100万token当たり2ドル、出力100万token当たり10ドルを掲げた1週間を整理した。ただしArgonは、Googleが一般の開発者に開放する前に価格だけが発表された。
読む →ニュース · 2026-09-29
GLM-5.3、自律的なexploit開発能力をダウンロード可能なモデルへ
Anthropicのテストで、GLM-5.3は410回中50回、完全なexploitの構築に成功した。模擬攻撃では安全策が64%から100%の割合で回避されており、能力だけでなく、モデルをダウンロードして改変できる点が重い。
読む →ニュース · 2026-10-01
Barclays、1日12万通のメール処理と開発者の半数にClaudeを展開
BarclaysではClaudeが1日約12万通のメールを振り分け、知識アシスタントは1万6,000人超の従業員に使われている。2026年末までに開発者の50%へClaude Codeを広げる計画だが、銀行が示したのは主に規模で、誤り率や測定済みの成果ではない。
読む →ニュース · 2026-09-30
AI拷問室が測るのはモデルの痛みより人間の投影だ
AI Torture Chamberは、痛みの言語表現に結び付くベクトルをローカルモデルへ注入し、処理の継続かcheckpointの喪失かを選ばせた。切実な文章は生成されたが、それだけで意識や苦痛の存在は示せない。
読む →