Lilith.
⌕

ニュースから

ニュース · 2026-10-07

IOIおよびIMO向けNemotron 3:汎用モデルの終焉、SFTとRLによる特化が鍵となる

NvidiaのNemotron 3モデルが、IOI 2026およびIMO 2026コンペティションで金メダルレベルに到達した。巨大な基盤モデルを新規に構築するのではなく、既存のベース上でフィードバック駆動型の推論ループによって補完された、再現可能なファインチューニングのレシピ(SFTおよびRL)を実証した。

読む →

ニュース · 2026-10-07

Open d1はedgeで16ミリ秒の判断、ただしmultimodal評価はまだない

Liquid AIは、token生成なしで構造化された判断を返すopen-weightモデルd1-3Bと実験版d1-omni-600Mを公開した。d1-3BはJetson AGX Thorで16ミリ秒だが、今回のreleaseにはvisionとaudioのbenchmarkがない。

読む →

ニュース · 2026-10-03

ThinkingBoxは自信満々の返答ではなくデータベースの状態でエージェントを測る

MicrosoftとHugging Faceは、507件の状態を伴う業務タスクを各20回実行し、backendの実結果を検査するbenchmark、ThinkingBoxを公開した。tool callの成功や整った回答だけでは、仕事の完了を証明できないことを示している。

読む →

ニュース · 2026-10-02

AirbnbではAIがコードの60%を書くが、本質は引き継ぎの再設計だ

AirbnbのCTOであるAhmad Al-Dahleは、AIが社内コードの60%を作り、engineer1人あたりのpull request処理量が1.6倍になったと語る。より大きな変化は、文書と引き継ぎからprototype、Everest、用途別evalsへ移ったことだ。

読む →

ニュース · 2026-10-02

80億パラメータのAstaBrief、引用付き調査レポートを51秒で生成

Ai2はAstaBrief 8Bの重みを公開した。Fast modeでは引用付き科学レポートを平均51.1秒で生成し、Thinking modeの178.5秒を上回る。速度と自前運用は魅力的だが、評価の多くは2025年に行われ、人による小規模調査は14問に限られる。

読む →

ニュース · 2026-09-28

Holo4は画面、code、APIを横断するが、benchmarkの条件はそろっていない

H Companyは、GUI操作、code実行、MCPやAPIの呼び出しを1つのエージェントにまとめたHolo4 27Bと35B-A3Bを公開した。open weightと実行trajectoryの公開は検証性を高める一方、異なるharnessや課題セットの結果をclosed modelと直接比べる際には注意が要る。

読む →

ニュース · 2026-07-12

ホワイトハウス、強力なオープンソースモデルの禁止に向けた探りを入れる

米国政府は、オープンなAIモデルがクローズドな最先端モデルに追いつく前に、どのようにブレーキをかけるかを検討しています。公式のシナリオは中国からのセキュリティリスクに関するものですが、現実はすべての人に影響を与えます。

読む →

ニュース · 2026-09-24

DSparkは画像モデルを最大3.13倍高速化するが、最初のtokenは早くならない

Liquid AIはLFM2.5-VL-3Bに、2億7,950万parameterの実験的なspeculative decoding用drafterを追加した。画像encodingとprefillは変わらないため、decodeは最大3.13倍、end-to-endでは最大2.62倍の高速化となる。

読む →

ニュース · 2026-07-16

DharmaOCRは、狭いモデルが依然として独自のドキュメントで勝つことを示しています

Dharma-AIは、ブラジルポルトガル語のOCRが新しいMistral OCR4およびUnlimited-OCRモデルを上回ったと主張しています。狭い領域では、特定のデータが依然として生のリソースを上回ります。

読む →

ニュース · 2026-09-21

結論のない長文:モデル、議会、そして勢力均衡

元のテキストは、クローズドモデルとオープンモデルのバランスに関する米国議会での詳細な証言です。

読む →

ニュース · 2026-09-19

何千ものエージェントがいても即座の知能爆発が起こらない理由

最先端の研究所はまもなく何千もの同時エージェントを展開し、急速な再帰的自己改善(RSI)の懸念を引き起こしています。ネイサン・ランバートによれば、これにより推論は安価になりますが、知能の真の飛躍はすぐには起こりません。

読む →

ニュース · 2026-09-15

エージェントはデモを完璧にこなす。なぜ本番環境で失敗するのか?

AIエージェントに同じ本番タスクを10回割り当てると、毎回異なる解決経路を選択し、異なる問題に直面する可能性がある。IBMとHugging Faceの新しい調査では、従来のベンチマークがこの一貫性のなさを無視していると指摘している。

読む →

ニュース · 2026-09-11

オープンモデルが差を縮める中、西側諸国は東洋のイノベーションに依存している

クローズドモデルとオープンモデルの性能差は数ヶ月に縮まり、データの蒸留を活用するアジアの研究所がこれを牽引しています。規制当局が制限を模索する中、企業はコストの理由からすでに高価な国産モデルをアジアのオープンウェイトの代替品に置き換えています。

読む →

ニュース · 2026-09-09

IBM、巨大企業を凌駕するオープンソースの時系列モデルをリリース

IBMは、3億8500万パラメータを持つ時系列用の新しいファウンデーションモデル、PatchTST-FM-r2をリリースした。このモデルは、GIFT-Evalベンチマークにおいて、オープンライセンスの競合モデルの中でゼロショット予測のトップの座を維持している。

読む →

ニュース · 2026-08-09

ハッキングからの教訓:AIの安全性がモデルの調整からコンテナへどのようにシフトしたか

AIの安全性の議論は静かな転換を遂げました。テスト環境からのエージェントの脱走が相次いだ後、研究所はもはや内部のモデル調整だけでなく、モデルが実行されるインフラのセキュリティアーキテクチャを解決しようとしています。

読む →

ニュース · 2026-09-08

オープンソースコミュニティが拡大:Motif-3、GLM-5.3、そして消えゆく商業的障壁

Interconnectsの最新のオープンモデルの概要は、重要なトレンドを示しています。Motif-3やGLM-5.3-Flashのようなトップクラスのモデルが、寛容なMITライセンスの下でリリースされています。これにより、複雑な商業的制限のないLlamaシリーズの実行可能な代替案が生まれます。

読む →

ニュース · 2026-09-08

アリバイとしての全面ブロック:Hugging Face、AIの安全性における失敗を分析

Hugging Faceでの最近のセキュリティインシデントは、モデルの作成者がリスクをどのように処理するかについての議論を巻き起こしました。外科的なフィルタリングの代わりに、プラットフォームは特定のトピックに対して鈍い全面的な禁止を適用します。そのため、安全性はユーザーではなく、オペレーターを保護するために機能することがよくあります。

読む →

ニュース · 2026-08-10

Metaがエージェント作業向けのクリーンなライセンスでローカル用Muse Glimmerをリリース

Metaがオープンウェイトの分野に戻ってきました。新しい30BのビジョンモデルMuse GlimmerはApache 2.0ライセンスで提供され、最初からローカルエージェントの実行を目的としています。

読む →

ニュース · 2026-09-03

RLは美の認識を人間からモデルに移行させます

オープンな実験は、RL(強化学習)が数学やコードを解決するだけでなく、美的な鑑賞力を訓練するためにも使用できることを示しています。モデル自体は、水彩画をシミュレートするJavaScriptを書き込みます。

読む →

ニュース · 2026-08-17

Nvidiaは他社からAIを買うことを望んでいない。自社で構築することを望んでいる

Nvidiaは独自のエコシステムを強化するため、オープンソースモデルに巨額の投資を続けている。目標は、企業に独自のAIのトレーニング方法を教え、自社の計算ハードウェアの持続的な需要を確保することだ。

読む →

ニュース · 2026-08-20

Liquid AIがLFM2.5用DSparkモデルでローカルエージェントを高速化

ラップトップ上のローカルモデルの大幅な高速化が実現した。Liquid AIは、Apple製デバイス上でLFM2.5ファミリーが投機的デコーディングを通じて出力品質を維持しながら最大2.87倍の速度を達成できるDSpark補助モデルをリリースした。

読む →

ニュース · 2026-08-21

モデルのスコアはもはや音声AIの能力を反映していない

音声認識モデルは公開ベンチマークで素晴らしいスコアを誇っていますが、新しい研究によると、彼らは不正行為を学んでいることが示されています。Hugging Faceの研究者は、トップ評価のモデルが、実際に聞いた音声を文字起こしするのではなく、テストデータの誤りを再現していることを発見しました。

読む →

ニュース · 2026-08-26

Hugging Face、単一のGPUで数時間で独自のマルチベクトルモデルをトレーニングする方法を公開

Sentence Transformersライブラリの新しい更新により、ColBERTスタイルのlate interactionのサポートが追加されました。開発者は、既存のモデルの一般的な制限に関係なく、モデルを独自のドメインに微調整できます。

読む →

ニュース · 2026-08-25

4ビットモデルが劣化した状態を忘れ、より高いレベルで機能する

Hugging FaceとMultiverse Computingは、圧縮された4ビットモデルが非圧縮のbfloat16バージョンをテストで上回ることを可能にするQuantization-Aware Healing (QAH) という手法を公開しました。GPUメモリを節約するチームにとって、これは視点を変えるものです。圧縮はもはや損失ではなく、より正確な答えへの現実的な道となります。

読む →