Lilith.
⌕
編集イラスト: IOIおよびIMO向けNemotron 3:汎用モデルの終焉、SFTとRLによる特化が鍵となる
Lilithのイラスト · 編集リミックス

ドメイン適応のためのレシピ

Nvidiaは、プログラミング(IOI 2026)と数学(IMO 2026)の2つのエリート競技レベルにおいて、Nemotron 3モデルが成功を収めたと発表した。IOIの非公式な実行では535.4というスコアで金メダルのしきい値(361.12)を超え、IMOのシステムでは42点中30点を獲得した(金メダルのしきい値は29)。

このリリースのポイントはスコアだけではなく、そのプロセスにある。Nvidiaは、「簡単なファインチューニング」がドメイン適応のための再現可能なプロセスを意味しなければならないことを示している。それは、高品質データに基づくSFT(教師ありファインチューニング)、選択されたパラメータに対するRL(強化学習)、およびモデルに自身の回答を検証し修正させるテスト時推論ループの組み合わせである。

一つの巨大モデルへの依存の終焉

これまで、これらのベンチマーク競技での成功は、専用システムの構築(GoogleのAlphaCodeなど)や、まったく新しい巨大モデルの構築に結びついていることが多かった。

対照的に、Nvidiaは既存のNemotronファミリーを使用した。彼らは、適切なデータキュレーション(IOIのために22,000の問題を収集し、合成の推論ステップを生成)と、「生成、検証、改善」のループを組み合わせることで、比較的規模の小さいモデル(30BのNanoバージョンなど)でさえ飛躍的な進歩を遂げられることを実証した。NanoバリアントはSFT後に130から280ポイントへ上昇し、RL後に291となり、反復によって金のしきい値を超えて468に到達した。

より小規模なデータセットと鋭いメタ評価

数学オリンピックのために、彼らはUltraモデルを展開した。そのSFTコーパスは、最終的な回答を教えるためだけでなく、議論の構築、ギャップの特定、批判への対応、および証明が完全であるかどうかの判断を目的として設計された。RLフェーズは、モデルの能力の限界ぎりぎりで選択された問題のごく一部のみで実行された。

これは量からメタ評価へのシフトである。モデルは単に方程式を解くことを学ぶだけでなく、自身の議論が論理的かどうかを評価することを学ぶのだ。

ベンチマーク外でのパイプラインの採用

成功の真の証は、Nemotronが来年のオリンピックでスコアを維持するかどうかではなく、開発者が公開された反復の手法を採用するかどうかにかかっている。

説明された手法(SFT、RL、推論ループ)が、小規模モデルで社内の専門家を訓練するための一般的な企業標準になれば、Nvidiaはハードウェアメーカーとしてだけでなく、AIソフトウェアインフラストラクチャのアーキテクトとしての役割を確固たるものにするだろう。

Lilithの判定

巨大モデルのトレーニング用にハードウェアを販売するのは良いことだが、推論ループや候補の生成に誰もがサイクルを消費するように仕向けることは、持続可能なビジネスモデルとなる。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗ ↗