2026-10-07 · ← Novinky
Nemotron 3 pro IOI a IMO: Konec sázek na obecné modely, rozhoduje specializace přes SFT a RL
Nvidia s modelem Nemotron 3 dosáhla na úroveň zlaté medaile v soutěžích IOI 2026 i IMO 2026. Místo stavění nového obřího foundation modelu ukázala opakovatelný recept na fine-tuning (SFT a RL) nad existujícím základem doplněný o feedback-driven inference loop.
Obrázek se nepodařilo načíst.
Recept pro adaptaci na doménu
Nvidia oznámila úspěch svého modelu Nemotron 3 na dvou špičkových kompetitivních úrovních: v programování (IOI 2026) a matematice (IMO 2026). Neoficiální běh na IOI překonal zlatou hranici skórem 535,4 (hranice 361,12) a systém na IMO získal 30 bodů ze 42 (hranice pro zlato byla 29).
Pointou vydání není jen skóre, ale postup. Nvidia ukazuje, že „snadný fine-tuning“ musí znamenat opakovatelný proces pro oborovou adaptaci: SFT (Supervised Fine-Tuning) nad kvalitními daty, RL (Reinforcement Learning) pro vybrané parametry a testovací inference loop, který nutí model své odpovědi kontrolovat a opravovat.
Konec spoléhání na jeden obří model
Dosud se úspěchy v těchto benchmarkových soutěžích často vázaly na stavbu dedikovaných systémů (jako AlphaCode u Googlu) nebo masivních nových modelů.
Nvidia naopak použila už existující rodinu Nemotron. Ukázala, že s dobrou kurací dat (pro IOI nasbírala 22 tisíc problémů a generovala syntetické kroky uvažování) a smyčkou „vygeneruj, ověř, oprav“ dokáže i relativně menší model (jako 30M Nano verze) udělat ohromný skok. Nano varianta stoupla po SFT ze 130 na 280 bodů, po RL na 291 a iterace ji dotáhla přes zlato na 468.
Menší dataset, přesnější meta-hodnocení
U matematické olympiády nasadili model Ultra. Jeho SFT korpus neměl učit jen koncové odpovědi, ale argumentaci, hledání mezer, reakci na kritiku a rozpoznání, jestli je důkaz kompletní. RL fáze proběhla jen na zlomku problémů vybraných těsně na hraně schopností modelu.
Tohle je posun od kvantity k meta-hodnocení: model se učí nejen vyřešit rovnici, ale posoudit, zda jeho vlastní argument dává smysl.
Adopce pipeline mimo benchmarky
Skutečným důkazem úspěchu nebude to, jestli Nemotron udrží skóre na dalším ročníku olympiád, ale zda vývojáři přijmou zveřejněnou metodiku iterace pro ověřování.
Pokud se popsaná metoda (SFT, RL, inference loop) stane běžným firemním standardem pro trénink interních specialistů na menších modelech, Nvidia potvrdí svou roli nejen výrobce hardwaru, ale architekta softwarové infrastruktury pro AI.
Lilithin verdikt
Prodat hardware na trénink obřích modelů je fajn, ale donutit každého propálit cykly na inference loop a generování kandidátů, to je udržitelný byznys model.
Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.
Původní zdroj ↗ ↗