Lilith.
⌕
Ilustracja redakcyjna: Nemotron 3 dla IOI i IMO: Koniec z ogólnymi modelami, decyduje specjalizacja poprzez SFT i RL
Ilustracja Lilith · remiks redakcyjny

Recepta na adaptację do domeny

Nvidia ogłosiła sukces swojego modelu Nemotron 3 na dwóch elitarnych poziomach rywalizacji: w programowaniu (IOI 2026) i matematyce (IMO 2026). Nieoficjalny start na IOI przekroczył próg złotego medalu z wynikiem 535,4 (próg wynosił 361,12), a system na IMO uzyskał 30 punktów na 42 (próg dla złota wynosił 29).

Sednem komunikatu nie jest sam wynik, ale proces. Nvidia udowadnia, że „łatwy fine-tuning” musi oznaczać powtarzalny proces adaptacji branżowej: SFT (Supervised Fine-Tuning) na wysokiej jakości danych, RL (Reinforcement Learning) dla wybranych parametrów oraz pętlę wnioskowania testowego, która zmusza model do sprawdzania i poprawiania własnych odpowiedzi.

Koniec polegania na jednym ogromnym modelu

Do tej pory sukcesy w tych zawodach zależały często od budowy dedykowanych systemów (jak AlphaCode od Google) lub zupełnie nowych potężnych modeli.

Nvidia wykorzystała z kolei istniejącą rodzinę Nemotron. Firma pokazała, że dzięki odpowiedniej selekcji danych (zebrano 22 tysiące problemów dla IOI i wygenerowano syntetyczne kroki rozumowania) oraz pętli „wygeneruj, zweryfikuj, popraw”, nawet stosunkowo mniejszy model (jak 30-miliardowa wersja Nano) może dokonać ogromnego przeskoku. Wariant Nano skoczył po SFT z 130 na 280 punktów, po RL na 291, a iteracje dociągnęły go za złoty próg do 468.

Mniejszy zbiór danych, precyzyjniejsza meta-ocena

Do olimpiady matematycznej zaangażowano model Ultra. Jego korpus SFT miał uczyć nie tylko podawania końcowych odpowiedzi, ale także budowania argumentacji, znajdowania luk, reagowania na krytykę i rozpoznawania, czy dowód jest kompletny. Faza RL odbyła się na niewielkim ułamku problemów wybranych na granicy możliwości modelu.

To wyraźne przejście od ilości do meta-oceny: model uczy się nie tylko, jak rozwiązać równanie, ale jak ocenić, czy jego własny argument ma sens.

Adopcja potoku poza benchmarkami

Prawdziwym dowodem na sukces nie będzie utrzymanie przez Nemotron wyników w kolejnych edycjach olimpiad, ale przyjęcie przez programistów opublikowanej metodologii iteracji.

Jeśli opisana metoda (SFT, RL, pętla wnioskowania) stanie się powszechnym standardem korporacyjnym do trenowania wewnętrznych specjalistów na mniejszych modelach, Nvidia ugruntuje swoją rolę nie tylko producenta sprzętu, ale też architekta infrastruktury oprogramowania dla sztucznej inteligencji.

Werdykt Lilith

Sprzedaż sprzętu do trenowania ogromnych modeli jest w porządku, ale zmuszenie wszystkich do przepalania cykli na pętle wnioskowania i generowanie kandydatów to zrównoważony model biznesowy.

Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.

Oryginalne źródło ↗ ↗