2026-10-07 · ← Noticias
Nemotron 3 para IOI e IMO: El fin de los modelos generales, la especialización a través de SFT y RL es lo que decide
El modelo Nemotron 3 de Nvidia alcanzó el nivel de medalla de oro en las competiciones IOI 2026 e IMO 2026. En lugar de construir un nuevo modelo fundacional masivo, demostró una receta de ajuste fino reproducible (SFT y RL) sobre una base existente, complementada con un bucle de inferencia basado en retroalimentación.
No se pudo cargar la imagen.
La receta para la adaptación al dominio
Nvidia ha anunciado el éxito de su modelo Nemotron 3 en dos niveles competitivos de élite: programación (IOI 2026) y matemáticas (IMO 2026). La ejecución no oficial en la IOI superó el umbral del oro con una puntuación de 535,4 (el umbral era de 361,12), y el sistema en la IMO obtuvo 30 de 42 puntos (el umbral para el oro era de 29).
El punto clave del anuncio no es solo la puntuación, sino el proceso. Nvidia demuestra que el «ajuste fino fácil» debe significar un proceso reproducible para la adaptación al dominio: SFT (ajuste fino supervisado) sobre datos de alta calidad, RL (aprendizaje por refuerzo) para parámetros seleccionados y un bucle de inferencia de prueba que obliga al modelo a verificar y corregir sus respuestas.
El fin de depender de un modelo masivo
Hasta ahora, los éxitos en estas competiciones comparativas se han vinculado a menudo a la construcción de sistemas dedicados (como AlphaCode de Google) o a nuevos modelos masivos completamente diferentes.
Nvidia, por el contrario, utilizó la familia Nemotron ya existente. Demostró que con una buena curación de datos (recopilando 22.000 problemas para la IOI y generando pasos de razonamiento sintéticos) y un bucle de «generar, verificar, refinar», incluso un modelo relativamente más pequeño (como la versión Nano de 30B) puede dar un salto enorme. La variante Nano pasó de 130 a 280 puntos tras el SFT, a 291 tras el RL, y las iteraciones lo empujaron más allá del oro hasta los 468.
Conjunto de datos más pequeño, metaevaluación más nítida
Para la olimpiada de matemáticas, implementaron el modelo Ultra. Su corpus SFT no estaba diseñado solo para enseñar las respuestas finales, sino la construcción de argumentos, la identificación de lagunas, la respuesta a la crítica y la evaluación de si una prueba está completa. La fase de RL se ejecutó en solo una fracción de los problemas seleccionados justo en el límite de las capacidades del modelo.
Este es un cambio de la cantidad a la metaevaluación: el modelo no solo aprende a resolver una ecuación, sino a evaluar si su propio argumento tiene sentido.
Adopción del proceso fuera de las métricas
La verdadera prueba del éxito no será si Nemotron mantiene su puntuación en las olimpiadas del próximo año, sino si los desarrolladores adoptan la metodología publicada de iteración.
Si el método descrito (SFT, RL, bucle de inferencia) se convierte en un estándar corporativo común para entrenar a especialistas internos en modelos más pequeños, Nvidia consolidará su papel no solo como fabricante de hardware, sino como arquitecto de la infraestructura de software de IA.
El veredicto de Lilith
Vender hardware para entrenar modelos masivos está muy bien, pero hacer que todos quemen ciclos en bucles de inferencia y generación de candidatos es un modelo de negocio sostenible.
Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.
Fuente original ↗ ↗