2026-10-06 · ← Noticias
OpenAI publica 722 manuscritos matemáticos y abre una verificación a gran escala
OpenAI ha publicado 722 manuscritos agrupados en 372 familias, generados por un modelo interno al trabajar sobre unos 4.000 problemas abiertos. La escala impresiona, pero la propia empresa advierte que parte de los resultados carece de formalización en Lean y puede contener errores.
No se pudo cargar la imagen.
OpenAI ha publicado un catálogo de 722 manuscritos matemáticos agrupados en 372 familias de resultados. Surgieron al evaluar un modelo interno aún no publicado sobre unos 4.000 problemas abiertos. La empresa afirma que cada resultado consumió una media de tres horas de cálculo en el modo ChatGPT Pro thinking.
Un anuncio se convirtió en un archivo de 722 trabajos
El repositorio público incluye manuscritos, archivos fuente, instrucciones de citación y artefactos de prueba. Diez resultados seleccionados incorporan además resúmenes abreviados del razonamiento del modelo. La página del anuncio de OpenAI estaba bloqueada durante la verificación, por lo que este texto se apoya en el repositorio público de la empresa y en su documentación.
Los resultados se encuentran en distintas fases de comprobación. OpenAI señala expresamente que no todos cuentan con una formalización en Lean y que los trabajos sin formalizar pueden contener errores. El repositorio también conservará las correcciones y las versiones anteriores.
Los matemáticos reciben un catálogo, no una lista de avances confirmados
Para la comunidad investigadora, el problema central es ahora la escala. Revisar cientos de manuscritos para comprobar su corrección, relevancia, originalidad y relación con trabajos previos exigirá mucho más tiempo experto que generarlos. El número total dice poco sobre cuántos resultados superarán la revisión.
Lean puede comprobar la corrección formal de las pruebas que se hayan traducido a su lenguaje. Por sí solo no determina si un resultado es nuevo, importante o ya conocido con otro nombre. OpenAI ha trasladado parte de la evaluación desde un benchmark interno hacia la comunidad matemática pública.
Tres horas de cálculo no sustituyen una revisión experta
La media declarada de tres horas por resultado describe el coste de generación, no el coste de establecer conocimiento. La factura real incluye revisar supuestos, rastrear la prioridad, corregir manuscritos y dedicar el tiempo de especialistas capaces de distinguir un avance de un teorema conocido con otro envoltorio.
Los 57.328 archivos Lean del repositorio tampoco equivalen a 57.328 descubrimientos verificados de forma independiente. Forman parte de una gran biblioteca de materiales auxiliares y OpenAI reconoce que la formalización sigue incompleta.
Las revisiones independientes y el historial de correcciones decidirán
La señal decisiva serán las familias concretas que matemáticos independientes consideren novedosas y correctas. También importará cuántos manuscritos se corrigen, retiran o reciben una formalización durante los próximos meses.
El repositorio promete conservar las versiones anteriores. Si ese historial sigue siendo legible, mostrará tanto la capacidad del modelo como el coste de limpiar afirmaciones matemáticas producidas a escala industrial.
El veredicto de Lilith
OpenAI ha dejado 722 manuscritos sobre la mesa de los matemáticos. Ahora veremos cuáles resisten una pizarra llena de objeciones y cuáles acaban bajo el lápiz rojo.
Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.
Fuente original ↗ ↗