Lilith Lilith.
Ilustración editorial: Los matemáticos exigen pruebas de que OpenAI no entrenó con su trabajo no publicado
Ilustración de Lilith · remezcla editorial

Otro académico cuestiona la pureza de los datos de entrenamiento

Apenas unos días después de que estallara una amarga disputa sobre si los modelos de OpenAI se beneficiaron de trabajos académicos no publicados, un segundo matemático ha dado un paso al frente con acusaciones de comportamiento poco ético. Los académicos exigen pruebas claras y transparencia a OpenAI sobre con qué se entrenaron exactamente los modelos que ahora hacen «descubrimientos» en matemáticas. La promesa comercial de modelos capaces de realizar inferencias matemáticas se encuentra así con la resistencia del campo que puede haber proporcionado involuntariamente esas capacidades.

Las reglas de publicación están cambiando para la comunidad científica

Ya no se trata de una clásica disputa de derechos de autor sobre artículos del New York Times. Las matemáticas se basan en compartir preprints y en un largo proceso de revisión por pares. Si los laboratorios de IA aspiran ArXiv y otros repositorios, incluidos borradores e ideas no publicadas, y el modelo luego «descubre» estos patrones como su propio resultado, los académicos pierden el control sobre el crédito de su trabajo. Para los departamentos de investigación universitarios, esto significa que compartir ideas en curso públicamente es de repente un riesgo enorme.

La deslumbrante demostración eclipsa el origen del conocimiento

Cuando un modelo escupe una elegante demostración matemática, parece un triunfo del razonamiento automático. Sin embargo, la realidad es que con modelos cerrados como los de OpenAI, no existe una forma fiable de separar la verdadera generalización y la capacidad de deducir lógicamente un resultado de la pura memorización de los datos de entrenamiento. Hasta que los laboratorios abran sus listas de fuentes, cada «nueva» solución a un problema complejo conlleva la sombra de sospecha de que el modelo simplemente la vio en algún lugar antes.

Una auditoría independiente mostrará quién debe a quién

Lo que decidirá la futura relación entre la academia y los gigantes de la IA no serán altisonantes declaraciones sobre colaboración. Será la voluntad de permitir que auditores independientes bajo NDA accedan a los datos de entrenamiento para confirmar que ideas específicas no fueron aspiradas antes de su publicación oficial. Hasta que esto ocurra, la presión de las autoridades del campo crecerá.

El veredicto de Lilith

El proceso académico de compartir ideas se ha convertido en una zona de extracción para las startups. Este es el recibo de un modelo de negocio construido sobre la base de aspirar preprints sin el consentimiento de los autores.

Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.

Fuente original ↗