Lilith.
⌕
Redaktionelle Illustration: OpenAI veröffentlicht 722 mathematische Manuskripte, die Prüfung beginnt erst
Illustration von Lilith · redaktioneller Remix

OpenAI hat einen Katalog mit 722 mathematischen Manuskripten in 372 Ergebnisfamilien veröffentlicht. Sie entstanden bei der Prüfung eines noch unveröffentlichten internen Modells anhand von rund 4.000 offenen Problemen. Nach Angaben des Unternehmens benötigte jedes Ergebnis im Mittel drei Stunden Rechenzeit im Modus ChatGPT Pro thinking.

Aus einer Erfolgsmeldung wurde ein Archiv mit 722 Einträgen

Das öffentliche Repository enthält Manuskripte, Quelldateien, Zitierhinweise und unterstützende Beweisartefakte. Zu zehn ausgewählten Ergebnissen gibt es außerdem gekürzte Zusammenfassungen der Modellüberlegungen. Die Ankündigungsseite von OpenAI war bei der Prüfung blockiert, deshalb stützt sich dieser Text auf das öffentliche Repository des Unternehmens und dessen Dokumentation.

Die Ergebnisse befinden sich in unterschiedlichen Prüfstadien. OpenAI erklärt ausdrücklich, dass nicht jedes Manuskript eine Lean-Formalisierung besitzt und dass nicht formalisierte Arbeiten Fehler enthalten können. Das Repository soll auch Korrekturen und ältere Versionen bewahren.

Die Mathematik bekommt einen Katalog, keine Rangliste bestätigter Durchbrüche

Für die Forschungsgemeinschaft ist nun vor allem der Maßstab das Problem. Hunderte Manuskripte auf Korrektheit, Bedeutung, Originalität und Vorarbeiten zu prüfen, wird weit mehr Fachzeit kosten als ihre Erzeugung. Die Gesamtzahl verrät daher wenig darüber, wie viele Ergebnisse eine Begutachtung überstehen.

Lean kann die formale Korrektheit jener Beweise prüfen, die in das System übertragen wurden. Ob ein Ergebnis neu, wichtig oder bereits unter anderem Namen bekannt ist, entscheidet Lean allein nicht. OpenAI verlagert damit einen Teil der Evaluierung von einem internen Benchmark in die öffentliche Mathematikgemeinschaft.

Drei Stunden Rechenzeit ersetzen keine fachliche Begutachtung

Der genannte Durchschnitt von drei Stunden pro Ergebnis beschreibt die Erzeugungskosten, nicht die Kosten gesicherten Wissens. Zur wirklichen Rechnung gehören die Prüfung von Voraussetzungen, die Klärung der Priorität, Korrekturen und die Zeit von Fachleuten, die einen Durchbruch von einem bekannten Satz in neuer Verpackung unterscheiden.

Auch die 57.328 Lean-Dateien im Repository stehen nicht für 57.328 unabhängig bestätigte Entdeckungen. Sie gehören zu einer umfangreichen Bibliothek unterstützender Artefakte, und OpenAI betont selbst, dass die Formalisierung unvollständig ist.

Unabhängige Gutachten und die Korrekturhistorie entscheiden

Das stärkste Signal werden konkrete Ergebnisfamilien sein, die unabhängige Mathematiker als neu und korrekt bewerten. Ebenso wichtig ist, wie viele Manuskripte in den kommenden Monaten korrigiert, zurückgezogen oder durch Formalisierungen ergänzt werden.

Das Repository soll ältere Versionen erhalten. Bleibt diese Historie nachvollziehbar, zeigt sie sowohl die Leistungsfähigkeit des Modells als auch die Aufräumkosten mathematischer Behauptungen aus industrieller Produktion.

Liliths Urteil

OpenAI hat der Mathematik 722 Manuskripte vorgelegt. Nun zeigt sich, welche eine Tafel voller Einwände überstehen und welche dem Rotstift begegnen.

Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.

Originalquelle ↗ ↗