2026-10-06 · ← News
OpenAI veröffentlicht 722 mathematische Manuskripte und macht die Prüfung zum Engpass
OpenAI hat 722 mathematische Manuskripte in 372 Ergebnisfamilien veröffentlicht, erstellt von einem nicht freigegebenen internen Modell. Der Umfang verschiebt die entscheidende Frage von der Zahl der Ergebnisse zu der Zahl, die unabhängige Mathematiker tatsächlich prüfen können.
Das Bild konnte nicht geladen werden.
OpenAI hat auf GitHub einen Katalog mit 722 mathematischen Manuskripten veröffentlicht, gegliedert in 372 Familien verwandter Ergebnisse. Nach Angaben des Unternehmens entstand die große Mehrheit mit demselben Verfahren und einem nicht freigegebenen internen Modell, dem rund 4.000 offene Probleme vorgelegt wurden. Pro Ergebnis fielen im Schnitt drei Stunden Rechenaufwand auf dem Niveau von ChatGPT Pro thinking an.
Aus einer Evaluation wurde ein Katalog mit 722 Manuskripten
Das Repository enthält PDF-Dateien, Quelldateien, Zitationshinweise und unterstützende Beweisartefakte. Für zehn ausgewählte Ergebnisse gibt es gekürzte Zusammenfassungen des Modellwegs. OpenAI stellt außerdem einen Katalog mit Lean-Formalisierungen bereit, weist aber ausdrücklich darauf hin, dass nicht alle Manuskripte formalisiert sind und ungeprüfte Ergebnisse Fehler enthalten können.
Eine Ergebnisfamilie kann eine Hauptaussage, alternative Beweise und verwandte Folgerungen umfassen. Deshalb stehen 722 Manuskripte nicht für 722 unabhängig gelöste Probleme. Die 372 Familien beschreiben den Umfang sinnvoller als die reine Dateizahl.
Die Beweisproduktion überholt die Lesekapazität des Fachs
Für Mathematiker wird die Verteilung von Aufmerksamkeit zum praktischen Problem. Ein Team kann Hunderte Texte erzeugen, während die Prüfung jedes Beweises weiterhin Fachleute, Zeit und oft eine formale Rekonstruktion verlangt. GitHub löst Verteilung und Versionierung, aber kein wissenschaftliches Vertrauen.
Damit ändert sich die Ökonomie der Forschungsarbeit. Wert entsteht sowohl durch das Modell, das einen Beweis vorschlägt, als auch durch Systeme, die Ergebnisse nach Bedeutung ordnen, Voraussetzungen offenlegen und strittige Schritte an passende Experten weiterleiten. Die tiefere Geschichte handelt von der Verwaltung eines Forschungsüberschusses.
Lean deckt einen Teil ab, der Rest wartet auf Kontrolle
Ein formales Artefakt kann zeigen, dass eine konkrete Aussage in einer festgelegten Prüfumgebung besteht. Neuheit, Bedeutung oder die korrekte Einordnung in die Literatur belegt es allein nicht. OpenAI nennt zudem Ausnahmen vom Standardverfahren und ein von Menschen redigiertes Manuskript. Der Katalog ist daher kein homogener Benchmark aus einer einzigen Methode.
Das größte Risiko liegt darin, dass die Menge einen Konsens vortäuscht, bevor unabhängige Prüfung stattfindet. Bei 372 Familien zählen die öffentliche Korrekturhistorie und die Reproduzierbarkeit entscheidender Schritte ohne Vertrauen in das private Modell mehr als die Ankündigung.
Bestätigungen und Korrekturen bestimmen den wirklichen Wert
Entscheidend wird sein, wie viele Familien unabhängig bestätigt werden, wie viele Manuskripte Korrekturen erhalten und wo gewichtige Gegenargumente auftauchen. Ebenso wichtig ist, ob OpenAI weitere Formalisierungen ergänzt und ob die Prüfung über die an der Veröffentlichung beteiligten Gruppen hinausreicht.
Weitere hundert PDF-Dateien wären eine schwache Erfolgskennzahl. Die Zeit von der Veröffentlichung bis zur Prüfung und der Anteil der Ergebnisse, die der Begutachtung durch Fachleute standhalten, zeigen den tatsächlichen Wert des Katalogs.
Liliths Urteil
OpenAI legt Mathematikern 722 Manuskripte auf einmal vor. Wirkliches Gewicht bekommen nur jene, deren Beweise monatelange unabhängige Anmerkungen überstehen.
Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.
Originalquelle ↗ ↗