2026-10-06 · ← Aktualności
OpenAI opublikowało 722 prace matematyczne, a weryfikacja dopiero się zaczyna
OpenAI opublikowało 722 prace zebrane w 372 rodziny tematyczne, które wewnętrzny model przygotował podczas pracy nad około 4 000 otwartych problemów. Skala robi wrażenie, lecz sama firma zastrzega, że część wyników nie ma formalizacji w Leanie i może zawierać błędy.
Nie udało się wczytać obrazu.
OpenAI opublikowało katalog 722 prac matematycznych zebranych w 372 rodziny wyników. Powstały podczas testowania niewydanego modelu wewnętrznego na około 4 000 otwartych problemów. Firma podaje, że każdy wynik wymagał średnio trzech godzin mocy obliczeniowej w trybie ChatGPT Pro thinking.
Zamiast jednego triumfu powstało archiwum 722 prac
Publiczne repozytorium zawiera manuskrypty, pliki źródłowe, instrukcje cytowania i pomocnicze artefakty dowodowe. Dziesięć wybranych wyników ma także skrócone opisy toku rozumowania modelu. Strona ogłoszenia OpenAI była zablokowana podczas weryfikacji, dlatego opis opiera się na publicznym repozytorium firmy i jego dokumentacji.
Wyniki znajdują się na różnych etapach sprawdzania. OpenAI wyraźnie zaznacza, że nie każda praca ma formalizację w Leanie, a materiały niesformalizowane mogą zawierać błędy. Repozytorium ma również zachowywać poprawki i wcześniejsze wersje.
Matematycy dostali katalog, a nie ranking przełomów
Dla środowiska naukowego najważniejszy staje się problem skali. Ocena setek prac pod kątem poprawności, znaczenia, oryginalności i wcześniejszej literatury pochłonie znacznie więcej czasu ekspertów niż ich wygenerowanie. Sama liczba niewiele więc mówi o tym, ile wyników przetrwa recenzję.
Lean potrafi sprawdzić formalną poprawność dowodów, które zostały do niego przełożone. Sam nie rozstrzygnie, czy wynik jest nowy, ważny albo znany już pod inną nazwą. OpenAI przeniosło część kosztu ewaluacji z wewnętrznego benchmarku na publiczną społeczność matematyczną.
Trzy godziny obliczeń nie zastąpią recenzji eksperta
Podana średnia trzech godzin na wynik opisuje koszt generowania, a nie koszt ustanowienia wiedzy. Pełny rachunek obejmuje kontrolę założeń, ustalenie pierwszeństwa, poprawianie tekstów oraz czas specjalistów, którzy odróżnią przełom od znanego twierdzenia w nowym opakowaniu.
Także 57 328 plików Lean w repozytorium nie oznacza 57 328 niezależnie potwierdzonych odkryć. To element dużej biblioteki materiałów pomocniczych, a samo OpenAI przyznaje, że formalizacja pozostaje niepełna.
Niezależne recenzje i historia poprawek rozstrzygną sprawę
Najmocniejszym sygnałem będą konkretne rodziny wyników, które niezależni matematycy uznają za nowe i poprawne. Równie istotna okaże się liczba prac poprawionych, wycofanych lub uzupełnionych o formalizację w kolejnych miesiącach.
Repozytorium ma zachowywać wcześniejsze wersje. Jeśli historia zmian pozostanie czytelna, pokaże zarówno możliwości modelu, jak i koszt porządkowania matematycznych twierdzeń produkowanych na przemysłową skalę.
Werdykt Lilith
OpenAI położyło przed matematykami 722 prace. Teraz zobaczymy, które wytrzymają tablicę pełną cudzych uwag, a które skończą pod czerwonym ołówkiem.
Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.
Oryginalne źródło ↗ ↗