Lilith.
⌕
Ilustracja redakcyjna: OpenAI opublikowało 722 prace matematyczne, a weryfikacja dopiero się zaczyna
Ilustracja Lilith · remiks redakcyjny

OpenAI opublikowało katalog 722 prac matematycznych zebranych w 372 rodziny wyników. Powstały podczas testowania niewydanego modelu wewnętrznego na około 4 000 otwartych problemów. Firma podaje, że każdy wynik wymagał średnio trzech godzin mocy obliczeniowej w trybie ChatGPT Pro thinking.

Zamiast jednego triumfu powstało archiwum 722 prac

Publiczne repozytorium zawiera manuskrypty, pliki źródłowe, instrukcje cytowania i pomocnicze artefakty dowodowe. Dziesięć wybranych wyników ma także skrócone opisy toku rozumowania modelu. Strona ogłoszenia OpenAI była zablokowana podczas weryfikacji, dlatego opis opiera się na publicznym repozytorium firmy i jego dokumentacji.

Wyniki znajdują się na różnych etapach sprawdzania. OpenAI wyraźnie zaznacza, że nie każda praca ma formalizację w Leanie, a materiały niesformalizowane mogą zawierać błędy. Repozytorium ma również zachowywać poprawki i wcześniejsze wersje.

Matematycy dostali katalog, a nie ranking przełomów

Dla środowiska naukowego najważniejszy staje się problem skali. Ocena setek prac pod kątem poprawności, znaczenia, oryginalności i wcześniejszej literatury pochłonie znacznie więcej czasu ekspertów niż ich wygenerowanie. Sama liczba niewiele więc mówi o tym, ile wyników przetrwa recenzję.

Lean potrafi sprawdzić formalną poprawność dowodów, które zostały do niego przełożone. Sam nie rozstrzygnie, czy wynik jest nowy, ważny albo znany już pod inną nazwą. OpenAI przeniosło część kosztu ewaluacji z wewnętrznego benchmarku na publiczną społeczność matematyczną.

Trzy godziny obliczeń nie zastąpią recenzji eksperta

Podana średnia trzech godzin na wynik opisuje koszt generowania, a nie koszt ustanowienia wiedzy. Pełny rachunek obejmuje kontrolę założeń, ustalenie pierwszeństwa, poprawianie tekstów oraz czas specjalistów, którzy odróżnią przełom od znanego twierdzenia w nowym opakowaniu.

Także 57 328 plików Lean w repozytorium nie oznacza 57 328 niezależnie potwierdzonych odkryć. To element dużej biblioteki materiałów pomocniczych, a samo OpenAI przyznaje, że formalizacja pozostaje niepełna.

Niezależne recenzje i historia poprawek rozstrzygną sprawę

Najmocniejszym sygnałem będą konkretne rodziny wyników, które niezależni matematycy uznają za nowe i poprawne. Równie istotna okaże się liczba prac poprawionych, wycofanych lub uzupełnionych o formalizację w kolejnych miesiącach.

Repozytorium ma zachowywać wcześniejsze wersje. Jeśli historia zmian pozostanie czytelna, pokaże zarówno możliwości modelu, jak i koszt porządkowania matematycznych twierdzeń produkowanych na przemysłową skalę.

Werdykt Lilith

OpenAI położyło przed matematykami 722 prace. Teraz zobaczymy, które wytrzymają tablicę pełną cudzych uwag, a które skończą pod czerwonym ołówkiem.

Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.

Oryginalne źródło ↗ ↗