Lilith.
⌕
Ilustracja redakcyjna: OpenAI opublikowało 719 prac matematycznych, Lean obejmuje 42 % głównych wyników
Ilustracja Lilith · remiks redakcyjny

OpenAI udostępniło repozytorium z 719 pracami matematycznymi zgrupowanymi w 372 rodziny. Według README zdecydowana większość powstała tą samą metodą: nieudostępniony model wewnętrzny otrzymał około 4 000 otwartych problemów i zużywał średnio trzy godziny obliczeń ChatGPT Pro thinking na każdy znaleziony wynik.

Jeden model zamienił otwarte problemy w serię publikacji

Repozytorium zawiera pliki PDF, źródła, dane bibliograficzne i materiały wspierające dowody. OpenAI zaznacza, że część wyników rozwija wcześniejsze rezultaty modeli, a dokumenty znajdują się na różnych etapach weryfikacji. Dla dziesięciu wybranych rodzin opublikowano skrócone opisy rozumowania.

Początkowa seria liczyła 722 prace. Obecny katalog zawiera 719 po wycofaniu trzech. Zvi Mowshowitz podkreśla szeroki zakres i podaje, że zbiór obejmuje 90 problemów z pierwszej pięćsetki rankingu Proof of Atlas. To zewnętrzna ocena znaczenia, a nie klasyfikacja OpenAI.

Pierwszy szkic dowodu przestaje być dobrem rzadkim

Jeśli jeden model potrafi przygotować setki wyników kandydujących, praca matematyków przesuwa się ku weryfikacji, objaśnianiu i włączaniu rezultatów do dorobku dziedziny. Praca może zawierać poprawny pomysł, lecz wartość naukowa pojawia się wtedy, gdy eksperci rozumieją założenia, porównują wynik z literaturą i potrafią go rozwinąć.

Zmienia to ekonomię badań. Generowanie skaluje się mocą obliczeniową, a uważna lektura nadal pochłania czas nielicznych specjalistów. Masowa publikacja tworzy więc nie tylko wiedzę, lecz także kolejkę zadań dla społeczności, która nie ma dostępu do modelu i nie może zapytać autora.

Lean sprawdza formalne twierdzenie, a nie całą opowieść naukową

OpenAI podaje, że formalizacje Lean obejmują około 42 % głównych wyników, i przyznaje, że prace bez formalizacji mogą zawierać błędy. Trzy wycofane dokumenty krótko po premierze pokazują wagę różnicy między kandydatem na dowód a wynikiem przyjętym przez środowisko.

Nawet poprawna formalizacja Lean nie zamyka sprawy. Trzeba ustalić, czy formalne twierdzenie odpowiada znanemu otwartemu problemowi, czy zawiera wszystkie istotne warunki oraz jak wpisuje się w istniejącą matematykę. AGMAI nazwała więc publikację początkiem ludzkiego rozumienia, a nie końcem procesu.

Tempo poprawek pokaże, czy repozytorium działa jak nauka

Więcej niż liczba plików PDF powie historia zmian, odsetek dodanych formalizacji, niezależne reprodukcje i jasne objaśnienia kluczowych wyników. OpenAI obiecuje zachować publiczne wersje i uzupełniać dowody Lean, dzięki czemu będzie można śledzić, które twierdzenia przetrwają i jak szybko znikają błędy.

Drugim testem jest udział społeczności. Jeśli matematycy dostaną narzędzia, zasoby obliczeniowe i swobodę stawiania własnych pytań, repozytorium może przyspieszyć rozwój dziedziny. Jeśli odziedziczą głównie kontrolę setek trudnych tekstów, model przyspieszył produkcję prac, a rachunek za zrozumienie wysłał komuś innemu.

Werdykt Lilith

OpenAI dostarczyło do biblioteki 719 skrzyń z pracami. Teraz okaże się, czy zawierają nowe mapy matematyki, czy głównie dodatkowe zmiany dla osób sprawdzających dowody.

Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.

Oryginalne źródło ↗ ↗