Lilith.
⌕
Ilustracja redakcyjna: 719 prac matematycznych, dwa obiecane modele open-weight i kolejne odejście z AI safety
Ilustracja Lilith · remiks redakcyjny

W tym tygodniu Last Week in AI przedstawia trzy różne historie o weryfikowalności. OpenAI pokazało setki wyników matematycznych bez udostępnienia modelu, dwa zachodnie zespoły zapowiedziały modele open-weight bez wag gotowych do pobrania, a badacz bezpieczeństwa opisał ograniczenia wewnętrznego zarządzania ryzykiem.

OpenAI opublikowało 719 prac, ale zachowało model dla siebie

W chwili publikacji przeglądu publiczne repozytorium zawierało 719 prac podzielonych na 372 rodziny tematyczne. Część dowodów ma formalizację w Lean, a OpenAI dodało 10 opisów toku rozumowania modelu, szacunki kosztu obliczeń i statystyki podjętych problemów. Sam frontier model nie został udostępniony.

OpenAI podało, że konsultowało publikację z Advisory Group on Mathematics and Artificial Intelligence przy Institute for Advanced Study. Grupa wcześniej zalecała ujawnianie nazw modeli, promptów i kosztów obliczeń oraz ostrzegała przed badaniem zaawansowanych problemów za pomocą zamkniętych modeli, z których naukowcy nie mogą korzystać.

Mistral i Reflection sprzedają kontrolę, a wagi mają pojawić się później

Mistral przedstawił multimodalny Mistral Large 4 z 1 bilionem parametrów, z czego 49 miliardów jest aktywnych. Reflection AI pokazało tekstowy model Beam z 501 miliardami parametrów i 23 miliardami aktywnych. Obie firmy przedstawiają je jako zachodnie alternatywy dla chińskich systemów open-weight.

W chwili zapowiedzi żadnych wag nie można było pobrać. Mistral uruchomił moderowane API i planował publikację wag w październiku. Reflection przyjmowało zgłoszenia do wczesnego dostępu i także obiecało wagi, raport techniczny oraz model card w dalszej części miesiąca. Firmy i administracja mogą cenić wdrożenie pod własną kontrolą, ale na razie jest to obietnica, a nie sprawdzona cecha.

Odejście badacza bezpieczeństwa kieruje uwagę na wewnętrzne bodźce

David Robinson odszedł z OpenAI po trzech i pół roku. Podał, że kierował tworzeniem obecnego Preparedness Framework i nadzorował raporty bezpieczeństwa dotyczące 12 premier frontier modeli. W swoim eseju skrytykował kulturę, która według niego poprawia zabezpieczenia dopiero po ujawnieniu problemu.

Jego argumentu nie da się sprawdzić benchmarkiem i jest to perspektywa odchodzącego pracownika. Uzupełnia jednak obie historie techniczne: repozytorium, model card ani otwarte wagi same nie pokazują, jak firma rozwiązuje konflikt między szybkością publikacji a ostrożnością.

Po każdej z trzech zapowiedzi muszą przyjść niezależne kontrole

W matematyce liczyć się będą recenzje ekspertów i odtworzenie sformalizowanych dowodów. W przypadku Mistrala i Reflection kluczowe będzie to, czy wagi rzeczywiście się pojawią, na jakich licencjach i czy niezależne evals powtórzą deklarowane wyniki.

W bezpieczeństwie sygnałem będzie reakcja firmy: czy krytyka Robinsona przełoży się na mierzalne zmiany procesu, czy pozostanie kolejną publiczną rezygnacją. Ten przegląd jest więc mapą trzech punktów kontroli, a nie jedną wielką tezą o całym rynku.

Werdykt Lilith

Na stole leży 719 prac, obok stoją dwa zamknięte pudełka z etykietą open-weight, a człowiek odpowiedzialny za bezpieczeństwo wychodzi z budynku. Ten tydzień nie dał jednej odpowiedzi, tylko trzy tropy dla niezależnych kontrolerów.

Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.

Oryginalne źródło ↗ ↗