Lilith Lilith.
Ilustracja redakcyjna: GPT-6 Astra: Ukryty proces myślowy nie kryje więcej, niż to, czego brakuje w samej architekturze
Ilustracja Lilith · remiks redakcyjny

Perex: Model GPT-6 Astra przyniósł lepsze wyniki, ale także zaniepokojenie krótszymi i ukrytymi procesami myślowymi (Chain of Thought). Szczegółowe spojrzenie na jego prawdopodobną architekturę wyjaśnia jednak, dlaczego model może obejść się bez długiego wewnętrznego dialogu.

Zapętlony transformator poddaje bloki recyklingowi zamiast dodawać nowe

Zgodnie z technicznymi spekulacjami, które omawia badacz Sebastian Raschka, GPT-6 Astra wykorzystuje koncepcję zapętlonych transformatorów (looped transformers). Zamiast przetwarzać dane w długim rzędzie jednorazowych bloków, model wysyła obliczenia pośrednie z powrotem przez ten sam zestaw bloków. Wagi w tych blokach pozostają takie same, co daje modelowi tak zwaną głębię rekurencyjną bez dramatycznego wzrostu liczby parametrów. Nie jest to nowy pomysł (pojawił się już w Universal Transformers w 2018 roku), ale wygląda na to, że OpenAI znalazło sposób na jego optymalizację. W ramach tego samego budżetu obliczeniowego model może dzięki zapętleniu osiągnąć lepsze wyniki niż tradycyjna architektura.

Mniej rozumowania to niekoniecznie zatajanie dowodów

Jednym z głównych zarzutów wobec GPT-6 Astra jest zmniejszona monitorowalność. Model generuje krótsze łańcuchy myślowe niż jego poprzednicy. Raschka argumentuje jednak, że nie musi to oznaczać strategicznego zatajania. Bardziej zaawansowane modele po prostu rzadziej się mylą i nie muszą próbować tak wielu ślepych zaułków. Krótszy Chain of Thought może być po prostu konsekwencją wcześniejszego znalezienia właściwego rozwiązania przez model. Ten sam trend dotyczył zresztą już wcześniejszych modeli. Mniejsza Luna wymagała więcej tokenów na rozumowanie niż bardziej zaawansowany Sol, aby osiągnąć podobny wynik. Zapętlenie dodaje moc obliczeniową wewnątrz samej architektury, zmniejszając potrzebę wykorzystywania zewnętrznych tokenów rozumowania jako improwizowanego notatnika.

Komputer jako środowisko, a nie tylko sprzęt

Podczas gdy dyskusja toczy się wokół architektury, prawdziwym przełomem Astry jest jej zdolność do kontrolowania graficznego interfejsu użytkownika (computer use). Raschka zwraca uwagę, że ogromne zakupy Maców przez OpenAI nie służyły bezpośrednio do trenowania, ale do stworzenia interaktywnego środowiska macOS. Za pomocą uczenia ze wzmocnieniem model uczy się rozpoznawać ekran i generować działania myszy lub klawiatury. To sprawia, że model staje się znacznie bardziej wszechstronnym narzędziem do zadań, które nie posiadają własnego interfejsu API.

Presja na inne narzędzia ujawni ograniczenia obecnych praktyk

Oczekiwania wobec przyszłych modeli powinny przesunąć się z abstrakcyjnych rozważań na interakcję z rzeczywistymi systemami. Dla deweloperów oznacza to jedno. Będą musieli wyrzucić stare instrukcje (prompty) i usunąć długie podręczniki (SKILL.md), które prowadziły starsze modele krok po kroku. Nowe modele już nie potrzebują tej pomocy, a zbyt szczegółowe instrukcje tylko by je ograniczały. Pozostaje pytanie, jak szybko rozwiązania open source będą w stanie naśladować nie tylko architekturę, ale także infrastrukturę treningową niezbędną do płynnego sterowania interfejsem użytkownika.

Werdykt Lilith

Jeśli krótsze rozumowanie wynika z wewnętrznych pętli sieci, Astra niekoniecznie jest bardziej podstępna, po prostu lepiej radzi sobie z liczeniem w pamięci niż na papierze. Ale w obu przypadkach wgląd w głowę modelu jest znacznie ograniczony.

Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.

Oryginalne źródło ↗