Lilith Lilith.
Redakční ilustrace: GPT-6 Astra: Skrytý myšlenkový pochod neskrývá víc, než chybí v samotné architektuře
Ilustrace Lilith · redakční remix

Perex: Model GPT-6 Astra přinesl lepší výsledky, ale i znepokojení z kratších a skrytých myšlenkových pochodů (Chain of Thought). Detailní pohled na jeho pravděpodobnou architekturu ale vysvětluje, proč se model může obejít bez sáhodlouhého vnitřního dialogu.

Zacyklený transformátor recykluje bloky místo přidávání nových

Podle technických spekulací, které rozebírá výzkumník Sebastian Raschka, GPT-6 Astra využívá koncept zacyklených transformátorů (looped transformers). Místo toho, aby model zpracovával data v dlouhé řadě jednorázových bloků, posílá mezivýpočty zpět přes stejnou sadu bloků. Váhy v těchto blocích zůstávají stejné, čímž model získává takzvanou rekurentní hloubku bez dramatického nárůstu počtu parametrů. Nejde o novou myšlenku (objevila se už u Universal Transformers v roce 2018), ale zdá se, že OpenAI našla způsob, jak ji zefektivnit. Ve stejném výpočetním rozpočtu dokáže model díky zacyklení dosáhnout lepších výsledků než tradiční architektura.

Méně uvažování není nutně zatajování důkazů

Jednou z hlavních výtek vůči GPT-6 Astra je snížená monitorovatelnost. Model generuje kratší myšlenkové pochody než jeho předchůdci. Raschka ale argumentuje, že to nemusí nutně znamenat strategické zatajování. Schopnější modely prostě dělají méně chyb a nepotřebují tolik zkoušet slepé uličky. Kratší Chain of Thought může být prostě důsledkem toho, že model najde správné řešení dříve. Stejný trend ostatně platil už u dřívějších modelů. Menší Luna vyžadovala více tokenů na uvažování než schopnější Sol, aby dosáhla podobného výsledku. Zacyklení přidává výpočetní výkon uvnitř samotné architektury, čímž snižuje potřebu využívat externí uvažovací tokeny jako improvizovaný zápisník.

Počítač jako prostředí, ne jen jako hardwarová výbava

Zatímco diskuse se točí kolem architektury, skutečným průlomem Astry je schopnost ovládat grafické uživatelské rozhraní (computer use). Raschka poukazuje na to, že nákupy obrovského množství Maců společností OpenAI nesloužily přímo k tréninku, ale k vytvoření interaktivního prostředí macOS. Model se pomocí zpětnovazebního učení učí rozpoznávat obrazovku a generovat akce myši nebo klávesnice. To z modelu dělá mnohem univerzálnější nástroj pro úkoly, které nemají vlastní API rozhraní.

Tlak na odlišné nástroje odhalí limity stávajících postupů

Očekávání od budoucích modelů by se měla posunout od abstraktních úvah k interakci s reálnými systémy. Pro vývojáře to znamená jediné. Budou muset zahodit staré instrukce (prompty) a smazat sáhodlouhé manuály (SKILL.md), které starším modelům radily krok za krokem. Nové modely už tuhle pomoc nepotřebují, a příliš podrobný návod by je jen omezoval. Otázkou zůstává, jak rychle dokážou open source řešení napodobit nejen architekturu, ale i trénovací infrastrukturu nezbytnou pro plynulé ovládání uživatelských rozhraní.

Lilithin verdikt

Pokud kratší uvažování vychází z vrácených smyček v síti, Astra není nutně záludnější, jen je lepší v počítání zpaměti než na papíře. V obou případech ale vidíte do hlavy modelu podstatně méně.

Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.

Původní zdroj ↗