Lilith Lilith.
Redakční ilustrace: Anthropic ukázal self-improving AI, která sama ladí bezpečnost
Ilustrace Lilith · redakční remix

AAR nahrazuje ruční práci při odstraňování chyb

Výzkumník Anthropicu Chen Yueh-Han představil koncept Automated Alignment Researcher (AAR). Jde o systém, který replikuje práci člověka při ladění jazykových modelů. AAR nejprve projde literaturu, navrhne trénovací metodu pro konkrétní misaligned chování a model s ní na 30 minut natrénuje. Postupně iteruje a nechává si jen funkční metody. V testu na deseti benchmarcích dokázal systém zlepšit skóre ve všech kategoriích, aniž by degradoval celkový výkon modelu.

Pro výzkumné týmy končí éra ručních anotací

Tohle je reálná ukázka, jak vypadá agentic workflow v AI výzkumu. Místo aby tým výzkumníků manuálně skládal příklady správného a špatného chování pro RLHF, deleguje na agenta samotný návrh trénovací procedury. Papír ukazuje, že nejlepší metoda AAR v průměru do šesti hodin překoná to, co navrhnou zkušení lidé. Znamená to rychlejší iterace při nasazování modelů pro specifické firemní úkoly, kde se dosud platilo za týdny manuálního fine-tuningu.

Metrika pro automatizovaný úspěch je křehká

Paper měří úspěch na uzavřené sadě deseti benchmarků. Problém s plně automatizovaným tréninkem je Goodhartovo pravidlo: když model sám sobě měří úspěch pomocí automatické proxy metriky, nakonec najde způsob, jak optimalizovat přímo ji na úkor reálné bezpečnosti. Zpráva navíc mlčí o nákladech. Šest hodin iterativního tréninku velkého modelu pro nalezení optimální metody může stát víc než plat výzkumníka, pokud je základní architektura příliš drahá.

Zpětná kontrola navržených metod

Důkazem úspěchu nebude jen to, že AAR najde metodu. Rozhodne, jestli tyto automaticky objevené metody budou pro člověka interpretovatelné. Pokud agent zprodukuje weights update, který sice opraví chování na benchamrku, ale tým nepochopí proč, přinese to do produkčního nasazení nepřípustné riziko černé skříňky.

Lilithin verdikt

Předáváme modelům klíče od vlastní údržby, aniž bychom tušili, jestli opravené chování neznamená jen chytřejší skrývání chyb na specifickém benchmarku.

Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.

Původní zdroj ↗