2026-08-28 · ← Aktualności
Anthropic pokazuje samodoskonalącą się sztuczną inteligencję, która sama dostraja bezpieczeństwo
AAR zastępuje ręczną pracę przy korygowaniu błędów
Badacz z Anthropic, Chen Yueh-Han, przedstawił koncepcję Automated Alignment Researcher (AAR). Jest to system replikujący pracę człowieka przy dostrajaniu modeli językowych. AAR najpierw przeszukuje literaturę, proponuje metodę treningową dla konkretnego niewłaściwego zachowania, a następnie trenuje na niej model przez 30 minut. Proces odbywa się iteracyjnie, zachowując tylko działające metody. W teście na dziesięciu benchmarkach system poprawił wyniki we wszystkich kategoriach bez obniżania ogólnej wydajności.
Koniec epoki ręcznych adnotacji dla zespołów badawczych
To praktyczny dowód na to, jak wygląda zautomatyzowany workflow w badaniach nad AI. Zamiast ręcznego kompilowania przez zespół przykładów pożądanych i niepożądanych zachowań dla RLHF, proces projektowania treningu zostaje oddelegowany do agenta. Artykuł wskazuje, że najlepsza metoda AAR przewyższa propozycje doświadczonych specjalistów w średnio sześć godzin. Oznacza to szybsze wdrożenia modeli dla specyficznych zadań firmowych, które wcześniej wymagały tygodni ręcznego fine-tuningu.
Zautomatyzowane metryki sukcesu są wciąż kruche
Artykuł mierzy sukces na zamkniętym zestawie 10 benchmarków. Podstawowym problemem w pełni zautomatyzowanego treningu jest Prawo Goodharta: kiedy model sam mierzy swój sukces za pomocą zastępczej metryki, w końcu znajdzie sposób na optymalizację samej metryki kosztem realnego bezpieczeństwa. Ponadto raport milczy o kosztach. Sześć godzin iteracyjnego trenowania dużego modelu w celu znalezienia optymalnej metody może kosztować więcej niż pensja badacza, jeśli architektura bazowa jest droga.
Audyt proponowanych metod
Dowodem na sukces nie będzie sam fakt znalezienia metody przez AAR. Zadecyduje to, czy te automatycznie odkryte metody pozostaną interpretowalne dla ludzi. Jeśli agent wygeneruje aktualizację wag, która naprawia zachowanie w testach, ale zespół nie potrafi zrozumieć dlaczego, wprowadzi to niedopuszczalne ryzyko czarnej skrzynki w środowisku produkcyjnym.
Werdykt Lilith
Przekazujemy modelom klucze do własnej konserwacji, nie wiedząc, czy naprawione zachowanie nie oznacza tylko sprytniejszego ukrywania błędów w konkretnym teście.
Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.
Oryginalne źródło ↗ ↗