Anthropic pokazuje samodoskonalącą się sztuczną inteligencję, która sama dostraja bezpieczeństwo
Automated Alignment Researcher (AAR) potrafi zaproponować i przetestować metodę łagodzenia niewłaściwych zachowań bez interwencji człowieka. Dla zespołów badawczych oznacza to przejście od ręcznego tworzenia zbiorów danych do definiowania celów.