Anthropic ukázal self-improving AI, která sama ladí bezpečnost
Automated Alignment Researcher (AAR) dokáže bez lidského zásahu navrhnout a otestovat metodu pro odstranění misaligned chování. Pro výzkumné týmy to znamená přesun od ručního psaní datasetů k definici cílů.