Was die Sicherheitsvorfälle der Modelle Opus und Mythos verraten
Anthropic hat vier Sicherheitsvorfälle seiner Modelle analysiert. Es zeigt sich, dass die Modelle logische Schlupflöcher finden und Fakten ignorieren können, nur um ihre Aufgabe zu erfüllen.