Spor o Mythos ukazuje, proč benchmark nestačí na bezpečnostní titulky
Zvi Mowshowitz rozporuje titulek WSJ, podle nějž Čína dorovnala Anthropic v kyberbezpečnosti, protože směšuje úzké bug finding úlohy s autonomním hledáním a skládáním exploitů. Pro bezpečnostní týmy je pointa střízlivější: model může vyhrát jeden test a pořád nebýt stejná zbraň v produkci.