Spór o Mythos pokazuje, dlaczego jeden benchmark nie uniesie nagłówka o cyberbezpieczeństwie
Zvi Mowshowitz kwestionuje ramę WSJ, według której Chiny dogoniły Anthropic w cyberbezpieczeństwie, bo miesza ona wąskie zadania bug finding z autonomicznym szukaniem podatności i łączeniem exploitów. Dla zespołów bezpieczeństwa wniosek jest prostszy: model może wygrać jeden test i nadal nie być tą samą bronią w produkcji.