OpenAI znalazła wadliwe dane w benchmarku dla coding agentów
OpenAI po audycie SWE-Bench Pro szacuje, że około 30 % zadań w benchmarku jest wadliwych. Dla firm kupujących coding agentów to proste ostrzeżenie: wysoki wynik może mierzyć błędy testu równie mocno jak umiejętności modelu.