OpenAI našla rozbitá data v benchmarku, který měl měřit coding agenty
OpenAI po auditu SWE-Bench Pro odhaduje, že zhruba 30 % úloh v benchmarku je rozbitých. Pro týmy kupující coding agenty je to varování, že vysoké skóre může měřit kvalitu testu stejně jako kvalitu modelu.