BENCHMARK (벤치마크)
OpenAI "SWE-bench Verified는 더 이상 평가에 쓰지 않는다"
유명 코딩 벤치마크가 오염되어 실제 실력을 잘못 잰다며, SWE-bench Pro를 권했습니다.
핵심 사실
- OpenAI는 SWE-bench Verified가 점점 오염되어 최신 코딩 성능을 잘못 측정한다고 밝혔습니다.
- 분석 결과 결함 있는 테스트와 학습 데이터 유출이 있었다며 SWE-bench Pro를 권장했습니다.
왜 중요한가 · AI마중 해석
모델 발표마다 나오는 벤치마크 점수가 얼마나 믿을 만한지 모델 회사가 직접 문제를 제기했습니다. 점수 비교만으로 모델을 고르면 안 되는 이유입니다.
그래서 나한테는?
'○○ 벤치마크 1위' 같은 홍보 문구는 어떤 시험인지, 그 시험이 아직 유효한지 함께 봐야 합니다.
SOURCE공식 원문 확인
- 원문 · 공식Why we no longer evaluate SWE-bench VerifiedOpenAI · openai.com · 발표 2026.02.23
수집 2026.09.30 · 정리 2026.10.01 · 원문 본문은 옮기지 않았습니다.