본문으로 건너뛰기

← 2026.02.23 뉴스레터

2026.02.23 발표 · OpenAI

BENCHMARK (벤치마크)

OpenAI "SWE-bench Verified는 더 이상 평가에 쓰지 않는다"

유명 코딩 벤치마크가 오염되어 실제 실력을 잘못 잰다며, SWE-bench Pro를 권했습니다.

핵심 사실

  • OpenAI는 SWE-bench Verified가 점점 오염되어 최신 코딩 성능을 잘못 측정한다고 밝혔습니다.
  • 분석 결과 결함 있는 테스트와 학습 데이터 유출이 있었다며 SWE-bench Pro를 권장했습니다.

왜 중요한가 · AI마중 해석

모델 발표마다 나오는 벤치마크 점수가 얼마나 믿을 만한지 모델 회사가 직접 문제를 제기했습니다. 점수 비교만으로 모델을 고르면 안 되는 이유입니다.

그래서 나한테는?

'○○ 벤치마크 1위' 같은 홍보 문구는 어떤 시험인지, 그 시험이 아직 유효한지 함께 봐야 합니다.

SOURCE공식 원문 확인

수집 2026.09.30 · 정리 2026.10.01 · 원문 본문은 옮기지 않았습니다.

같은 주제 · OpenAI

OpenAI 전체 →