
OpenAI 공식 연구 글에 따르면 회사는 7월 8일(현지시간) AI 코딩 에이전트 평가에 쓰이는 SWE-Bench Pro를 감사한 결과 약 30%의 과제에 평가 결함이 있는 것으로 추정된다고 밝혔다. OpenAI는 벤치마크 결함이 모델 성능과 안전성 판단을 왜곡할 수 있다며, 코딩 평가 결과를 해석할 때 데이터 품질 검토가 함께 이뤄져야 한다고 설명했다.
SWE-Bench Pro는 기존 SWE-bench Verified보다 긴 작업 흐름과 현실적인 소프트웨어 개발 과제를 측정하기 위해 설계된 평가 체계다. 모델은 기능 변경 이력에서 구성된 과제를 받아 새 테스트를 통과하는 코드를 작성해야 한다. OpenAI는 공개 split 731개 과제에서 프런티어 모델 통과율이 8개월 사이 23.3%에서 80.3%로 상승했다고 소개했다.
문제는 이 상승이 순수한 모델 능력 향상만을 의미하지 않을 수 있다는 점이다. OpenAI는 데이터포인트 분석 파이프라인으로 모델 시도, 과제 메타데이터, 실패 추적 정보를 검토해 평가 결함 가능성이 큰 과제를 걸러냈다. 이후 여러 차례의 조사 에이전트 검토와 다섯 명의 숙련된 소프트웨어 엔지니어 독립 검토를 거쳤다고 밝혔다.
감사 결과는 작지 않았다. OpenAI에 따르면 분석 파이프라인은 200개 과제, 전체의 27.4%를 결함 가능성이 있는 과제로 표시했다. 별도의 인간 주석 캠페인에서는 249개 과제, 34.1%에서 문제를 확인했다. 회사는 이를 바탕으로 SWE-Bench Pro 과제의 약 30%가 깨져 있는 것으로 추정한다고 설명했다.
OpenAI가 지적한 결함은 테스트와 과제 설계 전반에 걸쳐 있었다. 일부 과제는 문제 설명이 실제 기대 동작을 충분히 특정하지 못했고, 일부는 테스트가 잘못된 해결책을 통과시키거나 올바른 해결책을 실패하게 만들 수 있었다. 평가 데이터가 어려운 과제를 담는 것과 공정한 과제를 담는 것은 별개의 문제라는 의미다.
이번 발표는 AI 코딩 에이전트 경쟁이 모델 점수뿐 아니라 평가 인프라의 신뢰성 경쟁으로 옮겨가고 있음을 보여준다. 기업과 개발팀이 벤치마크 수치를 모델 도입 판단에 활용하는 만큼, 평가 과제의 결함은 제품 선택, 비용 산정, 보안·배포 판단에 직접적인 영향을 줄 수 있다.
OpenAI는 모델 개발자가 SWE-Bench Pro 결과를 신중하게 검토해야 하며, 결함 있는 과제를 제거하거나 가중치를 조정해 성능을 재해석할 필요가 있다고 밝혔다. 동시에 에이전트를 활용한 데이터 품질 검사가 대규모 벤치마크 감사에 유용할 수 있다는 점도 이번 작업의 의미로 제시했다.
출처: OpenAI https://openai.com/index/separating-signal-from-noise-coding-evaluations/









