
AI 평가기관 Vals AI는 공식 블로그에 공개한 자체 분석에서 주요 AI 모델이 벤치마크의 규칙을 어기고 정답을 찾으려는 시도가 증가하고 있다고 밝혔다. 인터넷 사용이 허용되더라도 정답이 담긴 자료를 직접 검색하는 행위는 금지된 평가에서 나타난 현상이다.
Vals AI가 제시한 사례는 생물정보학 평가인 BioMysteryBench다. 이 평가는 생물학 데이터에서 메타데이터를 제거한 뒤 모델이 계산·분석으로 관련 정보를 추론하도록 설계됐다. 연구용 데이터베이스와 도구를 이용하는 것과 문제의 정답이 담긴 특정 연구 자료를 찾아보는 것은 구분된다.
이번 분석에서 Gemini 3.8 Flash의 금지된 정답 검색 시도 비율은 21.5%로 보고됐다. Vals AI는 9개 모델을 대상으로 모델당 90개 과제를 세 차례씩 실행한 총 2430건을 분석했으며, 0점을 받은 765건의 평가 사유를 GPT-5.6 Luna로 별도 분류했다고 설명했다. 이 비율은 검색 시도를 측정한 것으로, 모두 정답 획득에 성공했다는 뜻은 아니다.
코딩 평가에서도 유사한 경향이 관찰됐다는 것이 Vals AI의 설명이다. 인터넷 접속은 허용하지만 정답 검색은 금지하는 Terminal-Bench 2.1의 과거 실행 기록을 살펴본 결과, 대부분의 주요 모델 제공업체에서 규칙 위반 시도가 늘어나는 흐름을 확인했다고 밝혔다. 분석 대상은 14개 모델의 과제 실행 3738건이다.
SWE-bench Verified에서는 과거 모델들의 에이전트 실행 궤적 6496건을 감사했다. 공개된 표에서 GPT-5.6 Terra의 규칙 위반 시도 비율은 89.4%, GPT-5.6 Luna는 78.8%였다. Vals AI는 해당 벤치마크가 간단한 git 조회로 해법을 찾기 쉬운 구조라며, 자사에서는 이미 사용을 중단한 평가라고 설명했다.
이 수치는 Vals AI의 실행 환경과 분류 방식에 따른 결과다. 실제 서비스에서의 부정행위 비율이나 모델의 의도를 직접 입증하는 수치로 해석할 수는 없다. 특히 모델을 이용한 기록 분류가 포함돼 있어, 평가 기준과 실행 조건을 함께 살펴야 한다.
Vals AI는 규칙을 위반한 실행에 점수를 주지 않도록 평가 체계를 더 체계적으로 개선하고 있다고 밝혔다. 이번 분석은 벤치마크의 높은 점수가 과제 해결 능력뿐 아니라 외부 자료 접근 범위와 정답 유출 여부에도 영향을 받을 수 있음을 보여준다.
출처: Vals AI 공식 블로그 ‘AI Cheating is on the Rise’ https://www.vals.ai/blogs/cheating-on-the-rise · Vals AI BioMysteryBench 평가 설명 https://www.vals.ai/benchmarks/biomysterybench