
개발 도구 업체 비토(Bito)가 공개한 AI 코딩 모델 비교 자료에 따르면, 29개 모델을 동일한 60개 엔지니어링 과제로 평가한 결과 21개 모델은 더 저렴하면서 점수가 같거나 높은 다른 모델이 있었다. 비토는 정답의 품질뿐 아니라 각 과제를 수행하는 데 실제로 사용된 토큰 비용을 함께 집계해 모델 선택의 기준을 제시했다.
비토는 새 코드 작성, 버그 수정, 코드 검토, 문제 조사 등 개발 현장에서 접할 만한 과제를 사용했다고 설명했다. 전체 60개 중 34개는 공개 오픈소스 프로젝트, 26개는 자체 제작한 비공개 코드에 기반했다. 답변 1,740건을 평가했으며, 28개 과제는 코드 실행이나 미리 심어 둔 오류의 발견 여부로 확인하고 나머지 32개는 사전에 정한 기준에 따라 AI 심사 모델이 채점했다.
최고 점수를 기록한 모델은 60점 만점에 54.5점이었고, 전체 과제 수행 비용은 135.51달러로 집계됐다. 비토는 다른 오픈 가중치 모델이 50.5점을 기록하면서 같은 과제에 2.67달러를 썼다고 제시했다. 이 수치는 정해진 과제 묶음의 결과로, 실제 조직의 코드베이스와 사용량에 그대로 적용되는 가격표는 아니다.
평가의 한계도 있다. 공개 저장소의 코드는 모델 학습 데이터에 포함됐을 가능성이 있고, 모델마다 각 과제를 한 번씩만 수행했다. 비토는 1~2점 차이는 단일 실행의 변동 범위에 있을 수 있다고 설명했다. AI 심사 모델이 평가 대상에도 포함돼 있다는 점 역시 결과 해석에 유의해야 한다.
이번 자료는 AI 개발 도구를 판매하는 비토가 수행한 자체 평가다. 특정 모델의 보편적 우열을 확정하기보다, 도입하려는 작업을 기준으로 성공률과 실제 비용을 함께 검증할 필요가 있음을 보여준다.
출처: 비토(Bito) AI 코딩 모델 비용·성능 비교 원문 https://bito.ai/benchmarks/ai-coding-model-cost/