
GitHub 공식 블로그에 따르면 GitHub는 2026년 6월 25일 Copilot 에이전트 하네스의 성능과 효율 평가 결과를 공개했다. 회사는 같은 모델과 같은 벤치마크 과제를 기준으로 비교했을 때 Copilot 하네스가 모델 벤더가 제공하는 하네스와 대체로 유사한 과제 해결률을 보이면서, 여러 구성에서 더 낮은 토큰 사용 경향을 보였다고 설명했다.
하네스는 AI 모델을 실제 개발 도구로 동작하게 만드는 실행 계층이다. 모델이 원시적인 추론 능력을 제공한다면, 하네스는 어떤 맥락을 제공할지, 어떤 도구를 노출할지, 터미널·파일·테스트 결과를 어떻게 다시 모델에 전달할지를 정한다. GitHub는 Copilot SDK의 공통 하네스가 Copilot CLI, Copilot 앱, Copilot 코드 리뷰 등 여러 제품 표면에 쓰인다고 밝혔다.
이번 공개의 핵심은 모델 성능 경쟁이 단순한 벤치마크 점수에서 제품 실행 환경의 효율로 옮겨가고 있다는 점이다. GitHub는 공개 벤치마크와 내부 벤치마크를 함께 사용해 Copilot 하네스를 평가한다고 설명했다. 공개 벤치마크에는 SWE-bench Verified, SWE-bench Pro, SkillsBench, TerminalBench가 포함됐다. 내부적으로는 Windows 컨테이너 환경에서 동작하는 Win-Hill 벤치마크도 사용한다고 덧붙였다.
비교 대상은 GitHub Copilot CLI와 모델 벤더 하네스다. GitHub는 Claude Sonnet 4.6과 Claude Opus 4.7에는 Claude Code를, GPT-5.4와 GPT-5.5에는 Codex CLI를 비교 대상으로 삼았다고 설명했다. 비교 과정에서는 모델, 과제, 컨텍스트 창, 추론 노력, 도구 선택, MCP 서버 조건을 가능한 한 맞췄다고 밝혔다.
GitHub는 토큰 효율을 별도 지표로 다뤘다. 에이전트형 개발 도구에서는 같은 작업을 해결하더라도 반복 호출, 도구 사용, 파일 읽기, 테스트 실행 방식에 따라 비용과 지연 시간이 크게 달라질 수 있다. GitHub는 Copilot 하네스가 여러 벤치마크 구성에서 과제 해결률을 유지하면서 토큰 소비를 줄였다고 설명했다. 다만 공개 글은 도표 중심으로 결과를 제시했으며, 세부 원자료 전체를 공개하지는 않았다.
TerminalBench 2.0 분석에서는 실행 간 변동성도 함께 제시됐다. GitHub는 각 에이전트·모델 조합을 최소 5회 이상 실행하고, 해결률과 과제당 비용의 분산을 함께 살폈다고 설명했다. 회사는 모델 출력의 확률적 특성 때문에 하네스 간 차이가 실행마다 달라질 수 있으며, 이런 변동성을 고려해야 실제 제품 품질을 판단할 수 있다고 봤다.
다중 모델 구조도 강조됐다. GitHub는 Copilot 에이전트 하네스가 GPT, Claude, Gemini, MAI 계열 등 20개 이상의 프런티어 모델과 자체 키 기반 오픈소스·로컬 모델 사용을 지원한다고 밝혔다. 사용자는 과제별로 비용과 성능의 균형에 맞춰 모델을 고를 수 있고, 자동 모델 선택 기능을 통해 작업 의도와 모델 상태를 반영할 수 있다는 설명이다.
이번 공개는 AI 코딩 도구의 경쟁 축이 모델 자체에서 실행 환경으로 넓어지고 있음을 보여준다. 개발자에게 중요한 것은 어느 모델이 특정 공개 벤치마크에서 가장 높은 점수를 냈는지만이 아니다. 같은 모델을 쓰더라도 하네스가 어떤 맥락을 넣고, 어떤 도구 호출을 허용하며, 실패와 재시도를 어떻게 다루는지가 비용과 품질을 함께 좌우한다.
다만 GitHub가 공개한 평가는 자사 제품 하네스의 성능을 설명하는 자료다. 기사에서 언급한 비교 결과는 GitHub가 설정한 조건과 벤치마크 범위 안에서 해석해야 한다. 독립적인 제3자 검증이나 원자료 공개가 확대되면, 개발 조직은 모델 선택뿐 아니라 하네스 선택과 운영 비용까지 더 정밀하게 비교할 수 있을 것으로 보인다.
출처: GitHub Blog https://github.blog/ai-and-ml/github-copilot/evaluating-performance-and-efficiency-of-the-github-copilot-agentic-harness-across-models-and-tasks/