
AWS 공식 발표에 따르면 회사는 실제 AWS 환경에서 AI 에이전트의 진단·인프라 구축 능력을 평가하는 오픈소스 벤치마크 ‘aws-bench’를 연구 프리뷰로 공개했다. 정적인 문제와 정답만 비교하는 방식에서 벗어나, 에이전트가 클라우드 자원을 직접 살펴보고 변경하는 과정을 재현하려는 도구다.
aws-bench는 자연어로 작성된 과제와 미리 정의한 클라우드 자원 상태, 검증 가능한 정답을 한 묶음으로 제공한다. 과제는 설정 오류 조사와 문제 해결, 인프라 생성 등 실제 AWS 운영에서 접할 수 있는 작업을 바탕으로 구성됐다. 공개된 명령줄 도구는 시험 환경 생성부터 실행, 채점, 자원 상태 초기화까지 지원한다.
공식 GitHub 저장소에 따르면 각 시나리오는 AWS CDK 스택으로 정의한 실제 인프라를 일회용 AWS 계정에 배포한다. 에이전트는 범위가 제한된 AWS 자격증명을 받은 샌드박스 컨테이너에서 작업한다. 평가가 끝나면 환경을 원래 상태로 되돌리거나 계정을 정리할 수 있도록 설계됐다.
평가 방식은 과제 성격에 따라 나뉜다. 읽기 전용 진단 과제는 에이전트가 작성한 답을 기준 답안과 비교하는 LLM 심사 방식을 사용한다. 자원을 만들거나 변경하는 과제는 실제 AWS 상태를 프로그램으로 검사한다. AWS는 이를 통해 모델 자체뿐 아니라 에이전트 실행 도구와 작업 절차의 실패 원인을 함께 분석할 수 있다고 설명했다.
현재 데이터 세트는 빠른 설치 확인용 9개 과제, 기본 78개 과제, 고급 47개 과제로 구성됐다. API·관측성, 컴퓨팅·데이터, 데이터베이스·스토리지, 멀티리전 EC2, 서버리스, 스트리밍·IoT 등 시나리오별 실행도 지원한다. 프레임워크는 AI 에이전트와 언어 모델 평가용 오픈소스 프로젝트 Harbor를 기반으로 하며, Apache License 2.0으로 공개됐다.
실제 클라우드 환경을 사용하는 만큼 실행 조건과 비용 관리에는 주의가 필요하다. aws-bench는 AWS Organizations와 멤버 계정을 만들 수 있는 관리 계정 권한을 요구하며, 시험 과정에서 배포된 자원에는 비용이 발생할 수 있다. 에이전트와 검증기에는 최소 권한 역할을 적용하지만, 운영 계정과 분리된 시험용 관리 체계를 마련하는 것이 안전하다.
이번 공개는 AI 에이전트 평가가 코드 작성 정확도를 넘어 실제 인프라 운영 능력으로 확장되고 있음을 보여준다. 동일한 자원 상태와 검증 절차를 재현할 수 있어 모델 공급자와 연구자는 에이전트·모델 조합별 성능을 비교할 수 있다. 다만 AWS는 연구 프리뷰 단계라고 밝혔으며, 논문과 공개 리더보드, 더 많은 과제와 에이전트 지원은 향후 계획으로 제시했다.
출처: AWS What’s New https://aws.amazon.com/about-aws/whats-new/2026/07/aws-bench/
출처: aws-bench GitHub 저장소 https://github.com/aws-bench/aws-bench