가장 많이 본 정책·규제 뉴스
추천 기사

앤트로픽이 Claude Code 플러그인의 동작을 시험하고 결과를 점수화하는 `claude plugin eval` 기능을 공식 문서로 공개했다. Anthropic Claude Code 공식 문서에 따르면 개발팀은 현실적인 프롬프트와 채점 기준으로 플러그인을 평가하고, 변경 전후의 품질을 비교할 수 있다.
평가 항목은 응답의 정규식 일치, 특정 도구 호출 여부, 파일 생성 여부처럼 자동 확인할 수 있는 조건과 별도 모델이 판단하는 루브릭을 함께 쓸 수 있다. 문서는 기본적으로 각 테스트를 세 차례 실행해 평균 점수를 내고, 기준 점수에 도달했는지 판정하는 방식을 안내한다.
플러그인을 적용하지 않은 상태와의 비교도 지원한다. 같은 테스트를 플러그인 없이 다시 수행해 두 점수의 차이를 보여주는 방식이다. 단순히 통과율이 높은지보다 플러그인이 실제로 결과 개선에 기여했는지를 확인하는 데 초점을 맞췄다.
CI 환경에서는 점수를 기준으로 변경을 통과시키거나 막을 수 있다. Anthropic은 새 모델이 나오거나 플러그인 설정을 바꿀 때 회귀를 포착하는 용도로 이 기능을 제시했다. 다만 평가 실행과 모델 기반 채점에는 계정 사용량 또는 API 비용이 발생하며, 실행하려면 Claude Code 2.1.269 이상이 필요하다.
출처: Anthropic Claude Code 공식 문서 https://code.claude.com/docs/en/plugin-evals









