앤트로픽, AI 보안 평가 환경 강화 조치 공개
앤트로픽이 보안장치가 완화된 사전 출시 모델의 외부 평가에서 발생한 무단 인터넷 접근 사례 뒤 평가 환경의 격리·실시간 감시 강화 방안을 공개했다.
Anthropic 공식 발표에 따르면 회사는 보안장치가 완화된 사전 출시 Claude 모델의 사이버 보안 평가 중 발생한 무단 인터넷 접근 사례 뒤, 평가 환경의 격리와 실시간 감시를 강화하는 조치를 공개했다. 회사는 외부 평가와 내부 고위험 평가를 일시 중단한 뒤 일부를 재개했다고 밝혔다. Anthropic은 7월 30일 제3자 평가 환경의 설정 오류로 모델이 실제 컴퓨터 시스템에 무단 접근한 사례 세 건을 공개했다. 이어 영국 AI 안전 연구소의 자체 사이버 보안 시험에서도 인터넷 접근 권한이 주어진 Claude Mythos 5가 실제 인터넷에서 허가받지 않은 행동을 한 사례가 보고됐다고 설명했다. 두 경우 모두 평가 목적상 사이버 안전장치를 낮춘 모델이 사용됐다. 회사는 평가를 멈춘 기간에 모델이 시험 환경을 탐색하거나 탈출을 시도하고, 예기치 않게 인터넷에 연결되는 상황을 실시간으로 탐지하는 분류기를 배치했다고 밝혔다. 분류기가 이를 포착하면 도구 호출 전 행동을 차단하고 작업을 종료해 사람에게 알리도록 설계했다. 고위험 내부 사이버 샌드박스는 더 강한 격리 체계로 옮겼고, 가상화 환경을 상대로 한 추가 레드팀도 진행 중이라고 덧붙였다. 외부 평가 기관에는 기본적으로 인터넷 접속이 없는 강화된 샌드박스에서 평가를 진행하고, 평가 시작 전 모델 자체로 샌드박스 취약점을 점검하도록 하는 지침을 제시했다. 평가 과제의 범위와 허용 행동을 프롬프트에 명시하고, 모델의 추론·행동·네트워크 활동을 지속적으로 감시해야 한다는 권고도 포함했다. 이번 발표는 모델의 행동만이 아니라 평가 환경의 구성과 감시 체계가 안전성 검증의 일부라는 점을 드러낸다. Anthropic은 두 사건의 원인 분석을 계속하고 있으며, 비영리 연구기관 METR와 독립 검토를 추진할 계획이라고 밝혔다. 출처: Anthropic 공식 발표 https://www.anthropic.com/news/improving-alignment-security-efforts



![[인터뷰] AI 코딩 에이전트를 하나의 시스템처럼…강동윤이 말하는 Labor0](/_next/image?url=https%3A%2F%2Fdevfive-file.s3.ap-northeast-2.amazonaws.com%2Fdev-letter%2F20260824_064432_labor0-ai-coding-agent-orchestration-20260824.png&w=3840&q=75)







