
Anthropic 공식 엔지니어링 블로그에 따르면, 회사는 claude.ai, Claude Code, Claude Cowork 등 에이전트형 제품에서 모델 감시만으로는 에이전트 위험을 충분히 낮추기 어렵다고 보고 실행 환경 중심의 격리 전략을 강화하고 있다.
Anthropic은 에이전트 보안 위험을 사용자 오남용, 모델 오작동, 외부 공격으로 나눴다. 회사는 모델 자체뿐 아니라 에이전트가 실행되는 환경과 외부 콘텐츠 접근 범위를 함께 방어해야 한다고 설명했다.
핵심은 샌드박스와 권한 경계다. claude.ai의 코드 실행은 서버 측 임시 컨테이너에서 이뤄지고, Claude Code는 로컬 개발 환경 특성상 파일시스템·셸·네트워크 접근을 다루기 때문에 macOS Seatbelt와 Linux bubblewrap 기반 OS 수준 샌드박스를 도입했다. 작업 공간 내부 쓰기는 허용하되 기본적으로 네트워크 접근을 제한하는 방향이다.
Anthropic은 프로젝트를 신뢰하기 전 로컬 설정 파일이나 훅이 먼저 해석되는 구조, 사용자가 악성 프롬프트를 직접 실행하도록 유도되는 사례도 위험으로 제시했다. 회사는 민감한 자격 증명이 샌드박스에 들어오지 않도록 하고 외부 송신을 환경 차원에서 차단하는 조치가 필요하다고 밝혔다.
이번 공개는 AI 에이전트가 더 넓은 권한을 갖게 될수록 보안 설계의 중심이 모델 평가에서 실행 환경 통제로 이동하고 있음을 보여준다. MCP 서버, 플러그인, 웹 검색, 외부 문서처럼 에이전트 문맥에 들어오는 데이터가 늘어날수록 도구 권한을 세분화하는 정책이 중요해질 전망이다.
출처: Anthropic Engineering Blog, “How we contain Claude across products” https://www.anthropic.com/engineering/how-we-contain-claude









