
Anthropic의 공식 Claude 개발자 X 계정 게시물에 따르면 회사는 Claude Fable 5의 프런티어 LLM 개발 관련 안전장치를 사용자에게 보이는 방식으로 전환하고 있다. Anthropic은 2026년 6월 11일 해당 게시물에서 “잘못된 균형 선택이었다”며 안전장치를 보이지 않게 운영한 데 대해 사과했다.
변경 이후 표시 대상 요청은 Claude Opus 4.8로 눈에 보이게 전환된다. Anthropic은 사이버보안과 생물학 분야 안전장치와 같은 방식으로 사용자가 전환 사실을 확인할 수 있게 하겠다고 설명했다. API에서는 표시 대상 요청에 대해 거절 이유를 반환하며, 서버 측 fallback에도 며칠 안에 같은 방식이 적용될 예정이다.
논란의 배경은 Claude Fable 5와 Claude Mythos 5 시스템 카드에 담긴 안전장치 설명이다. Anthropic은 고위험 분야와 프런티어 AI 개발 관련 요청을 탐지해 모델의 효과를 제한할 수 있다고 설명했다. 특히 프런티어 LLM 개발 요청에 대해서는 사용자가 제한 사실을 명확히 알기 어려운 방식이 적용될 수 있다는 점이 연구자와 개발자 사이에서 문제로 지적됐다.
Anthropic은 보이지 않는 안전장치가 더 좁게 적용될 수 있어 빠른 배포에 유리하다고 판단했지만, 사용자가 어떤 보호장치가 왜 작동하는지 알아야 한다는 비판을 수용했다고 밝혔다. 회사는 보이는 안전장치가 우회 시도에 더 노출될 수 있어 당분간 오탐이 늘 수 있다고도 덧붙였다. 동시에 무해한 요청에 대한 생물학·사이버보안 분류기의 과잉 작동을 줄이도록 조정하고 있다고 설명했다.
이번 조치는 프런티어 AI 모델 안전장치가 단순한 내부 정책이 아니라 연구 생태계와 이용자 신뢰의 문제라는 점을 드러낸다. 고성능 모델이 생물학, 사이버보안, AI 개발 작업을 모두 지원하는 상황에서 사업자는 위험 완화와 투명성 사이의 균형을 설명해야 한다. 이용자 입장에서는 모델이 답하지 않는 이유뿐 아니라, 더 약한 모델로 전환되는지 여부도 제품 신뢰성과 재현성에 영향을 준다.
다만 이번 발표는 Claude 개발자 계정의 공개 게시물과 시스템 카드 기준이다. 실제 제품 전환이 모든 Claude 접점에 언제 적용되는지, 오탐 조정 결과가 연구자 경험에 어떤 영향을 주는지는 추가 확인이 필요하다.
출처: Claude Developers X https://x.com/ClaudeDevs/status/2064949876463645026
출처: Anthropic System Card https://www-cdn.anthropic.com/d00db56fa754a1b115b6dd7cb2e3c342ee809620.pdf









