
AWS 공식 블로그와 Amazon Nova 문서에 따르면 AWS는 Amazon Nova 모델의 콘텐츠 조정 설정을 조정하기 위한 선택적 언러닝 접근법을 공개했다. 이번 글은 Amazon Nova Customizable Content Moderation Settings(CCMS)의 배경 기술로 Reverse Direct Preference Optimization(rDPO)을 소개하고, 기업 고객이 승인된 업무 목적에 맞춰 일부 안전장치의 동작을 조정할 수 있다고 설명했다.
AWS가 제시한 문제의식은 기업 환경에서 자주 나타나는 과도한 거절이다. 콘텐츠 조정과 안전 정렬은 유해한 출력을 줄이는 데 필요하지만, 보안 교육, 법무 검토, 미디어 콘텐츠 분석처럼 정당한 업무 목적의 요청까지 차단할 수 있다. AWS는 단순한 프롬프트 조정만으로는 모델 파라미터에 학습된 거절 성향을 바꾸기 어렵다고 보고, 특정 정책 영역의 거절 행동을 선택적으로 완화하는 방식에 초점을 맞췄다.
rDPO는 기존 Direct Preference Optimization의 선호 쌍을 반대로 활용하는 방식으로 설명됐다. AWS에 따르면 이 방법은 모델이 특정 정책 영역에서 거절 응답에서 멀어지도록 하는 동시에, 승인된 업무 맥락에서 품질 있는 응답 쪽으로 이동하도록 학습한다. 회사는 이 접근이 단순히 잊게 하는 방식보다 출력 품질과 학습 효율을 함께 고려한다고 설명했다.
제품 적용 방식은 LoRA 어댑터 기반이다. 고객이 승인된 정책 영역에 대해 조정 요청을 하면, 해당 영역의 정렬 행동을 완화하도록 훈련된 어댑터가 별도 커스텀 모델 ARN 형태로 제공된다. 추론 시에는 이 어댑터가 기본 모델의 응답 경향을 조정하고, 출력 조정 장치도 승인된 정책 영역에 맞춰 구성된다.
Amazon Nova 문서에 따르면 CCMS는 Nova Lite와 Nova Pro에서 승인된 비즈니스 사용 사례를 가진 고객에게 제공된다. 조정 가능한 영역은 보안 단독, 안전·민감 콘텐츠·공정성 묶음, 모든 영역 등 세 가지 조합으로 나뉜다. AWS는 아동 위해 방지와 개인정보 보호처럼 필수적인 비구성 통제는 계속 적용된다고 밝혔다.
이번 공개는 기업용 생성형 AI가 안전장치를 단순히 켜고 끄는 단계에서 벗어나, 업무 목적과 책임 있는 AI 원칙 사이의 균형을 세밀하게 맞추려는 방향으로 이동하고 있음을 보여준다. 특히 보안·법무·미디어처럼 민감한 입력을 합법적이고 방어적인 목적으로 다루는 조직에는 모델 거절률, 감사 가능성, 승인 절차가 실제 도입 판단의 핵심 변수가 될 수 있다.
다만 이 기능은 일반 사용자용 설정이 아니다. AWS 문서는 승인된 비즈니스 사용 사례를 전제로 하며, 접근하려면 AWS Account Manager에 문의해야 한다고 안내한다. 사용 가능 모델과 리전도 Nova Lite·Pro, us-east-1 리전으로 제한된다.
출처: AWS Machine Learning Blog https://aws.amazon.com/blogs/machine-learning/teaching-models-to-forget-selective-unlearning-with-amazon-nova/
출처: Amazon Nova Documentation https://docs.aws.amazon.com/nova/latest/userguide/customizable-content-moderation.html