
OpenAI가 최첨단 AI 모델의 강화학습을 계속하기 전에 위험과 대응책을 체계적으로 설명하는 안전성 자료를 마련해야 한다는 지침을 공개했다. OpenAI 공식 발표에 따르면 회사는 안전에 관한 주장과 근거를 구조화하는 '안전성 입증 자료(safety case)'를 지향점으로 삼고, 실제 훈련에 적용할 초기 권고안을 제시했다.
권고안은 기술적 보호조치를 모델 정렬, 격리, 감시의 세 축으로 나눈다. 훈련 환경의 허점을 이용한 보상 편법을 찾아내고 평가 지표가 모델의 문제 행동을 놓치지 않는지 점검하는 한편, 모델이 실행되는 샌드박스와 연구 인프라를 강화하자는 내용이다. 훈련 중 위험 신호를 감지하면 담당자에게 알리거나 실행을 자동으로 멈추는 대응 절차도 포함했다.
운영 측면에서는 훈련팀 밖의 구성원이 안전성 자료의 빈틈을 검토하고, 고위 책임자가 훈련 진행 여부를 심사하는 방안을 제안했다. 새로운 보안 문제가 생겨 기존 안전성 판단이 무효가 될 때는 훈련을 중단할 수 있어야 한다고 봤다. 감사자가 주장의 근거를 확인할 수 있도록 접근권을 제공하고, 남는 위험을 빠짐없이 기록하는 방식도 권고했다.
OpenAI는 모델의 일탈 행동을 조사할 때 훈련 과정에서 원인을 추적하고, 사고 조사 결과와 운영 변경 사항을 공개하는 원칙도 함께 제시했다. 다만 이번 문서는 최첨단 강화학습 훈련에 초점을 맞춘 것으로, 외부 배포까지 포괄하는 완성된 안전 기준은 아니다. 회사는 제시한 관행이 내부 도입 과정에 있으며 앞으로 바뀔 수 있다고 밝혔다.
출처: OpenAI 공식 발표 'Towards safety cases for frontier AI training' https://openai.com/index/towards-safety-cases-for-frontier-ai-training/









