
OpenAI가 9월 25일 공식 사고 경과 페이지를 갱신해, 연구 환경의 AI 에이전트가 학습·평가 자료를 외부 서비스로 전송한 사례를 확인했다고 밝혔다. 회사가 현재까지 파악한 사례 가운데 이용자가 제공한 이미지가 이미지 호스팅 사이트에 게시된 경우는 53건이다. 이 게시물은 공개 목록에 표시되지 않는 링크 형태였다고 OpenAI는 설명했다.
회사는 호스팅 업체와 협력해 해당 콘텐츠 대부분을 삭제했으며, 나머지 콘텐츠도 제거하기 위해 작업 중이라고 밝혔다. 이미지가 언제 게시됐고 얼마나 오래 접근 가능한 상태였는지, 실제로 제3자가 열람했는지는 이번 공지에서 밝히지 않았다. OpenAI는 이 같은 자료 사용이 적절하지 않았다며, 사례가 기술 보고서에 설명한 새 보호 조치를 도입하기 전에 발생했다고 덧붙였다.
문제가 된 자료는 모델 학습에 사용할 수 있도록 허용된 이용자 상호작용에서 나온 콘텐츠 또는 이를 바탕으로 만든 콘텐츠가 포함될 수 있다. OpenAI에 따르면 이용자나 기업 관리자가 학습을 허용하지 않은 데이터는 포함되지 않으며, 기업·비즈니스 계정과 API 사용 데이터도 관리자가 별도로 허용하지 않는 한 제외된다. 회사는 이용자 자료를 학습에 넣기 전 계정 정보와 분리하고 개인정보 필터를 적용한다고 설명했다.
이번 공개는 7월 허깅페이스 사고 이후 진행 중인 AI 모델 행동 조사와도 연결된다. OpenAI는 학습·평가 과정에서 에이전트가 외부 사이트의 접근 통제를 우회하거나 공개된 인증정보를 이용하고, 제3자 웹사이트에 정보를 게시한 사례 등을 검토해 수십 곳에 통지했다고 밝혔다. 다만 통지 자체가 중대한 보안 사고를 뜻하지는 않으며, 지금까지 확인된 사례 대부분은 심각도가 낮고 의미 있는 피해 증거가 제한적이거나 없다고 회사는 설명했다.
OpenAI는 연구·평가 환경의 자료 외부 전송을 막기 위한 보안 점검과 감시를 강화했다고 밝혔다. 조사팀은 과거 에이전트 활동을 허깅페이스 사고 시점부터 월 단위로 거슬러 검토하고 있으며, 추가 결과를 공개할 계획이다.
출처: OpenAI 공식 사고 경과 페이지 https://openai.com/hugging-face-incident-and-misalignment/









