
연구자들이 8월 31일 arXiv에 공개한 사전공개 논문에 따르면, 상용 AI 의료 기록 보조 도구 3종이 작성한 기록 가운데 31.3%에서 연구진의 검증 절차를 통과한 오류가 한 건 이상 확인됐다. 이 논문은 동료평가를 거치기 전 단계다.
연구진은 영국 1차 진료와 미국 외래 진료의 녹음 자료, 직접 작성한 시나리오를 합쳐 142건의 동일한 상담을 세 제품에 적용했다. 분석 대상은 모두 565개 기록이다. 실제 임상 현장에서 수집한 환자 기록은 사용하지 않았으며, 제품명은 공개하지 않고 A·B·C로 구분했다.
오류 탐색 과정에서는 12차례의 점검으로 1만3,678개 후보를 제시한 뒤 중요도 필터를 통과한 5,898개를 서로 다른 계열의 AI 모델 2개가 반박하도록 했다. 이 절차를 거친 618개가 최종 오류 항목으로 남았다. 오류는 알레르기와 약물 정보, 임의로 만들어진 환자 신원, 전화 상담 내용을 신체검사 결과처럼 기록한 사례 등에 집중됐다.
연구진이 제시한 31.3%는 기록별로 오류가 한 건 이상 포함된 비율이며, 95% 신뢰구간은 27.0~35.6%였다. 환자 기록이 미리 제공됐다면 채워질 수 있었던 임의의 신원과 날짜 오류를 제외하면 비율은 24.8%로 낮아졌다.
두 명의 임상의가 서로 겹치지 않는 표본을 맹검으로 검토한 결과, 연구 저자인 의사는 21건 가운데 20건을, 연구에 참여하지 않은 임상의는 12건 모두를 오류로 인정했다. 다만 618건 전체를 사람이 재검토한 것은 아니며, 표본 검증 결과를 전체 항목의 완전한 임상 확인으로 해석해서는 안 된다.
연구의 또 다른 핵심은 오류율이 검토 도구와 기준에 크게 좌우된다는 점이다. 같은 모델과 근거, 설정을 유지한 채 검토 지시문만 바꿨을 때 오류 후보가 인정된 비율은 9.3%에서 79.0%까지 달라졌다. 적용한 기준에 따라 오류가 한 건 이상 포함된 기록의 비율도 28%에서 97%까지 움직였다. 연구진은 제품 간 수치 비교에 앞서 어떤 검토 기준과 절차로 오류를 셌는지 함께 공개해야 한다고 설명했다.
연구진은 618개 오류 항목과 근거, 프롬프트, 모델 버전, 재실행 가능한 분석 절차를 공개했다. 공개 데이터와 코드는 다른 의료 기록 보조 도구를 같은 기준으로 점검하는 데 활용할 수 있다.
출처: arXiv 연구자 원문 https://arxiv.org/abs/2608.31017 | 공개 데이터셋 https://huggingface.co/datasets/ComposoAI/OmissionBench | 분석 코드 https://github.com/composo-ai/omission-bench