Clario(Thermo Fisher Scientific 소속)가 임상시험 DICOM 의료 이미지에서 PHI/PII를 자동 탐지하는 솔루션을 Amazon Bedrock 기반으로 구축했다. 수천 개의 이미지 슬라이스에서 메타데이터 태그, 커스텀 벤더 필드, 픽셀에 박힌 텍스트를 스캔해 민감 정보를 탐지하며, 탐지와 교정을 의도적으로 분리해 감사 추적성과 임상 데이터 무결성을 동시에 확보했다.
핵심 포인트- DICOM 파일의 표준 메타데이터 태그, 커스텀 프라이빗 태그, 픽셀에 직접 새겨진(burned-in) 텍스트 세 영역을 모두 스캔한다
- Claude Sonnet 4.5(Amazon Bedrock)와 Amazon Textract OCR을 결합해 PHI/PII를 식별한다
- PDF 텍스트 탐지 F1=0.9775, 픽셀 이미지 텍스트 F1=0.9750, 메타데이터 태그 F1=0.9951의 높은 정확도를 달성했다
- 탐지(Detection)와 교정(Redaction)을 분리해 비가역적 변경 전에 반드시 인간 검토가 이뤄지도록 설계했다
- Amazon EKS에서 메모리 집중 탐지 백엔드를 실행하고 RDS PostgreSQL로 감사 추적을 관리한다
상세 정리- 배경: DICOM 파일은 이미지 외에 환자명·생년월일·의료기록 번호·기관 식별자 등 광범위한 메타데이터를 포함하며, 수작업 검토만으로는 HIPAA·GDPR·ICH E6 컴플라이언스를 충족하기 어렵다
- 탐지 범위 1: 표준 DICOM 헤더 필드(표준 메타데이터 태그)를 전수 스캔한다
- 탐지 범위 2: 비표준 벤더 프라이빗 태그(non-standard custom fields)를 별도로 분석한다. 민감 데이터가 이 경로로 숨어 들어오는 경우가 빈번하다
- 탐지 범위 3: 이미지 픽셀에 직접 새겨진 텍스트(burned-in pixel content)를 Textract OCR로 추출해 LLM으로 분류한다
- 파이프라인 구성: API Gateway(인증·속도 제한) → EKS(탐지 백엔드) → Textract(OCR) → Claude Sonnet 4.5(PHI/PII 분류) → RDS PostgreSQL(감사 로그) → S3(수명주기 기반 삭제) 순으로 흐른다
- 탐지·교정 분리 설계: 탐지 결과는 민감 요소의 위치 좌표를 구조적 출력으로 반환하고, 픽셀 마스킹은 별도 단계에서 수행한다. 임상 데이터 무결성 보호와 감사 가능성 확보가 목적이다
- 평가 방법론: 운영 대표 데이터로 수작업 주석된 지상 진실(ground truth)로 평가했다. 정제된 테스트 샘플은 다양한 이미지 모달리티에서의 실제 정확도 문제를 발견하지 못해 운영 대표 데이터가 필수임을 확인했다
- 정확도 결과: PDF 텍스트 F1 0.9775, 픽셀 이미지 텍스트 F1 0.9750, 메타데이터 태그 F1 0.9951. 탐지 유형별 레이블 정확도 98~99%
- Human-in-the-Loop: 자격을 갖춘 검토자가 플래그된 발견을 검증한 후에만 교정이 적용되어, 임상적으로 관련 있는 정보의 실수 제거를 방지한다
왜 읽나DICOM·의료 이미징 파이프라인에서 PHI/PII 컴플라이언스를 자동화하려는 헬스케어 엔지니어 및 임상시험 데이터 플랫폼 개발자에게 실전 아키텍처와 정확도 수치를 제공한다