pile·
AI / ML·aws-architectureAWS Architecture·

Amazon Bedrock으로 DICOM 의료 이미지에서 PHI/PII 자동 탐지하기

Clario(Thermo Fisher Scientific 소속)가 임상시험 DICOM 의료 이미지에서 PHI/PII를 자동 탐지하는 솔루션을 Amazon Bedrock 기반으로 구축했다. 수천 개의 이미지 슬라이스에서 메타데이터 태그, 커스텀 벤더 필드, 픽셀에 박힌 텍스트를 스캔해 민감 정보를 탐지하며, 탐지와 교정을 의도적으로 분리해 감사 추적성과 임상 데이터 무결성을 동시에 확보했다.

핵심 포인트
  • DICOM 파일의 표준 메타데이터 태그, 커스텀 프라이빗 태그, 픽셀에 직접 새겨진(burned-in) 텍스트 세 영역을 모두 스캔한다
  • Claude Sonnet 4.5(Amazon Bedrock)와 Amazon Textract OCR을 결합해 PHI/PII를 식별한다
  • PDF 텍스트 탐지 F1=0.9775, 픽셀 이미지 텍스트 F1=0.9750, 메타데이터 태그 F1=0.9951의 높은 정확도를 달성했다
  • 탐지(Detection)와 교정(Redaction)을 분리해 비가역적 변경 전에 반드시 인간 검토가 이뤄지도록 설계했다
  • Amazon EKS에서 메모리 집중 탐지 백엔드를 실행하고 RDS PostgreSQL로 감사 추적을 관리한다
상세 정리
  • 배경: DICOM 파일은 이미지 외에 환자명·생년월일·의료기록 번호·기관 식별자 등 광범위한 메타데이터를 포함하며, 수작업 검토만으로는 HIPAA·GDPR·ICH E6 컴플라이언스를 충족하기 어렵다
  • 탐지 범위 1: 표준 DICOM 헤더 필드(표준 메타데이터 태그)를 전수 스캔한다
  • 탐지 범위 2: 비표준 벤더 프라이빗 태그(non-standard custom fields)를 별도로 분석한다. 민감 데이터가 이 경로로 숨어 들어오는 경우가 빈번하다
  • 탐지 범위 3: 이미지 픽셀에 직접 새겨진 텍스트(burned-in pixel content)를 Textract OCR로 추출해 LLM으로 분류한다
  • 파이프라인 구성: API Gateway(인증·속도 제한) → EKS(탐지 백엔드) → Textract(OCR) → Claude Sonnet 4.5(PHI/PII 분류) → RDS PostgreSQL(감사 로그) → S3(수명주기 기반 삭제) 순으로 흐른다
  • 탐지·교정 분리 설계: 탐지 결과는 민감 요소의 위치 좌표를 구조적 출력으로 반환하고, 픽셀 마스킹은 별도 단계에서 수행한다. 임상 데이터 무결성 보호와 감사 가능성 확보가 목적이다
  • 평가 방법론: 운영 대표 데이터로 수작업 주석된 지상 진실(ground truth)로 평가했다. 정제된 테스트 샘플은 다양한 이미지 모달리티에서의 실제 정확도 문제를 발견하지 못해 운영 대표 데이터가 필수임을 확인했다
  • 정확도 결과: PDF 텍스트 F1 0.9775, 픽셀 이미지 텍스트 F1 0.9750, 메타데이터 태그 F1 0.9951. 탐지 유형별 레이블 정확도 98~99%
  • Human-in-the-Loop: 자격을 갖춘 검토자가 플래그된 발견을 검증한 후에만 교정이 적용되어, 임상적으로 관련 있는 정보의 실수 제거를 방지한다
왜 읽나DICOM·의료 이미징 파이프라인에서 PHI/PII 컴플라이언스를 자동화하려는 헬스케어 엔지니어 및 임상시험 데이터 플랫폼 개발자에게 실전 아키텍처와 정확도 수치를 제공한다
aws-architecture
AWS Architecture 블로그
원문은 여기서 이어서 읽을 수 있어요
원문 읽기
읽음 (0)

이 글과 비슷한

  1. AI / ML·stackoverflow-blogStack Overflow Blog·

    에이전틱 SDLC를 QA 엔지니어링 마인드셋으로 구축하기

    Motorola Solutions의 테스트 엔지니어링 선임 매니저 Suneet Malhotra가 Stack Overflow 팟캐스트에 출연해 MCP(Model Context Protocol) 기반 에이전틱 SDLC 파이프라인 구축과 LLM-as-judge 평가 방법론을 소개했다. QA 엔지니어링 관점을 소프트웨어 개발 생애 전반에 적용하고, 설계 단계 직후 스펙을 강화해 결함 비용을 줄이는 'QA shift-left' 접근을 다룬다.

    요약 이어보기
    #llm-agent#mcp#test-automation+2
  2. AI / ML·LINE EngineeringLINE Engineering·

    보안 업무를 위한 AI 에이전트 플랫폼 「SAGE」 개발기 1편: 판단은 사람에게 남기는 설계

    LY Corporation Security Development Division이 보안 업무용 AI 에이전트 플랫폼 SAGE의 개발 과정을 공개했다. "완전 자동화"와 "도입 미루기" 양 극단 사이에서 "판단은 사람에게 남기는 설계"를 핵심 원칙으로 삼고, 3단계 점진적 도입 전략(AI 보조→에이전트 협업→자동화)을 채택했다. 현재는 1단계를 중심으로 파일럿·실운영 중이다.

    요약 이어보기
    #llm-app#opensearch#mcp+2