AI 정밀의료 분야의 모든 기사와 보고서를 읽을 때 가장 먼저 기준점으로 삼아야 할 결정적인 숫자가 있습니다.
2025년 npj Digital Medicine에 발표된 계량서지학적 스코핑 리뷰는 알츠하이머병의 디지털 바이오마커 연구를 전수 조사했습니다: 5개 데이터베이스에서 431편의 연구를 선별하고, 86개의 AI 모델을 심층 분석했습니다. 성능을 보고한 모델 중 알츠하이머병 타깃 모델 21개는 평균 AUC 0.887, 경도인지장애(MCI) 모델 45개는 평균 AUC 0.821을 기록했습니다. 언뜻 보기에 매우 훌륭한 변별력(discrimination)입니다.
이제 밸리데이션 항목을 보겠습니다. 86개 연구 중 외부 코호트 검증(external validation)을 수행한 연구는 단 2개에 불과했습니다. 모델 캘리브레이션(calibration, 예측 확률과 실제 발생 확률의 일치도)을 평가한 것은 3개(논문 결과 섹션의 세부 수치로는 4개)뿐이었습니다. TRIPOD 임상 예측 모델 보고 가이드라인을 준수한 연구는 86개 중 단 1개였으며, 재현을 위해 코드를 공개한 연구는 86개 중 단 2개였습니다.
이 충격적인 사실은 논문의 초록(Abstract), 결과(Results), 고찰(Discussion)에 걸쳐 세 차례나 명시적으로 강조되어 있습니다. 부정적 결과로서는 매우 이례적일 만큼 단호한 서술입니다. 결코 가볍게 넘길 수 없는 분석입니다.
명확히 표현하자면: 새로운 의료기관, 새로운 측정 기기, 혹은 새로운 환자 집단으로의 전이 가능성(transportability)이 단 한 번도 시험되지 않은 모델에서 산출된 AUC 0.887은 임상적 유용성의 증거가 아닙니다. 단지 내부 데이터에 대한 과적합(internal fit)의 증거일 뿐입니다.
이것이 이 분야의 정직한 현주소입니다. 분자 설계 및 가상 세포 분석에서 확인했던 문제와 정확히 맞닿아 있습니다. 즉, 후보군을 발굴하는 능력은 폭발적으로 증가했으나 이를 엄격히 검증하는 역량은 까마득히 뒤처져 있습니다.
명확히 짚고 넘어가는 바이오마커 프레임워크와 정의
비판에 앞서 표준 정의를 바로잡아야 합니다. 이 개념들은 업계에서 일상적으로 오용되고 있습니다.
| 항목 | 규제적 위상 | 상세 내용 |
|---|---|---|
| BEST 정의 | FDA-NIH 바이오마커 용어집 (비구속적) | “정상적인 생물학적 과정, 병원성 과정, 또는 치료적 개입을 포함한 노출이나 개입에 대한 생물학적 반응의 지표로서 측정되는 명확히 정의된 특성” — 흔히 뒤의 한정 조건들이 누락됨 |
| 7대 카테고리 | BEST 용어집 (비구속적) | 감수성/위험도, 진단, 모니터링, 예후, 예측, 약력학/반응, 안전성 |
| “대체 평가변수 (Surrogate Endpoint)” | 8번째 카테고리가 아님 | BEST는 이를 별도의 평가변수 유형(후보 / 합리적 개연성 / 검증됨)으로 정의함 |
| 바이오마커 적격성 평가 프로그램 (BQP) 단계 | 법률 규정 | 의향서(LOI) → 적격성 평가 계획서(QP) → 최종 적격성 패키지(FQP). 단순 행정 절차가 아니라 FD&C Act 제507조(21세기 치료법, 2016)에 의해 법제화됨 |
| 적격성 평가 ≠ 시험법 적격성 평가 | 프로그램 공식 FAQ | “바이오마커는 … 특정 진단 시험법과 독립적이다.” 시험법 성능은 LOI/QP 심사 시 검토되며, 이후 분석적으로 밸리데이션된 모든 시험법을 사용할 수 있음 |
이 표에서 두 가지 차이점이 실무적으로 가장 중요합니다.
바이오마커는 진단 검사(test) 그 자체가 아닙니다. 적격성을 인정받은 바이오마커는 *특정 사용 맥락(Context of Use)*에 대한 판정입니다. 즉, 특정 목적으로 특정한 임상적 해석을 신뢰할 수 있게 지원한다는 의미입니다. 귀사의 진단 분석법(assay)은 여전히 자체적인 분석적 밸리데이션(analytical validation)을 거쳐야 합니다. 적격성 인정을 획득하면 측정 방법까지 자동으로 승인받는 것으로 착각하는 AI 바이오마커 사업 계획서는 규제 문서를 오독하고 있는 것이며, 이는 현장에서 가장 치명적인 사업적 실패를 부르는 요인입니다.
예후(prognostic) 바이오마커는 예측(predictive) 바이오마커가 아닙니다. 환자의 생존 기간을 예측하는 모델이, 자신이 선별한 환자군에서 특정 치료제가 더 잘 듣는다는 것을 증명한 것은 아닙니다. 예측 바이오마커 주장을 뒷받침하려면 치료 효과의 이질성(treatment-effect heterogeneity)을 입증해야 하며, 이는 훨씬 더 엄격한 증거를 요구하는 고난도 과제입니다. 업계가 점차 인과추론(causal) 방법론으로 선회하는 이유가 여기에 있습니다.
밸리데이션 결손의 실태
두 편의 체계적 문헌고찰을 종합하면 거대한 공백의 전모가 드러납니다.
2025년 알츠하이머 디지털 바이오마커 리뷰: 86개 중 외부 검증 2개, 캘리브레이션 평가 3~4개, TRIPOD 준수 1개, 코드 공유 2개. (참고로 해당 논문 초록의 “1,403개 기관”은 본문의 912개와 모순되며, “224개 연구비” 역시 정부 프로젝트만 센 것으로 실제로는 539개 소스 1,345건의 연구비가 투입되었습니다.)
2021년 오믹스 기반 환자 계층화 스코핑 리뷰 (Glaab et al., BMJ Open): 총 352편의 논문을 분석했습니다. 이 방대한 문헌에서 임상적으로 승인되거나 허가(cleared)를 획득한 검사는 MammaPrint, Prosigna/PAM50, Oncotype DX, Decipher, Afirma 등 암 분야 9개 및 비암 분야 4개로 단 13개 검사에 불과했습니다. 4개가 FDA 허가, 8개가 실험실 개발 검사(LDT), 1개가 의료기기였습니다. 그리고 밸리데이션 실태는: 78%가 내부 검증만 수행했고, 내부 교차검증과 외부 코호트를 병행한 연구는 12%, 순수 외부 코호트 검증만 수행한 것은 약 10%에 그쳤습니다.
증거가 실제로 멈춰 서는 경계선
출판된 후보 시그니처 (Candidate signatures) ████████████ 모든 연구에서 보고
오직 내부 검증만 수행 █████████░░░ 약 78% (2021 리뷰)
어떠한 형태로든 외부 코호트 검증 수행 ██░░░░░░░░░░ 약 22% (2021 리뷰)
외부 검증 + 모델 캘리브레이션 동시 수행 ░░░░░░░░░░░░ 86개 중 2개 (AD 리뷰)
재현을 위한 소스 코드 공개 ░░░░░░░░░░░░ 86개 중 2개
TRIPOD 가이드라인 준수 ░░░░░░░░░░░░ 86개 중 1개
신뢰할 수 있는 소수 연구들의 공통점
이들에게는 예외 없이 명확한 공통점이 있습니다. 완전히 분리된 외부 독립 코호트(held-out cohort)를 보유하고 있다는 점입니다.
| 연구 주제 | 적용된 실증적 검증 규율 |
|---|---|
| 괴사성 근막염 vs 골수염 감별 (npj Digital Medicine 2026) | 3,415명 환자, 10개 일상 혈액 바이오마커, LightGBM — 제2의 병원에서 수집한 독립 외부 코호트에서 AUC 0.926 달성, 공용 웹 도구로 배포 |
| 폐선암 H&E 슬라이드 기반 EGFR 돌연변이 예측 (Nature Medicine 2025) | 8,461건 다국가 증례; 내부 AUC 0.847, 외부 코호트 0.870, 전향적 검증 0.890 |
| 가와사키병 단일세포 패널 (Front. Immunol. 2025) | 학습 AUC 0.914/0.958/0.985; 독립 외부 코호트 GSE73461에서 0.872/0.861/0.893 재현 |
| 영상의학 파운데이션 모델 (Nat. Mach. Intell. 2024) | 11,467개 병변; 면역 경로 농축 분석에서 인터페론, MHC 클래스 II, PD-1 신호 전달을 독립적으로 재발견 |
| EHR 종단 데이터 기반 환자 계층화 (ML4H 2021) | 당뇨병 환자 29,229명; 질병 궤적(trajectory)과 실제 임상 결과가 모두 상이한 군집 도출 |
| PBMF 면역항암제 반응 예측 (Cancer Cell 2025) | 면역항암제 임상시험 사후 적용: 한 건의 3상 시험에서 생존 위험도 15% 개선, 합성 대조군을 활용한 다른 두 시험에서 10% 이상 개선 |
| 운동 특성 기반 자폐 중증도 분류 (Front. Psychiatry 2026) | 교차검증 84.6%, 테스트셋 86.4% — 저자 스스로 중증군 100% 정확도가 합성 데이터에서 기인했음을 밝히며 임상적 밸리데이션이 아닌 개념 증명이라고 한계를 명시 |
마지막 행에 주목할 필요가 있습니다. 가장 매력적으로 보이는 수치의 한계를 스스로 밝히는 연구야말로 현장에서 진정으로 필요한 태도입니다. 이를 다른 비교군을 슬그머니 바꿔치기한 “AUC 0.98” 헤드라인과 대조해 보십시오.
여기서 바로잡아야 할 중요한 사실이 있습니다: 혈장 p-tau217 바이오마커는 알츠하이머병을 다른 신경퇴행성 질환과 감별하는 데 있어 AUC 0.96~0.98에 달하는 지표가 아닙니다. 방어 가능한 정직한 수치는 약 0.89~0.96이며, 33개 연구 6,138명 환자를 메타분석한 2026년 연구의 통합 추정치는 0.95입니다. 시중에 떠도는 0.98이라는 수치는 인지 기능이 정상인 대조군이나 MCI 환자와 알츠하이머를 비교한 훨씬 쉬운 분류 작업에서 나온 값입니다. 루이소체 치매와의 감별 특이도는 약 0.69에 불과합니다. 여전히 훌륭한 수치이지만, 인용되고 있는 마케팅 수치와는 분명한 격차가 있습니다.
AI가 바이오마커의 지평을 실질적으로 확장하는 영역
물론 실질적인 진전도 존재하며 이는 매우 고무적입니다. 상업적으로 가장 앞서 나가는 분야는 계산 병리학(computational pathology)으로, 일상적인 H&E 조직 염색 이미지에서 형태학적 바이오마커를 추출하여 고가의 분자 진단 검사를 대체하거나 우선순위화하는 데 활용됩니다.
| 모델 | 검증된 데이터 규모 및 성능 |
|---|---|
| CHIEF (Nature 2024) | 19개 기관 60,530개 전체 슬라이드 이미지(WSI, 44 TB); 24개 병원 32개 슬라이드 세트(19,491개 WSI)에서 검증; 신경교종 IDH, 대장암 MSI 예측; 15개 코호트에서 생존율 검증 |
| Virchow (Nature Medicine 2024) | 9개 주요 암 및 7개 희귀 암에 걸쳐 검체 수준 AUC 0.95 달성; 150만 WSI, 6억 3,200만 파라미터. 2024년 7월 기준 “최대 규모”였으나 현재는 후속 모델에 의해 갱신됨 |
| CONCH (Nature Medicine 2024) | 117만 개 이미지-캡션 쌍으로 학습된 시각-언어 모델; 19개 모델 벤치마크에서 최고 성능 기록, Virchow2를 근소하게 앞섬 |
| RIDGE (BMC Medical Imaging, 2026년 9월) | 12개 고형암 유형에 걸쳐 4,983개 WSI 분석, 전체 AUC 0.763 달성 — 암 종의 범용적 확장이 개별 작업의 정확도 저하를 수반함을 보여주는 중요한 사례 |
| Stratipath Breast | H&E 기반 CE-IVD 인증 예후 계층화 도구, 중간 위험군으로 분류된 ER 양성/HER2 음성 조기 유방암에서 검증 완료 |
라디오믹스(영상 바이오마커) 문헌을 인용할 때 흔히 발생하는 오류 두 가지를 바로잡습니다. PyRadiomics의 기본 출력 특성 수는 105개가 아니라 107개입니다(v3.0.1 직접 실행 검증). 또한 시중에 회자되는 6개 군집 분류(글로벌 분산, 국소 명도 등)는 출판된 출처가 전무하며 PyRadiomics 분류 체계나 IBSI 표준의 일부가 아닙니다.
규제 경로는 요약본들의 설명보다 훨씬 좁다
현장의 풍문이 규제 문서와 가장 크게 어긋나는 지점이 바로 여기입니다.
약물 유도 신손상 패널. 6개 뇨 바이오마커(클러스터린, 시스타틴 C, KIM-1, NAG, NGAL, 오스테오폰틴)는 2018년에 적격성을 인정받았습니다. 그러나 실제 승인 범위는 세간의 인식보다 훨씬 좁습니다. 이들은 **복합 지표(composite measure)**로 해석되며, 임상 1상 건강한 자원자 시험에서 보조적(adjunctive) 안전성 모니터링 용도로만 적격성을 인정받았습니다. 기존 표준 검사를 대체하는 것은 명시적으로 불허되었으며, 개별 환자의 안전성 모니터링 용도로도 승인되지 않았습니다. 이를 “사전 지정된 안전성 평가변수”라고 과장해서는 안 됩니다.
ADPKD(상염색체 우성 다낭신) 적격성. 기저 시점의 총 신장 부피(TKV)를 예후적 농축(prognostic enrichment) 바이오마커로 인정했습니다. 12세 이상 환자에서 확인된 30% eGFR 감소 고위험군을 선별하기 위한 용도입니다 (2016년 9월 16일 공포, Docket FDA-2015-D-2843).
디지털 바이오마커. 디지털 바이오마커만을 위한 별도의 전용 적격성 트랙은 존재하지 않으며, 검증 증거가 의향서/계획서/최종패키지(LOI/QP/FQP)에 그냥 “포함되어 처리된다”는 주장은 FDA 출처 어디에서도 뒷받침되지 않습니다. 실제로는 DHT 프레임워크(2023년 3월), DHT 운영위원회, 관련 가이드라인, 그리고 CDRH 의료기기 규제라는 완전히 별개의 체계를 거쳐야 합니다. 디지털 바이오마커는 의료기기 허가(510(k), De Novo)를 받거나 특정 용도에 대한 기기/DHT 적격성 평가를 통해 클리닉에 진입합니다.
규제 당국의 연구 신호. FDA의 CPIM(의약품 개발 도구 조기 협의 미팅) 주제에 **“독성 간 질환 바이오마커 식별을 위한 AI 활용”(2026년 3월)**이 포함된 바 있으나, CPIM은 비규제(non-regulatory) 성격의 미팅이며 그 조언은 법적 구속력이 없습니다. 임상시험에서 **적응적 농축(adaptive enrichment)**을 위한 AI 연구를 다룬 CERSI 프로젝트는 2021년 10월로 거슬러 올라갑니다. 이들은 관심의 신호일 뿐 인허가 경로가 아닙니다.
**동반진단(CDx)**은 여전히 고도로 통제된 최종 규제 영역으로 남아 있습니다: 치료 혜택을 받을 가능성이 가장 높은 환자 식별, 심각한 부작용 위험 환자 식별, 또는 치료 조정을 위한 모니터링이 이에 해당합니다.
주장들의 출처 이력 감사 (Provenance Audit)
AI 바이오마커 시장에 떠도는 주요 주장들을 1차 출처와 대조한 결과입니다.
| 주장 내용 | 실제 출처 및 상태 |
|---|---|
| COMPASS — 면역관문억제제 반응 예측 | 동료 평가 통과 및 우수함. Nature Medicine (2026년 7월 3일). 10,184개 종양 사전학습; 16개 코호트 1,133명 환자 검증; 정확도 +8.5%, AUPRC +15.7%; 요로상피암 반응군에서 HR 4.7, P = 1.7×10⁻⁷로 TMB 및 PD-L1 능가. 개념 레이어는 43개가 아니라 44개 개념임 |
| Tempus 면역 프로파일 점수 | 동료 평가 논문 (J. Immunother. Cancer 2025) 확인 |
| Tempus 오시머티닙 HR 4.536; xM MRD 생존율 개선 | 보도자료 전용 — Tempus 투자자 발표자료 (2026년 5월 29일) |
| MutationProjector — KMT2D / SMARCA4+STK11 내성 예측 | 동료 평가 논문 (Cancer Discovery, 2026년 5월 27일) 확인 |
| Tufts CSDD / DIA 2025 — 표적 환자 식별 시간 68% 단축 | 동료 평가 논문 (Ther. Innov. Regul. Sci. 59:1074–1086) 확인 |
| McKinsey: 340개 AI 배포, ROI 중앙값 210%, 16개월 회수 | 거짓 (FALSE) — 허위 귀속. 인용된 매킨지 원문 어디에도 이러한 수치는 없음. 원문은 6개월 일정 단축, 등록률 10~20% 개선, 최대 50% 비용 절감을 다룸. 340개/210%/16개월 수치는 AI 마케팅 블로그에서 조작된 것임 |
| Immunai AMICA: 아스트라제네카 임상 25% 단축 | 출처 없음 (Unsourced). 링크드인 기고문이 유일한 발원지임. 실제 양사 협력은 8,500만 달러 IBD 협약 및 최대 3,750만 달러 종양학 협력임 |
| 바이오마커 시장 규모 전망치들 | 보도자료 전용 및 내부 모순. 한 조사기관은 북미 시장 규모를 보도자료에서는 422.5억 달러, 세부 페이지에서는 452.5억 달러로 표기함. 서로 다른 기준 연도의 3개 보고서를 억지로 하나로 이어 붙인 곡선임 |
| “12개 카테고리 9개 치료 영역의 142개 AI 기업” | 인용 금지. 링크드인 펄스(Pulse) 기고문이며 저자 스스로 “Claude의 지원을 받음”이라 명시함. 방법론도 데이터셋도 없으며, 허위 매킨지 수치와 출처 불명의 Immunai 수치의 발원지임 |
하단 3개 행을 함께 보십시오. 신뢰도가 결여된 단 하나의 웹 분석글에서 시작된 허위 수치와 왜곡된 통계가 지금 제약 업계의 공식 보고서와 발표 자료 속에서 ’기정사실’인 양 유통되고 있습니다. 이는 알고리즘의 문제가 아닙니다. 증거의 공급망이 붕괴된 것이며, 학술 문헌에서 발견된 ‘86개 중 2개’ 문제와 정확히 동일한 결함 모드입니다.
의료기기 인허가 관련 주장도 마찬가지입니다. “NeuroRPM이 2024년 FDA 혁신 의료기기(Breakthrough Device) 지정을 받았다”는 주장은 틀렸습니다. 실제 기록은 **510(k) 시판 전 신고 통과(K221772, 2023년 3월 17일)**이며 혁신 기기 지정 기록은 없습니다. “physIQ가 6건의 FDA 승인을 보유하고 있다”는 주장 역시 openFDA 기록상 4건뿐입니다. “Quibim QP-Brain이 조기 신경퇴행 감별로 허가를 받았다”는 내용도 뇌 MRI 영상 처리 소프트웨어로 허가받은 것이지 질병 진단 기능으로 승인된 것이 아닙니다.
도입 및 개발 조직을 위한 6가지 핵심 원칙
- AUC 수치를 확인하기 전에 독립 외부 코호트 유무를 먼저 물으십시오. 동일한 기관의 데이터에서 무작위로 쪼개어 측정한 수치는 성능 예측치가 아니라 내부 데이터 적합도 통계에 불과합니다.
- 캘리브레이션 지표를 별도로 요구하십시오. 변별력(AUC)과 캘리브레이션은 독립적으로 실패하며, 대다수의 논문과 벤더는 후자를 숨깁니다.
- 예후 주장과 예측 주장을 엄격히 분리하십시오. 치료 효과의 이질성을 입증하는 것은 완전히 다른 차원의 연구 설계와 증거 기준을 요합니다.
- 적격성 평가를 ‘사용 맥락’ 관점에서 정밀하게 해석하십시오. 바이오마커가 특정 목적에 인정받았더라도, 귀사의 진단 시약, 컷오프 기준, 분석 플랫폼은 별도로 밸리데이션되어야 합니다. 또한 승인 범위가 협소한 보조적 용도인지 확인하십시오.
- 보도자료가 아닌 openFDA 인허가 원부를 직접 조회하십시오. 510(k), De Novo, PMA 승인, 혁신 의료기기 지정은 법적으로 완전히 다른 권리와 효력을 가집니다.
- 시장 규모와 ROI 수치의 최초 발원지를 역추적하십시오. 홍보성 보도자료나 개인 블로그 기고문으로 연결된다면 즉시 사업 계획서에서 삭제하십시오.
결론 (The Bottom Line)
AI는 바이오마커가 될 수 있는 영역을 실질적으로 확장했습니다: 멀티모달 시그니처, H&E 염색 이미지로부터 추출된 조직 형태학, 연속적 웨어러블 센서 스트림, 고정된 목록이 아니라 개별 검체별로 동적 해석되는 단백질 패널 등이 그것입니다. Nature Medicine에 실린 COMPASS 모델처럼 독립 2상 시험에서 TMB와 PD-L1을 모두 능가하는 생존 신호를 보여준 연구는 진정으로 주목해야 할 성과입니다.
그러나 이 분야의 결정적 병목은 새로운 바이오마커의 ’탐색’에 있지 않습니다. 86개 연구 중 외부 검증은 단 2개였습니다. 캘리브레이션을 확인한 것은 3~4개에 불과했습니다. 이전 세대 오믹스 연구의 78%가 내부 검증에 갇혀 있었습니다. 그리고 규제 당국의 적격성 인정은 특정 용도에 국한되며, 현장의 시험법과 플랫폼 밸리데이션 과제를 고스란히 남겨둡니다.
진정한 바이오마커와 ’바이오마커의 형태를 띤 단순한 숫자’를 가르는 기준은 화려하지 않습니다: 독립된 외부 코호트, 캘리브레이션 곡선, 모델 카드 공유, 그리고 철저한 검증을 견뎌내는 출처 추적성입니다. 그 외의 모든 것은 임상적 수사로 포장된 과적합 통계에 지나지 않습니다.
관련 기사: 117개 AI 개발 신약 파이프라인, 승인은 0건 · 일반화의 벽: 저분자 화합물과 바이오로직스에서 분자 AI가 실제로 전달하는 가치 · 표현은 해결되었으나 시뮬레이션은 미완이다: AI 가상 세포의 현주소
출처 및 참고 문헌: FDA BEST 용어집 (NBK338448) · FD&C Act 제507조 (21세기 치료법) · FDA 바이오마커 적격성 평가 프로그램 공식 페이지 · ADPKD 총 신장 부피 적격성 인정 (81 FR 63764) · FDA 동반진단 안내서 · FDA CPIM 토론 주제 (2026년 3월) · FDA CERSI 적응적 농축 프로젝트 (2021년 10월) · FDA DHT 프레임워크 (FR 2023-06066) · Qi et al., npj Digital Medicine 8:366 (2025) · Glaab et al., BMJ Open 11:e053674 · Yasin et al., npj Digital Medicine 9:507 (2026) · Feng et al., Front. Immunol. 16:1541939 · Fırat, Front. Psychiatry 17:1751654 · Carr et al., ML4H 2021 · Arango-Argoty et al., Cancer Cell 2025 · CHIEF, Nature 2024 · Virchow, Nature Medicine 2024 · CONCH, Nature Medicine 2024 · EGFR-from-H&E, Nature Medicine 2025 · RIDGE, BMC Medical Imaging 2026 · Stratipath Breast (CE-IVD) · PyRadiomics v3.0.1 매뉴얼 · openFDA 데이터베이스 (K221772, K232231) · COMPASS, Nature Medicine 32:3010–3022 · Tempus IPS, J. Immunother. Cancer 2025 · MutationProjector, Cancer Discovery 2026 · Tufts CSDD/DIA, Ther. Innov. Regul. Sci. 59:1074–1086.
연구 노트: [[AI-Biomarkers-Stratification-Precision-Medicine-2026]]
Saram Consulting