2026년 제약 바이오 분야 AI의 현주소를 정의하는 두 가지 숫자가 있습니다. 이 두 숫자는 완전히 상반된 방향을 가리킵니다.

117. 이는 63개 기업에서 중재 임상시험(interventional clinical trials)에 진입시킨 AI 기반 치료제 파이프라인(자산)의 수입니다. 이 중 60개가 임상 1상을 완료했고, 8개가 임상 2상을 마쳤습니다. AI가 발굴한 분자 물질의 임상 1상 통과율은 **8090%**에 달하며, 이는 과거 기존 방식의 기준치인 4065%를 크게 웃돕니다. 화학은 작동하고 있습니다. 예측도 들어맞고 있습니다. 대형 계약도 현실입니다. 일라이 릴리(Eli Lilly)는 엔비디아(NVIDIA)와의 공동 혁신 랩에 5년간 최대 10억 달러를 투입하기로 약정했고, BMS는 앤트로픽(Anthropic)과 협력하여 3만 명 이상의 임직원에게 에이전트 AI를 보급했으며, 로슈(Roche)는 자율 연구소(autonomous labs) 구축을 위해 2,176개의 블랙웰(Blackwell) GPU로 구성된 AI 팩토리를 도입했습니다.

0. 이는 FDA 승인을 획득한 AI 기원(AI-originated) 신약의 수입니다. 임상 2상 성공률은 약 40%로, 과거 역사적 평균과 통계적으로 구별되지 않습니다. AI가 전체 신약 개발 기간을 단축했음을 입증한 조직은 단 한 곳도 없으며, 초기 신약 탐색(drug discovery)은 시장 출시까지 소요되는 1015년의 여정 중 2030%에 불과합니다.

두 숫자는 모두 명백한 사실입니다. 이 팽팽한 긴장감이 전체 현실을 말해줍니다. 그리고 이는 결코 모델의 능력 부족에 관한 이야기가 아닙니다.

현재 가장 앞선 후보물질은 슈뢰딩거(Schrödinger)와 님버스(Nimbus)의 **자소시티닙(zasocitinib, TAK-279)**입니다. 3상 LATITUDE-PsO 시험에서 모든 1차 및 2차 평가변수를 충족했으며, 2026년 9월 14일 우선심사(Priority Review) 대상으로 신약허가신청(NDA)이 승인되어 2027년 1분기 PDUFA 일정을 앞두고 있습니다. 만약 승인된다면 누구나 신뢰할 수 있는 형태로 ’AI 설계 신약’이라 부를 수 있는 최초의 약물이 될 가능성이 높습니다. 그러나 그 칭호의 신뢰성은 기만적이지 않은 수준에서 인간 의약화학자들의 기여를 얼마나 배제할 수 있느냐에 전적으로 달려 있습니다. FDA에는 ’AI 발굴 신약’이라는 별도 분류 체계가 없습니다. 그러한 모든 주장은 사실(fact)이 아니라 공적 귀속(attribution)에 관한 논쟁일 뿐입니다.

기술이 실제로 도달한 지점, 기술이 멈춰 서는 경계선, 그리고 병목 현상이 대부분의 AI 프로그램이 간과하는 다른 지점으로 옮겨간 이유를 살펴봅니다.

AI가 실제로 배포되어 작동하는 영역

배포 성숙도는 정확히 단 하나의 변수를 추종합니다. 바로 기반 데이터가 얼마나 정제되어 있고, 구조화되어 있으며, 검증 가능한가입니다. 열정, 예산, 경영진의 특명과 같은 다른 모든 요소는 단순한 소음에 불과합니다.

 가치 사슬 단계별 배포 성숙도

 표적 발굴 (Target ID)          ████████████  프로덕션 배포
 분자 설계 (Molecule design)     ████████████  프로덕션 배포
 단백질 구조 (Protein structure)  ████████████  프로덕션 배포
 ADMET 예측                     ██████████░░  프로덕션 배포, 벤치마크 한계 봉착
 전임상 / 페노믹스 (Phenomics)    ████████░░░░  파일럿 → 프로덕션 전환 중
 규제 문서 작성 (Regulatory)     ████████░░░░  가장 빠른 ROI, 인간 최종 서명
 약물 감시 (PV, Pharmacovigilance) ████████░░░░  성숙했으나 보수적 운영
 임상 개발 (Clinical dev)        ██████░░░░░░  성장 중이나 불균등
 품질 / 일탈 관리 (Quality)      █████░░░░░░░  보조 도구 전용, 자체 승인 불가
 CMC / 제조 (Manufacturing)      ████░░░░░░░░  파일럿 단계, 규제 제출 드묾

이 중 몇 가지 주요 영역의 실상을 구체적으로 짚어볼 필요가 있습니다.

구조 예측은 기본 인프라로 자리 잡았습니다. AlphaFold DB는 2억 개 이상의 예측 구조를 보유하고 있으며, 실험적 구조가 전혀 없던 표적들도 최소한 약물화 가능성(druggability) 가설을 갖추게 되었습니다. RFdiffusion, Chai-1, ESMFold, ProteinMPNN은 바이오로직스 연구 그룹에서 데 노보(de novo) 결합체 및 효소 설계를 단순 시연에서 일상적 업무 루틴으로 격상시켰습니다.

ADMET 예측은 작동하지만, 올바른 시험에서만 유효합니다. CYP 억제에 대해 0.850.92 AUC, hERG에 대해 0.890.96 AUC 수준의 성능이 흔히 보고됩니다. 그러나 이러한 수치는 거의 예외 없이 무작위 분할(random split) 환경에서 측정된 값입니다. 우리가 실제로 관심을 갖는 유일한 영역인 진정한 신규 화학물질을 다루는 골격 분할(scaffold split)에서는 성능 저하가 빈번하게 나타납니다. 누군가 화려한 벤치마크 점수를 제시할 때마다 이 점을 상기해야 합니다.

임상 개발은 성과가 불균등한 중간 지대입니다. 조직의 약 26%가 임상시험 자동화, 이상반응 감지, 치료 반응 예측에 AI를 사용하고 있으며, 약 42%는 시험기관 선정(site selection) 파일럿을 진행 중입니다. 보고되는 성과는 주로 등록 기간 단축과 프로토콜 초안 작성입니다. 이들은 실질적이지만 점진적인 개선에 불과하며, 인간 생체 내에서 작용 기전을 입증하는 데 드는 막대한 비용에는 영향을 미치지 못합니다.

CMC 및 제조 영역은 벤더들의 영업 자료가 주장하는 것보다 훨씬 뒤처져 있습니다. 디지털 및 AI 기반 CMC 도구에 대한 업계 설문조사에 따르면 도구 도입 경험은 광범위했으나, 규제 당국에 제출된 사례는 15% 미만에 불과했습니다. 장벽은 기술 역량이 아닙니다. 조직 문화의 변화, 실무자의 기술 부족, 그리고 규제 기관이 어떤 증거를 수용할지에 대한 불확실성이 걸림돌입니다.

품질 및 약물감시(PV)는 가장 눈여겨봐야 할 패턴을 보여줍니다. 약물감시에서 신호 탐지를 위한 머신러닝은 광범위하게 연구되었으며 전통적인 불균형 분석법(disproportionality methods)을 종종 능가합니다. 그러나 설치 기반에서는 여전히 고전적 통계 기법이 지배적이며, 검토된 PV 연구 중 머신러닝이나 딥러닝을 실제 활용한 사례는 12.3%에 불과했습니다. 첨단 기술은 존재하지만, 현장의 운영 시스템은 구형입니다. 가용한 기술과 실제 배포된 기술 사이의 이 거대한 간극은 제약 산업 전반에서 반복되며, 예산 수립 시 반드시 고려해야 할 실체입니다.

현재 할 수 있는 것과 할 수 없는 것

단계 현재 수행 가능한 작업 현재 불가능한 작업
생물학 (Biology) 고차원 오믹스(omics) 군집화를 통한 표적 우선순위화; 경성~중등도 단백질 입체형태 예측 인간의 복합적인 전신 생체 반응 재구성; 세포 유동 상태의 복합 알로스테릭 메커니즘, 다중 단백질 복합체, 후성유전학 모델링
화학 (Chemistry) 고정된 구조에 대한 선도물질형(lead-like) 히트 발굴; 표준 화학형에 대한 역합성(retrosynthetic) 경로 제안 비표준 골격에 대한 합성 접근성 보장; in vitro 친화도로부터 in vivo 유효성 예측
안전성 / ADMET 알려진 심장독성 및 변이원성 모티프 식별; 극단적 PK 결함 물질 제거 특이체질성 약물 유도 간손상(DILI), 면역 매개 이상반응, 2차 장기 손상 예측
임상 (Clinical) 환자 매칭 가속화, 프로토콜 초안 작성, 실사용 증거(RWE) 추출 유효하지 않은 표적의 결함 보상; 전신 면역 반응 예측
지표 AI 기원 신약 전통적 기준치 (Baseline)
임상 1상 성공률 80–90% 40–65%
임상 2상 성공률 약 40% (표본 제한적) 약 40%
전체 개발 기간 개선 입증되지 않음 —
FDA 최종 승인 0건 —

임상 1상에서의 높은 성공률은 미스터리가 아닙니다. 1상은 주로 안전성과 약동학(PK)을 시험하며, 이는 계산 기반 분자 설계가 스크리닝을 통해 걸러내는 데 가장 특화된 영역입니다. 반면 2상은 인간 생리 환경에서 해당 표적이 실제로 질환을 치료할 수 있는지를 시험하며, 이는 현재 그 어떤 모델도 답을 내릴 수 없는 문제입니다. AI는 분자를 ‘만드는’ 속도를 가속화했습니다. 하지만 신약 개발의 병목은 분자를 합성하는 단계에 있었던 적이 없습니다.

2026년에 발생한 실패 사례들은 성공 사례보다 현실을 더 극명하게 보여줍니다. 엑센시아(Exscientia)와 스미토모(Sumitomo)가 인간에게 투약한 최초의 AI 설계 약물인 DSP-1181은 1상 이후 개발이 중단되었습니다. 리커전(Recursion)의 REC-994는 1차 평가변수가 안전성이었기 때문에 이를 충족했으나, 유효성 입증에 실패하여 2025년 5월 개발이 중단되었습니다. REC-2282 역시 같은 날 중단되었습니다. 슈뢰딩거의 SGR-2921은 2025년 8월 중단되었습니다. 약 30억 달러 규모의 파트너십 가치를 보유한 아이소모픽 랩스(Isomorphic Labs)조차 2026년 중반 기준으로 임상 후보물질을 내놓지 못했습니다.

무비판적 반복을 멈춰야 할 네 가지 주장

“AI 모델은 결합 메커니즘을 이해한다.” 2025년 Nature Communications 연구는 4개의 공동 접힘(co-folding) 모델(AlphaFold 3, RoseTTAFold All-Atom, Chai-1, Boltz-1)을 대상으로 결합 부위에 의도적인 파괴적 변이를 도입하여 테스트했습니다. 결과는 충격적이게도 모델들이 거의 변화 없는 결합 구조를 예측한다는 것이었습니다. 중요한 세부 사항은 이러한 교란이 실험적으로 파괴된 결합 부위가 아니라 in silico 점돌연변이였다는 점입니다. 단백질 접힘은 유지되었고, AlphaFold 3가 가장 우수한 성능을 보였으며, 일부 조건에서는 부분적인 리간드 이탈만 발생했습니다. 명확한 결론은 “모델이 고장 났다”가 아닙니다. 이 시스템들은 결합의 물리적 원리를 모델링하는 것이 아니라 과거에 보았던 패턴을 인식하고 있다는 점입니다. 이는 모델을 신뢰할 수 있는 시점(기존 화학 공간 내의 보간)과 신뢰해서는 안 되는 시점(신규 화학형, 유도 적합, 은닉 포켓)을 명확히 구분해 줍니다.

“AI가 신약 개발의 성과를 향상시키고 있다.” Nature Reviews Drug Discovery는 2026년 8월 평가에서 임상적으로 유의미한 개선에 대한 증거가 여전히 제한적이라고 결론지었습니다. 저자들이 제시한 원인은 알고리즘의 문제가 아니기에 깊이 새겨볼 가치가 있습니다. 바로 조건부(conditional) 생명과학 데이터, 불충분한 문제 정의, 시스템 통합 장벽, 데이터 사일로, 계산 예측을 실제 의사결정으로 전환하는 것의 어려움입니다. 여기서 핵심 단어는 ’조건부’입니다. 세포 기반 분석은 계대 수(passage number), 혈청 배치, 온도 변화에 따라 IC₅₀ 값이 10배씩 달라질 수 있으며, 대부분의 AI 학습 코퍼스는 이러한 맥락을 암묵적으로 소실시킵니다.

“환각(Hallucination) 문제는 곧 해결될 것이다.” 2025년의 한 정형 이론 연구는 현재는 물론 예견 가능한 미래의 아키텍처에서도 환각이 결정 불가능(undecidable)한 문제라고 주장합니다. 이 주장은 학계의 반론 논문이 발표되는 등 논쟁 중이므로 확정된 수학적 진리라기보다는 진지한 미해결 쟁점으로 다루어야 합니다. 그러나 운영상 도출되는 결론은 논쟁의 여지가 없습니다. 규제 대상 산출물에 대해 인간의 책임성은 100% 유지되어야 합니다. 기술적 수단만으로는 결함의 발생 가능성을 완전히 제거할 수 없기 때문입니다.

“문제는 데이터 부족이다.” 문제는 데이터의 양이 아니라 데이터의 **형태(shape)**입니다. 딥러닝은 데이터의 풍요를 전제하지만, 신약 개발은 소규모이고 비싸며 기밀성이 높고 조건에 극도로 민감한 데이터셋을 생산합니다. 고품질 실험 데이터의 희소성은 웹 스크래핑으로 해결할 수 있는 일시적 이상 현상이 아닙니다. 이 도메인이 지닌 구조적 고유 속성입니다.

단절의 실체 (The Disconnect)

AI 기술이 위치한 자리와 실제 업무가 수행되는 자리는 분리되어 있습니다. 동일한 분자의 레퍼런스 구현체를 네 개 확보하는 것이 신뢰할 수 있는 단 하나의 분석 결과를 얻는 것보다 쉽습니다. 이것이 현장의 실상입니다.

       전문가 (화학자 · 임상의 · QA · 규제 전문가)
                     │
                     ▼
 ┌─ AI 인터페이스 ──────────────────────┐   ← 벤더들의 경쟁이 치열한 곳
 └──────────────────┬──────────────────┘
                    │
         ┌──────────┴──────────┐
               ▼         ▼
             추론     에이전트
         └──────────┬──────────┘
                    ▼
 ┌─ 지식 계층 (Knowledge layer) ───────┐   ← 실질적 가치가 축적되는 곳
 │  온톨로지 · 출처 이력(provenance) ·   │
 │  엔티티 레지스트리 · 클레임           │
 └──────────────────┬──────────────────┘
                    │
     ┌──────────────┼──────────────┐
     ▼              ▼              ▼
    ELN           LIMS            QMS      ← 실제 데이터가 존재하는 곳

이 접합면에는 다섯 가지 층위의 마찰이 존재하며, 기술에 기인한 것은 그중 하나에 불과합니다.

1. 적격성 평가의 공백 (The qualification gap)

제약 업계는 장비, 분석법, 제조 공정을 철저히 밸리데이션합니다. 밸리데이션 프로토콜 없이는 아무것도 가동되지 않으며, 문서화된 교육 훈련 없이는 누구도 장비를 조작할 수 없습니다. 운영자가 시스템의 고장 모드와 한계를 이해하고 있음을 입증하는 페이퍼 트레일이 필수적입니다.

그러나 AI 구현체들은 일상적으로 이 모든 과정을 건너뜁니다. 운영자 적격성 평가, 한계 조건 시험(challenge conditions), 문서화된 인간 감독 체계가 필요한 규제 대상 시스템이 아니라 단순한 일반 소프트웨어로 현장에 도입되고 있습니다.

규제 당국의 집행 의지는 결코 이론에 머물지 않습니다. 2026년 4월, FDA는 퓨롤레아 코스메틱스 랩(Purolea Cosmetics Lab)을 대상으로 경고장(Warning Letter 320-26-58)을 발부했습니다. 회사 이름과 달리 CDER 의약품 cGMP 위반에 대한 조치였으며, *“의약품 제조에서 인공지능의 부적절한 사용(Inappropriate Use of Artificial Intelligence in Pharmaceutical Manufacturing)”*이라는 제목의 전용 섹션이 포함되었습니다. 지적 사항은 AI를 사용했다는 사실 자체가 아니었습니다. 권한 있는 품질 부서(Quality Unit)의 검토와 승인 없이 규격, 절차서, 제조기록서 원본을 생성하는 데 AI에 의존했다는 점이 핵심 지적 사항이었습니다.

이를 일반적인 규제 기조로 읽어야 합니다. 규제 당국은 새로운 AI 전용 가이드라인이 최종 확정될 때까지 기다리지 않습니다. 기존의 CGMP 권한을 바탕으로 AI가 개입된 공정을 지금 즉시 단속하고 있습니다.

2. 검증 비용 (The verification tax)

과거 작성에 30분이 걸리던 보고서를 이제 3분 만에 생성할 수 있습니다. 하지만 이를 확인하고 검증하는 데 15분이 소요됩니다. 이는 실질적인 12분의 시간 절약이지만, 동시에 완전히 다른 성격의 노동을 의미합니다.

품질 시스템과 맞닿았을 때 살아남는 지표는 생성 속도가 아닙니다. **신뢰할 수 있는 산출물에 도달하기까지의 시간(Time-to-trusted-output)**입니다. 이는 규제 환경에서 AI를 도입하는 모든 조직이 가져야 할 가장 중요한 관점의 전환입니다. 산출물을 감사(audit)할 수 있는 약간 덜 똑똑한 모델이, 처음부터 산출물을 다시 검증해야 하는 고성능 모델을 이깁니다.

3. 지표의 불일치 (Metric mismatch)

계산 과학 팀은 공개 데이터셋을 바탕으로 RMSD, 도킹 점수, 교차 검증 R², 벤치마크 ROC-AUC를 최적화합니다. 그러나 실험실 연구원들이 관심을 갖는 것은 화합물이 용해되는지, 완충액에서 침전되는지, 마우스 간세포를 죽이는지, HPLC에서 순수한 거울상이성질체를 분리할 수 있는지 여부입니다.

ADMET 지표가 가장 명확한 예시입니다. 무작위 분할에서 0.9 AUC가 나왔다는 것은 모델이 이미 본 화학 영역 내에서 훌륭하게 보간(interpolation)하고 있음을 뜻할 뿐입니다. 완전히 새로운 골격에 대해서는 아무것도 알려주지 못하며, 신약 개발의 핵심은 바로 그 새로운 골격을 찾는 것입니다.

4. 워크플로우의 파편화 (Workflow fragmentation)

AI는 주피터(Jupyter), 데이터브릭스(Databricks), 벤더 포털, 개인 ChatGPT 계정 속에 존재합니다. 반면 실제 업무는 ELN, LIMS, QMS, ERP, MES, DMS에 존재합니다. 연구원은 데이터를 내보내고, 정제하고, 업로드하고, 프롬프트를 입력하고, 해석하고, 복사하여 시스템에 다시 입력합니다.

이러한 규모의 마찰은 모델의 품질과 상관없이 도입을 좌절시킵니다. 더 나아가 심각한 문제를 초래합니다. 역량이 감사 가능한 전사 시스템이 아닌 통제되지 않는 개인 계정으로 숨어들게 되며, 이는 현재 모든 품질 부서가 정량화하려 애쓰는 섀도우 AI(Shadow AI) 문제로 직결됩니다.

5. 파일럿에서 프로덕션으로의 전환 장벽

수치들은 냉혹한 현실을 보여줍니다.

조사 결과 수치 출처
측정 가능한 재무적 수익을 내지 못하는 생성형 AI 파일럿 비율 약 95% MIT Project NANDA, 2025 (52개 인터뷰 및 컨퍼런스 설문 기반 예비조사)
배포가 진전되고 있다고 응답한 경영진 비율 71% Deloitte, 2026년 4월, 생명과학 경영진 150명
어떤 형태로든 측정 가능한 개선을 보고한 비율 45% 동일 출처
*전사적 규모(at scale)*로 개선을 달성했다고 보고한 비율 13% 동일 출처
생성형 AI를 통해 유의미한 재무적 가치를 창출했다고 답한 기업 약 5% McKinsey, 제약/의료기술 리더 100명 이상
승인된 생성형 AI 접근 권한을 보유한 임직원 비율 약 3명 중 1명 ZS, 2025, 기술 임원 127명 대상
그중 주간 단위로 이를 적극 활용하는 비율 약 10% 동일 출처
AI가 팀에 도움이 된다고 믿는 임직원 비율 77% Cognizant
자신의 실제 직무에서 이를 어떻게 활용해야 하는지 이해하는 임직원 37% 동일 출처
머신러닝 이해도: 경영진 vs 일반 직원 89% vs 56% 동일 출처
AI를 전면 도입한 임상 개발 활동 비율 10.7% Tufts CSDD, Ther Innov Regul Sci 2025 — 302개 기관 대상 동료 평가 논문
도입 장벽으로 적격 인력 부족을 꼽은 비율 34% (전년 23%에서 증가) Pistoia Alliance, 2025년 9월

이 표에서 두 가지 항목은 다시 한번 정독할 필요가 있습니다.

접근 권한이 곧 도입을 의미하지 않습니다. 직원의 3명 중 1명이 승인된 도구를 보유하고 있지만, 이를 매주 사용하는 인원은 약 10명 중 1명에 불과합니다. 시중에 떠도는 ‘AI 라이선스 구매 좌석 수’ 지표는 실질적으로 아무것도 측정하지 못하고 있습니다.

전략 수립자들은 구형 AI를, 실무자들은 신형 AI를 서로 다르게 이해하고 있습니다. 경영진은 자신의 머신러닝 이해도를 89%로 평가하지만 직원은 56%로 평가합니다. 반면 생성형 및 에이전트 AI에 대해서는 직원이 경영진보다 스스로를 더 높게 평가합니다. AI 전략에 서명하는 사람과 현장에서 이를 조작하는 사람이 기술에 대해 서로 완전히 어긋난 멘탈 모델을 공유하고 있는 것입니다.

또한 인력 격차의 추세에 주목하십시오. 인력 부족을 장벽으로 꼽은 비율은 불과 1년 만에 23%에서 34%로 상승했습니다. 인재 병목은 좁혀지지 않고 오히려 넓어지고 있으며, 조직 내 AI 인재의 67%는 외부 채용이 아닌 사내 재교육(upskilling)에서 공급되고 있습니다. 현재 가장 희소한 전문가는 단순 ML 연구원이 아닙니다. 과학적 연구 과제와 AI 모델의 실패 모드를 머릿속에 동시에 담아낼 수 있는 도메인 통섭형 인재입니다.

정확하게 정리한 규제 현황

이 영역은 전문가를 자처하는 이들조차 가장 자주 잘못 전달하는 부분입니다.

규제 문서 / 조치 2026년 10월 기준 공식 상태 핵심 내용
FDA 규제 의사결정 지원을 위한 AI 활용 고려사항 (2025년 1월) 여전히 초안 상태. “이행용이 아님(Not for Implementation)” 명시 **사용 맥락(Context of Use)**에 연계된 7단계 위험 기반 신뢰성 평가 프레임워크. 질문은 “이 AI가 밸리데이션되었는가”가 아니라 “이 AI가 이 특정 용도에 충분히 신뢰할 만한가”임
FDA + EMA 우수 AI 실무 가이드 원칙 (2026년 1월) 비구속적 권고 10대 원칙: 인간 중심 설계, 위험 기반 접근, GxP 기준 준수, 명확한 사용 맥락, 다학제 전문성, 데이터 거버넌스, 모델 설계, 성능 평가, 라이프사이클 관리, 정보 투명성
FDA의 AIM-NASH 적격성 인정 (2025년 12월) 공식 적격성 평가 완료 MASH 임상에서 간 조직학 채점을 위해 최초로 적격성을 인정받은 AI 신약 개발 도구 — 단, 병리학자가 최종 판독 책임을 유지함
FDA 경고장 Warning Letter 320-26-58 (2026년 4월) 규제 집행 조치 권한 있는 품질 부서 검토 없이 AI가 생성한 규격 및 절차서에 의존한 사례 적발
EU GMP 부속서 22 (Annex 22) 초안 상태, 미확정. 2025년 10월 의견 수렴 종료, 2026년 4분기 최종본 예상 초안 문구는 동적이고 확률론적 출력을 내는 생성형 AI를 “중요 GMP 애플리케이션에 사용해서는 안 된다”고 명시 — 잠정 문구이며 변경 가능
EU AI 법 (EU AI Act) 고위험 의무 규정 시행 유예 — 현재 미적용 규정 (EU) 2026/1744에 따라 고위험 AI 의무 적용 시점이 2027년 12월 2일 및 2028년 8월 2일로 연기됨. 2026년 8월 2일에는 일반 투명성 조항만 발효됨

마지막 행은 수많은 기존 기고문과 보고서에 대한 실시간 교정입니다. EU AI Act의 고위험 규제가 2026년 8월 2일부터 전면 적용되었다고 읽으셨다면, 그것은 오보입니다. 디지털 옴니버스(Digital Omnibus) 법안을 통해 일정이 연기되었습니다.

이 표가 시사하는 바는 두 가지입니다. 첫째, 규제의 초점이 “이 AI 모델이 밸리데이션되었는가”에서 “이 AI가 해당 사용 맥락에 대해 신뢰할 만한가”로 이동했습니다. 이는 훨씬 합리적인 접근이지만, 기존의 정적 소프트웨어 밸리데이션 SOP로는 대응하기 어려운 질문입니다. 둘째, 최종 가이드라인의 부재가 규제의 피난처가 되지 못합니다. 퓨롤레아 경고장이 이를 입증합니다. 규제 당국의 집행은 가이드라인 확정보다 앞서 나가고 있으며, 새로운 법률이 아니라 기존 CGMP 체계를 통해 단속이 이루어지고 있습니다.

밸리데이션 전략을 수립할 때 귀감으로 삼아야 할 표준은 AIM-NASH입니다. AI는 점수를 산출하고, 병리학자는 해석에 대한 책임을 지며, 감사 추적(audit trail)은 양쪽 모두를 기록합니다. **“AI → 즉시 의사결정”**이 아니라 “AI → 전문가 검토 → 책임 있는 결정” 구조여야 합니다.

현장의 격차를 실제로 메우는 7가지 실무 방안

  1. 소프트웨어뿐만 아니라 운영자의 적격성을 평가하십시오. 장비 적격성 평가의 원칙을 AI로 확장해야 합니다. 문서화된 교육 훈련, 운영자가 모델의 한계와 적용 도메인을 이해하고 있다는 증거, AI 산출물마다 지정된 책임 있는 인간을 명시해야 합니다.

  2. 모델 자체가 아니라 ’사용 맥락’에 맞춰 밸리데이션하십시오. FDA의 신뢰성 평가 프레임워크가 올바른 방향입니다. 알고리즘에 대한 이분법적 합격 판정이 아니라, 특정 의사결정에 비례하는 타당한 증거를 확보해야 합니다. 문서를 분류하는 모델과 배치 출하(batch release) 결정을 내리는 모델에 동일한 검증 부담을 지우는 것은 밸리데이션 프로젝트를 1년 넘게 표류하게 만드는 지름길입니다.

  3. 연구팀 내부에 도메인 번역가를 배치하십시오. 계산과학자 1명을 질환 생물학 또는 의약화학 팀에 직접 배속시키고, 알고리즘 개선 지표가 아니라 과학적 마일스톤을 공동 책임지도록 하십시오. 고립된 중앙 전문조직(CoE) 형태의 서비스 데스크는 실패 모델입니다. 팀에 밀착된 임베디드 포드(pod) 형태가 작동합니다.

  4. 드라이 랩과 웻 랩의 루프를 닫고 네거티브 데이터를 기록하십시오. 실패한 반응, 효능이 없는 물질, 불용성 화합물은 체계적으로 기록되지 않는 경향이 있으며, 이는 구조-활성 모델에서 가장 유익한 신호를 박탈합니다. 네거티브 결과를 표준화하여 수집하는 자동화된 능동 학습(active learning)은 신약 탐색 인프라에서 가장 레버리지가 높은 투자입니다.

  5. 단일 점 예측 대신 캘리브레이션된 불확실성을 제공하십시오. 컨포멀 예측 구간(conformal prediction intervals)과 분포 이탈(out-of-distribution) 경고는 화합물이 모델의 적용 가능 영역을 벗어났을 때 화학자에게 이를 알려줍니다. 불확실성 구간이 없는 단일 수치는 과도한 신뢰를 유발하고 결국 웻 랩에서의 실망으로 이어집니다.

  6. 데이터 준비도를 사후 과제가 아닌 전제 조건으로 취급하십시오. 동종 기업 대비 9~10배 빠른 속도로 전사 확장에 성공하는 조직들은 AI 프로그램을 시작하기 전에 거버넌스와 데이터 기반을 다져놓은 곳들입니다. AI를 도입한 후 데이터를 정비하겠다는 약속은 지켜지지 않습니다.

  7. 검증 가능한 중간 계층(Middle Layer)을 직접 소유하십시오. 기초 모델은 반나절 만에 교체할 수 있는 범용재입니다. 경쟁자가 모방할 수 없는 자산은 온톨로지, 표준 엔티티 레지스트리, 데이터 출처 이력 체인, 밸리데이션 규칙, 그리고 “이 데이터가 왜 여기에 있는가?“라는 감사 질문에 원본 문서, 버전, 원문 텍스트 근거로 답할 수 있는 감사 추적 인프라입니다. AI 인터페이스는 바로 이 계층 위에 올라서며, 가치는 여기서 축적됩니다.

간과하기 쉬운 사각지대

병목은 가설 생성에서 가설 검증으로 이동했습니다. AI는 이제 로봇이든 인간이든 그 어떤 실험실도 감당할 수 없을 만큼 많은 검증 가능한 가설을 쏟아냅니다. 진정한 한계 자원은 컴퓨팅 파워가 아니라 실험적 검증 용량(experimental capacity)입니다. 하지만 이를 고려한 AI 로드맵을 가진 곳은 거의 없습니다.

AI 도입 여부가 잘못된 도구로 측정되고 있습니다. 라이선스 구매 좌석 수나 프롬프트 호출량은 QMS 관점에서 아무런 의미가 없습니다. 유일하게 유의미한 지표는 ’신뢰할 수 있는 산출물에 도달하기까지의 시간’입니다.

공적 귀속 문제는 해결되지 않았습니다. 어떤 규제 기관도 약물을 AI 발굴 신약으로 분류하지 않습니다. 모든 주장은 그 표현이 마케팅으로 변질되기 전에 인간 화학자의 기여를 얼마나 제거할 수 있는지에 기반하고 있습니다.

진정한 해자는 독점 데이터와 출처 추적성이지 최신 모델이 아닙니다. 파운데이션 모델은 분기 단위로 범용화되고 있습니다. 반면 독점 데이터 기반 연합 파인튜닝, 엄선된 생물학 데이터셋, 고유하게 축적된 실사용 증거(RWE) 자산은 복제할 수 없습니다.

접합면(The Seam)의 주인이 없습니다. 품질 부서와 IT 부서는 결정론적 소프트웨어용 프레임워크를 사용해 확률론적 AI 시스템을 밸리데이션해야 하는 처지에 놓여 있습니다. 반면 AI 엔지니어링 팀은 초기부터 GxP를 고려해 개발할 수 있는 규제 이해도가 부족합니다. 모델 → 데이터 → 워크플로우 → 증거 → 인간의 의사결정 → 조직의 기억으로 이어지는 이 빈틈이야말로 탁월한 역량을 갖춘 프로젝트들이 좌초하는 지점입니다.

결론 (The Bottom Line)

기술은 조직보다 앞서 있고, 조직은 인력의 준비 상태보다 앞서 있습니다. AI는 파이프라인의 전반부와 방대한 지식 작업을 명백히 가속화했고, 임상 운영을 일부 최적화했으며, 임상적 유효성에 대해서는 여전히 미검증 상태이지만 이제 본격적으로 검증 가능한 가설들을 제시하고 있습니다.

누구나 클라우드에서 대여할 수 있는 동일한 모델로부터 압도적인 가치를 끌어내는 조직은 가장 뛰어난 알고리즘을 가진 곳이 아닐 것입니다. 데이터 준비도, 작업자 적격성 평가, 사용 맥락 기반 밸리데이션, 워크플로우 통합을 일급 엔지니어링 규율로 다루고, 병목이 모델 자체에서 모델을 둘러싼 운영 시스템으로 이동했음을 조기에 인정한 조직들이 승리할 것입니다.


관련 기사: 결정 레이어: 밸리데이션된 쓰기 경로 외부의 타입 안전 모델 · 환각 엣지 없는 지식 그래프 구축 · 감사관들은 생명과학 분야 AI를 어떻게 다루고 있는가

출처 및 참고 문헌: Jayatunga et al., Drug Discovery Today 2024;29(6):104009 · ASCO/JCO 2026 초록 doi:10.1200/JCO.2026.44.16_suppl.11072 (63개 기업 117개 AI 자산) · Bender et al., Nature Reviews Drug Discovery (doi:10.1038/s41573-026-01496-2) · Masters, Mahmoud & Lill, Nature Communications 16, 8854 (2025) · Banerjee et al., IntelliSys 2025 · 인실리코(Insilico) rentosertib 2a상, Nature Medicine · FDA 가이드라인 초안 FDA-2024-D-4689 · FDA AIM-NASH 적격성 평가 (2025년 12월 8일) · FDA 경고장 Warning Letter 320-26-58 (2026년 4월 2일) · EU GMP 부속서 22 초안 · Regulation (EU) 2026/1744 · Tufts CSDD 2025 · Pistoia Alliance 2025 · ZS 2025 보고서 · Cognizant 생명과학 AI 성숙도 조사 · Deloitte 2026 생명과학 AI 설문조사 · Benchling 2026 AI 보고서 · 릴리-엔비디아 공동 연구소 (2026년 1월) · 로슈-엔비디아 AI 팩토리 (2026년 3월) · BMS-앤트로픽 파트너십 (2026년 5월) · 로슈 자율 연구소 로이터 보도 (2026년 9월 28일) · International Journal of Pharmaceutics 2026 CMC 도구 조사.

연구 노트: [[AI-in-Pharma-Landscape-2026]]