제약 회사의 품질 관리자(Quality Manager)가 AI 시스템에 다음과 같이 질문합니다: “진행 중인 3상 항암 임상시험에서 3등급 호중구감소증(Grade 3 neutropenia) 이상사례가 발생했을 때 보고 기한은 언제입니까?”
시스템은 벡터 데이터베이스에서 해당 이상사례(AE) 보고서를 정확하게 추출합니다. 그리고 FDA의 중대한 이상사례(SAE) 보고 규정을 상호 교차 참조합니다. 시스템은 이것이 7일 이내 신속 보고(expedited reporting)가 필요한 중대하고 예상치 못한 이상사례임을 파악합니다. 이어 AE 보고서, FDA 가이던스, 임상시험 계획서(protocol)에 대한 인라인 인용(inline citation)과 함께 규정을 준수하는 답변을 반환합니다. 안전 관리 책임자(Safety Officer)는 규제 기관에 제출하기 전 이 내용을 최종 검토합니다.
불과 1년 전만 해도 이는 이론적인 사고 실험에 불과했습니다. 하지만 오늘날에는 이를 실제로 구현할 수 있는 규제적, 기술적 인프라가 갖추어져 있습니다. 단, 올바른 아키텍처를 수립했을 때만 가능합니다. 그리고 올바른 아키텍처를 수립한다는 것은 RAG나 파인튜닝(Fine-tuning) 어느 하나만으로는 정답이 될 수 없음을 명확히 이해하는 것에서 출발합니다. 정답은 두 기술의 결합입니다.
핵심적인 역설 (The Core Paradox)
파인튜닝은 모델 가중치(weights)에 도메인 지식을 내재화하여, 모델이 전문 용어, 추론 패턴, 출력 구조에 깊은 친숙함을 갖도록 만듭니다. 반면 RAG는 모델 파라미터를 변경하지 않고 추론 시점에 외부 지식을 동적으로 검색합니다. 규제 대상 생명과학(regulated life sciences) 분야에서는 이 두 가지가 모두 필요하며, 그 이유는 단순히 실용적인 차원을 넘어 아키텍처적 필연성에 기인합니다.
파인튜닝은 모델이 과학자처럼 생각하도록 가르칩니다. GxP 용어, 시정 및 예방조치(CAPA) 추론 패턴, ICH E3 규정을 준수하는 임상시험 결과보고서(CSR) 작성 방식, 그리고 규정에 어긋나는 질의를 거부하는 법을 학습시킵니다. 그러나 파인튜닝은 정확한 사실적 지식을 신뢰성 있게 기억해 내지 못하는 것으로 악명이 높습니다. 파인튜닝은 사실(facts)이 아니라 패턴(patterns)을 내재화하기 때문입니다. 파인튜닝된 모델 역시 규제 세부사항에 대해 환각(hallucination)을 일으키며, 단지 조직 고유의 어조와 문체로 그럴듯하게 거짓말을 할 뿐입니다.
RAG는 모델에게 참조할 수 있는 **감사 가능한 서고(auditable library)**를 제공합니다. 유효성이 검증된 문서(현재 유효한 SOP, 승인된 의약품 라벨, 최신 FDA 가이던스 등)에서 변형되지 않은 정확한 원문을 검색해 옵니다. 모든 진술은 특정 문서, 버전, 페이지 번호까지 역추적 가능합니다. 하지만 RAG 단독으로는 검색한 내용을 바탕으로 올바르게 추론할 수 없습니다. “3등급 호중구감소증”이 CTCAE 기준상 중대한 이상사례에 매핑된다는 점이나, 7일 이내 보고 기한 규정이 21 CFR 312.32에서 비롯된다는 사실을 이해하지 못합니다.
여기서 역설이 발생합니다. 단 하나의 숫자 환각만으로도 규제 위반이 촉발될 수 있는 규제 산업에서는, 파인튜닝의 깊이 있는 추론 능력과 RAG의 사실적 정밀성이 모두 필요합니다. 어느 하나만으로는 결코 충분하지 않습니다.
QA-RAG 아키텍처 (The QA-RAG Architecture)
제약 규제 컴플라이언스 분야에서 학술적으로 입증된 대표적인 아키텍처는 QA-RAG(Question and Answer Retrieval-Augmented Generation, 성균관대학교 Kim & Min, 2024)입니다. 이는 파인튜닝된 LLM의 도메인 전문성을 활용하여 검색 품질을 획기적으로 향상시키는 듀얼 트랙(dual-track) 검색 시스템입니다.
동작 원리 (How It Works)
User Query
│
├─→ Track 1: Query-based retrieval (dense vector search)
│
├─→ Track 2: Fine-tuned LLM generates hypothetical expert answer
│ → Answer-based retrieval (captures domain nuance)
│
├─→ Fusion: BGE reranker scores all retrieved documents
│ → Top-k context selected
│
└─→ Generator LLM → Cited, compliant answer
핵심 통찰은 다음과 같습니다. 파인튜닝된 모델은 단순히 최종 답변만 제시하는 데 그치지 않고, 원래의 사용자 질문보다 훨씬 뛰어난 검색 쿼리 역할을 하는 **가상 전문가 답변(hypothetical expert answer)**을 직접 생성합니다. 제약 규제 컴플라이언스와 같은 특화 도메인에서는 범용 LLM이 생성한 가상 답변(기존 HyDE 방식)을 적용할 경우 불완전하고 부정확한 검색 결과로 이어집니다. 반면 도메인에 특화되어 파인튜닝된 모델이 내놓는 답변은 규제 추론 패턴을 온전히 포착하여 검색 정확도를 극적으로 향상시킵니다.
벤치마크 결과 (1,404개 FDA 및 ICH 가이드라인 문서 대상)
| 방식 (Method) | 컨텍스트 정밀도 (Context Precision) | 컨텍스트 재현율 (Context Recall) | F1 (답변 점수) |
|---|---|---|---|
| QA-RAG (질문 + 가상 답변) | 0.717 | 0.328 | 0.591 |
| 리랭커를 적용한 HyDE | 0.673 | 0.283 | 0.582 |
| 가상 답변만 사용 (Only Hypothetical Answer) | 0.713 | 0.295 | 0.583 |
| 다중 질의 질문 (Multiquery Questions) | 0.564 | 0.269 | 0.573 |
| 질문만 사용 (기존 RAG 방식) | 0.556 | 0.270 | 0.581 |
여기서 주목할 만한 두 가지 핵심 결과가 있습니다:
-
파인튜닝된 모델의 가상 답변만 사용한 경우(정밀도 0.713)에도 전체 QA-RAG 시스템(0.717)에 거의 근접했습니다. 이는 도메인 특화 파인튜닝이 단순히 답변의 완성도를 높이는 데 그치지 않고, 더 우수한 검색 쿼리를 생성함으로써 근본적으로 검색 품질 자체를 비약적으로 개선한다는 명백한 증거입니다.
-
기존의 질문 단독 기반 RAG(0.556)가 가장 낮은 성능을 기록했습니다. 규제 준수 언어가 매우 조밀하고 전문화된 도메인에서는, 사용자의 단순 질의만으로는 적절한 문서를 찾아내기 위한 정보 신호(signal)가 턱없이 부족합니다.
Google은 완전히 다른 대규모 환경에서 이 하이브리드 원칙을 입증했습니다. RecSys 2025 논문(Meng et al., arXiv:2510.20260)에서는 10억 명 규모의 사용자 플랫폼을 대상으로 한 실시간 A/B 테스트를 통해, 월 단위 파인튜닝과 주 1회 미만 주기의 RAG 업데이트를 결합했을 때 두 접근법 중 하나만을 단독으로 사용한 것보다 사용자 만족도에서 통계적으로 유의미한 향상을 달성했음을 입증했습니다. 이 결과는 일반화될 수 있습니다. 장기적인 지식 적응에는 파인튜닝을, 기민한 실시간 업데이트에는 RAG를 사용하는 것입니다.
헬스케어 AI 분야의 종합 문헌고찰(MDPI Bioengineering, 2026) 역시 임상 영역 전반에서 이러한 패턴을 확인했습니다. FT+RAG 결합 시스템은 질의응답, 임상 요약, 보고서 생성, 임상 의사결정 지원 등 다양한 태스크 전반에 걸쳐 FT 단독이나 RAG 단독 방식보다 일관되게 우수한 성능을 보였습니다.
파인튜닝할 대상 vs. 검색(RAG)할 대상
생명과학 AI에서 가장 흔히 저지르는 아키텍처적 실수는 사실(facts) 데이터 자체를 파인튜닝에 쏟아붓는 것입니다. 파인튜닝은 사실이 아니라 패턴을 학습시킵니다. 의약품 라벨 데이터를 파인튜닝한 모델도 규제 세부사항에 대해 여전히 환각을 일으키며, 단지 훨씬 더 확신에 차서 잘못된 정보를 생성할 뿐입니다.
관심사의 분리 (The Separation of Concerns)
행동 및 추론 패턴을 파인튜닝하십시오:
- 도메인 어휘 및 전문 용어 (GxP 전문 용어, MedDRA 코드, CMC 개념 등)
- 추론 패턴 (근본 원인 분석 수행 절차, 일탈 평가 방법 등)
- 출력 서식 (ICH E3 보고서 구조, eCTD 섹션 구성, CAPA 계획 템플릿 등)
- 안전 가드레일 (허가 외 사용(off-label) 질의 거부, 출처 인용 강제, 개인건강정보(PHI) 요청 차단 등)
- 에이전트 스키마 (다운스트림 에이전트 워크플로우를 위한 구조화된 JSON 출력)
RAG를 통해 동적으로 검색하십시오:
- 버전 관리되는 SOP 및 사내 규정 (반드시 현재 승인된 유효 버전을 반환해야 함)
- 규제 가이던스 (FDA 가이던스, ICH 가이드라인, EMA 리플렉션 페이퍼 등)
- 임상시험 데이터 (접근 제어가 엄격하고 독점적이며 수시로 업데이트됨)
- 배치 제조기록서 및 품질 관리(QC) 데이터 (실시간 운영 데이터)
- 이상사례 보고서 및 최신 안전성 정보
기본적인 원칙은 명확합니다: 감사관을 위해 명확한 근거를 인용해야 한다면 RAG를 사용하십시오. 과학자처럼 사고하고 추론해야 한다면 파인튜닝을 적용하십시오. 둘 다 필요하다면 하이브리드 아키텍처를 구축하십시오.
파인튜닝 방식: LoRA / PEFT (Fine-Tuning Method: LoRA/PEFT)
LoRA(Low-Rank Adaptation)를 활용한 매개변수 효율적 파인튜닝(PEFT)은 생명과학 분야의 표준 접근법으로 확고히 자리 잡았습니다:
- 전체 모델 파라미터의 약 0.39%만 업데이트
- GPU 메모리 요구량을 3~10배 절감
- 학습 시간을 며칠 단위에서 몇 시간 단위로 대폭 단축
- Springer 2025 벤치마크에 따르면 바이오메디컬 NLP 태스크에서 LoRA 및 QLoRA가 전체 파인튜닝(Full Fine-Tuning)과 대등한 경쟁력 있는 성능을 달성함
- 의료 텍스트 요약 연구(arXiv:2603.21970): LoRA는 훨씬 적은 연산 자원만으로도 PubMed 요약 태스크에서 전체 파인튜닝과 동등한 성능을 입증함
주로 활용되는 베이스 모델: Mistral-7B, LLaMA-3-8B, Qwen2-7B. 호스팅 솔루션의 경우: OpenAI의 파인튜닝 API를 활용한 GPT-3.5-Turbo 등.
시스템 구축 환경: 인프라 및 보안 (Where This Lives: Infrastructure and Security)
생명과학 분야에서 시스템이 “어디에 위치하는가”는 데이터 프라이버시(HIPAA, GDPR)와 지적 재산권(IP) 보호 규정에 의해 엄격히 결정됩니다.
배포 아키텍처 (Deployment Architecture)
┌─────────────────────────────────────────────────┐
│ Private VPC / On-Premise │
│ │
│ ┌──────────┐ ┌──────────┐ ┌───────────┐ │
│ │ Fine- │ │ Vector │ │ Generator │ │
│ │ Tuned │◄──►│ Database │◄──►│ LLM │ │
│ │ Model │ │ (RAG) │ │ │ │
│ └────┬─────┘ └────┬─────┘ └────┬──────┘ │
│ │ │ │ │
│ └───────────────┼───────────────┘ │
│ │ │
│ ┌────────▼────────┐ │
│ │ Audit Logger │ │
│ │ (21 CFR Part 11)│ │
│ └────────┬────────┘ │
│ │ │
│ ┌────────▼────────┐ │
│ │ HITL Review │ │
│ │ Queue │ │
│ └─────────────────┘ │
└─────────────────────────────────────────────────┘
핵심 인프라 요구사항 (Key Infrastructure Requirements)
프라이빗 VPC 또는 온프레미스 호스팅. 환자 데이터와 독점적 임상시험 데이터는 결코 기업의 통제 범위를 벗어나 외부로 유출되어서는 안 됩니다. 사내 방화벽 내부에서 오픈 가중치 모델(Llama-3, Mistral 등)을 안전하게 호스팅해야 합니다. 또한 역할 기반 접근 제어(RBAC)를 지원하는 엔터프라이즈급 벡터 데이터베이스(Milvus, Pinecone Enterprise, Qdrant 등)를 사용해야 합니다.
격리된 세그먼트 지식 베이스(Segmented knowledge bases). 공개 의료 문헌(PubMed)과 기밀로 보호되는 눈가림 해제(unblinded) 임상시험 데이터를 결코 동일한 풀에 섞어서는 안 됩니다. RAG 시스템은 사용자 역할에 따라 철저한 접근 제어를 적용해야 합니다. 예를 들어 1상 연구원이 3상 시험의 비맹검(눈가림 해제) 데이터를 임의로 검색할 수 없도록 격리해야 합니다.
데이터 리니지(Data lineage) 추적. 모델을 파인튜닝하거나 RAG 데이터베이스를 구성하는 데 사용된 모든 데이터는 감사 추적(audit trail)을 위해 철저히 기록되어야 합니다. 문서 ID, 버전, 시행일자(Effective Date), 담당 부서 메타데이터가 데이터 수집 단계부터 검색 및 최종 출력에 이르기까지 일관되게 전파되어야 합니다.
시기: 규제 일정과 흐름 (When: The Regulatory Timeline)
2025년과 2026년에 걸쳐 규제 환경은 결정적인 전환점을 맞이했습니다. 생명과학 분야에서 하이브리드 AI 도입은 이제 단순한 기술적 선택이 아니라 규제 준수(컴플라이언스)를 위한 필수 요건입니다.
주요 규제 동향 (The Regulatory Stack)
| 규제 문서 | 일자 | 하이브리드 AI에 대한 의미 |
|---|---|---|
| FDA/EMA 공동 지도 원칙 (Joint Guiding Principles) | 2026년 1월 14일 | 의약품 전주기에 걸친 양호한 AI 실행(Good AI Practice)을 위한 10대 원칙. 인간의 감독, 데이터 품질 거버넌스, 투명성, 위험 기반 밸리데이션, 지속적인 모니터링을 의무화함. |
| ISPE GAMP AI 가이드 | 2025년 7월 | GxP 환경에서 AI를 밸리데이션하기 위한 290페이지 분량의 프레임워크. “고정형(locked) vs 동적형(dynamic)” 모델 결정을 사전에 명시하도록 강제함. AI 사이버 보안, 공급업체 적격성 평가, 드리프트(drift) 모니터링을 포괄적으로 다룸. |
| FDA 7단계 신뢰성 프레임워크 (7-Step Credibility Framework) | 2025년 1월 7일 (초안) | 규제 의사결정을 지원하는 AI에 대한 위험 기반 평가 체계. 사용 맥락(Context of Use)을 사전에 정의해야 하며, 지속적인 성능 모니터링이 의무화됨. |
| FDA Purolea 경고장 (Warning Letter) | 2026년 4월 2일 | cGMP 환경에서 AI 오용을 직접적으로 지적한 최초의 FDA 경고 서한. 품질 부서(Quality Unit)의 검토 없이 의약품 규격서에 AI 생성 산출물을 반영함. 명확한 선례 확립: AI 산출물은 반드시 품질 부서의 권한 있는 인간 담당자가 검토해야 함. |
| EU AI 법 (EU AI Act) | 2026년 8월 전면 시행 | 헬스케어 및 제약 AI가 고위험(high-risk) 등급으로 분류됨. 적합성 평가, 기술 문서화, 인간의 감독, 시판 후 모니터링이 법적으로 요구됨. |
| ICH E6(R3) GCP | 2025년 1월 6일 | 임상시험에서 디지털 기술 및 AI 도입을 체계적으로 수용하도록 개정된 최신 GCP 가이드라인. |
“고정형(Locked) vs 동적형(Dynamic)” 모델에 대한 결정
ISPE GAMP AI 가이드는 AI가 적용된 모든 GxP 시스템이 초기 단계부터 모델의 성격을 명확히 선언하도록 규정합니다: 검증 후 동결되는 고정형(locked) 모델인가, 아니면 배포 후 지속적으로 재학습되는 동적형(dynamic) 모델인가?
2026년 현재 제약 업계의 실제 운영 현실은 공식적인 변경 제어(change control) 절차 하에 주기적으로 재학습되는 고정형 모델입니다. 공개된 GxP 배포 환경 중 온라인 연속 학습(continual learning)을 채택한 사례는 존재하지 않습니다. 사노피(Sanofi), 바이오젠(Biogen), 아스트라제네카(AstraZeneca), 로슈(Roche), 모더나(Moderna) 전반에 걸친 공통 패턴은 일관됩니다. 정적 모델을 정해진 주기에 따라 재학습시키며, 매 재학습 시 전체 모델 밸리데이션을 다시 수행하는 방식입니다.
하이브리드 아키텍처는 이러한 운영 패턴에 완벽하게 부합합니다. 파인튜닝된 모델은 고정(locked)되어 버전 관리되는 반면, 모델 가중치를 전혀 건드리지 않고도 RAG 말뭉치(corpus)는 지속적으로 업데이트할 수 있습니다. 이것이 바로 현재 제약 업계에서 가장 보편적인 프로덕션 아키텍처인 “고정형 백본 + 적응형 RAG(locked backbone + adaptive RAG)” 패턴입니다.
단계별 구현 로드맵 (The Implementation Roadmap)
| 단계 (Phase) | 기간 (Timeline) | 핵심 활동 (Key Activities) |
|---|---|---|
| 기반 구축 (Foundation) | 0~90일 | AI 시스템 목록화, FDA 신뢰성 프레임워크에 따른 위험 분류, GxP 갭 분석(gap assessment), 벤더 적격성 평가 |
| RAG MVP 구축 | 60~180일 | RBAC 지원 벡터 DB 배포, 가이던스/SOP 수집, 하이브리드 검색 및 리랭킹 구현, 컨텍스트 정밀도 >0.70 달성 목표 |
| 파인튜닝 (Fine-Tuning) | 120~270일 | 도메인 데이터셋 큐레이션(FDA Q&A, 규제 텍스트, 비식별화된 SOP), LoRA/PEFT 파인튜닝, BERTScore 기반 검증 |
| 하이브리드 통합 | 180~365일 | QA-RAG 듀얼 트랙 배포, HITL(인간 참여) 검토 워크플로우 구현, 21 CFR Part 11 감사 추적 연동 |
| 지속적인 모니터링 | 상시 진행 | 모델 드리프트 모니터링, 변경 제어를 통한 주기적 재학습, 실사 대응 가능한 증적 패키지(inspection-ready evidence packs) 관리 |
주의해야 할 점 (What to Avoid)
환각 현상을 해결하기 위해 파인튜닝에 의존하는 것. 파인튜닝은 사실이 아니라 패턴을 가르칩니다. 파인튜닝된 모델은 회사의 공식 어조로 규제 세부사항에 대해 그럴듯하게 거짓말을 만들어낼 뿐입니다. 사실적 근거를 확보하려면 RAG를 사용해야 합니다.
인용 검증 없는 RAG 도입. 모델은 실제로는 해당 주장을 담고 있지 않은 문서를 인용문으로 제시할 수 있습니다. QA-RAG의 검증 단계는 LLM이 실제 문서를 인용하면서도 그 내용을 왜곡하거나 잘못 전달하는 실패 모드를 효과적으로 포착합니다.
제약 분야에서 단일 벡터 검색에만 의존하는 것. 제약 문서는 섹션, 버전 이력, 규제 메타데이터, 상호 참조 등 고유한 구조를 지니고 있습니다. 순수 시맨틱 벡터 검색만으로는 이러한 구조적 맥락을 모두 놓치게 됩니다. 검색 전 메타데이터 필터링을 병행하는 하이브리드 검색(벡터 + BM25)을 활용해야 합니다.
인적 검토(Human Review)를 생략하는 것. 인간 참여(Human-in-the-loop, HITL)가 배제된 규제 준수 사용 사례는 언젠가 감사의 지적을 받을 수밖에 없습니다. FDA의 Purolea 경고장은 이를 명백히 경고했습니다. cGMP에 사용되는 AI 산출물은 반드시 품질 부서의 권한 있는 담당자가 직접 검토해야 합니다.
GxP 환경에서 온라인 연속 학습(Online Continual Learning)을 시도하는 것. 밸리데이션된 규제 환경에서는 실시간 가중치 업데이트를 수용할 수 있는 변경 제어 메커니즘이 존재하지 않습니다. 공식 변경 제어 절차에 따라 정해진 일정에 재학습되는 고정형 모델을 사용하십시오. 실제 적응이 반드시 필요한 사례라면 FDA의 PCCP(Predetermined Change Control Plan, 의료기기) 절차를 밟거나, 모든 적응 과정을 공식 규제 변경 관리 이벤트로 처리해야 합니다.
최종 결론 (The Bottom Line)
규제 대상 생명과학 분야에서 하이브리드 RAG + 파인튜닝 아키텍처는 단순한 이론적 개선안이 아닙니다. 헬스케어 AI 태스크 전반에서 가장 강력한 성능을 내는 것으로 실증 검증되었으며, 점차 규제 기관의 기대 수준으로 자리 잡아가고 있습니다.
빠른 배포, 감사 가능성, 그리고 수시로 변경되는 가이드라인에 대한 규정 준수를 위해 먼저 RAG부터 시작하십시오. 도메인 데이터셋이 큐레이션되고 일관된 규제 언어, 출력 서식, 추론 능력이 필요해지면 파인튜닝을 추가하십시오. 그리고 QA-RAG 듀얼 트랙 아키텍처를 통해 이 둘을 유기적으로 통합하십시오.
파인튜닝 계층은 모델에게 도메인의 제약조건과 요구사항 내에서 작동하는 방식을 가르칩니다. RAG 계층은 모든 응답이 완벽한 추적 가능성을 바탕으로 최신 공인 출처에 근거하도록 보장합니다. 단 한 줄의 부정확한 진술도 규제 제재, 재정적 손실, 그리고 환자 안전에 치명적인 결과를 초래할 수 있는 산업에서, 이 두 가지 기술의 결합은 선택이 아닌 필수입니다.
벤치마크 표, 규제 문서 인용, 그리고 사노피(Sanofi), 바이오젠(Biogen), 아스트라제네카(AstraZeneca), 로슈(Roche)의 실제 배포 사례가 포함된 전체 연구 보고서는 [[Hybrid RAG + Fine-Tuning for Regulated Life Sciences - Deep Analysis]] 문서를 참조하십시오.
Saram Consulting