밸리데이션 엔지니어는 빈 Word 문서를 멍하니 바라봅니다. 시계는 오전 9시 15분을 가리키고 있습니다. LIMS(실험실 정보관리 시스템) 업그레이드를 위한 운전 적격성평가(OQ, Operational Qualification) 프로토콜을 작성해야 합니다. 200페이지에 달하는 사용자 요구사항 명세서(URS, User Requirements Specification)와 일일이 추적성을 연결해야 하며, 사전 조건(preconditions), 수행 절차(steps), 기대 결과(expected results)가 포함된 120개의 테스트 케이스를 하나하나 써 내려가야 합니다. 오전 내내 이 작업에 매달려야 한다는 사실을 그녀는 잘 알고 있습니다. 게다가 오후 2시가 되면 품질보증(QA) 부서로부터 지난번 제출했던 프로토콜이 반려될 것이 뻔합니다. “적격성 판정 기준(acceptance criteria)이 너무 모호함”, “URS 버전이 2.3으로 기재되어 있으나 현행 버전은 2.4임” 같은 지적 코멘트와 함께 말입니다.

이것이 바로 생명과학 분야 컴퓨터화 시스템 밸리데이션(CSV, Computer System Validation) 엔지니어가 매일 마주하는 현실입니다. 화려하지도 않고, 흥미진진하지도 않습니다. 하지만 절대적으로 중요합니다. 만약 해당 LIMS가 역가(potency) 계산 결과를 잘못 산출한다면, 엉뚱한 농도의 항암제 한 배치가 그대로 출하될 수도 있기 때문입니다.

이제 그 엔지니어가 문서 대신 대시보드를 열어보는 상황을 상상해 보십시오. 밤사이 AI 에이전트가 200페이지 분량의 URS를 파싱하여 127개의 요구사항을 추출했고, 이 중 98.4%를 커버하는 94개의 테스트 케이스를 생성했으며, 추적성 매트릭스(Traceability Matrix)를 구축하고 컴플라이언스 갭(compliance gap)이 없는지 초안에 대한 사전 검토까지 마쳐두었습니다. 엔지니어는 출근 후 45분 동안 자신이 원래 교육받고 훈련한 본연의 업무에 집중합니다. 바로 엣지 케이스를 판단하고, 도메인 전문 지식을 적용하며, AI가 놓친 단 하나의 빈틈을 찾아내는 일입니다.

이러한 변화는 가상의 시나리오가 아닙니다. Pydantic AI, DSPy, Langfuse, Qdrant, RustFS 기반으로 구축된 AI 에이전트 하네스(AI agent harness)를 도입한 규제 대상 생명과학 기업들에서 지금 이 순간 실제로 일어나고 있는 패러다임의 전환입니다.

AI 도입 전과 후, CSV 엔지니어의 8-to-5(오전 8시부터 오후 5시까지) 일과는 어떻게 다른지 비교해 보겠습니다.

기존의 일과: 시간이 실제로 소모되는 곳

제약, 바이오텍, 의료기기 분야의 CSV 엔지니어는 LIMS, MES, ERP, CDS(크로마토그래피 데이터 시스템), ELN(전자연구노트), QMS(품질경영시스템) 등 다양한 컴퓨터화 시스템을 검증(validation)하여, 해당 시스템이 미국 FDA 21 CFR Part 11, EU GMP Annex 11, GAMP 5, 그리고 ALCOA+ 데이터 완전성(Data Integrity) 원칙을 준수하는지 보증합니다.

통상적인 업무 비중은 대략 다음과 같이 나뉩니다:

업무 활동 하루 비중 (%) 소요 시간
밸리데이션 문서 작성 및 검토 60-70% 5-6시간
회의 및 유관 부서 조율 15-20% 1.5-2시간
테스트 수행 및 증거(Evidence) 수집 10-15% 1-1.5시간
위험 기반 판단 및 의사결정 5-10% 30-60분

문제는 이 업무들이 중요하지 않다는 것이 아닙니다. 엔지니어 전문성의 70%가 서식 맞추기, 상호 참조(cross-referencing), 스크린샷 복사·붙여넣기, 스프레드시트 업데이트, 버전 번호 재입력 등 전혀 전문성을 요하지 않는 단순 작업에 낭비되고 있다는 점이 진짜 문제입니다.

오전 8:00 — 받은 편지함 분류 (Inbox Triage)

30통의 이메일이 쌓여 있습니다. 그중 3통이 긴급 건입니다: CDS 벤더 패치 안내, 프로토콜에 대한 QA 검토 코멘트, 그리고 지난밤 테스트 도중 발생한 일탈(Deviation) 보고입니다. 엔지니어는 이메일 스레드를 읽고 맥락을 파악하며 답변 초안을 작성하는 데 40분을 소비합니다. 대부분은 일상적이고 반복적인 답변입니다.

오전 9:00 — 지루한 프로토콜 작성 (The Protocol Grind)

빈 Word 문서를 엽니다. URS를 띄워놓습니다. 테스트 케이스를 하나씩 써 내려가기 시작합니다. “유효한 자격 증명으로 로그인한다. 기대 결과: 접근 권한 부여. 실제 결과: [공란].” 120개의 요구사항 각각에 대해 테스트 절차를 작성하고, 판정 기준을 정의하며, 소스 요구사항에 링크를 연결하고, 21 CFR Part 11 통제 항목이 포함되었는지 확인해야 합니다. 이 작업에만 3~4시간이 걸립니다.

오후 12:00 — 일하면서 때우는 점심 (Working Lunch)

벤더가 보내온 150페이지짜리 설치 적격성평가(IQ) 패키지를 읽으며 내부 URS와의 불일치(gap)를 찾습니다. 상호 참조 대조 작업에만 꼬박 2시간이 흘러갑니다.

오후 2:00 — QA 검토 코멘트 도착

지난주 제출한 프로토콜에 대해 4건의 지적 코멘트가 도착했습니다. “판정 기준이 너무 모호함”, “URS 버전 불일치”, “URS-LIMS-047에 대한 추적성 링크 누락”. 각 코멘트마다 문서를 열고, 해당 섹션을 찾고, 내용을 수정하고, 다시 내보내고, 시스템에 재업로드해야 합니다. 여기에 45분이 소요됩니다.

오후 3:00 — 변경 관리 (Change Control)

패치에 대한 영향도 평가(Impact Assessment)가 필요합니다. 엔지니어는 어떤 시스템이 영향을 받는지, Part 11 통제 기능에 영향을 미치는지, 어느 수준의 재밸리데이션(Revalidation)이 필요한지 평가합니다. 이는 엔지니어의 진정한 전문성이 발휘되는 작업이지만, 정작 양식 서식을 채우고 과거 선례를 검색하는 데만 45분이 허비됩니다.

오후 4:00 — 추적성 매트릭스 (Traceability Matrix)

Excel에서 127개의 요구사항과 94개의 테스트 케이스를 대조합니다. 누락된 부분이 있는지 찾습니다. 두 군데의 누락을 발견하고 수정합니다. 앞선 업무들이 모두 지연된 탓에, 원래 3시간이 걸릴 작업을 마지막 1시간 동안 허겁지겁 압축해서 처리합니다.

AI가 보조하는 일과: 같은 엔지니어, 완전히 달라진 업무

이러한 혁신이 엔지니어의 법적·규제적 책임을 바꿔 놓지는 않습니다. 달라지는 것은 엔지니어가 ’무엇을 하며 시간을 보내는가’입니다.

구조화된 에이전트 실행을 위한 Pydantic AI, 최적화된 추론을 위한 DSPy, 전 과정의 가시성을 확보하는 Langfuse, 시맨틱 검색을 위한 Qdrant, 불변 아티팩트 저장소인 RustFS 기반의 AI 에이전트 하네스(AI agent harness)가 기계적인 반복 작업을 도맡아 처리합니다. 그리고 엔지니어는 전문적인 판단에 집중합니다.

오전 8:00 — 대시보드 확인

30통의 이메일 대신 대시보드를 엽니다. 밤사이 분류 에이전트(Triage Agent)가 인입된 커뮤니케이션을 처리했고, 변경 영향도 에이전트(Change Impact Agent)가 밸리데이션 완료 상태(validated state)를 기준으로 두 건의 벤더 패치를 분석해 두었으며, 요구사항 파서(Requirements Parser)가 새로 업로드된 URS에서 요구사항을 추출하여 분류해 두었습니다. 사람의 확인이 필요한 항목은 단 3건뿐입니다. 나머지 7건은 자동 처리되었습니다. 40분 대신 10분 만에 끝납니다.

오전 8:30 — 검토 대기열 (Review Queue)

검토 대기열에 12건의 ‘요구사항-테스트 케이스’ 매핑이 올라와 있습니다. 추적성 구축 에이전트(Traceability Builder)가 이를 자동으로 연결해 놓았습니다. 9건은 명백하게 올바르게 매핑되어 있어 클릭 한 번으로 승인합니다. 3건은 에이전트의 신뢰도 점수(confidence scoring) 기준 모호한 것으로 플래그가 지정되어 있습니다. 엔지니어는 명확한 108건의 매핑에 시간을 낭비하는 대신, 이 3건의 판단에 자신의 전문성을 집중합니다.

오전 9:00 — 스탠드업 미팅 (Standup)

유관 부서들이 모이는 동일한 회의이지만, 공유하는 내용의 차원이 다릅니다. “밤새 에이전트 하네스가 URS 분석을 완료했습니다. 127개의 요구사항이 추출되었고, 94개의 테스트 케이스 초안과 추적성 매트릭스가 완성되었습니다. 현재 수동으로 해결해야 할 갭 3건과 자동 테스트 생성이 불가능할 정도로 모호한 요구사항 2건이 있어 이에 대한 확인이 필요합니다.” 회의의 성격이 단순 ’진행 상황 보고’에서 ’실질적인 의사결정’으로 전환됩니다.

오전 9:30 — 프로토콜 검토 (작성이 아닌 검토)

문서 초안 작성 에이전트(Document Drafting Agent)가 50페이지 분량의 OQ 프로토콜을 이미 생성해 두었습니다. 엔지니어는 직접 타이핑하지 않고 검토를 수행합니다. 에이전트가 “시스템이 데이터를 올바르게 처리함”이라고 단순하게 작성한 TC-034를 포착합니다. 엔지니어는 SOP-QC-012에 따라 LIMS의 계산 정확도가 ±0.05% 이내여야 한다는 사실을 알고 있습니다. 그녀는 해당 구체적인 기준을 명시하여 판정 기준을 수정합니다. 또한 에이전트가 Part 11 감사 추적(Audit Trail) 검증을 빠뜨린 TC-067을 발견하고, 세 단계의 테스트 스텝을 추가합니다.

3~4시간에 걸친 지루한 문서 작성 작업이 40분간의 전문적인 검토 작업으로 대체됩니다.

오전 10:00 — 벤더 미팅, 완벽한 사전 준비

벤더와의 미팅 전, 엔지니어는 에이전트에게 URS에서 핵심 질의 항목을 도출해 달라고 요청합니다. 에이전트는 Part 11 통제 요건에 매핑된 요구사항들을 검색하여 5가지 핵심 질문을 생성합니다. 5번째 질문은 수작업 검토였다면 결코 발견하지 못했을 핵심을 짚어냅니다. 바로 벤더 문서에서 감사 추적 항목의 ‘변경 사유(reason-for-change)’ 입력에 대한 언급이 누락되어 있다는 점입니다. 이는 FDA 실사관들이 정기적으로 지적하는 대표적인 위반 사항입니다.

오전 10:30 — 테스트 수행 (Test Execution)

이 부분은 크게 달라지지 않으며, 이는 의도된 설계입니다. 엔지니어는 여전히 직접 테스트를 실행하고, 스크린샷을 찍으며, 결과를 기록합니다. 그러나 에이전트가 증빙 파일명을 자동으로 지정하고, 테스트가 통과될 때마다 추적성 매트릭스를 실시간으로 채워 넣으며, 테스트가 실패할 경우 일탈 보고서(deviation report) 초안을 작성합니다. TC-023이 실패했을 때(시스템이 변경 사유 입력 없이도 결과 수정을 허용하는 결함 발견), 에이전트는 21 CFR Part 11.10(e) 및 ALCOA+의 완전성(completeness) 원칙을 인용하여 일탈 경위서 초안을 즉시 작성합니다. 엔지니어는 30분 동안 백지에서 작성하는 대신, 5분 만에 정확성을 검토하고 마무리합니다.

오후 12:00 — 온전한 점심시간

백그라운드에서 에이전트들이 작업을 계속 진행하는 동안, 엔지니어는 온전한 휴식을 취합니다.

오후 1:00 — 가속화된 변경 관리

변경 영향도 에이전트(Change Impact Agent)가 제안된 패치 분석을 이미 마쳤습니다. Qdrant에서 과거의 유사 변경 이력을 검색하고, GAMP 5 위험 분류를 평가했으며, Part 11 영향도를 판단한 뒤 특정 테스트 케이스 번호를 명시한 타깃 회귀 테스트(regression testing) 범위를 권고했습니다. 엔지니어는 Langfuse에서 추론 체인(reasoning chain)을 검토하고, 평가 결과에 동의한 후, 테스트 배치 일정에 대해 제조 부서와의 조율이 필요하다는 메모를 추가하여 제출합니다. 45분 대신 15분 만에 끝납니다.

오후 2:00 — 예외 기반 증빙 검토 (Evidence Review, by Exception)

증빙 검토 에이전트(Evidence Reviewer)가 어제 수행된 테스트 실행 패키지들을 선별 검토했습니다. 25건 중 3건에 플래그가 지정되었습니다: 타임스탬프 누락, 기대 결과와 실제 결과의 불일치, 서명란 공란 등입니다. 엔지니어는 플래그가 지정된 예외 건들만 집중 검토하고, 이상 없는 “클린(clean)” 패키지 2건을 샘플링 점검합니다. 90분 대신 30분 만에 완료됩니다.

오후 3:00 — 정기 검토 (Periodic Review)

정기 검토 에이전트(Periodic Review Agent)가 지난 12개월간의 데이터를 모두 취합했습니다: 적용된 변경 관리 건, 발생 및 해결된 일탈 내역, 평가된 패치, SOP 개정 이력, 사용자 접근 권한 검토 기록 등입니다. 엔지니어는 취합된 데이터를 확인하고 “시스템이 지속적으로 밸리데이션 완료 상태(validated state)를 유지하고 있음”을 최종 판정합니다. 5개 시스템을 뒤지며 데이터를 추출하느라 이틀을 허비하던 일이 15분 만에 끝납니다.

오후 3:30 — 새로운 책무: 에이전트 캘리브레이션 (Agent Calibration)

일주일에 한 번, 엔지니어는 과거 인간 전문가의 의사결정으로 구축된 골든 데이터셋(Golden Dataset)을 기준으로 에이전트 출력 샘플을 검토합니다. 영향도 평가 에이전트의 위험 분류 결과가 엔지니어 자신의 판단과 일치했는가? 이 피드백은 DSPy 최적화 파이프라인으로 유입되어 에이전트가 시간이 지남에 따라 더욱 정교해지도록 만듭니다. 엔지니어의 수정과 피드백을 통해 고유한 도메인 전문성이 시스템에 내재화(encoding)되는 것입니다.

오후 4:30 — 하루 마무리 (Wrap-Up)

수작업으로 진행 상황 추적기를 업데이트할 필요가 없습니다. Temporal의 워크플로우 상태 자체가 신뢰할 수 있는 단일 출처(Source of Truth)이기 때문입니다. 엔지니어는 내일 처리할 엣지 케이스 하나를 지정해 두고, 오늘 캘리브레이션 점검에서 얻은 데이터 하나를 골든 데이터셋에 추가합니다.

무엇이 바뀌었고, 무엇이 바뀌지 않았는가

수치가 그 변화를 명확히 보여줍니다:

업무 항목 도입 전 도입 후 개선 배율
프로토콜 작성 3-4시간 45분 (검토) 5배
추적성 매트릭스 구축 3시간 10분 (검토) 18배
QA 코멘트 처리 45분 8분 5.6배
변경 영향도 평가 45분 15분 3배
정기 검토 데이터 수집 2일 15분 48배
벤더 문서 갭 분석 2시간 20분 6배
일탈 보고서 작성 30분 5분 6배

반면, 바뀌지 않은 것은 다음과 같습니다:

  • 모든 위험 기반(Risk-based) 의사결정은 여전히 엔지니어가 직접 내립니다.
  • 모든 전자서명은 여전히 엔지니어가 직접 수행합니다.
  • 여전히 무균복(Gown)을 착용하고 현장 물리 테스트 실행을 직접 입회·확인합니다.
  • FDA 실사관을 똑바로 바라보며 “이 시스템은 밸리데이션되었습니다”라고 선언하는 주체는 여전히 엔지니어입니다.
  • QMS에 등재되는 모든 검증 문서에 대한 최종 책임(ownership)은 여전히 엔지니어에게 있습니다.

에이전트는 결코 서명하지 않습니다. 서명하는 것은 오직 사람인 엔지니어입니다.

새롭게 요구되는 역량 프로필 (The New Skill Profile)

기존의 CSV 엔지니어에게 요구되던 핵심 역량은 프로토콜 작성, 추적성 매트릭스 구축, 테스트 실행, 증빙 문서화 능력이었습니다. 이러한 기술들은 여전히 중요하지만, 더 이상 전체 프로세스의 병목(bottleneck)이 아닙니다.

AI로 역량이 강화된 CSV 엔지니어에게 요구되는 새로운 핵심 역량은 다음과 같습니다:

AI 출력물에 대한 비판적 검토 능력. 에이전트가 생성한 프로토콜을 보고 무엇이 누락되었는지 즉각 알아차릴 수 있어야 합니다. 앞으로 뛰어난 성과를 낼 엔지니어는 단순 양식이 아니라 시스템 아키텍처를 깊이 이해하고 있기에, 에이전트가 특정 요구사항에서 Part 11 통제 요건을 놓쳤다는 사실을 곧바로 짚어낼 수 있는 인재입니다.

에이전트 동작 캘리브레이션 역량. 엔지니어 관점에서는 “중간 위험(Medium Risk)“이어야 할 변경 사항을 왜 에이전트가 “낮은 위험(Low Risk)“으로 분류했는지 원인을 파악하고, 최적화 루프에 해당 교정 데이터를 피드백하여 에이전트를 지속적으로 학습시킬 수 있어야 합니다.

추적 로그(Trace) 검증 및 설명 역량. FDA 실사관이 “왜 전체 재밸리데이션 대신 타깃 회귀 테스트만 권고했습니까?“라고 묻는다면, 엔지니어는 Langfuse를 열어 해당 트레이스 ID(Trace ID)를 호출하고, 에이전트가 어떤 과거 문서를 참조했는지, 어떠한 추론 논리를 적용했는지, 그리고 엔지니어가 그 권고사항을 어떻게 최종 승인했는지 정확하게 제시할 수 있어야 합니다. 모든 의사결정은 완벽하게 방어 가능(defensible)해야 합니다.

하네스 시스템 운영 역량. Keycloak 토큰 이슈를 디버깅하고, DSPy 최적화 실행 결과를 검토하며, Qdrant 검색 결과가 적절한 청크(chunk)를 반환했는지 검증할 수 있어야 합니다. 에이전트 하네스 시스템 그 자체가 하나의 GxP 컴퓨터화 시스템이므로, 유지보수와 모니터링, 그리고 주기적인 밸리데이션이 필수적입니다.

이를 가능케 하는 시스템 아키텍처

이 기술 스택은 단일 도구가 아닙니다. 각 구성 요소가 명확한 책임을 분담하는 다계층 시스템(layered system)입니다:

Pydantic AI는 엄격한 타입 정의 출력(typed outputs)을 갖춘 에이전트를 정의합니다. 모든 테스트 케이스, 위험 평가서, 일탈 보고서는 Pydantic 스키마를 엄격히 준수하므로, 환각된 필드나 필수 데이터 누락이 원천적으로 방지됩니다.

DSPy는 추론 파이프라인을 최적화합니다. 시간이 지남에 따라 변질(drift)되기 쉬운 수작업 프롬프트 튜닝 대신, DSPy는 골든 데이터셋을 기준으로 프롬프트 프로그램을 컴파일하고 평가합니다. 엔지니어가 에이전트를 교정할 때마다 그 교정 내용은 최적화를 위한 학습 신호(training signal)로 작용합니다.

Langfuse는 모든 에이전트의 동작 — 모든 LLM 호출, 도구 실행, 데이터 검색 단계를 빠짐없이 추적(trace)합니다. 규제 환경에서 이는 선택이 아닌 필수입니다. 바로 AI 시스템 자체에 대한 ‘감사 추적(Audit Trail)’ 역할을 하기 때문입니다.

Qdrant는 규제 가이드라인, SOP, 과거 밸리데이션 패키지, 일탈 이력에 대한 시맨틱 검색(semantic retrieval)을 제공합니다. 에이전트는 21 CFR Part 11 요건을 임의로 추측하지 않으며, 실제 공식 규정을 검색하여 그에 기반한(grounded) 출력을 생성합니다.

RustFS는 모든 아티팩트를 불변(immutable) 상태로 안전하게 저장합니다. 프로토콜, 테스트 증빙, 스크린샷, 일탈 보고서, 트레이스 내보내기 파일 등 모든 데이터가 버전 관리되고, 해시로 무결성이 검증되며, 규제 보존 연한 동안 안전하게 보관됩니다.

Temporal은 인간 참여(Human-in-the-loop) 게이트를 포함하는 다단계 워크플로우를 오케스트레이션합니다. 밸리데이션 워크플로우는 단계별 승인을 기다리며 수주 동안 지속될 수 있습니다. Temporal은 어떠한 단계도 유실되지 않고, 상태가 유실되지 않으며, 모든 상태 전이가 기록되도록 보장합니다.

**OPA (Open Policy Agent)**는 에이전트가 자율적으로 수행할 수 있는 작업과 수행할 수 없는 작업의 경계를 강제합니다. 에이전트는 위험 평가 초안을 생성할 수는 있지만, 이를 단독으로 승인할 수는 없습니다. 이러한 경계는 단순한 운영 규칙이 아니라 인프라 레벨에서 강제됩니다.

핵심 요약 (The Bottom Line)

CSV 엔지니어의 본질적인 책무는 애초에 ’문서를 작성하는 것’이 아니었습니다. 생명을 구하는 치료제를 생산하는 데 사용되는 컴퓨터 시스템이 올바르고 입증 가능하게(provably) 작동하도록 보증하는 것이 본질이었습니다. 문서는 입증을 위한 증거였을 뿐, 그 자체가 목적은 아니었던 것입니다.

AI 에이전트는 증거를 생성하는 기계적인 메커니즘을 전담합니다. 그리고 엔지니어는 시스템 본연의 목적을 통제합니다.

검증된 AI 에이전트 하네스의 지원을 받는 숙련된 CSV 엔지니어 1명은, 과거 3~4명이 매달려야 했던 방대한 밸리데이션 영역을 혼자서도 완벽하게 감독할 수 있습니다. 이는 절차를 생략하거나 타협해서가 아니라, 애초에 인간의 두뇌를 필요로 하지 않던 단순 반복 작업에 쓰이던 시간을 근본적으로 제거했기 때문입니다.

이 새로운 시대에서 성공을 거둘 엔지니어는 프로토콜을 가장 빠르게 타이핑하는 사람이 아닙니다. AI가 생성한 프로토콜을 한눈에 검토하고 무엇이 누락되었는지를 즉각 간파해 낼 수 있는 엔지니어입니다.

그것이야말로 매일 아침 출근할 가치가 있는, 진정으로 보람찬 하루의 모습입니다.


전체 연구 노트: [[CSV Engineer Workday - Traditional vs AI-Augmented]]

관련 기사