LangSmith, 의료 AI 신뢰성 확보 위한 임상 평가 인프라로 활용
핵심 내용
LangSmith를 활용해 임상 전문가의 판단을 재사용 가능한 평가 자산으로 전환, 의료 AI의 릴리스 속도와 안전성을 동시에 확보했다.
자세히 보기
임상 전문가 판단의 인프라화
의료 AI 개발의 핵심 병목은 희소한 임상 전문가의 검증 시간이다. Abridge와 Included Health는 LangSmith를 활용해 이러한 전문가 판단을 라벨, 평가자(judge), 데이터셋 등 재사용 가능한 인프라로 전환했다. 이를 통해 신뢰성을 점진적으로 복리화하고, 엔지니어링 팀 외부의 전문가 의존도를 낮추는 것이 목표다.
평가 체계의 정교화: 이중 Judge 전략
임상 평가는 정답이 유일하지 않고 '올바른 비활성화(Correct inaction)'까지 고려해야 하므로 복잡하다. Abridge는 이를 해결하기 위해 두 가지 평가자를 병행한다.
- Reference-free Judge: 원본 대화와 직접 비교하여 개발 및 운영 단계에서 일반화된 정확도를 측정한다.
- Reference-based Judge: 큐레이션된 예시와 비교하여 특정 전문의의 맥락과 뉘앙스를 포착한다.
또한, 알려진 실패 모드를 빈도와 심각도 순으로 분류하고 각 항목별 전용 Judge를 자동 프롬프트 최적화 프레임워크로 생성하여 확장성을 확보했다.
릴리스 사이클 단축 및 프로덕션 신뢰성
평가 결과를 릴리스 게이트로 연결함으로써 배포 속도와 안전성을 동시에 개선했다.
- Abridge: 오프라인 평가부터 제한적 A/B 테스트(10~15% 고객 대상 silent rollout)까지의 과정을 자동화하여 릴리스 사이클을 기존 1~2개월에서 며칠 수준으로 단축했다.
- Included Health: AI 가이드 'Dot'의 마이그레이션을 2주 내 무회귀로 완료했으며, 출시 후 채팅 참여율 75% 상승과 고위험 상황 식별율 99% 이상을 달성했다.
PHI 관리와 보안 아키텍처
의료 데이터 특성상 평가 인프라 설계 단계부터 PHI(보호 대상 건강 정보) 관리가 필수적이다. Abridge는 self-hosting, 접근 제어, 감사 가능성을 필수 요건으로 삼고, 데이터 유입 단계에서 식별 정보를 제거하는 통제 방식을 채택했다. LangSmith는 managed cloud부터 self-hosted까지 다양한 배포 옵션을 제공하여 데이터 저장 위치와 감사 통제를 팀이 직접 결정할 수 있도록 지원한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.