AI Briefing

LangSmith, 의료 AI 신뢰성 확보 위한 임상 평가 인프라로 활용

·2026.09.23 02:00

핵심 내용

LangSmith를 활용해 임상 전문가의 판단을 재사용 가능한 평가 자산으로 전환, 의료 AI의 릴리스 속도와 안전성을 동시에 확보했다.

1 / 4

자세히 보기

임상 전문가 판단의 인프라화

의료 AI 개발의 핵심 병목은 희소한 임상 전문가의 검증 시간이다. Abridge와 Included Health는 LangSmith를 활용해 이러한 전문가 판단을 라벨, 평가자(judge), 데이터셋 등 재사용 가능한 인프라로 전환했다. 이를 통해 신뢰성을 점진적으로 복리화하고, 엔지니어링 팀 외부의 전문가 의존도를 낮추는 것이 목표다.

평가 체계의 정교화: 이중 Judge 전략

임상 평가는 정답이 유일하지 않고 '올바른 비활성화(Correct inaction)'까지 고려해야 하므로 복잡하다. Abridge는 이를 해결하기 위해 두 가지 평가자를 병행한다.

  • Reference-free Judge: 원본 대화와 직접 비교하여 개발 및 운영 단계에서 일반화된 정확도를 측정한다.
  • Reference-based Judge: 큐레이션된 예시와 비교하여 특정 전문의의 맥락과 뉘앙스를 포착한다.

또한, 알려진 실패 모드를 빈도와 심각도 순으로 분류하고 각 항목별 전용 Judge를 자동 프롬프트 최적화 프레임워크로 생성하여 확장성을 확보했다.

릴리스 사이클 단축 및 프로덕션 신뢰성

평가 결과를 릴리스 게이트로 연결함으로써 배포 속도와 안전성을 동시에 개선했다.

  • Abridge: 오프라인 평가부터 제한적 A/B 테스트(10~15% 고객 대상 silent rollout)까지의 과정을 자동화하여 릴리스 사이클을 기존 1~2개월에서 며칠 수준으로 단축했다.
  • Included Health: AI 가이드 'Dot'의 마이그레이션을 2주 내 무회귀로 완료했으며, 출시 후 채팅 참여율 75% 상승과 고위험 상황 식별율 99% 이상을 달성했다.

PHI 관리와 보안 아키텍처

의료 데이터 특성상 평가 인프라 설계 단계부터 PHI(보호 대상 건강 정보) 관리가 필수적이다. Abridge는 self-hosting, 접근 제어, 감사 가능성을 필수 요건으로 삼고, 데이터 유입 단계에서 식별 정보를 제거하는 통제 방식을 채택했다. LangSmith는 managed cloud부터 self-hosted까지 다양한 배포 옵션을 제공하여 데이터 저장 위치와 감사 통제를 팀이 직접 결정할 수 있도록 지원한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.