AI Briefing

AI 헬스 코치 구축하기: 평가, 안전성 및 규제 준수

·2026.06.10 15:53

디지털 헬스 기업 Numan이 AI 코치 'Nu'의 품질과 규제 준수를 위해 LLM 페르소나를 활용한 자동화된 평가 루프를 구축하는 방법을 설명한다.

영국의 디지털 헬스 기업 Numan은 영양 가이드 및 행동 변화 코칭을 제공하는 AI 코치 Nu를 운영하고 있다. Nu는 의료 진단이나 처방을 내리지 않도록 설계되었으며, 이를 위해 '의료 기기' 범주에 해당하지 않도록 규제 경계선을 지키는 것이 핵심 과제다.

기존의 고정된 데이터셋을 활용한 Single-turn eval이나 미리 작성된 대본을 사용하는 Scripted multi-turn 방식은 코칭의 맥락을 반영하지 못한다는 한계가 있었다. 코칭은 단답형 답변이 아니라 대화의 흐름 속에서 환자의 문제를 파악하고 적절한 경계를 유지하는 과정이기 때문이다.

Numan은 이를 해결하기 위해 LLM 페르소나를 활용한 에이전트 평가(Agent evals) 방식을 도입했다. 환자 페르소나, 시나리오, 추출해야 할 핵심 문제, 대화 턴 제한을 입력하면 저비용 모델이 환자 역할을 수행하며 Nu와 다회차 대화를 나눈다. 이를 통해 다음과 같은 이점을 얻었다.

  • 광범위한 언어 공간 커버: 고정된 문구가 아닌 생성된 페르소나를 통해 다양한 표현 대응 가능
  • 적대적 테스트(Adversarial probes): 진단 요청이나 약물 복용 질문 등 규제 위반 가능성이 있는 질문을 자동으로 테스트
  • 안전한 완료(Safe-completion): 규제 범위를 벗어난 질문에 대해 코칭의 톤을 유지하면서도 적절히 거절하고 안내하는 능력 측정

이 시스템은 4단계 개선 루프를 통해 작동한다. 사람이 실제 대화를 검토하여 오류를 주석으로 남기면, 자동화된 스크립트가 이를 분류하고 우선순위를 정해 백로그로 관리하며, 이를 통해 지속적인 모델 개선을 이뤄낸다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.