HealthBench 소개
·2025.05.12 19:30
OpenAI가 의료 AI의 성능과 안전성을 정밀하게 평가하기 위한 새로운 벤치마크 **HealthBench**를 공개했다.
OpenAI는 AI가 인류의 건강 증진에 기여하기 위해서는 모델의 유용성과 안전성을 보장하는 것이 필수적이라고 강조하며, 새로운 의료 AI 평가 벤치마크인 HealthBench를 발표했다.
HealthBench는 전 세계 60개국의 전문의 262명과 협력하여 구축되었으며, 실제 의료 현장을 반영한 5,000개의 현실적인 건강 관련 대화 데이터를 포함한다. 이 데이터는 다국어 및 다회차 대화(multi-turn) 형식을 지원하며, 다양한 의료 전문 분야와 페르소나를 아우른다.
이 벤치마크는 다음과 같은 세 가지 핵심 원칙을 바탕으로 설계되었다:
- Meaningful (의미 있는 평가): 단순 시험 문제를 넘어 실제 임상 워크플로우와 복잡한 시나리오를 반영한다.
- Trustworthy (신뢰할 수 있는 평가): 전문의의 판단 기준과 우선순위를 반영하여 신뢰도를 높였다.
- Unsaturated (발전 가능성): 최신 모델들이 개선할 여지를 남겨두어 지속적인 성능 향상을 유도한다.
각 대화는 전문의가 직접 작성한 48,562개의 고유한 **평가 기준(rubric)**에 따라 채점된다. 모델의 응답은 GPT-4.1 기반의 평가 모델을 통해 각 기준의 충족 여부를 검증받고, 전체 점수 중 획득한 점수를 바탕으로 최종 점수가 산출된다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.