AI Briefing

Meta, 실제 웨어러블 데이터 기반 건강 추론 벤치마크 'WearableQA' 공개

·2026.09.11 09:00

핵심 내용

Meta가 200명의 실제 웨어러블 시계열 데이터를 활용한 4,084개 건강 추론 문제 벤치마크 'WearableQA'를 공개했다.

1 / 2

자세히 보기

Meta Research가 실제 사용자의 웨어러블 기기 데이터를 기반으로 한 건강 추론 벤치마크 WearableQA를 공개했다. 기존 합성 데이터와 달리, 200명의 실제 사용자로부터 수집된 최대 500일 분량의 웨어러블 시계열 데이터와 혈액 생체 마커를 활용하여 실제 디바이스 노이즈, 데이터 누락, 개인차를 반영한 것이 특징이다.

벤치마크 구성 및 분류 체계 WearableQA는 총 4,084개의 10지선 객관식 문제(Multiple-choice)로 구성되어 있으며, 정답은 A부터 J까지 균일하게 분포되어 랜덤 추론 기준선(Random baseline)은 10%다. 문제는 다음과 같은 16가지 유형으로 분류된다.

  • 추론 그룹(Reasoning group): 데이터 기반(Data, 2,724개) vs 건강 기반(Health, 1,360개)
  • 신호 복잡도(Signal complexity): 단일 신호(Single, 1,682개) vs 교차 신호(Cross, 2,402개)
  • 근거(Grounding): 인구 통계 기반(Population, 3,154개) vs 문헌 기반(Literature, 930개)

데이터 구조 및 프롬프트 제공되는 데이터는 WearableQA.jsonl(평가용)과 WearableQA_raw.json(구조화된 소스)으로 나뉜다. 프롬프트는 사용자 프로필(나이, 성별, BMI 등), 최대 500일의 센서 데이터(걸음 수, 심박수, 수면 패턴 등 16종), 17종 혈액 생체 마커 패널, 그리고 코호트 참조 통계(p10~p90)를 포함한다. 프롬프트의 중앙값 길이는 약 86,000자, 최대 124,000자에 달하며, 특정 지표가 없는 날은 행에서 누락되는 희소(sparse) 특성을 보인다.

활용 및 평가 render_raw.py 스크립트를 통해 원본 데이터를 CSV, Markdown 등 다양한 형식으로 변환할 수 있으며, 직렬화 방식에 따라 모델 성능이 수% 변동할 수 있다. 평가 시 모델이 선택한 문자가 정답과 정확히 일치해야 하며, 파싱이 불가능한 응답은 오답으로 처리된다. 해당 벤치마크는 연구 및 벤치마킹 목적(CC BY-NC 4.0)으로만 사용 가능하며, 재식별 시도나 임상 진단 목적의 사용은 엄격히 금지된다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.