신약 예측 벤치마크 LEADBOARD 공개
AI 신약 후보 물질 발견을 위한 '예측 도구(능력)' 평가 리더보드 허깅페이스에 공개
핵심 내용
신약 물성 예측 도구의 성능을 정직하게 평가하기 위해 시간 분할과 잡음 바닥을 적용한 벤치마크 LEADBOARD가 공개되었습니다.
자세히 보기
신약 물성 예측 도구의 성능을 측정하기 위한 벤치마크 LEADBOARD가 공개되었습니다. 이 벤치마크는 21개 보드, 홀드아웃 18,382개 화합물로 구성되며, 라벨은 배포하지 않습니다.
1. 데이터 분할 방식이 성능을 좌우함 hERG 보드에서 시간 분할(2022년 이전 학습/이후 시험)과 무작위 분할을 비교한 결과, AUROC가 0.211 차이로 벌어졌습니다. 무작위 분할은 구조적으로 유사한 분자가 학습/시험셋에 섞여 모델이 이미 본 것의 쌍둥이를 평가하게 만드는 과대평가 문제를 일으킵니다. 반면 시간 분할은 실제 미지 화합물 예측 상황을 정직하게 재현하며, 학습 시점에 답이 존재하지 않으므로 과적합을 방지합니다.
2. 실험적 잡음 바닥(Noise Floor) 명시 같은 화합물의 실험값이 논문 간에 얼마나 달라지는지 분석하여 잡음 바닥을 산출했습니다. hERG의 경우 잡음 바닥이 0.421 log로, 1위와 2위의 차이가 0.02라면 그 순위는 통계적으로 의미 없음을 의미합니다. 이를 통해 점수의 신뢰도를 객관적으로 판단할 수 있게 했습니다.
3. 베이스라인 성능과 한계 모든 보드에서 무학습 베이스라인(Constant, Nearest Neighbor, Morgan+LightGBM)을 실행하여 현재 기술의 한계를 드러냈습니다. 일부 보드(CYP2D6, CYP3A4)에서는 베이스라인의 MAE가 잡음 바닥에 근접하거나 그 이하를 보여, 해당 엔드포인트에서 더 이상의 모델 개선이 실험적 불일치보다 큰 의미를 갖지 못할 수 있음을 시사합니다.
4. 보드 태그 체계 분할 방식(T: 시간, S: 스캐폴드)과 데이터 출처 투명성(P1~P4)을 태그로 명시하여, 각 보드가 어떤 실험 조건인지 명확히 구분합니다. 무작위 분할(R) 보드는 열지 않습니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.