AI Briefing

과학적 발견 에이전트 평가하기 (4분 읽기)

·2026.04.16 00:01

핵심 내용

ScienceWorld와 DiscoveryWorld는 AI 과학 에이전트의 실제 수행력을 드러낸다.

자세히 보기

AI 과학 에이전트가 쏟아지고 있지만, 진짜로 과학을 할 수 있는지는 별개다. Ai2는 이를 검증하기 위해 ScienceWorld와 DiscoveryWorld라는 벤치마크를 만들었고, 최근 모델들이 이 과제들에 도달하면서 그 의미가 다시 커지고 있다.

ScienceWorld는 초등학교 수준의 과학 실험을 실제로 수행할 수 있는지 보는 환경이다. 2022년에는 최고 수준 모델도 다중선택 과학 시험에서는 높은 점수를 받았지만, 같은 지식을 실험 수행으로 옮기게 하면 10% 미만에 그쳤다. 반면 2025년 초 기준 상위 프론티어 모델은 80점대 초반까지 올라왔지만, 여전히 4학년 과학 교육과정을 완전히 푼 수준은 아니다.

DiscoveryWorld는 한 단계 더 어렵다. 가상의 우주 식민지 Planet X에서 감염 원인 규명, 양자 반응기 수학적 관계 추론 같은 120개 과제를 해결하게 하며, 8개 주제, 3개 난이도, 실행마다 달라지는 파라메트릭 변형을 포함한다. 에이전트는 가설을 세우고, 실험을 설계하고, 실행하고, 결과를 분석해야 하며, 정답 여부뿐 아니라 과학적 절차를 따랐는지도 평가된다.

핵심 비교는 다음과 같다.

  • ScienceWorld: 교과서 수준의 과학 개념을 실험으로 재현할 수 있는지 측정
  • DiscoveryWorld: 새로운 발견을 처음부터 설계하고 검증하는지 측정
  • 실험 결과: 최근 최고의 시스템도 DiscoveryWorld의 고난도 과제를 약 **20%**만 해결
  • 인간 기준: 평균적인 고학력 과학자는 약 **70%**를 해결

이 두 벤치마크는 “지식을 아는 것”과 “과학적으로 발견을 수행하는 것”의 간극을 드러낸다. Ai2는 과학 에이전트가 질병 치료, 신소재 개발, 새로운 발견으로 이어지려면, 먼저 이런 폐쇄형이 아닌 end-to-end scientific discovery 과제에서 실제 성능을 증명해야 한다고 강조한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.