AI Briefing

AI의 과학 연구 수행 능력 평가

·2025.12.16 18:00

OpenAI가 물리, 화학, 생물 분야의 전문가 수준 과학 추론 능력을 측정하는 새로운 벤치마크 FrontierScience를 공개했다.

OpenAI가 물리, 화학, 생물학 분야에서 전문가 수준의 과학적 추론 능력을 평가하기 위한 새로운 벤치마크인 FrontierScience를 도입했다. 이는 단순한 사실 회상을 넘어 가설 생성, 테스트, 아이디어 통합 등 과학 연구의 핵심인 추론 능력을 측정하는 데 중점을 둔다.

기존 GPQA 벤치마크에서 GPT-4는 39%의 점수를 기록했으나, GPT-5.2는 92%를 기록하며 비약적인 발전을 보였다. 하지만 기존 벤치마크들은 객관식 위주이거나 과학 분야에 특화되지 않았다는 한계가 있었다.

FrontierScience는 다음과 같은 두 가지 트랙으로 구성된다:

  • Olympiad: 올림피아드 스타일의 과학적 추론 능력 측정
  • Research: 실제 과학 연구 수행 능력 측정

초기 평가 결과, GPT-5.2는 Olympiad 트랙에서 77%, Research 트랙에서 25%를 기록하며 다른 모델들을 앞섰다. 모델이 구조화된 추론에는 강점을 보였으나, 개방형 연구 스타일의 과제에서는 여전히 개선의 여지가 있음을 확인했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.