AI Briefing

Stanford 연구진, 과학 워크플로우 기반 AI 에이전트 벤치마크 Terminal-Bench-Science 0.1 공개

·2026.08.28 09:00

핵심 내용

Stanford 연구진이 실제 과학 워크플로우를 기반으로 한 AI 에이전트 벤치마크 Terminal-Bench-Science 0.1을 공개했다.

자세히 보기

Stanford University의 AI 연구팀과 Terminal-Bench 개발팀이 협력하여 실제 과학 연구 워크플로우를 기반으로 한 AI 에이전트 평가 벤치마크 Terminal-Bench-Science 0.1을 공개했다. 이 벤치마크는 모델 개발자나 데이터 공급업체가 아닌, 실제 과학자들이 주도하여 AI의 과학적 능력을 측정하는 기준을 설정한다.

벤치마크의 특징 및 목표

Terminal-Bench-Science는 AI 에이전트가 복잡한 과학적 작업을 수행하는 능력을 평가하기 위해 설계되었다. 주요 특징은 다음과 같다:

  • 실제 워크플로우 기반: 교과서적 질문이나 표준화된 연습 문제가 아닌, 실제 연구 현장에서 추출된 70개의 과제를 포함한다.
  • 검증 가능한 결과: 분석, 시뮬레이션, 증명, 코드, 데이터 산출물 등 구체적인 결과물을 재현 가능한 테스트로 평가한다.
  • 지속적 발전: AI 기술의 발전과 함께 벤치마크도 진화하며, 과학 커뮤니티와 AI 개발 간의 피드백 루프를 형성한다.

평가 결과 및 과제 범위

초기 릴리스에는 생명과학, 물리학, 지구과학, 수학, 공학 분야의 70개 과제가 포함되었다. 현재까지 평가된 모델 중 가장 높은 성능을 보인 Claude Opus 5는 Terminal-Bench-Science 0.1에서 **30%**의 해결률(resolution rate)을 기록했다. 이는 AI 에이전트가 아직 복잡한 과학적 문제를 완전히 자율적으로 해결하기에는 한계가 있음을 시사한다.

이 벤치마크는 AI 에이전트가 연구 질문에 대한 정의, 가설 수립, 결과 해석 등 인간 판단이 필요한 부분에 집중할 수 있도록, 기술적으로 demanding하고 시간이 많이 소요되는 워크플로우를 자동화하는 데 기여하는 것을 목표로 한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.