AI Briefing

IMO 수학 문제로 본 LLM 성능 및 에이전트 효과

We compared different LLMs on IMO 2026 [R]

·2026.07.26 16:21

IMO 수학 문제를 활용해 프론티어 모델과 오픈 웨이트 모델의 추론 성능 및 멀티 에이전트 활용 효과를 비교했다.

국제 수학 올림피아드(IMO) 문제를 벤치마크로 활용하여 다양한 LLM의 추론 능력을 테스트한 결과입니다. IMO 문제는 학습 데이터에 포함되지 않은 새로운 문제이며, 복잡한 다단계 추론이 필요해 모델의 일반 지능을 측정하기에 적합합니다.

주요 결과:

  • 프론티어 모델: SolFable 모델은 별도의 하네스(Harness) 없이도 완벽하거나 거의 완벽한 점수를 기록했습니다.
  • Claude 모델: SonnetOpus는 기본 웹앱 성능은 낮았으나, Claude Code와 같은 프로바이더 하네스 및 자체 개발한 멀티 에이전트 하네스인 AutoFyn을 통해 성능이 크게 개선되었습니다.
  • 오픈 웨이트 모델: GLM은 하네스 없는 Sonnet과 유사한 수준을 보였으며, AutoFyn 적용 시 성능이 향상되었습니다.

한계점 및 관찰 사항:

  • 환각(Hallucination) 문제: 수학이라는 검증 가능한 도메인에서도 모델이 잘못된 해결책을 주장하는 사례가 발견되었습니다.
  • 추론의 한계: 가장 어려운 문제(P3)의 경우, 모든 하네스를 적용한 프론티어 모델들조차 핵심적인 아이디어(Key reduction)를 놓치고 동일한 단계에서 정체되는 현상이 나타났습니다. 이는 단순한 검색이나 검증을 넘어선 핵심적 직관의 필요성을 시사합니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.