AI Briefing

Taste-Bench, 프런티어 LLM의 장기 작업 의사결정 정확도 59.7% 기록

·2026.09.25 09:00

핵심 내용

Taste-Bench 벤치마크에서 GPT-5.6 Sol이 장기 작업 의사결정 정확도 59.7%를 기록했다.

1 / 3

자세히 보기

Taste-Bench는 LLM 에이전트의 '미감(taste)', 즉 장기적인 작업에서 올바른 방향을 선택하는 능력을 평가한다. 모델은 태스크와 분기점까지의 궤적, 그리고 두 가지 후보 다음 단계를 제시받으며, 숨겨진 나머지 궤적이 증명하는 정답을 선택해야 한다. 잘못된 선택은 초기에는 합리적으로 보이지만 이후 에이전트의 예산을 소진시키는 경우가 많다.

벤치마크 구성 및 방법론

데이터셋은 소프트웨어 엔지니어링과 머신러닝 연구 궤적에서 추출한 502개 질문으로 구성되며, 전문가 주석이 필요 없다. 질문은 두 가지 방식으로 생성된다:

  • 병렬 분기(Parallel forks): 같은 태스크에 대한 독립적인 시도가 특정 지점에서 갈라지며, 최종 결과가 더 나은 방향을 결정한다.
  • 우회 분기(Detour forks): 에이전트가 실패 후 방향을 포기했다가 나중에 복구하는 경우, 포기한 경로와 복구 경로가 후보가 된다.

추출된 4,657개 분기 중 자명하거나 판별 불가능한 경우를 걸러낸 502개가 최종 선정되었다. 여기에는 SWE-bench 및 SWE-bench Pro 기반의 엔지니어링 질문 390개와 METR의 MALT 릴리스 기반 연구 질문 112개가 포함된다.

평가 프로토콜 및 결과

모델은 paired_order_v1 프로토콜로 평가된다. 각 질문은 공개된 선택지 순서와 그 역순으로 두 번 제시되며, 두 순서 모두에서 정답을 맞혀야 한다. 이를 통해 무작위 추측 점수는 25%로 낮아진다. 최고 성능 모델인 GPT-5.6 Sol은 평균 정확도 **59.7%**를 기록했으며, GPT-5.5가 **59.5%**로 근소하게 뒤를 이었다.

기타 주요 점수:

  • Claude Opus 5: 평균 55.5%
  • Grok 4.5: 평균 54.6%
  • GLM-5.2: 평균 53.9%

최고 정확도가 60% 미만에 그친다는 사실은 프런티어 모델조차 장기적인 판단에서 어려움을 겪고 있음을 보여준다. 학습 데이터 오염 방지를 위해 데이터셋은 Hugging Face에서 게이트 방식으로 제공되며, 코드는 MIT 라이선스로 공개된다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.