AI Briefing

ADeLe: 다양한 task에서 AI 성능을 예측하고 설명하기

·2026.04.02 01:00

핵심 내용

18개 능력 점수로 LLM 성능을 설명하고 새 task 성공률을 88% 정확도로 예측한다.

1 / 2

자세히 보기

기존 AI benchmark는 모델이 특정 task에서 얼마나 잘하는지만 보여주고, 왜 잘하거나 실패하는지는 잘 설명하지 못한다. ADeLe(AI Evaluation with Demand Levels)는 모델과 task를 같은 18개 core abilities 기준으로 점수화해, 성능을 단순한 총점이 아니라 능력 구조로 읽어낸다.

각 task는 attention, reasoning, domain knowledge 같은 능력에 대해 0~5점으로 요구 수준을 부여받고, 각 모델은 여러 task에서의 성과를 바탕으로 능력 프로필을 만든다. 이렇게 얻은 모델 프로필과 task demand profile을 비교하면, 어떤 능력의 간극 때문에 실패했는지까지 짚을 수 있다.

이 방식으로 팀은 여러 benchmark가 실제로 무엇을 측정하는지 점검했다. 결과적으로 많은 benchmark가 의도한 능력만 깔끔하게 분리하지 못하거나, 난이도 범위가 너무 좁아 모델 능력을 불완전하게 보여준다는 점이 드러났다.

또한 15개 LLM을 평가해 능력 프로필을 만들고, 각 능력별로 **성공 확률 50%**에 해당하는 난이도를 능력 점수로 사용했다. 그 결과 GPT-4o, LLaMA-3.1-405B 같은 모델에 대해 새 task 성패를 약 88% 정확도로 예측했으며, 기존 방식보다 더 잘 맞췄다.

특히 reasoning benchmark는 겉으로는 같은 범주여도 실제 요구 능력이 크게 달랐다. 어떤 task는 기본 문제풀이에 그치지만, 어떤 task는 고급 논리, 추상화, domain knowledge를 함께 요구했고, 같은 모델도 저난도에서는 90% 이상, 고난도에서는 15% 이하로 떨어질 수 있었다.

Microsoft 연구진은 o1과 GPT-5 같은 reasoning-oriented model이 논리, 수학, user intent 해석에서 향상된 성능을 보이지만, task demand가 올라갈수록 성능이 떨어진다고 설명한다. ADeLe는 이런 한계를 정량화해, 모델이 어디까지 reasoning할 수 있는지와 어디서 무너지는지를 한 프레임워크 안에서 보여준다.

앞으로는 multimodal 및 embodied AI로 확장할 수 있고, AI research, policymaking, security auditing을 위한 표준 평가 틀로도 활용될 수 있다. 단순한 점수 비교를 넘어, 성능 예측과 오류 설명을 동시에 제공하는 평가 방식으로 발전시키는 것이 핵심이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.