AI 연구소들이 펠리컨 벤치마크를 과적합하고 있을까?
·2026.07.23 09:00
핵심 내용
1,008개의 SVG를 생성해 분석한 결과, AI 연구소들이 유명한 '자전거 탄 펠리컨' 벤치마크에 과적합한 증거는 발견되지 않았다.
자세히 보기
Simon Willison이 수년간 진행해온 'SVG로 자전거 탄 펠리컨 그리기' 프롬프트는 AI 커뮤니티에서 가장 유명한 비공식 벤치마크 중 하나가 됐다. 막대한 자본이 걸린 AI 연구소들이 이 벤치마크에 특화된 훈련(pelicanmaxxing)을 했을 가능성이 제기되어 왔다.
이를 검증하기 위해 8종 동물 × 6종 탈것 = 48가지 프롬프트 그리드를 구성하고, GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2, DeepSeek V4 Pro 총 7개 모델로 각 프롬프트당 3회씩 생성해 1,008개의 SVG를 수집했다. 판정은 GPT-5.6 Luna가 동물·탈것·동작 일관성을 각 1~5점으로 평가했다.
분석 결과, '펠리컨' 행이나 '자전거' 열이 다른 항목보다 유의미하게 높은 점수를 받는 패턴은 나타나지 않았다. 펠리컨-자전거 조합이 특별히 뛰어난 모델도 없었으며, 잘 그리는 모델은 다른 동물-탈것 조합도 전반적으로 잘 그렸다. 현재로서는 AI 연구소들이 이 벤치마크에 과적합했다는 증거가 없다는 결론이다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.