AI Briefing

AI 연구소들이 펠리컨 벤치마크를 과적합하고 있을까?

·2026.07.23 09:00

1,008개의 SVG를 생성해 분석한 결과, AI 연구소들이 유명한 '자전거 탄 펠리컨' 벤치마크에 과적합한 증거는 발견되지 않았다.

Simon Willison이 수년간 진행해온 'SVG로 자전거 탄 펠리컨 그리기' 프롬프트는 AI 커뮤니티에서 가장 유명한 비공식 벤치마크 중 하나가 됐다. 막대한 자본이 걸린 AI 연구소들이 이 벤치마크에 특화된 훈련(pelicanmaxxing)을 했을 가능성이 제기되어 왔다.

이를 검증하기 위해 8종 동물 × 6종 탈것 = 48가지 프롬프트 그리드를 구성하고, GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2, DeepSeek V4 Pro 총 7개 모델로 각 프롬프트당 3회씩 생성해 1,008개의 SVG를 수집했다. 판정은 GPT-5.6 Luna가 동물·탈것·동작 일관성을 각 1~5점으로 평가했다.

분석 결과, '펠리컨' 행이나 '자전거' 열이 다른 항목보다 유의미하게 높은 점수를 받는 패턴은 나타나지 않았다. 펠리컨-자전거 조합이 특별히 뛰어난 모델도 없었으며, 잘 그리는 모델은 다른 동물-탈것 조합도 전반적으로 잘 그렸다. 현재로서는 AI 연구소들이 이 벤치마크에 과적합했다는 증거가 없다는 결론이다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.