AI Briefing

Nonobench, 49개 LLM 논그림 퍼즐 벤치마크 공개

Nonobench: an open benchmark of 49 LLMs on nonogram puzzles, public and open source [P]

·2026.10.04 16:57

핵심 내용

GPT-6 Astra는 표준 퍼즐 30개를 모두 해결했으나, 15x15 그리드에서는 최고 노력 수준에서도 해결률이 20%에 그쳤다.

자세히 보기

Nonobench는 49개 LLM의 논그림 퍼즐(nonogram) 해결 능력을 평가하는 새로운 오픈소스 벤치마크다. 모델은 행과 열 힌트만 받아 외부 도구 없이 한 번의 시도로 전체 그리드를 반환해야 한다.

벤치마크 구성

평가는 두 가지 모드로 구성된다:

  • 표준 모드: Moyà-Alcover의 Nonograms 데이터셋에서 가져온 5x5부터 15x15까지의 퍼즐 30개.
  • 하드 모드: 단일 해답이 검증된 무작위 20x20 그리드 10개. 이 중 5개는 라인 로직만으로는 해결할 수 없으며, 모델이 그림 패턴을 추측하는 것을 방지하기 위해 무작위 채우기를 사용한다.

OpenRouter를 통해 각 실험실의 특정 모델 버전에 고정하여 다양한 노력 수준에서 130개 변형을 테스트했다.

주요 결과

퍼즐 복잡도가 높아질수록 성능이 크게 저하된다:

  • 표준 모드: 각 모델의 최고 노력 수준에서 5x5 그리드의 해결률은 **85%**이지만, 10x10에서는 46%, 15x15에서는 **20%**로 떨어진다.
  • 주요 성과: GPT-6 Astra는 표준 퍼즐 30개를 모두 해결했다. 하드 모드에서는 Claude Opus 5.5가 10개 중 8개를 해결한 반면, 15개 모델 중 11개는 하나도 해결하지 못했다.

방법론 참고

정확한 논리 테스트를 위해 하드 모드 답변은 400자 단일 문자열이 아닌 20개의 행 문자열 배열로 제공되어 모델이 그리드 구조를 놓치는 것을 방지한다. 벤치마크는 단일 시도 결과의 노이즈를 인정하며 95% 신뢰 구간을 제공한다.

이 프로젝트는 MIT 라이선스 하에 오픈소스로 공개되며, 코드는 GitHub에서, 결과는 nonobench.com에서 확인할 수 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.