Nonobench, 49개 LLM 논그림 퍼즐 벤치마크 공개
Nonobench: an open benchmark of 49 LLMs on nonogram puzzles, public and open source [P]
·2026.10.04 16:57
핵심 내용
GPT-6 Astra는 표준 퍼즐 30개를 모두 해결했으나, 15x15 그리드에서는 최고 노력 수준에서도 해결률이 20%에 그쳤다.
자세히 보기
Nonobench는 49개 LLM의 논그림 퍼즐(nonogram) 해결 능력을 평가하는 새로운 오픈소스 벤치마크다. 모델은 행과 열 힌트만 받아 외부 도구 없이 한 번의 시도로 전체 그리드를 반환해야 한다.
벤치마크 구성
평가는 두 가지 모드로 구성된다:
- 표준 모드: Moyà-Alcover의 Nonograms 데이터셋에서 가져온 5x5부터 15x15까지의 퍼즐 30개.
- 하드 모드: 단일 해답이 검증된 무작위 20x20 그리드 10개. 이 중 5개는 라인 로직만으로는 해결할 수 없으며, 모델이 그림 패턴을 추측하는 것을 방지하기 위해 무작위 채우기를 사용한다.
OpenRouter를 통해 각 실험실의 특정 모델 버전에 고정하여 다양한 노력 수준에서 130개 변형을 테스트했다.
주요 결과
퍼즐 복잡도가 높아질수록 성능이 크게 저하된다:
- 표준 모드: 각 모델의 최고 노력 수준에서 5x5 그리드의 해결률은 **85%**이지만, 10x10에서는 46%, 15x15에서는 **20%**로 떨어진다.
- 주요 성과: GPT-6 Astra는 표준 퍼즐 30개를 모두 해결했다. 하드 모드에서는 Claude Opus 5.5가 10개 중 8개를 해결한 반면, 15개 모델 중 11개는 하나도 해결하지 못했다.
방법론 참고
정확한 논리 테스트를 위해 하드 모드 답변은 400자 단일 문자열이 아닌 20개의 행 문자열 배열로 제공되어 모델이 그리드 구조를 놓치는 것을 방지한다. 벤치마크는 단일 시도 결과의 노이즈를 인정하며 95% 신뢰 구간을 제공한다.
이 프로젝트는 MIT 라이선스 하에 오픈소스로 공개되며, 코드는 GitHub에서, 결과는 nonobench.com에서 확인할 수 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.