람다 계산 벤치마크 공개
Here's an interesting new coding benchmark based on lambda-calculus. Results seem very realistic to me since no LLM was benchmaxxed on it yet.
·2026.04.24 23:24
핵심 내용
120개 순수 람다 계산 문제로 모델의 코딩 능력을 평가하는 벤치마크를 공개했다.
자세히 보기
λ-bench는 120개의 순수 람다 계산 프로그래밍 문제로 AI 모델을 평가하는 벤치마크다.
모델은 Lamb라는 최소 람다 계산 언어로 프로그램 하나를 작성해야 하며, λ-인코딩된 자료구조를 써서 각 문제의 알고리즘을 구현한다. 제출된 .lam 프로그램은 모든 입출력 테스트를 통과해야 정답으로 인정된다.
- v1 점수는
solved problems / 120의 단순 통과율이다. - 문제는 12개 카테고리로 나뉘며, 각 카테고리당 10문항씩 구성됐다.
- 범위는 알고리즘, Church/Scott 인코딩, N-tuples 등으로 넓게 잡혔다.
- 난도는 Church nat 덧셈 같은 기초 문제부터 BF 인터프리터, FFT, Sudoku solver 같은 고난도 문제까지 포함한다.
현재 공개된 순위는 GPT-5.4 101/120(84.2%), GPT-5.5 93/120(77.5%), Opus 4.7 84/120(70.0%), Gemini 3.1 Pro 81/120(67.5%) 순이다.
평가는 bun eval <provider/model>로 실행하며, 결과는 res/에 저장된다. 저장소의 결과 파일을 모아 GitHub Pages 랜딩 페이지를 다시 생성하는 방식으로 리더보드가 구성된다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.