AI Briefing

람다 계산 벤치마크 공개

Here's an interesting new coding benchmark based on lambda-calculus. Results seem very realistic to me since no LLM was benchmaxxed on it yet.

·2026.04.24 23:24

핵심 내용

120개 순수 람다 계산 문제로 모델의 코딩 능력을 평가하는 벤치마크를 공개했다.

자세히 보기

λ-bench는 120개의 순수 람다 계산 프로그래밍 문제로 AI 모델을 평가하는 벤치마크다.

모델은 Lamb라는 최소 람다 계산 언어로 프로그램 하나를 작성해야 하며, λ-인코딩된 자료구조를 써서 각 문제의 알고리즘을 구현한다. 제출된 .lam 프로그램은 모든 입출력 테스트를 통과해야 정답으로 인정된다.

  • v1 점수는 solved problems / 120의 단순 통과율이다.
  • 문제는 12개 카테고리로 나뉘며, 각 카테고리당 10문항씩 구성됐다.
  • 범위는 알고리즘, Church/Scott 인코딩, N-tuples 등으로 넓게 잡혔다.
  • 난도는 Church nat 덧셈 같은 기초 문제부터 BF 인터프리터, FFT, Sudoku solver 같은 고난도 문제까지 포함한다.

현재 공개된 순위는 GPT-5.4 101/120(84.2%), GPT-5.5 93/120(77.5%), Opus 4.7 84/120(70.0%), Gemini 3.1 Pro 81/120(67.5%) 순이다.

평가는 bun eval <provider/model>로 실행하며, 결과는 res/에 저장된다. 저장소의 결과 파일을 모아 GitHub Pages 랜딩 페이지를 다시 생성하는 방식으로 리더보드가 구성된다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.