AI Briefing

arc-task-gen: GPT-5.6보다 11배 저렴한 추론 비용, ARC-AGI-1 신규 과제 생성

pathwaycom/arc-task-gen

·2026.08.24 23:06

공용 ARC-AGI-1 데이터셋의 분포를 맞춰 새로운 추론 과제를 자동 생성한다. 기존 벤치마크에 노출된 문제를 피하고, 모델이 처음 보는 문제에서 얼마나 잘 수행하는지 측정하기 위한 사설 평가 세트를 만든다. 생성된 tasks.json 파일은 표준 ARC 형식을 따르므로 기존 평가 하네스와 호환된다.

이 저장소는 BDH-CQ 모델의 성능을 검증하는 데 사용된다. BDH-CQ는 Transformer 기반이 아닌 재귀적 잠재 공간 추론을 결합한 아키텍처다. 150M 파라미터 구성에서 공용 ARC-AGI-1 평가 세트 기준 pass@2 29.5%를 기록했다. 7월 30일 가격 인하 이후 GPT-5.6 Luna(Low) 대비 과제당 추론 비용이 11배 낮다.

ARC-AGI-1 효율성 프런티어 및 모델 성능 비교 차트
ARC-AGI-1 효율성 프런티어 및 모델 성능 비교 차트

Transformer 아키텍처 공동 저자 루카스 카이저와 NYU 연구자 리처드 종 등이 결과를 독립적으로 재현했다. 1B에서 600B 파라미터까지의 사전 학습 실험에서도 Transformer와 유사한 스케일링을 보이며 재귀적 잠재 추론 능력을 유지했다. MIT 라이선스로 공개되어 있으며, 프런티어 모델의 일반화 능력을 평가하려는 연구자에게 적합하다.

GitHub
GitHub 저장소

pathwaycom/arc-task-gen

Generates original ARC-AGI-1-style tasks distribution-matched to the public eval set.

Python

이 한국어 소개글은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 소개 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.