arc-task-gen: GPT-5.6보다 11배 저렴한 추론 비용, ARC-AGI-1 신규 과제 생성
pathwaycom/arc-task-gen
프로젝트 소개
공용 ARC-AGI-1 데이터셋의 분포를 맞춰 새로운 추론 과제를 자동 생성한다. 기존 벤치마크에 노출된 문제를 피하고, 모델이 처음 보는 문제에서 얼마나 잘 수행하는지 측정하기 위한 사설 평가 세트를 만든다. 생성된 tasks.json 파일은 표준 ARC 형식을 따르므로 기존 평가 하네스와 호환된다.
이 저장소는 BDH-CQ 모델의 성능을 검증하는 데 사용된다. BDH-CQ는 Transformer 기반이 아닌 재귀적 잠재 공간 추론을 결합한 아키텍처다. 150M 파라미터 구성에서 공용 ARC-AGI-1 평가 세트 기준 pass@2 29.5%를 기록했다. 7월 30일 가격 인하 이후 GPT-5.6 Luna(Low) 대비 과제당 추론 비용이 11배 낮다.

Transformer 아키텍처 공동 저자 루카스 카이저와 NYU 연구자 리처드 종 등이 결과를 독립적으로 재현했다. 1B에서 600B 파라미터까지의 사전 학습 실험에서도 Transformer와 유사한 스케일링을 보이며 재귀적 잠재 추론 능력을 유지했다. MIT 라이선스로 공개되어 있으며, 프런티어 모델의 일반화 능력을 평가하려는 연구자에게 적합하다.
pathwaycom/arc-task-gen
Generates original ARC-AGI-1-style tasks distribution-matched to the public eval set.
Python
이 한국어 소개글은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.