AI Briefing

ARC-AGI-1에서 67센트로 44% 달성 (22분 분량)

·2026.09.02 09:00

핵심 내용

5090 GPU에서 1.5시간 만에 학습된 소형 Transformer가 ARC-AGI 44%를 달성하며 LLM의 낮은 샘플 효율성을 비판했다.

1 / 2

자세히 보기

5090 GPU에서 1.5시간 만에 처음부터 학습된 소형 Transformer가 ARC-AGI 1 벤치마크에서 **44%**의 점수를 기록하며 67센트라는 극히 낮은 비용으로 달성했다. 이 모델은 TRM 및 HRM과 유사한 성능을 보이면서도 오픈소스이며, 기존 LLM들이 의존하던 대량의 사전 학습이나 합성 데이터 없이 순수 딥러닝만으로 메타 학습 능력을 입증했다.

샘플 효율성과 LLM 비판

저자는 현재 LLM들이 ARC에서 기록하는 높은 점수가 일반 추론 능력의 향상이 아니라, 대량의 합성 데이터를 통한 post-training과 benchmaxxing의 결과라고 주장한다. LLM은 인간에게 쉬운 태스크에서도 샘플 효율성이 낮으며, ARC-2 등장 시 모든 LLM의 성능이 리셋된 것은 이들이 '일반 추론'이 아닌 특정 태스크 해결법을 암기했음을 시사한다. 반면 본 모델은 제한된 데이터로 새로운 규칙을 빠르게 학습하는 메타 학습 능력을 보여준다.

기술적 접근 방식

성능 향상의 핵심은 3D RoPE 위치 인코딩과 per-task embedding을 결합한 아키텍처다. 또한 NorMuon 옵티마이저와 RMSNorm, SwiGLU FFN 등 현대화된 Transformer 구조를 적용했다. 학습 시 테스트 입력 자체는 사용하되 정답 라벨은 사용하지 않는 메타 학습 방식을 채택했으며, 이는 ARC 커뮤니티에서 허용되는 **Test-Time Training(TTT)**의 정신에 부합한다.

벤치마크 평가 기준의 문제점

저자는 기존 리더보드가 LLM의 막대한 오프라인 사전 학습 비용을 제외하고 비교하는 것은 불공정하다고 지적한다. 모든 모델의 lifetime compute(초기화부터 추론까지의 총 비용)를 포함해야 하며, 합성 데이터 사용은 벤치마크의 본래 의도인 '유동 지능' 테스트를 훼손하므로 금지되어야 한다고 강조한다. 또한 HRM과 TRM이 주장하는 모델 크기와 실제 학습된 파라미터 수 사이의 불일치도 비판했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.