소형 트랜스포머로 ARC-AGI-1 44% 달성, 비용 67센트
·2026.09.01 18:52
핵심 내용
소형 트랜스포머를 1.5시간 동안 학습해 ARC-AGI-1 벤치마크에서 44%의 성능을 67센트 비용으로 달성했다.
1 / 3
자세히 보기
ARC-AGI 벤치마크에서 소형 트랜스포머를 활용해 **44%**의 성능을 달성했으며, 이를 위한 학습 비용은 67센트에 불과하다. 이 모델은 RTX 5090 GPU에서 1.5시간 만에 처음부터 학습되었으며, 기존 대형 언어 모델(LLM)들이나 TRM/HRM과 유사한 성능을 보이면서도 훨씬 저렴하고 빠르다.
기술적 접근 및 개선 사항
- 아키텍처 최적화: GELU 대신 SwiGlu, LayerNorm 대신 RMSNorm을 적용하고 Flash Attention 및 Flex Attention 커널을 사용하여 효율성을 높였다.
- 학습 방식 변경: 입력 토큰을 학습하지 않고 출력 토큰만 포함하는 지도 학습(Supervised) 방식으로 전환하여 성능을 40%에서 44%로 개선했다.
- 데이터 처리: 3D RoPE 임베딩과 태스크별 임베딩을 사용하여 표현력을 강화했으며, AdamW 대신 Normuon 옵티마이저를 적용해 수렴 문제를 해결했다.
- 데이터 누수 방지: ARC-2의 비중복 태스크를 추가하되, ARC-1과 중복되는 773개 퍼즐을 필터링하여 데이터 누수를 방지했다.
시사점
이 연구는 **샘플 효율성(Sample Efficiency)**이 현재 AI의 가장 중요한 문제임을 강조하며, 제한된 데이터와 저비용 환경에서도 높은 성능을 낼 수 있음을 입증한다. 검증 손실(Val Loss)이 악화되었음에도 실제 성능이 향상되는 현상을 통해, 기존 최적화 방식의 한계와 새로운 방향성을 제시한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.