AI Briefing

소형 트랜스포머로 ARC-AGI-1 44% 달성, 비용 67센트

·2026.09.01 18:52

핵심 내용

소형 트랜스포머를 1.5시간 동안 학습해 ARC-AGI-1 벤치마크에서 44%의 성능을 67센트 비용으로 달성했다.

1 / 3

자세히 보기

ARC-AGI 벤치마크에서 소형 트랜스포머를 활용해 **44%**의 성능을 달성했으며, 이를 위한 학습 비용은 67센트에 불과하다. 이 모델은 RTX 5090 GPU에서 1.5시간 만에 처음부터 학습되었으며, 기존 대형 언어 모델(LLM)들이나 TRM/HRM과 유사한 성능을 보이면서도 훨씬 저렴하고 빠르다.

기술적 접근 및 개선 사항

  • 아키텍처 최적화: GELU 대신 SwiGlu, LayerNorm 대신 RMSNorm을 적용하고 Flash Attention 및 Flex Attention 커널을 사용하여 효율성을 높였다.
  • 학습 방식 변경: 입력 토큰을 학습하지 않고 출력 토큰만 포함하는 지도 학습(Supervised) 방식으로 전환하여 성능을 40%에서 44%로 개선했다.
  • 데이터 처리: 3D RoPE 임베딩과 태스크별 임베딩을 사용하여 표현력을 강화했으며, AdamW 대신 Normuon 옵티마이저를 적용해 수렴 문제를 해결했다.
  • 데이터 누수 방지: ARC-2의 비중복 태스크를 추가하되, ARC-1과 중복되는 773개 퍼즐을 필터링하여 데이터 누수를 방지했다.

시사점

이 연구는 **샘플 효율성(Sample Efficiency)**이 현재 AI의 가장 중요한 문제임을 강조하며, 제한된 데이터와 저비용 환경에서도 높은 성능을 낼 수 있음을 입증한다. 검증 손실(Val Loss)이 악화되었음에도 실제 성능이 향상되는 현상을 통해, 기존 최적화 방식의 한계와 새로운 방향성을 제시한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.