AI Briefing

Magic AI, DeepSeek V4 Pro 대비 48배 적은 연산으로 유사 성능 달성한 'Magic V5 e24' 공개

·2026.09.08 09:00

핵심 내용

Magic AI가 DeepSeek V4 Pro와 유사한 성능을 약 48배 적은 FLOPs로 달성한 Magic V5 e24 모델을 공개했다.

자세히 보기

Magic AI가 Magic V5 e24 모델을 공개하며, 기존 오픈 웨이트 기반 모델 대비 10배 이상의 연산 효율성을 달성했다고 밝혔다. 특히 DeepSeek V4 Pro와 유사한 성능을 약 48배 적은 FLOPs로 달성했으며, 이는 GPT-3 연산량의 절반 수준이다.

연산 효율성 및 성능 지표

Magic V5 e24는 Private Code, Research Papers, Math Reasoning 등 다양한 분야에서 경쟁 모델 대비 압도적인 효율성을 보였다. Bits per byte(bpb) 지표가 낮을수록 성능이 좋으며, V5 e24는 DeepSeek V4 Pro, Kimi K2, Nemotron 3 Ultra 등 주요 경쟁 모델보다 낮은 bpb를 기록했다.

  • Private Code: V5 e24 (0.194) vs DeepSeek V4 Pro (0.202, 48배 효율)
  • Research Papers: V5 e24 (0.383) vs DeepSeek V4 Pro (0.404, 45배 효율)
  • Math Reasoning: V5 e24 (0.587) vs DeepSeek V4 Pro (0.678, 45배 효율)

검증 방법 및 데이터 오염 통제

평가의 신뢰성을 위해 vLLM, GB200, Fireworks 엔진 등을 통해 logprobs를 확인했다. 학습 데이터와 평가 데이터의 중첩을 방지하기 위해 96자 일치 또는 높은 Jaccard 유사도를 가진 문서를 제거했으며, 시퀀스 암기를 막기 위해 제3자 LLM으로 문서를 재작성하거나 요약하는 과정을 거쳤다. 또한 AIME 벤치마크는 외부 모델 오염 우려로 제외하고, 비공개 heldout competition math eval(400문제)을 사용했다.

강화 학습(RL) 성능 및 향후 계획

SFT나 distillation 없이 base model 단계에서 16k CoT 예산의 수학 RL을 수행한 결과, V5 e24는 heldout competition math에서 **Pass@1 72%**를 기록했다. 이는 GPT-6 Astra(100%), Claude 5.1(98%) 등에는 미치지 못하지만, Kimi K3(75%)와 유사한 수준이다. 특히 e24 모델은 pretraining compute 예산의 **0.2%**만 사용했을 때 AIME26 pass@1 90%를 돌파했다.

Magic AI는 향후 장기 horizon RL 스케일링, 배포 후 학습, 그리고 조 단위 파라미터 모델을 학습하는 세계 최소 팀 규모를 유지하며 pretraining 효율성을 계속 개선할 계획이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.