Magic, DeepSeek V4 Pro Base와 유사한 성능을 약 50배 적은 FLOPs로 달성한 사전학습 연구 발표
핵심 내용
Magic은 새 사전학습 레시피가 DeepSeek V4 Pro Base와 유사한 성능에 약 50배 적은 FLOPs로 도달했으며, 이후 약 10배 확장한 학습에서는 공개 base 모델들을 perplexity 평가에서 앞섰다고 밝혔다.
자세히 보기
Magic 팀이 주요 오픈 웨이트 base 모델 대비 10배 이상 연산 효율적이라고 평가한 신규 프리트레인 레시피의 연구 결과를 발표했다. 이 레시피는 DeepSeek V4 Pro Base와 유사한 성능에 약 50배 적은 FLOPs(GB200 기준 약 50만 달러)로 도달했다. 이후 연산량을 약 10배로 확장한 학습(약 400만 달러)에서는 모든 공개 오픈 base 모델보다 perplexity 평가에서 의미 있게 우월한 성능을 보였다. 모델 출시는 향후 계획으로 제시했다.
연산 효율 및 성능 비교
Magic은 heldout 데이터의 bits per byte(bpb) 손실을 측정하고 scaling law를 적합해 같은 손실에 도달하는 데 필요한 연산량을 추정했다. 낮은 bpb가 더 나은 결과를 뜻하며, 다음은 V5 e24와 DeepSeek V4 Pro의 bpb 측정값 및 해당 분야에서 새 레시피의 연산 효율 추정 배수다.
- Reasoning (Math): DeepSeek V4 Pro 대비 127배 효율 (0.587 bpb vs 0.678 bpb)
- Private Code Repos: DeepSeek V4 Pro 대비 48배 효율 (0.194 bpb vs 0.202 bpb)
- Heldout Research Papers: DeepSeek V4 Pro 대비 45배 효율 (0.383 bpb vs 0.404 bpb)
이 배수는 bpb 값의 단순 비율이나 V5 e24와 비교 모델의 실제 학습 FLOPs 비율이 아니라, 적합한 scaling law를 이용한 동일 성능 도달 연산량 비교다.
검증 방법 및 데이터 오염 방지
모델의 일반화 능력을 객관적으로 평가하기 위해 엄격한 검증 프로세스를 적용했다. 데이터 오염(contamination)을 방지하기 위해 자체 비공개 코드베이스, Kimi K3로 생성한 CoT 기반 수학 문제, 최근 저인용 연구 논문을 사용했으며, 96자 정규화 텍스트 매칭 또는 Jaccard 유사도 기준을 초과하는 문서를 제거했다. 또한, 서드파티 프론티어 LLM으로 문서를 재작성하여 시퀀스 암기를 보상받지 않도록 설계했다.
향후 계획 및 로드맵
Magic 팀은 조 파라미터 모델을 학습하는 세계 최소 규모 팀 중 하나로, 향후 장시간(long-horizon) RL 스케일링, 배포 후 장문 컨텍스트 학습, 그리고 좁게 유도된 잠재 지식(latent knowledge)에 대한 정렬(alignment) 기법 개발에 집중할 계획이다. 또한, 배포 게이트와 RL 훈련 중 안전 요구사항을 포함한 AGI Readiness Policy 업데이트를 예고했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.