ZAYA1-74B 미리보기 공개
ZAYA1-74B-Preview: Scaling Pretraining on AMD
·2026.05.08 07:50
핵심 내용
Zyphra가 AMD MI300x로 훈련한 ZAYA1-74B-Preview를 공개했다.
1 / 2
자세히 보기
Zyphra가 ZAYA1-74B-Preview를 공개했다. 이 모델은 4B active / 74B total 파라미터의 MoE 기반 pre-RL reasoning base checkpoint로, RL 후학습이나 instruction/chat 튜닝을 거치지 않았다. 가중치는 Apache 2.0으로 Hugging Face에 공개됐다.
- 사전학습은 2단계로 진행됐고, 일반 지식 중심 단계와 수학·코딩·과학 역량 강화 단계에서 합계 약 15T tokens를 학습했다.
- 미드트레이닝은 3단계로 이어졌으며, 컨텍스트를 32k → 128k → 256k로 늘렸고 각 단계는 약 1T tokens 규모였다.
- 아키텍처는 긴 컨텍스트 효율을 위해 모든 다른 attention layer를 **4K SWA(sliding window attention)**로 대체했고, Zyphra의 CCA attention variant를 사용했다.
- 학습은 AMD MI300x GPU와 Pensando Pollara 인터커넥트 위에서 수행됐고, expert-context-parallel folding과 CCA compute efficiency로 긴 컨텍스트 학습 효율을 끌어올렸다고 밝혔다.
Zyphra는 이 체크포인트가 최종 RL 모델은 아니지만 pass@4 결과가 경쟁력 있다고 설명했다. 회사는 현재 AMD에서 full-scale RL을 진행 중이며, 최종 ZAYA1-74B는 수주 내 공개할 계획이다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.