ZAYA1-74B 미리보기 공개
ZAYA1-74B-Preview: Scaling Pretraining on AMD
·2026.05.08 07:50
Zyphra가 AMD MI300x로 훈련한 ZAYA1-74B-Preview를 공개했다.
Zyphra가 ZAYA1-74B-Preview를 공개했다. 이 모델은 4B active / 74B total 파라미터의 MoE 기반 pre-RL reasoning base checkpoint로, RL 후학습이나 instruction/chat 튜닝을 거치지 않았다. 가중치는 Apache 2.0으로 Hugging Face에 공개됐다.
- 사전학습은 2단계로 진행됐고, 일반 지식 중심 단계와 수학·코딩·과학 역량 강화 단계에서 합계 약 15T tokens를 학습했다.
- 미드트레이닝은 3단계로 이어졌으며, 컨텍스트를 32k → 128k → 256k로 늘렸고 각 단계는 약 1T tokens 규모였다.
- 아키텍처는 긴 컨텍스트 효율을 위해 모든 다른 attention layer를 **4K SWA(sliding window attention)**로 대체했고, Zyphra의 CCA attention variant를 사용했다.
- 학습은 AMD MI300x GPU와 Pensando Pollara 인터커넥트 위에서 수행됐고, expert-context-parallel folding과 CCA compute efficiency로 긴 컨텍스트 학습 효율을 끌어올렸다고 밝혔다.
Zyphra는 이 체크포인트가 최종 RL 모델은 아니지만 pass@4 결과가 경쟁력 있다고 설명했다. 회사는 현재 AMD에서 full-scale RL을 진행 중이며, 최종 ZAYA1-74B는 수주 내 공개할 계획이다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.