Zyphra, ZAYA1-8B 공개
ZAYA1-8B: Frontier intelligence density.
·2026.05.08 01:05
Zyphra가 AMD Instinct MI300에서 학습한 8B MoE 모델 ZAYA1-8B를 공개했다.
ZAYA1-8B는 760M active / 8.4B total 규모의 MoE 언어모델로 공개됐다. AMD Instinct MI300 기반 스택에서 pretraining, midtraining, SFT까지 모두 진행됐고, 1,024개 MI300x 노드와 AMD Pensando Pollara 인터커넥트를 쓴 IBM 공동 구축 클러스터가 사용됐다.
벤치마크에서는 수학·코딩·추론에서 강한 성능을 보였다. 모델 카드에는 AIME'26 89.1, HMMT'26 71.6, LiveCodeBench-v6 65.8, GPQA-Diamond 71.0, MMLU-Pro 74.2가 제시됐고, 같은 급의 Qwen3/Qwen3.5·Gemma 4 계열과 더 큰 오픈웨이트 모델들과도 비교됐다.
핵심 구조는 다음과 같다.
- CCA(Compressed Convolutional Attention)
- expert 선택용 MLP router
- 깊이에 따른 residual norm을 제어하는 learned residual scaling
여기에 Markovian RSA test-time compute 방식을 더해 추가 성능을 끌어올렸고, Apache-2.0 라이선스로 Hugging Face와 Zyphra Cloud에 공개됐다. 총 파라미터가 작아 온디바이스 배포 가능성도 제시됐다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.