5.17.02주 전
Release 5.17.0
핵심 내용
Hugging Face Transformers v5.17.0은 780B 파라미터의 HYV4 MoE 모델과 VibeVoice 음성 합성 프레임워크를 지원하는 새로운 모델 아키텍처를 도입했습니다.
자세히 보기
주요 신규 기능
-
HYV4 모델 지원 추가: 780B 파라미터의 Mixture-of-Experts(MoE) 언어 모델 Hy4-Preview를 지원합니다. 각 토큰당 49B 파라미터가 활성화되며, 1M 토큰의 컨텍스트 윈도우를 제공합니다.
- Multi-head Latent Attention (MLA): 키와 값을 저랭크 잠재 변수로 압축하여 효율성을 높입니다.
- DeepSeek Sparse Attention (DSA): 가벼운 인덱서를 사용하여 쿼리당 상위
index_topk키를 선택합니다.indexer_types에서"full"로 표시된 레이어만 인덱서를 실행하고,"shared"레이어는 이전 전체 레이어의 선택을 재사용합니다. - Gated MLA with learnable attention sinks: 각 헤드마다 softmax에 참여하지만 값에는 기여하지 않는 sink logit을 소유합니다.
- Independent Hyper-Connections (iHC): 평범한 잔차 경로 대신
hc_mult개의 병렬 잔차 스트림을 사용하여 서브레이어 전후로 병합 및 재분배합니다. - 참고: 다중 토큰 예측(MTP) 레이어는 실행되지 않으며, 체크포인트에 포함된 해당 가중치는 로드 시 무시됩니다(다른 런타임의 추측 디코딩을 위해 유지됨).
-
VibeVoice 프레임워크 지원: 새로운 음성 합성 프레임워크인 VibeVoice를 지원합니다.