Cerebras Model Catalog (Website)
·2026.09.04 09:00
핵심 내용
Cerebras가 GPT OSS와 Qwen 3.8 모델을 공개 엔드포인트에서 제공하며, 모든 모델은 원본 상태의 비프닝(non-pruned) 버전임을 명시했다.
자세히 보기
Cerebras는 공개 엔드포인트를 통해 GPT OSS와 Qwen 3.8 모델을 제공한다. GPT OSS는 약 3000 tokens/s의 속도로 작동하며, 무료 티어에서 64k, 유료 티어에서 128k의 컨텍스트 윈도우를 지원한다. Qwen 3.8 역시 유사한 속도 및 컨텍스트 제한을 가진다.
모델 압축 및 품질 관리
Cerebras는 공개 엔드포인트에서 제공되는 모든 모델이 원본(unpruned) 상태임을 강조한다. 프루닝(pruning) 기법은 모델 구조를 변경하여 성능 저하를 유발할 수 있으므로, 연구용으로 개발된 REAP 프루닝 모델은 Hugging Face에서만 공유되고 API로는 제공되지 않는다.
대신 Cerebras는 저장 시 **선택적 가중치 양자화(selective weight-only quantization)**를 적용한다. 이는 메모리 효율성을 높이기 위해 가중치를 FP8 또는 FP4로 저장하되, 연산 시에는 고품질 유지를 위해 즉시 역양자화(dequantization)하여 고정밀도로 처리하는 방식이다. 활성값(activations)과 KV 캐시는 항상 완전한 정밀도로 유지된다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.