Cerebras, Qwen 3.8 27B 모델 초당 1,500토큰 속도로 제공
·2026.09.04 06:23
핵심 내용
Cerebras가 공개 엔드포인트에서 Qwen 3.8 27B 모델을 초당 약 1,500토큰의 속도로 제공하기 시작했다.
자세히 보기
Cerebras가 공개 API 엔드포인트를 통해 Qwen 3.8 27B 모델을 제공하며, 추론 속도는 초당 약 1,500토큰이다. 이 모델은 270억 파라미터 규모로, 무료 티어와 종량제 티어 모두에서 사용 가능하며 컨텍스트 길이는 각각 64k와 128k를 지원한다.
모델 압축 및 정량화 정책
Cerebras는 공개 엔드포인트에서 제공되는 모든 모델이 원본 상태의 비프루닝(unpruned) 버전임을 명시했다. 연구용으로 개발된 REAP(가중치 기반 전문가 활성화 프루닝) 모델은 Hugging Face에서 공개되지만, 생산 API에서는 제공되지 않는다.
가중치 정량화는 메모리 효율성을 위해 부분적으로 적용되지만, 연산 시에는 높은 정밀도로 디퀀타이징하여 수행된다. 특히 어텐션, KV 캐시, 활성값은 정량화되지 않은 상태로 유지되어 모델 성능을 보존한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.