Cerebras, Kimi K2.6를 실행 중
·2026.05.20 09:00
Cerebras가 Kimi K2.6을 실행 중이라고 밝혔다.
Cerebras 관련 X(트위터) 스레드가 묶여 있으며, 최근에는 Cerebras Inference의 성능 향상이 핵심으로 소개된다. 회사는 Llama3.1-70B 처리 속도를 650 t/s에서 2,100 t/s로 끌어올렸다고 밝히며, GPU 대비 16배 빠르다고 주장했다.
이전 발표들에서는 Cerebras Inference가 8B 모델에서 1,800 tokens/s, 70B 모델에서 450 tokens/s를 제공한다고 설명했고, Llama3.1 추론 API의 속도와 가격 경쟁력을 강조했다. 또한 첫 토큰 응답 지연이 실시간 애플리케이션에서 중요하다고 짚으며, wafer-scale 통합의 장점을 부각했다.
스레드에는 다른 과거 발표도 함께 포함된다.
- BTLM-3B-8K: 3B 파라미터 모델로, 7B급 성능과 8K 컨텍스트를 목표로 했다고 소개
- Condor Galaxy-1: 64개 CS-2 시스템으로 구성된 4 exaflop급 AI 슈퍼컴퓨터 발표
- SlimPajama-627B: RedPajama를 정제·중복 제거한 대규모 공개 데이터셋
- Cerebras-GPT: 111M~13B 규모의 GPT 계열 모델 공개
전체적으로 Cerebras가 추론 성능, 대규모 학습 인프라, 공개 모델·데이터셋을 동시에 밀어붙이고 있음을 보여준다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.