Sber, GigaChat-3.5-Reasoning 공개
GigaChat-3.5-Reasoning
·2026.09.10 21:19
핵심 내용
Sber가 MoE 구조의 GigaChat-3.5-Reasoning을 공개했으며, DeepSeek V4 Flash급 성능을 달성하면서 추론 토큰 사용량을 37% 줄였다.
자세히 보기
Sber가 새로운 추론 특화 모델 GigaChat-3.5-Reasoning을 공개했다. 이 모델은 432B-A28B MoE(Mixture of Experts) 구조를 채택했으며, 긴 컨텍스트 처리 효율성을 높이기 위해 Gated DeltaNet 기술을 적용했다.
학습 방식 및 성능
모델은 코드, 수학, 일반 등 특정 도메인 전문가 모델들을 CISPO 알고리즘으로 학습한 후, On-policy distillation 기법을 통해 단일 모델로 증류하는 방식으로 개발되었다. 자체 평가 결과, 이 모델은 DeepSeek V4 Flash Preview와 유사한 성능을 달성하면서도 추론 과정에서의 토큰 사용량을 37% 절감한 것으로 나타났다.
배포 및 접근성
모델 가중치는 Hugging Face에서 MIT 라이선스로 공개되어 있어 누구나 자유롭게 사용 및 수정이 가능하다. 또한 공식 웹사이트 giga.chat의 추론 탭을 통해 직접 테스트해 볼 수 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.