AI Briefing

Sber, GigaChat-3.5-Reasoning 공개

GigaChat-3.5-Reasoning

·2026.09.10 21:19

핵심 내용

Sber가 MoE 구조의 GigaChat-3.5-Reasoning을 공개했으며, DeepSeek V4 Flash급 성능을 달성하면서 추론 토큰 사용량을 37% 줄였다.

자세히 보기

Sber가 새로운 추론 특화 모델 GigaChat-3.5-Reasoning을 공개했다. 이 모델은 432B-A28B MoE(Mixture of Experts) 구조를 채택했으며, 긴 컨텍스트 처리 효율성을 높이기 위해 Gated DeltaNet 기술을 적용했다.

학습 방식 및 성능

모델은 코드, 수학, 일반 등 특정 도메인 전문가 모델들을 CISPO 알고리즘으로 학습한 후, On-policy distillation 기법을 통해 단일 모델로 증류하는 방식으로 개발되었다. 자체 평가 결과, 이 모델은 DeepSeek V4 Flash Preview와 유사한 성능을 달성하면서도 추론 과정에서의 토큰 사용량을 37% 절감한 것으로 나타났다.

배포 및 접근성

모델 가중치는 Hugging Face에서 MIT 라이선스로 공개되어 있어 누구나 자유롭게 사용 및 수정이 가능하다. 또한 공식 웹사이트 giga.chat의 추론 탭을 통해 직접 테스트해 볼 수 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.