지식과 추론을 분리해 효율을 높인 Intern-S2-Mobius 공개
[Paper] Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning
·2026.08.17 21:49
핵심 내용
지식 저장과 추론 과정을 분리하여 학습 효율과 추론 속도를 개선한 Mobius-v0 아키텍처를 제안한다.
자세히 보기
Mobius-v0는 지식 벡터를 저장하는 전역 공유 **Memory(FFN)**와 반복적 추론을 수행하는 다수의 **Reasoner(Self-Attn)**로 구성된 아키텍처다.
이 구조는 지식과 추론을 분리함으로써 지식 압축 성능을 높이고 추론 효율성을 극대화한다.
주요 실험 결과:
- 7B 모델 (Scratch 학습): 기존 7B Transformer 베이스라인과 유사한 성능을 달성하면서도, 학습 데이터는 **62.6%**만 사용했다.
- Intern-S2-Mobius (Qwen3.5-35B 기반 연속 사전 학습): 기존 모델과 대등한 성능을 유지하면서 엔드투엔드 추론 속도를 약 4배 향상시켰다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.