IQuestLab, IQuest-Q1 MoE 모델 출시
IQuestLab/IQuest-Q1 MoE 320B-15B
·2026.09.29 19:22
핵심 내용
IQuestLab이 총 320B 파라미터, 토큰당 15B 활성화되는 MoE 모델 IQuest-Q1을 공개했다.
자세히 보기
IQuestLab이 에이전트 코딩, 추론, 다단계 도구 사용을 위해 설계된 Mixture-of-Experts(MoE) 모델 IQuest-Q1을 공개했다. 이 모델은 총 320B 파라미터를 갖췄으며, 토큰당 15B 파라미터만 활성화되어 용량과 추론 효율의 균형을 맞췄다.
모델 사양
에이전트 기능을 지원하기 위해 하이브리드 어텐션 패턴과 특정 트랜스포머 구성을 적용했다.
- 아키텍처: 88개 트랜스포머 레이어, 3,072개의 숨겨진 차원(hidden dimensions).
- 어텐션: 48개 Query 헤드와 8개 Key/Value 헤드, 헤드 차원은 128. Sliding Window Attention(SWA) 3개 레이어와 Standard Attention 1개 레이어가 번갈아 배치된다.
- 슬라이딩 윈도우: SWA 레이어의 윈도우 크기는 4,096 토큰.
- 익스퍼트: 총 256개 익스퍼트 중 토큰당 8개 활성화.
- 컨텍스트 윈도우: 최대 524,288 토큰 지원.
- Multi-Token Prediction(MTP): 학습 시 2개의 독립적인 MTP 레이어, 추론 시 1개의 재귀적 MTP 레이어를 사용하며 추론 시 슬라이딩 윈도우 크기는 512.
이 모델은 Hugging Face에서 제공되며, 복잡한 코딩 및 추론 작업을 위해 높은 파라미터 수와 희소 활성화를 결합해 효율적인 배포가 가능하다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.