AI Briefing
추천

Qwen3.8-Flash-Next: 궁극적 비용 효율성을 향한 새로운 아키텍처

·2026.08.26 21:30

핵심 내용

Qwen3.8-Flash-Next가 1/9의 비용으로 기존 모델 대비 우수한 성능을 입증했다.

자세히 보기

Qwen 팀은 Qwen3.8-Flash-Next를 공개하며, 이는 Qwen4 아키텍처의 초기 프리뷰 역할을 수행하는 멀티모달 MoE 모델입니다. 기존 Qwen3.5~3.8 시리즈에 적용된 하이브리드 Gated DeltaNet + Gated Attention 설계의 진화형으로, 커뮤니티가 Qwen4 정식 출시 전에 아키텍처를 검토할 수 있도록 선공개되었습니다.

이 모델은 어텐션, 레지듀얼, 임베딩, 최적화 네 가지 측면에서 체계적으로 업그레이드되었습니다.

  • 어텐션: GDN과 Qwen Sparse Attention(QSA) 하이브리드 아키텍처를 적용해 긴 시퀀스 처리 비용을 대폭 절감했습니다.
  • 레지듀얼: Gated Residual(GR)을 통해 레지듀얼 스트림을 4개 분기로 확장하고 동적 게이트로 정보 흐름을 제어해 학습 안정성을 강화했습니다.
  • 임베딩: N-gram Embedding을 활용해 추가 계산 부담 없이 모델 용량을 확장하며, 호스트 메모리 오프로딩 및 비동기 프리페칭을 지원합니다.
  • 최적화: Muon 옵티마이저를 정교화하고, 새로운 아키텍처에 맞춘 스케일링 법칙을 재적합했습니다.

125B 파라미터의 메인 모델과 51B N-gram 임베딩을 갖추고 있으며, 토큰당 6B 파라미터만 활성화됩니다. Qwen3.7-Plus 대비 학습 비용은 약 1/9로 줄었으나, 코딩 및 오피스 작업 성능은 우월한 것으로 나타났습니다. 기본 262,144 토큰 컨텍스트를 지원하며, YaRN을 통해 1,000,000 토큰까지 확장 가능합니다.

벤치마크 결과, SWE-bench Pro에서 62.5점, GPQA Diamond에서 91.7점을 기록하며 경쟁 모델들을 상회했습니다. QwenCloud에서는 입력 토큰당 0.16 USD, 출력 토큰당 0.47 USD의 가격으로 제공될 예정입니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.