알리바바, Qwen4 아키텍처 미리 공개… 125B 중 6B만 활성화
핵심 내용
알리바바가 Qwen4 아키텍처를 미리 공개하며 추론 비용 절감을 강조했다.
자세히 보기
알리바바 Qwen 팀은 Qwen4에 적용할 아키텍처를 미리 보여주는 Qwen3.8-Flash-Next를 공개했다. 이 모델은 총 125B개의 파라미터를 갖추고 있으나, 토큰당 실제로 활성화되는 파라미터는 6B에 불과하다. 이는 이전 모델 Qwen3.7-Plus(397B 파라미터, 17B 활성화) 대비 활성 컴퓨트 사용량이 약 3분의 1 수준으로 줄어든 것이다.
팀의 주된 관심사는 성능이 아니라 추론 비용이다. 에이전트 작업과 매우 긴 컨텍스트가 표준 워크로드가 되는 상황에서 아키텍처 선택이 추론 비용에 미치는 영향을 줄이는 것이 목표다.
주요 기술적 변화는 네 가지다. 기존 개별 토큰 선택 방식 대신 마이크로 블록 단위로 동작하는 새로운 스파스 어텐션 스킴, 레이어 간 정보 전달을 제어하는 게이티드 리idual 메커니즘, 그리고 배치 사이즈 웜업을 완전히 제거한 학습 레시피가 포함된다.
특이한 변화는 전문가(expert)를 추가하는 대신 51B개의 파라미터를 별도 임베딩으로 결합한 것이다. 이 임베딩은 2~3자 단편으로 인덱싱되며, 계산 비용이 적게 들고 메모리가 제한된 가속기에서 오프로드하기가 쉽다. 이는 수출 통제로 최상위 칩 구매가 어려운 중국 연구소의 현실을 반영한 설계로 해석된다.
다만 공개된 성능 수치들은 알리바바 자체 벤치마크 기반이며, 독립적 검증은 이루어지지 않았다. 모델 카드에는 'Humanity's Last Exam' 점수가 GPT-4o에 의해 채점되었다는 점이 명시되어 있다.
라이선스 측면에서는 유럽의 AI Act 적용 여부가 쟁점이다. 가중치는 Hugging Face의 qwen-community 라이선스 아래 공개되었으나, 알리바바가 대규모 상업 사용자에게 비용을 청구할 의사가 있다는 보도가 나왔다. AI Act는 유료 또는 수익화되는 컴포넌트에 대해 오픈소스 면제를 적용하지 않도록 규정하고 있어, Qwen 기반 모델을 사용하는 유럽 기업들에게 법적 불확실성을 안겨줄 수 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.