AI Briefing

Ling-3.0-Flash 공개

Ling-3.0-flash activates 5.1B params and claims parity with its lab's own 1T flagship

·2026.08.05 12:30

InclusionAI가 5.1B 활성 파라미터의 124B MoE 모델을 공개했다.

Ant Group 산하 InclusionAI가 Ling-3.0-Flash 가중치를 MIT 라이선스로 공개했다.

  • 전체 파라미터는 124B, 토큰당 활성화되는 파라미터는 약 5.1B다.
  • 512개 라우팅 전문가와 1개 공유 전문가 중 8개를 활성화한다.
  • 네이티브 하이브리드 선형 어텐션을 사용하며, 35개 KDA 레이어와 7개 게이티드 MLA 레이어를 5:1 비율로 교차 배치했다.
  • 연구팀은 자체 1T 파라미터 Ring-2.6-1T와 벤치마크 성능이 동급이거나 앞선다고 주장한다. 다만 수치는 모두 개발팀 자체 보고다.

출시 시점에는 GGUF와 llama.cpp를 지원하지 않으며, 공식 서빙 예시는 자체 SGLang·vLLM 포크와 GPU 4개를 요구한다. 활성 파라미터는 작지만 전체 124B 가중치를 메모리에 보유해야 하므로, 추론 비용과 모델 보유 비용 사이에는 차이가 남는다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.