AI Briefing

inclusionAI, Ling-3.0-flash-VL 공개

inclusionAI/Ling-3.0-flash-VL · Hugging Face

·2026.09.09 00:57

핵심 내용

inclusionAI가 1M 토큰 컨텍스트와 MoE 아키텍처를 갖춘 멀티모달 모델 Ling-3.0-flash-VL을 공개했다.

자세히 보기

inclusionAI가 텍스트, 이미지, 비디오를 통합 이해하는 멀티모달 LLM Ling-3.0-flash-VL을 공개했다. 이 모델은 Ling-3.0-flash의 언어 및 추론 능력을 계승하면서도 네이티브 이미지 및 비디오 이해 기능을 확장했다.

아키텍처 및 성능

모델은 총 124B 파라미터를 보유하지만, MoE(Mixture of Experts) 구조를 통해 토큰당 5.5B 파라미터만 활성화하여 추론 효율성을 높였다. 최대 1M 토큰의 컨텍스트 윈도우를 지원하며, 42계층의 하이브리드 백본(KDA와 Gated MLA 레이어를 5:1 비율로 교대 배치)을 채택해 긴 컨텍스트 처리를 최적화했다.

비전 처리 기술

비전 인코더(ViT)와 2계층 MLP 프로젝터를 통해 시각적 특징을 텍스트 표현과 정렬한다. 특히 VideoRoPE 기술을 적용해 공간적 위치와 시간적 순서를 인코딩함으로써, 이벤트 위치 추적, 장기 비디오 질문 답변, 비디오 클립 편집 등 시간 변화가 포함된 작업을 수행할 수 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.