AI Briefing

llama.cpp, Ling 3.0 VL 지원 추가

model : add Ling 3.0 VL support by aetherbird · Pull Request #29151 · ggml-org/llama.cpp

·2026.09.24 17:36

핵심 내용

llama.cpp가 124B 파라미터 희소 MoE 기반 Ling 3.0 VL 멀티모달 모델 지원 기능을 추가했다.

자세히 보기

llama.cpp가 텍스트 추론과 함께 이미지 및 영상을 네이티브로 이해하도록 설계된 멀티모달 모델 Ling 3.0 flash-VL 지원 기능을 병합했다. 이 모델은 총 124B 파라미터를 갖춘 희소 MoE 아키텍처를 적용해 토큰당 5.5B 파라미터만 활성화함으로써 용량을 유지하면서 추론 효율을 최적화했다.

아키텍처 및 기능

이 모델은 에이전트 워크플로우에 시각 정보를 통합하기 위해 다음과 같은 핵심 구성 요소를 활용한다:

  • 시각 처리: ViT 시각 인코더가 이미지와 영상에서 특징을 추출하고, 2층 MLP 프로젝터를 통해 텍스트 표현과 정렬한다.
  • 시간적 이해: VideoRoPE가 공간 및 시간적 위치를 인코딩하여 이벤트 위치 파악과 장시간 영상 분석 같은 작업을 가능하게 한다.
  • 장문 컨텍스트 효율성: 42층 하이브리드 백본이 KDA와 Gated MLA 레이어를 5:1 비율로 교대로 배치해 텍스트, 이미지, 영상, 확장된 에이전트 작업 이력 전반에서 장문 컨텍스트 처리를 효율적으로 수행하며 최대 256K 토큰의 컨텍스트 윈도우를 지원한다.

이번 업데이트로 llama.cpp 개발자들은 Ling 3.0 VL을 활용해 통합 멀티모달 추론, 계획, 검증 작업을 배포할 수 있게 됐다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.