AI Briefing

Ling-2.6-flash 오픈소스 공개

Ling-2.6-flash

·2026.04.29 00:43

Ling-2.6-flash가 오픈소스로 공개돼 4× H20에서 최대 340 tok/s를 기록했다.

Ling-2.6-flash가 공식 오픈소스로 공개됐다. 총 104B 파라미터, 활성 7.4B 파라미터의 instruct 모델이다.

  • 기존 GQA1:7 MLA + Lightning Linear 하이브리드 구조로 바꾸고, sparse MoE를 결합해 추론 효율을 끌어올렸다.
  • 4× H20-3e 환경(TP=4, Batch Size = 32)에서 최대 340 tok/s를 기록했고, prefill과 decode throughput은 최대 약 4배까지 개선된다고 설명했다.
  • 전체 Artificial Analysis 평가에서는 15M tokens만 사용하면서도 경쟁력 있는 성능을 유지했다고 밝혔다.
  • BFCL-V4, TAU2-bench, SWE-bench Verified, Claw-Eval, PinchBench 등 agent 벤치마크와 일반 지식, 수학 추론, instruction following, long-context understanding에서 강점을 보였다고 밝혔다.
  • SGLang 권장 구성과 vLLM 지원을 함께 제공했으며, MTP (Multi-Token Prediction) 버전은 공식 SGLang의 버그 때문에 패치 브랜치를 따로 안내했다.
  • 한계로는 복잡한 상황의 tool hallucination, 중영 전환, 복잡한 지시 준수 개선이 남아 있다고 적었다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.