AI Briefing

Artificial Analysis, 모바일 기기용 소형 LLM 추론 성능 벤치마크 공개

·2026.08.28 04:12

핵심 내용

Artificial Analysis가 Liquid AI와 협력해 iPhone 17 Pro 기준 8GB 이하 소형 LLM의 지능 및 추론 속도를 측정한 벤치마크를 공개했다.

자세히 보기

Artificial Analysis가 Liquid AI와 협력하여 모바일 기기에서 실행되는 소형 LLM의 실제 추론 성능과 지능을 측정한 벤치마크 결과를 공개했다. 이번 평가는 iPhone 17 Pro를 기준으로 진행되었으며, 양자화 후 8GB 메모리(KV 캐시 포함, 8K 컨텍스트) 내에 저장되는 모델들을 대상으로 한다.

평가 지표 및 방법론

평가에는 실제 모바일 사용 환경을 반영한 5가지 벤치마크(BFCL 서브셋, IFBench, AA-Omniscience, GPQA Diamond, MATH-500)가 사용되었으며, 컨텍스트는 16K 토큰으로 제한했다. 주요 측정 항목은 다음과 같다:

  • 모델 지능: 위 5개 평가의 평균 점수
  • 추론 성능: 1024 토큰 프롬프트 처리 및 256 토큰 응답 생성에 걸리는 엔드투엔드(E2E) 시간
  • 토큰 효율성: 16K 토큰 제한으로 인해 생성이 중단된 비율

주요 평가 대상 모델

Gemma 4 31B, LFM2.5-2.6B, Ling 3.0 Tiny, Ministral 3 시리즈, Qwen3.5/3.6 시리즈 등 주요 소형 모델들이 포함되었다. 일부 모델은 기기 메모리 제한이나 시간 초과로 인해 성능 측정이 제외되기도 했다. Artificial Analysis는 Liquid AI의 추론 측정 과정을 독립적으로 검증했다고 밝혔다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.