AI Briefing

Google LiteRT-LM - 엣지 디바이스용 고성능 LLM 추론 프레임워크

·2026.04.22 09:31

핵심 내용

Google의 온디바이스 LLM 추론 엔진 LiteRT-LM이 공개됐다.

자세히 보기

Google이 프로덕션 수준의 온디바이스 LLM 추론 엔진인 LiteRT-LM을 공개했다.

Android, iOS, 웹, 데스크톱, IoT(Raspberry Pi) 같은 엣지 환경에서 대규모 언어 모델을 실행할 수 있도록 설계됐고, GPU/NPU 하드웨어 가속으로 추론 성능을 끌어올린다.

주요 기능은 다음과 같다.

  • Gemma 4 지원 추가
  • 멀티모달 입력 지원: 비전(이미지), 오디오
  • CLI에서 --attachment 옵션으로 이미지 첨부 추론 가능
  • 에이전틱 워크플로우용 Function Calling(Tool Use) 내장
  • Gemma, Llama, Phi-4, Qwen 등 다양한 모델 호환
  • uv tool install litert-lm 후 litert-lm run으로 바로 실행 가능

Google 제품에도 실제로 적용되고 있다.

  • Chrome, Chromebook Plus, Pixel Watch에 온디바이스 GenAI 탑재
  • Google AI Edge Gallery 앱으로 모바일에서 모델 즉시 실행 가능

지원 언어는 Kotlin, Python, **C++**이며, Swift 지원도 진행 중이다.

릴리스 현황은 v0.10.2가 최신이고, v0.10.1에서 Gemma 4와 CLI가 도입됐다. 이후 v0.8.0에서 데스크톱 GPU와 멀티모달, v0.7.0에서 NPU 가속이 추가됐다.

라이선스는 Apache-2.0이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.