Google LiteRT-LM - 엣지 디바이스용 고성능 LLM 추론 프레임워크
·2026.04.22 09:31
핵심 내용
Google의 온디바이스 LLM 추론 엔진 LiteRT-LM이 공개됐다.
자세히 보기
Google이 프로덕션 수준의 온디바이스 LLM 추론 엔진인 LiteRT-LM을 공개했다.
Android, iOS, 웹, 데스크톱, IoT(Raspberry Pi) 같은 엣지 환경에서 대규모 언어 모델을 실행할 수 있도록 설계됐고, GPU/NPU 하드웨어 가속으로 추론 성능을 끌어올린다.
주요 기능은 다음과 같다.
- Gemma 4 지원 추가
- 멀티모달 입력 지원: 비전(이미지), 오디오
- CLI에서
--attachment옵션으로 이미지 첨부 추론 가능 - 에이전틱 워크플로우용 Function Calling(Tool Use) 내장
- Gemma, Llama, Phi-4, Qwen 등 다양한 모델 호환
uv tool install litert-lm후litert-lm run으로 바로 실행 가능
Google 제품에도 실제로 적용되고 있다.
- Chrome, Chromebook Plus, Pixel Watch에 온디바이스 GenAI 탑재
- Google AI Edge Gallery 앱으로 모바일에서 모델 즉시 실행 가능
지원 언어는 Kotlin, Python, **C++**이며, Swift 지원도 진행 중이다.
릴리스 현황은 v0.10.2가 최신이고, v0.10.1에서 Gemma 4와 CLI가 도입됐다. 이후 v0.8.0에서 데스크톱 GPU와 멀티모달, v0.7.0에서 NPU 가속이 추가됐다.
라이선스는 Apache-2.0이다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.