AI Briefing

LM Studio Headless CLI와 Claude Code로 로컬에서 Google Gemma 4 실행하기

·2026.04.07 02:33

LM Studio의 새로운 CLI와 Gemma 4를 활용해 Claude Code를 로컬 환경에서 실행하는 방법을 안내한다.

Gemma 4Mixture-of-Experts(MoE) 구조를 채택하여, 26B 모델 중 4B 파라미터만 활성화함으로써 저사양 하드웨어에서도 고성능 추론을 지원한다. 256K의 긴 컨텍스트, 비전 입력, 함수 호출 기능을 갖춰 로컬 환경에 최적화되어 있다.

LM Studio 0.4.0은 새로운 Headless CLI인 **llmster**를 도입했다. 이를 통해 데스크톱 앱 없이도 lms 명령어로 모델 다운로드, 로드, 채팅, API 서버 실행이 가능하다. 특히 Anthropic 호환 API를 제공하여, Claude Code를 완전 오프라인 코드 어시스턴트로 활용할 수 있는 환경을 구축할 수 있다.

사용자는 다음과 같은 세밀한 하드웨어 튜닝을 통해 성능을 최적화할 수 있다:

  • 메모리 관리: --estimate-only 옵션으로 컨텍스트 길이에 따른 메모리 요구량을 예측하고 설정 가능
  • GPU 오프로딩: Apple Silicon의 통합 메모리 및 NVIDIA VRAM 활용 최적화
  • 병렬 요청 처리: 연속 배칭(continuous batching)을 통한 다중 요청 동시 처리
  • 효율성 향상: Flash Attention을 통한 KV 캐시 메모리 절감 및 TTL 설정을 통한 자동 모델 언로드

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.