AI Briefing

WebLLM, WebGPU 기반 브라우저 내 LLM 추론 엔진 공개

·2026.09.02 23:02

핵심 내용

서버 없이 브라우저에서 WebGPU로 LLM을 구동하는 WebLLM이 OpenAI API 호환성을 지원하며 공개됐다.

자세히 보기

WebLLM은 서버 지원 없이 웹 브라우저 내에서 직접 대규모 언어 모델(LLM) 추론을 수행할 수 있는 고성능 엔진이다. WebGPU를 활용해 하드웨어 가속을 적용하며, MLC LLM 프로젝트의 컴패니언 프로젝트로 개발되었다.

주요 특징

  • OpenAI API 호환: 스트리밍, JSON 모드, 함수 호출(WIP) 등 OpenAI API와 동일한 인터페이스를 제공하여 기존 애플리케이션과의 연동이 쉽다.
  • 다양한 모델 지원: Llama 3, Phi 3, Gemma, Mistral, Qwen(통의천문) 등 주요 오픈소스 모델을 네이티브로 지원한다.
  • 구조화된 JSON 생성: WebAssembly 부분을 통해 최적화된 성능으로 JSON 모드 구조화 생성을 지원한다.
  • 플러그 앤 플레이: NPM, Yarn, CDN 등을 통해 쉽게 설치할 수 있으며, Chrome 확장 프로그램 및 Web Worker/Service Worker를 지원하여 UI 성능을 최적화한다.

활용 및 배포

개발자는 @mlc-ai/web-llm 패키지를 설치하거나 CDN을 통해 모듈을 임포트하여 CreateMLCEngine() 팩토리 함수로 엔진을 생성하고 모델을 로드할 수 있다. 이를 통해 프라이버시를 보호하면서도 GPU 가속의 이점을 누리는 AI 어시스턴트나 채팅봇을 구축할 수 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.