AI Briefing

Launch HN: General Instinct (YC P26) – 엣지 디바이스를 위한 프론티어 모델

·2026.06.06 01:33

MoE 모델을 엣지 디바이스에서 구동할 수 있도록 최적화하는 **InstinctRazor** 기술을 공개했다.

General Instinct이 대규모 MoE(Mixture-of-Experts) 모델을 저사양 엣지 하드웨어에서 효율적으로 실행하기 위한 기술인 InstinctRazor를 오픈소스로 공개했다.

이 기술을 통해 약 245GB(BF16) 크기의 Qwen3.5-122B-A10B 모델을 48GiB GGUF 형식으로 압축하는 데 성공했다. 압축된 모델은 Gemma-4-26B-A4B보다 크기가 작음에도 불구하고, MMLU-ProGPQA-D와 같은 벤치마크에서 더 높은 성능을 기록했다.

주요 기술적 특징은 다음과 같다:

  • 선택적 양자화: 라우터, 노름(norms), Gated-DeltaNet/SSM 레이어 등 항상 활성화되는 부분은 유지하고, 라우팅되는 전문가(experts) 부분만 공격적으로 양자화한다.
  • 온폴리시 증류(On-policy distillation): 양자화 과정에서 손실된 성능을 복구하기 위해 사용된다.
  • 메모리 효율성: 전문가를 시스템 RAM에서 스트리밍하는 방식을 통해 '소형 GPU' 구성에서도 구동이 가능하다. 8k 컨텍스트 윈도우 기준 피크 VRAM 사용량은 약 7.6~8GB 수준이다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.