AI Briefing

메모리 제약 장치에서 비전-언어 모델 파인튜닝

·2026.01.09 01:41

핵심 내용

SharpZO는 forward pass만으로 VLM을 파인튜닝해 정확도와 속도를 높였다.

자세히 보기

비전-언어 모델(VLM) 파인튜닝은 보통 backpropagation에 의존하지만, 이는 계산과 메모리 비용이 커서 자원 제약이 큰 엣지 장치에서는 부담이 크다. 이를 대체하는 zeroth-order(ZO) 방식은 forward pass만 사용하지만, 기존 방법들은 정확도와 수렴 속도에서 backpropagation 기반 학습에 크게 못 미쳤다.

핵심 문제는 ZO의 높은 분산과 local search 특성이다. 추정된 gradient가 불안정해지기 쉽고, loss landscape의 더 나은 전역 해를 찾지 못한 채 지역 최적점에 갇힐 수 있다.

이에 따라 NeurIPS 2025에서 SharpZO를 제안했다. SharpZO는 forward pass만으로 VLM을 미세 조정하는 hybrid sharpness-aware zeroth-order optimization으로, 두 단계로 작동한다.

  • 1단계: global exploration

    • CMA-ES(covariance-matrix adaptation evolution strategy)를 사용해 loss landscape의 sharpness를 완화한다.
    • 분포의 평균과 covariance matrix를 함께 갱신하고, 현재 분포에서 발생할 수 있는 worst-case loss를 반영한 항을 loss function에 추가해 더 매끄러운 초기점을 만든다.
  • 2단계: local search

    • 수정된 sparse ZO로 정교한 탐색을 수행한다.
    • 기존처럼 작은 gradient 항을 단순히 버리는 대신, gradient vector를 mean과 standard deviation 기준으로 정규화해 이상치 추정치를 줄이고 더 안정적으로 최적점을 찾는다.

평가에서는 CLIP backbone을 사용해 11개 downstream task를 테스트했다. SharpZO는 ZIP과 BlackVIP 같은 forward-only 방법보다 평균 최대 7% 높은 정확도를 보였고, 일부 과제에서는 backpropagation이 필요한 CoOP에 근접한 성능을 냈다.

속도도 개선됐다. ImageNet에서 SharpZO는 목표 정확도에 15.3분 만에 도달해, ZIP의 19분과 BlackVIP의 170분보다 빨랐다. gradient storage를 피하기 때문에 메모리 사용량도 낮고, ImageNet-Sketch나 ImageNet-A 같은 분포 이동 환경에서도 baseline보다 더 강한 성능을 보였다.

다만 현재 SharpZO는 prompt tuning에 최적화되어 있어 full-model fine-tuning으로 확장하는 일은 남아 있다. 또한 sharpness-aware CMA-ES warmup 단계에는 coordinate-wise gradient estimation(CGE) 이 필요해 고차원 설정에서는 계산 비용이 커질 수 있다. 그래서 이 방법은 현재로서는 parameter-efficient fine tuning(PEFT) 에 특히 적합하다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.