AI Briefing

효율적인 파인튜닝을 위한 LoRA 타깃 모듈 선택 최적화

·2026.03.19 23:39

핵심 내용

Nova 2.0 Lite 기준, LoRA는 **o_proj**만 붙여도 효율·정확도 균형이 가장 좋았다.

자세히 보기

LoRA는 원본 모델 가중치를 고정한 채 특정 sublayer에 작은 adapter를 넣어 파라미터 업데이트 비용을 줄인다. 그만큼 어디에 adapter를 넣느냐가 정확도와 latency, 추론 비용을 동시에 좌우한다.

Amazon은 Nova 2.0 Lite를 기준으로, 대부분의 고객 사용 사례에 통하는 표준 target-module 구성을 찾기 위해 ablation study를 진행했다. qkv, o_proj, fc1/fc2를 단독 또는 조합으로 붙여 비교한 결과, 단일 모듈 중에서는 o_proj가 가장 좋은 효율-정확도 균형을 보였다.

Transformer block에서 attention은 **query/key/value(qkv)**와 o_proj로 구성되고, feed-forward는 fc1/fc2가 담당한다. 일반적으로 더 많은 모듈에 LoRA를 적용할수록 성능은 좋아지지만, training과 inference 비용도 함께 늘어난다.

실험은 텍스트와 이미지, reasoning과 non-reasoning을 아우르는 7개 데이터셋으로 진행됐다. 금융 reasoning, 긴 문서 요약, 의료 QA, JSON 추출, 멀티모달 Q&A, OCR까지 포함해 범용성을 점검했고, 동일한 hyperparameter로 SFT LoRA를 비교했다.

핵심 trade-off는 다음과 같다.

  • qkv only: latency가 가장 낮고 baseline으로 무난하지만, 최대 성능은 아니다.
  • o_proj only: 매우 효율적이며 reasoning에도 중요하고, ultralow-latency 환경에 적합하다.
  • qkv + o_proj: 대부분의 NLP 작업에서 accuracy와 latency의 균형이 가장 좋다.
  • qkv + fc1/fc2: near-full fine tuning에 가까운 높은 정확도를 내지만 latency 비용이 커진다.
  • o_proj + fc1/fc2: qkv가 불필요한 분류·감성 분석 같은 작업에 적합하다.
  • 모든 module: 최대 성능을 내지만 production에서는 latency 때문에 보통 비효율적이다.

결국 Nova 2.0 Lite에서는 o_proj 단독이 가장 좋은 효율 지점으로 정리됐고, 범용 production 설정으로는 qkv + o_proj가 가장 실용적인 선택지로 제시됐다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.