SAM 3 기반 프롬프트 가능 배경 제거 모델 'MultiMatte' 공개, DIS-VD 벤치마크 S-measure 0.901 달성
·2026.09.10 09:00
핵심 내용
SAM 3를 LoRA로 미세 조정해 텍스트 프롬프트로 특정 객체만 남기는 MultiMatte 모델이 공개되어 주요 벤치마크에서 성능이 대폭 향상됐다.
1 / 5
자세히 보기
Feyn Labs가 텍스트 프롬프트로 지정된 객체만 남기고 배경을 제거하는 MultiMatte 모델을 공개했다. 이 모델은 Meta의 SAM 3를 기반으로 하며, 전체 파라미터 중 **2.27%**만 수정하는 Low-rank fine-tuning(LoRA) 기법을 적용했다.
기술적 특징 및 학습 방법
- Alpha Matte 적용: 기존 SAM 3의 이진 마스크(binary mask) 한계를 극복하기 위해 연속적인 투명도 값을 가진 alpha matte를 사용하여 머리카락이나 흐린 경계 등 세밀한 부분을 더 정확하게 표현한다.
- 효율적인 미세 조정: PEFT 및 LoRA를 활용해 사전 학습된 가중치는 동결하고, Rank-16 어댑터를 모든 tower의 attention 및 MLP projection에 적용했다. 최종 어댑터는 released weights에 병합되어 추론 시 별도 라이브러리가 필요 없다.
- 학습 데이터: salient objects, camouflage, high-resolution, hair, marine scenes 등을 포함한 19,953장의 이미지로 학습했으며, 이 중 **24.8%**는 인간이 작성한 라벨을 사용하여 특정 객체 명칭에 대한 prompt supervision을 수행했다.
성능 개선 결과
MultiMatte는 12개의 모든 벤치마크 split에서 SAM 3 대비 성능 향상을 보였다. 특히 Dichotomous segmentation 벤치마크에서 두드러진 개선이 확인되었다.
- DIS-VD: S-measure 0.667에서 0.901로 상승 (+0.233)
- Salient Objects: DUT-OMRON에서 +0.109, UHRSD-TE에서 +0.084의 개선 폭을 기록
- Camouflage: COD10K-TE에서 +0.148의 큰 폭의 성능 향상
- Prompt 효과: Fine-tuning 없이도 개념 이름(concept name) 입력만으로 성능이 향상되며, DIS-VD에서 SAM 3에 실제 개념 이름을 적용했을 때 S-measure가 +0.150 증가했다.
구현 및 활용
- NoBg 라이브러리 기반:
pip install nobg로 설치 가능하며,model.predict(processor, "image.jpg", "concept")코드로 RGBA cutout을 생성할 수 있다. - 범용성: 학습 데이터에 포함되지 않은 DAVIS-S와 DUT-OMRON 벤치마크에서도 높은 성능을 보여 강력한 generalization 능력을 입증했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.