Meta Sapiens2 인간 중심 비전 모델 GitHub 저장소
·2026.04.29 09:00
핵심 내용
Meta가 10억 장의 인간 이미지로 학습한 Sapiens2 비전 모델군을 GitHub에 공개했다.
1 / 2
자세히 보기
Meta의 Sapiens2는 10억 장의 인간 이미지로 사전학습한 고해상도 transformer 계열 비전 모델군이다. 포즈 추정, body-part segmentation, surface normal, pointmap 같은 인간 중심 과제 전반에서 강한 성능을 목표로 하며, ICLR 2026 논문과 함께 GitHub 저장소로 공개됐다.
모델 카드는 다음과 같이 나뉜다.
- Sapiens2-0.1B: 0.114B params, 0.342T FLOPs
- Sapiens2-0.4B: 0.398B params, 1.260T FLOPs
- Sapiens2-0.8B: 0.818B params, 2.592T FLOPs
- Sapiens2-1B: 1.462B params, 4.715T FLOPs
- Sapiens2-1B (4K): 1.607B params
- Sapiens2-5B: 5.071B params, 15.722T FLOPs
모든 모델은 patch size 16으로 **1024×768(H×W)**에서 학습됐다. 예외인 **Sapiens2-1B (4K)**는 4096×3072 해상도와 use_tokenizer=True를 사용한다.
실행은 비교적 단순하다. torch와 safetensors만 있으면 백본 forward pass를 돌릴 수 있고, sapiens/backbones/standalone/sapiens2.py와 v1 sapiens.py는 레포 바깥 프로젝트에 그대로 복사해 사용할 수 있다.
- 설치 조건: Python 3.12+, PyTorch 2.7+
- 체크포인트:
MODEL_ZOO.md에서 내려받아$SAPIENS_CHECKPOINT_ROOT(기본값~/sapiens2_host)에 배치 - 포즈 추론:
detr-resnet-101-dc5디텍터 추가 필요 - 포즈, 세그멘테이션, 노멀, 포인트맵별로 추론/학습 문서가 분리돼 있다
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.