AI Briefing

Meta Sapiens2 인간 중심 비전 모델 GitHub 저장소

·2026.04.29 09:00

핵심 내용

Meta가 10억 장의 인간 이미지로 학습한 Sapiens2 비전 모델군을 GitHub에 공개했다.

1 / 2

자세히 보기

Meta의 Sapiens2는 10억 장의 인간 이미지로 사전학습한 고해상도 transformer 계열 비전 모델군이다. 포즈 추정, body-part segmentation, surface normal, pointmap 같은 인간 중심 과제 전반에서 강한 성능을 목표로 하며, ICLR 2026 논문과 함께 GitHub 저장소로 공개됐다.

모델 카드는 다음과 같이 나뉜다.

  • Sapiens2-0.1B: 0.114B params, 0.342T FLOPs
  • Sapiens2-0.4B: 0.398B params, 1.260T FLOPs
  • Sapiens2-0.8B: 0.818B params, 2.592T FLOPs
  • Sapiens2-1B: 1.462B params, 4.715T FLOPs
  • Sapiens2-1B (4K): 1.607B params
  • Sapiens2-5B: 5.071B params, 15.722T FLOPs

모든 모델은 patch size 16으로 **1024×768(H×W)**에서 학습됐다. 예외인 **Sapiens2-1B (4K)**는 4096×3072 해상도와 use_tokenizer=True를 사용한다.

실행은 비교적 단순하다. torch와 safetensors만 있으면 백본 forward pass를 돌릴 수 있고, sapiens/backbones/standalone/sapiens2.py와 v1 sapiens.py는 레포 바깥 프로젝트에 그대로 복사해 사용할 수 있다.

  • 설치 조건: Python 3.12+, PyTorch 2.7+
  • 체크포인트: MODEL_ZOO.md에서 내려받아 $SAPIENS_CHECKPOINT_ROOT(기본값 ~/sapiens2_host)에 배치
  • 포즈 추론: detr-resnet-101-dc5 디텍터 추가 필요
  • 포즈, 세그멘테이션, 노멀, 포인트맵별로 추론/학습 문서가 분리돼 있다

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.