Count Anything
·2026.06.15 09:00
핵심 내용
텍스트 쿼리를 통해 다양한 도메인의 객체를 정확하게 식별하고 개수를 세는 범용 모델을 제안한다.
자세히 보기
기존의 객체 카운팅 모델은 군중, 차량, 세포 등 특정 도메인에 국한되어 범용성이 떨어진다는 한계가 있었습니다. 이를 해결하기 위해 연구진은 자연어 쿼리를 입력하면 이미지 내 대상의 위치(point)를 찾아내어 개수를 반환하는 text-guided object counting 방식을 제안합니다.
연구진은 이를 위해 6개 시각 도메인(일반 장면, 원격 탐사, 조직 병리, 세포 현미경, 농업, 미생물학)을 아우르는 대규모 데이터셋인 CLOC를 구축했습니다. CLOC는 약 22만 장의 이미지, 619개 카테고리, 1,500만 개의 객체 인스턴스를 포함합니다.
새롭게 제안된 Count Anything 모델은 기존의 밀도 맵(density-map) 방식 대신 이산적인 인스턴스 포인트를 사용하는 dual-granularity instance enumeration 방식을 채택했습니다.
- Region-level Sparse Counter: 크고 드문드문하게 분포된 대상을 위한 객체 레벨 앵커 제공
- Pixel-level Dense Counter: 작고 밀집되었거나 경계가 불분명한 대상을 위한 픽셀 단위 예측
- Complementary Count Fusion: 두 카운터를 파라미터 없이 결합하여 정확도 극대화
실험 결과, Count Anything은 기존의 오픈 월드 카운팅 방법론들을 뛰어넘는 강력한 정확도와 다중 도메인 일반화 성능을 입증했습니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.