DBSCAN 기반 WordDetectorNet 구조 분석
Per-pixel bounding-box regression + DBSCAN for handwritten word detection - visual walkthrough of WordDetectorNet [P]
·2026.05.24 03:43
앵커 기반 방식 대신 픽셀별 거리 회귀와 DBSCAN을 사용하는 WordDetectorNet의 구조를 분석한다.
WordDetectorNet은 기존의 앵커 기반 탐지 및 NMS(Non-Maximum Suppression) 방식 대신, 픽셀 단위의 바운딩 박스 회귀와 DBSCAN 클러스터링을 결합한 독특한 구조를 제안한다.
핵심 메커니즘
- 네트워크가 '단어 픽셀'로 분류한 모든 픽셀은 해당 픽셀을 포함하는 바운딩 박스의 4가지 거리 값(상/우/하/좌)을 함께 회귀한다.
- 이를 통해 수천 개의 중첩된 후보 박스가 생성되며, DBSCAN을 사용하여
distance = 1 − IoU메트릭으로 이들을 클러스터링한다. - 최종적으로 각 클러스터의 중앙값(median) 박스를 탐지 결과로 채택한다.
아키텍처 구성
- Backbone: ResNet18 (1채널 그레이스케일 입력 및 중간 특징 추출 기능 수정).
- Decoder: FPN 스타일의 디코더를 통해 모든 스케일의 특징을 업스케일 및 결합.
- Head: 픽셀당 6개 채널(2개 세그멘테이션 로짓 + 4개 거리 값) 출력.
- Loss: Cross-entropy와 IoU 손실을 동일한 가중치로 학습.
장단점
- 장점: 앵커 설정이나 NMS 임계값 튜닝이 필요 없으며, IoU 기반 클러스터링 방식이 개념적으로 명확하다.
- 단점: 후보 박스 쌍에 대한 IoU 계산이 $O(n^2)$의 복잡도를 가져 실행 속도의 병목이 되며, DBSCAN의
eps하이퍼파라미터를 수동으로 설정해야 하므로 엔드투엔드(end-to-end) 학습이 어렵다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.