AI Briefing

DBSCAN 기반 WordDetectorNet 구조 분석

Per-pixel bounding-box regression + DBSCAN for handwritten word detection - visual walkthrough of WordDetectorNet [P]

·2026.05.24 03:43

앵커 기반 방식 대신 픽셀별 거리 회귀와 DBSCAN을 사용하는 WordDetectorNet의 구조를 분석한다.

WordDetectorNet은 기존의 앵커 기반 탐지 및 NMS(Non-Maximum Suppression) 방식 대신, 픽셀 단위의 바운딩 박스 회귀DBSCAN 클러스터링을 결합한 독특한 구조를 제안한다.

핵심 메커니즘

  • 네트워크가 '단어 픽셀'로 분류한 모든 픽셀은 해당 픽셀을 포함하는 바운딩 박스의 4가지 거리 값(상/우/하/좌)을 함께 회귀한다.
  • 이를 통해 수천 개의 중첩된 후보 박스가 생성되며, DBSCAN을 사용하여 distance = 1 − IoU 메트릭으로 이들을 클러스터링한다.
  • 최종적으로 각 클러스터의 중앙값(median) 박스를 탐지 결과로 채택한다.

아키텍처 구성

  • Backbone: ResNet18 (1채널 그레이스케일 입력 및 중간 특징 추출 기능 수정).
  • Decoder: FPN 스타일의 디코더를 통해 모든 스케일의 특징을 업스케일 및 결합.
  • Head: 픽셀당 6개 채널(2개 세그멘테이션 로짓 + 4개 거리 값) 출력.
  • Loss: Cross-entropy와 IoU 손실을 동일한 가중치로 학습.

장단점

  • 장점: 앵커 설정이나 NMS 임계값 튜닝이 필요 없으며, IoU 기반 클러스터링 방식이 개념적으로 명확하다.
  • 단점: 후보 박스 쌍에 대한 IoU 계산이 $O(n^2)$의 복잡도를 가져 실행 속도의 병목이 되며, DBSCAN의 eps 하이퍼파라미터를 수동으로 설정해야 하므로 엔드투엔드(end-to-end) 학습이 어렵다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.