AI Briefing

[AAAI-25] ImagePiece: 효율적인 ViT를 위한 새로운 컨텐츠 인식 재토큰화 기술 - LG AI Research BLOG

·2026.07.16 09:00

LG AI Research가 비전 트랜스포머(ViT)의 효율성을 높이기 위해 NLP의 서브워드 토큰화 방식을 적용한 ImagePiece 기술을 발표했다.

기존의 **Vision Transformer(ViT)**는 이미지를 고정된 패치 단위로 나누는 방식 때문에, 배경과 같이 의미 없는(non-semantic) 패치가 다수 생성되어 계산 비용이 높아지는 한계가 있었다. 특히 산업 현장의 이미지처럼 반복적인 배경이 많은 경우, 불필요한 토큰이 많아져 효율성이 급격히 떨어진다.

LG AI Research가 제안한 ImagePiece는 NLP의 Subword Tokenization 방식에서 영감을 얻은 새로운 재토큰화 기술이다. 이 기술은 단순히 토큰을 제거하거나 병합하는 기존 방식과 달리, 주변 정보와 결합하여 의미를 가질 수 있는 패치들을 하나의 **'의미 있는 단위(Semantic Unit)'**로 재구성한다.

**ImagePiece의 주요 특징은 다음과 같다:

  • 컨텐츠 인식(Content-Aware): 패치의 중요도를 정확히 판단하여 의미 없는 토큰을 효율적으로 처리한다.
  • 재토큰화(Re-tokenization): 비의미적 패치들을 주변 정보와 결합해 하나의 의미 있는 토큰으로 통합함으로써 정보 손실을 최소화한다.
  • 효율성 및 성능 향상: 모델의 구조적 효율성을 높이면서도, 기존의 토큰 제거 방식(DynamicViT, EViT 등)이 가졌던 정보 손실 문제를 해결하여 성능을 개선한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.