AI Briefing

[AAAI-25] ImagePiece: 효율적인 ViT를 위한 새로운 컨텐츠 인식 재토큰화 기술 - LG AI Research BLOG

·2026.07.16 09:00

핵심 내용

LG AI Research가 비전 트랜스포머(ViT)의 효율성을 높이기 위해 NLP의 서브워드 토큰화 방식을 적용한 ImagePiece 기술을 발표했다.

자세히 보기

기존의 **Vision Transformer(ViT)**는 이미지를 고정된 패치 단위로 나누는 방식 때문에, 배경과 같이 의미 없는(non-semantic) 패치가 다수 생성되어 계산 비용이 높아지는 한계가 있었다. 특히 산업 현장의 이미지처럼 반복적인 배경이 많은 경우, 불필요한 토큰이 많아져 효율성이 급격히 떨어진다.

LG AI Research가 제안한 ImagePiece는 NLP의 Subword Tokenization 방식에서 영감을 얻은 새로운 재토큰화 기술이다. 이 기술은 단순히 토큰을 제거하거나 병합하는 기존 방식과 달리, 주변 정보와 결합하여 의미를 가질 수 있는 패치들을 하나의 **'의미 있는 단위(Semantic Unit)'**로 재구성한다.

**ImagePiece의 주요 특징은 다음과 같다:

  • 컨텐츠 인식(Content-Aware): 패치의 중요도를 정확히 판단하여 의미 없는 토큰을 효율적으로 처리한다.
  • 재토큰화(Re-tokenization): 비의미적 패치들을 주변 정보와 결합해 하나의 의미 있는 토큰으로 통합함으로써 정보 손실을 최소화한다.
  • 효율성 및 성능 향상: 모델의 구조적 효율성을 높이면서도, 기존의 토큰 제거 방식(DynamicViT, EViT 등)이 가졌던 정보 손실 문제를 해결하여 성능을 개선한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.