AI Briefing

LG AI 연구원, 효율적인 이미지 인식을 위한 ImagePiece 연구 발표

·2026.07.16 09:00

LG AI연구원이 NLP의 토큰화 방식에서 영감을 얻어 비전 모델의 연산 효율을 높이는 ImagePiece 기법을 제안했다.

기존 **Vision Transformers (ViTs)**는 이미지의 특정 패치를 토큰화할 때 의미 없는 배경이나 비정형 구조를 포함하는 경우가 많아 과도한 연산 비용이 발생한다. 특히 기존의 토큰 제거 방식은 중요한 정보를 손실하거나 의미 있는 표현을 희석하는 한계가 있었다.

LG AI연구원이 제안한 ImagePiece는 NLP의 Subword Tokenization 방식에서 영감을 얻어, 의미 없는 시각 토큰들을 '의미 있는 단위'로 재구성(Re-tokenization)하는 전략을 사용한다. 이 기법은 단순히 토큰을 줄이는 것이 아니라, 토큰의 의미를 새롭게 정의하여 모델의 표현력을 유지하면서 연산량을 절감한다.

ImagePiece의 핵심 프로세스는 다음과 같다:

  • 토큰 중요도 평가: [CLS] 토큰과의 Attention Score를 기반으로 각 토큰의 중요도를 계산한다.
  • 비의미 토큰 병합: 중요도가 낮은 토큰들을 Bipartite Soft Matching 기법을 통해 유사한 토큰끼리 병합한다.
  • 의미 재평가: 병합된 토큰을 포함해 Attention Score를 다시 평가하여, 새롭게 의미를 갖게 된 토큰은 보존하고 불필요한 토큰은 제거한다.

또한, 공간적으로 인접한 패치들이 유사할 가능성이 높다는 점을 활용해 Local Coherence Bias 모듈을 도입했다. 이를 통해 Overlapping Convolution 기반으로 인접 토큰 간의 특징 유사도를 강화하여, 비의미 토큰들이 더욱 자연스럽고 의미 있게 병합되도록 유도한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.