AI Briefing

Dispersion loss가 소형 언어 모델의 embedding condensation 현상을 상쇄한다

·2026.07.04 07:35

소형 언어 모델에서 발생하는 임베딩 응집 현상을 해결하기 위한 새로운 학습 목적 함수를 제안한다.

Transformer 레이어를 거치며 토큰 임베딩 벡터들이 좁은 원뿔 형태의 하위 공간으로 쏠리는 embedding condensation(임베딩 응집) 현상을 발견했습니다. 이 현상은 모델의 크기가 작을수록 더 심하게 나타나며, 벡터들이 서로 거의 평행한 방향을 가리키게 만듭니다.

연구 결과에 따르면:

  • 모델 크기와의 상관관계: 동일 모델군 내에서 모델 규모가 커질수록 이러한 응집 현상은 줄어들며, 큰 모델은 이 현상에 더 잘 저항합니다.
  • 재현 가능성: MLP 차원만을 조절한 통제 실험에서도 동일한 현상이 관찰되어, 모델 크기와 밀접한 관련이 있음을 확인했습니다.
  • 발생 시점: 이 현상은 모델 초기화 단계부터 나타나며, 사전 학습(Pre-training)을 통해 점진적으로 완화되지만 완전히 사라지지는 않습니다.

연구진은 이러한 기하학적 문제를 해결하기 위해 임베딩의 분산을 높여주는 dispersion loss라는 새로운 학습 목적 함수를 설계하여 모델의 표현력을 개선했습니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.