다음 토큰 예측을 넘어: Diffusion 언어 모델과 Autoregressive 언어 모델의 성능 특성 분석
·2026.08.07 09:00
핵심 내용
Diffusion 언어 모델은 병렬 생성이 가능하지만 긴 문맥과 배치 처리에서 한계를 보였다.
자세히 보기
**Autoregressive 언어 모델(ARM)**은 이전 토큰을 바탕으로 한 토큰씩 생성하기 때문에 순차 의존성이 크고 산술 집약도가 낮다. 반면 **Diffusion 언어 모델(DLM)**은 여러 토큰을 병렬 생성해 추론 속도를 높일 가능성을 제시한다.
분석 결과 DLM은 토큰 위치 간 병렬성을 활용해 ARM보다 높은 산술 집약도를 달성할 수 있지만, 문맥이 길어질수록 효율적으로 확장되지 못했다. 연구진은 이를 개선하기 위해 시퀀스 길이와 산술 집약도를 분리하는 **블록 단위 디코딩(block-wise decoding)**을 검토했으며, 긴 문맥에서 ARM과 유사한 확장성을 확인했다.
배치 추론에서는 여러 시퀀스 간 병렬성을 더 효과적으로 활용하는 ARM이 더 높은 처리량을 보였다. 또한 오픈소스 DLM이 ARM보다 낮은 지연 시간을 달성하려면 생성 품질을 유지하면서 샘플링 단계 수를 줄이는 것이 핵심 과제로 제시됐다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.