AI Briefing

GLM-OCR 기반 Diffusion 초안 생성 및 AR 검증 기법으로 추론 속도 3.85배 가속

·2026.09.03 18:01

핵심 내용

GLM-OCR 모델에 Diffusion 초안 생성과 AR 검증 방식을 결합해 디코딩 구간 속도를 3.85배 높이는 기법을 공개했다.

1 / 8

자세히 보기

GLM-OCR(0.9B) 모델을 기반으로 Diffusion으로 초안을 생성하고 AR(autoregressive) 경로가 이를 검증하는 Self-speculative decoding 기법을 적용해 추론 속도를 대폭 개선했다. 이 방식은 AR 출력과 바이트 단위로 동일한 정확도를 유지하면서도, 한 번의 forward 연산당 평균 9.6개 토큰을 확정(commit)한다.

핵심 성과 및 성능

  • 속도 향상: 디코딩 구간만 비교했을 때 기존 대비 3.85배, 페이지 전체 처리 시간으로는 1.34배 빨라졌다.
  • 정확도 유지: OmniDocBench 기준 95.16점을 기록하며, 같은 모델의 MTP(Multi-token prediction) 베이스라인보다 높은 성능을 보였다.
  • 비용 효율: Diffusion 단독 사용 시 정확도와 병렬성 간 트레이드오프가 발생하지만, AR 검증을 병행하면 같은 forward 예산 내에서 더 나은 결과를 얻는다.

기술적 접근 방식

  • OCR 특화 병렬 생성: OCR 출력 텍스트는 입력 이미지에 의해 이미 결정되어 있어, Diffusion 모델이 여러 토큰을 동시에 예측해도 AR 디코더와 높은 일치율(라운드당 평균 19토큰 연속 일치)을 보인다.
  • Block Diffusion 적용: 문서 전체를 한 번에 처리할 때 발생하는 문맥 불일치 문제를 해결하기 위해, 블록 단위로 인과적(causal) 관계를 유지하며 병렬로 채우는 Block Diffusion 방식을 사용했다.
  • 하이브리드 디코딩: 하나의 모델이 AR과 Block Diffusion 두 가지 뷰를 학습하여, Diffusion이 빠른 초안을 제시하고 AR이 이를 검증하여 오류를 수정하는 구조를 취한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.