AI Briefing

추천HPD-Parsing, 문서 파싱 SoTA 달성

PaddlePaddle/HPD-Parsing · Hugging Face

·2026.07.23 16:56

PaddlePaddle이 계층적 병렬 디코딩 기반 1B 문서 파싱 모델 HPD-Parsing을 공개해 OmniDocBench v1.6에서 94.91%로 최고 성능을 기록했다.

HPD-Parsing은 PaddlePaddle이 공개한 경량(1B) 고처리량 문서 파싱 모델로, Hierarchical Parallel Decoding(HPD) 패러다임을 기반으로 한다.

기존 VLM 기반 파서는 페이지 전체를 단일 토큰-by-토큰 자기회귀로 생성해 문서 길이에 비례한 병목이 발생했다. HPD-Parsing은 이를 해결하기 위해:

  • 메인 레이아웃 브랜치가 전역 문서 구조를 조율하고 지역별 콘텐츠 생성을 병렬 브랜치에 동적 분배
  • **Progressive Multi-Token Prediction(P-MTP)**으로 각 브랜치 내 디코딩 스텝 추가 단축
  • Shared-prefix KV 캐시 재사용으로 효율 향상

벤치마크 결과:

  • OmniDocBench v1.6 전체 점수 94.91% — 엔드투엔드 통합 파서 중 최고
  • 최대 처리량 4,752 TPS — 기존 최속 파서 대비 2.62×, 자체 자기회귀 베이스라인 대비 3.06×

모델은 Hugging Face에서 공개되어 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.