추천
HPD-Parsing, 문서 파싱 SoTA 달성
PaddlePaddle/HPD-Parsing · Hugging Face
·2026.07.23 16:56
핵심 내용
PaddlePaddle이 계층적 병렬 디코딩 기반 1B 문서 파싱 모델 HPD-Parsing을 공개해 OmniDocBench v1.6에서 94.91%로 최고 성능을 기록했다.
자세히 보기
HPD-Parsing은 PaddlePaddle이 공개한 경량(1B) 고처리량 문서 파싱 모델로, Hierarchical Parallel Decoding(HPD) 패러다임을 기반으로 한다.
기존 VLM 기반 파서는 페이지 전체를 단일 토큰-by-토큰 자기회귀로 생성해 문서 길이에 비례한 병목이 발생했다. HPD-Parsing은 이를 해결하기 위해:
- 메인 레이아웃 브랜치가 전역 문서 구조를 조율하고 지역별 콘텐츠 생성을 병렬 브랜치에 동적 분배
- **Progressive Multi-Token Prediction(P-MTP)**으로 각 브랜치 내 디코딩 스텝 추가 단축
- Shared-prefix KV 캐시 재사용으로 효율 향상
벤치마크 결과:
- OmniDocBench v1.6 전체 점수 94.91% — 엔드투엔드 통합 파서 중 최고
- 최대 처리량 4,752 TPS — 기존 최속 파서 대비 2.62×, 자체 자기회귀 베이스라인 대비 3.06×
모델은 Hugging Face에서 공개되어 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.