텐센트, Youtu-Parsing-Omni 5B 모델 공개
tencent/Youtu-Parsing-Omni · Hugging Face
·2026.10.09 21:03
핵심 내용
텐센트, OmniDocBench v1.6서 96.96점 기록한 5B 올모달 파싱 모델 Youtu-Parsing-Omni 공개
자세히 보기
텐센트가 다양한 입력을 하나의 구조화된 JSON으로 변환하는 5B 파라미터의 올모달 파싱 모델 Youtu-Parsing-Omni를 공개했다. 이 모델은 문서 페이지, 자연 이미지, 차트, 플로우차트, 기하 도형, 오디오 클립, 오디오-비디오 영상 등 7가지 파싱 패밀리를 지원한다.
통합 스키마 및 기능
모델은 지각(perception)과 인지(cognition) 작업을 모두 포함하는 단일 JSON 출력을 생성한다. 지각 작업에는 레이아웃 요소, 텍스트, 표, 수식, 바운딩 박스, 타임스탬프, ASR, OCR, 음향 이벤트, 카메라 움직임이 포함된다. 인지 작업에는 캡션, 내러티브, 보고서가 포함된다. 특정 출력 패밀리는 태스크 프롬프트(예: --task)를 통해 선택한다.
지원되는 모달리티와 주요 내용은 다음과 같다:
- 문서 페이지: bbox가 포함된 레이아웃 요소, 텍스트/LaTeX/OTSL, 표, Mermaid 플로우차트, 읽기 순서.
- 자연 이미지: bbox가 포함된 엔티티와 텍스트, 태그, 캡션, 전역 설명.
- 차트: Markdown 표, 노트, 캡션.
- 플로우차트: Mermaid 코드와 캡션.
- 기하 도형: 기하학적 관계, 측정값, 요소.
- 오디오: 타임스탬프, 화자, ASR, 음색/장면 캡션, 음향 이벤트가 포함된 음성/비음성 세그먼트.
- 자연 영상: 시각 요소, 동작, 상호작용, 카메라 움직임, 오디오 트랙이 포함된 시간 세그먼트.
- 텍스트 중심 영상: OCR + ASR 세그먼트 및 Markdown 구조 보고서.
성능 및 배포
Youtu-Parsing-Omni는 모델 크기에 비해 강력한 성능을 보인다:
- OmniDocBench v1.6에서 96.96 Overall을 달성하며 SOTA를 기록했다.
- OmniParsingBench에서 **75.08 Avg.**를 기록해 오픈 웨이트 모델 중 최고이며, Gemini-3-Pro에 이어 2위를 차지했다.
- 화학 구조(ChemOCR) 및 악보(PDMX-Synth) 인식에서 전문 모델과 경쟁력 있는 성능을 보였다.
배포를 위해 vLLM 플러그인, 고정된 서빙 설정, 태스크 프롬프트, 추론 예제가 포함되었다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.