AI Briefing

ZDTaichu5.0-9B: 9B급 멀티모달 모델의 공간 추론과 에이전트 기능 결합

TaichuAI/ZDTaichu5.0-9B

·2026.09.17 11:43

Qwen3.5-9B 언어 백본과 C-RADIOv4-H 비전 인코더를 결합해 텍스트, 이미지, 영상을 동시에 처리한다. 일반적인 시각 이해 능력은 유지하면서 공간 인식과 3D 장면 해석, 다중 이미지 및 영상 분석까지 지원한다.

SparBench, ViewSpatial 등 벤치마크에서 10B급 범용 VLM 중 최상위권 공간 추론 성능을 보인다. ERQA 48점, RoboSpatial 56점을 기록하며 로봇 및 임바디드 AI 연구에 필요한 장면 이해와 계획 수립 능력을 갖췄다.

단순 시각 인식을 넘어 다단계 도구 사용과 에이전트 작업 수행이 가능하다. 문서, 차트, OCR, 시각 수학 문제 해결 등 복잡한 비전 언어 태스크를 처리하며, 해상도 제약 없이 다양한 입력을 수용한다.

영어와 중국어를 지원하며, 임바디드 AI나 로봇 제어 로직 개발에 필요한 공간 지능을 확보하려는 연구자에게 적합하다. 범용성을 희생하지 않고 특화된 공간·에이전트 기능을 추가한 점이 특징이다.

HuggingFace
HuggingFace 모델

TaichuAI/ZDTaichu5.0-9B

원문에 등록된 설명이 없습니다.

image-text-to-text

이 한국어 소개글은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 소개 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.