추천
Qwen-Drive-1.0, 자율주행용 비전-언어 파운데이션 모델 공개
·2026.09.03 09:00
핵심 내용
Qwen 팀이 3D 인식과 모션 플래닝을 통합한 자율주행 전용 비전-언어 파운데이션 모델 Qwen-Drive-1.0을 공개했다.
1 / 2
자세히 보기
Qwen 팀이 자율주행을 위해 설계된 최초의 비전-언어 파운데이션 모델 Qwen-Drive-1.0을 공개했다. 이 모델은 사전 학습된 VLM 아키텍처를 변경하지 않고 외부 모듈을 결합하여 3D 인식, 시각 질문 답변(VQA), 모션 플래닝을 통합한다.
핵심 아키텍처 및 기능
- 기반 모델: 네이티브 멀티모달 Qwen3.5-4B를 기반으로 하며, 사전 학습된 VLM 구조는 그대로 유지된다.
- BEV 인식 헤드: 다중 뷰 입력을 처리하여 3D 객체 감지, 시맨틱 점유 예측, BEV 맵 분할을 수행하는 명시적이고 검사 가능한 3D 프로브 역할을 한다.
- 플래닝 전문가(Planning Expert): VLM 표현에 맞춘 디퓨전 트랜스포머로, 플로우 매칭(flow matching)을 통해 5초간의 에고 궤적을 생성한다.
성능 및 결과
Qwen-Drive-1.0-SFT는 자율주행 VQA 평균 점수 69.43을 기록하며, 범용 VLM 및 자율주행 특화 모델들을 능가했다. 또한 LingoQA, WaymoQA 등 주요 벤치마크에서 경쟁력 있는 성능을 입증했으며, 범용 비전-언어 능력(MMBench, MMMU 등)을 유지하면서도 자율주행 도메인에 효과적으로 적응했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.