AI Briefing

Qwen, 자율주행용 비전-언어 파운데이션 모델 'Qwen-Drive-1.0' 공개

·2026.09.08 09:00

핵심 내용

Qwen 팀과 화중과기대가 자율주행 특화 비전-언어 모델 Qwen-Drive-1.0을 공개했으며, RL 적용 시 NAVSIM 벤치마크에서 90.7점의 성능을 달성했다.

1 / 3

자세히 보기

자율주행 특화 VLM 아키텍처 Qwen 팀과 화중과기대(HUST)가 자율주행을 위한 비전-언어 파운데이션 모델 Qwen-Drive-1.0을 공개했다. 이 모델은 네이티브 멀티모달 모델인 Qwen3.5-4B를 기반으로 하며, BEV Perception Head와 Planning Expert라는 두 개의 외부 모듈을 결합한 구조를 채택했다. BEV Perception Head는 3D 객체 감지, 시맨틱 점유 예측, BEV 맵 분할을 담당하며, Planning Expert는 공유된 VLM 표현을 기반으로 미래의 에고 궤적을 생성한다.

학습 방식 및 성능 모델은 단계적 학습(Staged training) 방식을 통해 자율주행 특화 감독 데이터와 범용 비전-언어 데이터를 함께 학습했다. SFT(지도 미세 조정) 단계에서는 Planning Expert를 학습시키고, 이후 RL(강화 학습) 단계를 통해 보상 최적화를 적용했다. 성능 평가 결과, NAVSIM v1.1 벤치마크의 PDMS 점수는 SFT에서 88.2점, RL 적용 시 90.7점으로 향상되었다. NVIDIA Open Dataset E2E 테스트에서도 RL 적용 시 RFS 점수가 7.78에서 7.91로 개선되었다.

범용 능력 및 공간 이해도 자율주행 특화 학습에도 불구하고 범용 VQA 및 추론 능력은 원본 Qwen3.5-4B 모델과 유사한 수준을 유지했다. MMBench, MMStar, MMMU 등 주요 벤치마크에서 원본 모델 대비 소폭의 변동만 보였으며, 일부 항목에서는 오히려 성능이 향상되기도 했다. 다만, EmbSpatial 등 특정 공간 이해도 벤치마크에서는 원본 모델 대비 성능 저하가 관찰되었다.

오픈소스 배포 및 사용법 모델은 Apache 2.0 라이선스로 GitHub 및 Hugging Face에 공개되었으며, GPU 메모리 24GB 이상과 Python 3.10 환경이 요구된다. VLM, SFT/RL 기반 Planning Expert, Perception 모듈이 각각 분리된 파일로 제공되며, scripts/demo.py를 통해 야간 교차로, 좌/우회전 등 다양한 시나리오에서의 궤적 예측 및 Reasoning 과정을 시각화할 수 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.