AI Briefing
추천

Qwen-Drive-1.0, 자율주행용 비전-언어 파운데이션 모델 공개

·2026.09.03 09:00

핵심 내용

Qwen 팀이 3D 인식과 모션 플래닝을 통합한 자율주행 전용 비전-언어 파운데이션 모델 Qwen-Drive-1.0을 공개했다.

1 / 2

자세히 보기

Qwen 팀이 자율주행을 위해 설계된 최초의 비전-언어 파운데이션 모델 Qwen-Drive-1.0을 공개했다. 이 모델은 사전 학습된 VLM 아키텍처를 변경하지 않고 외부 모듈을 결합하여 3D 인식, 시각 질문 답변(VQA), 모션 플래닝을 통합한다.

핵심 아키텍처 및 기능

  • 기반 모델: 네이티브 멀티모달 Qwen3.5-4B를 기반으로 하며, 사전 학습된 VLM 구조는 그대로 유지된다.
  • BEV 인식 헤드: 다중 뷰 입력을 처리하여 3D 객체 감지, 시맨틱 점유 예측, BEV 맵 분할을 수행하는 명시적이고 검사 가능한 3D 프로브 역할을 한다.
  • 플래닝 전문가(Planning Expert): VLM 표현에 맞춘 디퓨전 트랜스포머로, 플로우 매칭(flow matching)을 통해 5초간의 에고 궤적을 생성한다.

성능 및 결과

Qwen-Drive-1.0-SFT는 자율주행 VQA 평균 점수 69.43을 기록하며, 범용 VLM 및 자율주행 특화 모델들을 능가했다. 또한 LingoQA, WaymoQA 등 주요 벤치마크에서 경쟁력 있는 성능을 입증했으며, 범용 비전-언어 능력(MMBench, MMMU 등)을 유지하면서도 자율주행 도메인에 효과적으로 적응했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.