자율주행을 위한 Flash 비전-언어-행동 추론: FlashDrive
핵심 내용
FlashDrive는 자율주행 VLA 추론 전 과정을 최적화해 716ms를 159ms로 줄였다.
자세히 보기
전통적인 자율주행은 perception과 planning을 분리하지만, 희귀하고 복잡한 long-tail 상황에서는 쉽게 무너진다. Vision-Language-Action(VLA) 모델은 chain-of-thought reasoning을 포함한 end-to-end 방식으로 이 문제를 풀며, NVIDIA는 최근 오픈소스 reasoning VLA인 Alpamayo 1과 Alpamayo 1.5를 공개했다.
문제는 속도다. Alpamayo 1.5(10B, Qwen3-VL 기반)는 NVIDIA RTX PRO 6000에서 한 스텝당 716ms가 걸려 실시간 주행 요구를 크게 밑돈다. 이를 해결하기 위해 FlashDrive는 encode, prefill, decode, action의 네 단계를 모두 건드리는 algorithm-system co-design으로 전체 지연을 159ms까지 낮췄고, 이는 4.5× speedup에 해당한다.
병목은 한 군데가 아니었다. VLA 추론은 비전 인코딩, 프롬프트 prefilling, reasoning token decoding, flow matching 기반 action 생성으로 나뉘는데, 프로파일링 결과 네 단계 모두가 의미 있게 느렸다. 특히 decode와 action이 전체 시간의 큰 비중을 차지했지만, encode와 prefill도 커서 단일 최적화로는 실시간에 도달할 수 없었다.
가장 먼저 적용한 것은 streaming inference다. 자율주행 입력은 여러 카메라의 연속 영상 스트림이므로, 매 스텝마다 전체 윈도우를 다시 인코딩하는 것은 낭비다. FlashDrive는 다음 방식으로 중복 계산을 줄였다.
- KV cache reuse로 이전 3개 프레임의 중복 계산을 제거
- 프레임 이동에 맞춘 pre-RoPE key caching과 on-the-fly rotary embeddings 적용
- 카메라 view-major 토큰 순서를 처리하는 custom streaming attention mask 설계
이 방식은 effective sequence length를 75% 줄이지만, streaming KV cache는 full forward pass와 완전히 같지 않아 정확도가 떨어질 수 있다. 흥미롭게도 VLM 전체를 streaming 입력으로 fine-tune하면 더 나빠졌고, 이유는 reasoning token보다 action expert가 전체 KV cache에 더 민감하게 반응하기 때문이다. 그래서 FlashDrive는 VLM은 고정하고 action expert만 fine-tune하는 쪽으로 방향을 바꿨고, deployment에서 생기는 누적 오차를 반영하기 위해 여러 streaming step으로 cache를 채운 뒤 마지막 단계에만 gradient를 흘리는 방식으로 성능을 회복했다.
Reasoning 단계에는 speculative reasoning을 적용했다. driving domain의 reasoning sequence는 약 16 tokens로 짧고 템플릿이 강해 entropy가 낮기 때문에, block diffusion model인 DFlash를 parallel drafter로 써서 한 번에 후보 블록을 생성한다. speculative verification 덕분에 출력 분포는 기존 autoregressive decoding과 동일하게 유지되며, 품질 손실 없이 decode 병목을 줄인다.
마지막으로 action 생성에는 adaptive-step flow matching을 적용했다. 기존의 10-step denoising을 그대로 쓰지 않고 velocity field를 분석한 결과, 변화는 시작과 끝에서 크고 중간은 거의 일정한 U-shaped pattern이 나타났다. 이에 따라 중간 구간의 중복 step을 줄이고 중요한 endpoint를 더 살리는 방식으로 trajectory generation을 가속했다.
핵심은 하나의 최적화가 아니라, streaming inference + speculative reasoning + adaptive action generation을 묶어 전체 파이프라인을 함께 줄였다는 점이다. 결과적으로 FlashDrive는 자율주행용 reasoning VLA를 실시간에 훨씬 가깝게 끌어오면서도 정확도를 거의 유지했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.