Phi-4-reasoning-vision과 멀티모달 추론 모델 학습의 교훈
핵심 내용
Microsoft가 15B 오픈웨이트 멀티모달 추론 모델 Phi-4-reasoning-vision-15B를 공개했다.
자세히 보기
Phi-4-reasoning-vision-15B는 이미지 이해, 문서 읽기, GUI grounding, 수학·과학 추론을 아우르는 15B 오픈웨이트 multimodal reasoning model이다. Microsoft Foundry, HuggingFace, GitHub에서 제공되며, 느리고 토큰을 많이 쓰는 모델보다 효율적인 속도와 정확도의 균형을 목표로 한다.
핵심 방향은 더 큰 모델이 아니라 작고 빠른 VLM이었다. Microsoft는 Phi-4와 Phi-4-Reasoning에서 얻은 교훈을 바탕으로, 과도한 데이터나 초대형 아키텍처 없이도 넓은 vision-language 작업을 처리하는 모델을 만들었다고 설명한다. 학습에는 200B multimodal tokens가 사용됐고, 이는 1T+ tokens를 쓴 Qwen 2.5 VL/3 VL, Kimi-VL, Gemma3 계열보다 훨씬 적다.
아키텍처에서는 mid-fusion을 선택했다. 이미지와 텍스트를 하나의 거대한 transformer에서 처음부터 섞는 early-fusion보다, pretrained vision encoder를 LLM 임베딩 공간에 투영하는 방식이 계산·메모리·데이터 측면에서 현실적이라고 봤다. 실제 실험에서는 SigLIP-2 기반 vision encoder와 Phi-4-Reasoning 백본을 결합했고, 고해상도 입력에서 정보를 잘 뽑아내는 것이 중요하다는 점이 확인됐다.
비전 인코딩 방식 비교를 위해 5B proxy model을 1,000만 개 image-text pair로 학습해 여러 방식을 테스트했다.
- Dynamic resolution은 전반적으로 가장 강했고, 특히 고해상도 데이터에서 우수했다.
- 3600 max tokens 설정은 720p 수준의 네이티브 HD에 가까운 해상도를 다루며, ScreenSpot-Pro 같은 고해상도 벤치마크에서 큰 향상을 보였다.
- Multi-crop with S2는 일반 multi-crop보다 적은 visual token을 쓰면서도 더 좋은 결과를 냈다.
- 최종적으로 SigLIP-2 Naflex 변형이 선택됐다.
데이터는 양보다 quality에 초점을 맞췄다. 최종 데이터셋은 크게 세 축으로 구성됐다. 정제·개선한 open-source 데이터, 고품질 내부 도메인 데이터, 그리고 targeted acquisition 데이터다. 각 데이터셋은 샘플을 직접 검토해 품질을 분류했고, 답이 틀리거나 캡션이 부실한 경우에는 GPT-4o와 o4-mini로 응답을 재생성했다.
낮은 품질의 질문은 살리기 어려웠지만, 이미지 자체가 괜찮다면 새 caption이나 VQA 데이터의 seed로 재활용했다. 또한 수학·과학 데이터에는 상세한 이미지 설명을 붙이고, instruction-following 요구를 도메인 데이터에 직접 섞는 방식으로 데이터의 활용도를 높였다. 포맷 오류와 논리 오류도 광범위하게 수정해, 작은 모델이 적은 데이터로도 잘 배우도록 설계했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.