DeepSeek-V4-Flash-Vision-Exp: 텍스트 에이전트 성능 유지하며 시각 이해까지 더한 실험적 멀티모달 모델
deepseek-ai/DeepSeek-V4-Flash-Vision-Exp
·2026.08.31 23:16
프로젝트 소개
DeepSeek-V4 Flash 아키텍처에 시각 모듈을 결합해 텍스트와 이미지를 동시에 처리하는 실험적 멀티모달 모델이다. 기존 텍스트 전용 에이전트 성능을 유지하면서 ApexBench 등 멀티모odal 에이전트 벤치마크에서 점수를 크게 끌어올렸다.
Terminal Bench 2.1에서 83.9점, DeepSWE에서 59.3점을 기록해 텍스트 기반 코딩 및 터미널 작업 능력이 Opus-4.8에 근접하다. ApexBench Pass@1 점수는 36.5로, 멀티모달 입력을 무시했던 이전 버전 대비 10점 이상 향상됐다.
DFlash attention, MoE, Hyper-Connections 등 최신 구조를 반영한 추론 구현체를 제공한다. SGLang에서 DSPARK 추론 알고리즘을 활성화하면 단일 체크포인트로 타겟과 드래프트 가중치를 공유하며 효율적으로 서빙할 수 있다.
MIT 라이선스로 공개되어 상업적 활용이 가능하지만, 실험적 성격이 강해 프로덕션 적용 전 검증이 필요하다. 텍스트 에이전트 성능을 희생하지 않고 시각 인식을 추가해야 하는 개발자에게 적합한 선택지다.
HuggingFace 모델
deepseek-ai/DeepSeek-V4-Flash-Vision-Exp
원문에 등록된 설명이 없습니다.
image-text-to-text
이 한국어 소개글은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.