AI Briefing

DeepSeek-V4-Flash-Vision-Exp: 텍스트 에이전트 성능 유지하며 시각 이해까지 더한 실험적 멀티모달 모델

deepseek-ai/DeepSeek-V4-Flash-Vision-Exp

·2026.08.31 23:16

DeepSeek-V4 Flash 아키텍처에 시각 모듈을 결합해 텍스트와 이미지를 동시에 처리하는 실험적 멀티모달 모델이다. 기존 텍스트 전용 에이전트 성능을 유지하면서 ApexBench 등 멀티모odal 에이전트 벤치마크에서 점수를 크게 끌어올렸다.

Terminal Bench 2.1에서 83.9점, DeepSWE에서 59.3점을 기록해 텍스트 기반 코딩 및 터미널 작업 능력이 Opus-4.8에 근접하다. ApexBench Pass@1 점수는 36.5로, 멀티모달 입력을 무시했던 이전 버전 대비 10점 이상 향상됐다.

DFlash attention, MoE, Hyper-Connections 등 최신 구조를 반영한 추론 구현체를 제공한다. SGLang에서 DSPARK 추론 알고리즘을 활성화하면 단일 체크포인트로 타겟과 드래프트 가중치를 공유하며 효율적으로 서빙할 수 있다.

MIT 라이선스로 공개되어 상업적 활용이 가능하지만, 실험적 성격이 강해 프로덕션 적용 전 검증이 필요하다. 텍스트 에이전트 성능을 희생하지 않고 시각 인식을 추가해야 하는 개발자에게 적합한 선택지다.

HuggingFace
HuggingFace 모델

deepseek-ai/DeepSeek-V4-Flash-Vision-Exp

원문에 등록된 설명이 없습니다.

image-text-to-text

이 한국어 소개글은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 소개 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.