
News
DeepSeek-V4-Flash-Vision-Exp Release: Multimodal API Now Live | DeepSeek API Docs
2026.08.28
·Web·by Mineru#Agent#API#LLM#Multimodal AI#Vision Model
핵심 포인트
- 1DeepSeek-V4-Flash-Vision-Exp는 DeepSeek-V4-Flash와 동일한 텍스트 성능을 유지하면서 멀티모달 에이전트 기능을 대폭 강화한 실험적 모델입니다.
- 2해당 모델은 Chat Completions API를 통해 이미지와 텍스트 입력을 모두 지원하며, 이미지 토큰화는 V4-Flash와 동일한 가격 정책이 적용됩니다.
- 3새롭게 도입된 Files API를 통해 이미지를 효율적으로 업로드하고 재사용할 수 있어 대역폭을 절약하며 실무적인 에이전트 워크플로우를 최적화합니다.
본 문서는 DeepSeek의 새로운 멀티모달 모델인 DeepSeek-V4-Flash-Vision-Exp의 출시와 그 기술적 사양, 그리고 관련 API 생태계에 대한 상세 내용을 담고 있습니다.
핵심 요약
DeepSeek-V4-Flash-Vision-Exp는 기존 DeepSeek-V4-Flash의 텍스트 처리 능력(에이전트, 추론, 세계 지식)을 그대로 유지하면서, 시각적 이해 능력을 대폭 강화한 실험적 모델입니다. 특히 멀티모달 에이전트 벤치마크에서 기존 모델 대비 비약적인 성능 향상을 달성하여, Opus-4.8 수준의 멀티모달 에이전트 성능에 근접했습니다.기술적 상세 및 방법론
- 멀티모달 통합 및 토큰화(Tokenization):
- 본 모델은 텍스트와 이미지 입력을 혼합하여 처리할 수 있으며, 이미지 데이터는 고정된 비용 효율적 방식으로 토큰화됩니다.
- 이미지 입력은 요청당 최대 개의 토큰으로 변환되며, 이는 DeepSeek-V4-Flash와 동일한 가격 정책이 적용됩니다.
- 입력 방식은 Base64 인코딩, 외부 URL, 그리고 신규 도입된 Files API를 통한 파일 참조를 모두 지원합니다.
- Files API 활용:
- 대역폭 효율성을 극대화하기 위해 Files API가 도입되었습니다. 사용자는 이미지를 한 번 업로드하여 고유한
file_id를 할당받고, 이후 동일한 이미지를 반복 사용할 경우 이를 참조함으로써 네트워크 전송 비용과 요청 대역폭을 절감할 수 있습니다.
- 대역폭 효율성을 극대화하기 위해 Files API가 도입되었습니다. 사용자는 이미지를 한 번 업로드하여 고유한
- 에이전트 프레임워크 호환성:
- DeepSeek Harness 0.1.1 업데이트를 통해 즉각적인 모델 지원이 가능해졌으며, 다양한 에이전트 프레임워크와 결합하여 시각적 이해와 도구 사용(Tool-use)을 연계한 복합적이고 실용적인 워크플로우 구축을 지향합니다.
- API 사양:
- Chat Completions, Messages, Responses 인터페이스를 모두 지원하며, 파라미터를 통해 호출할 수 있습니다.
본 모델은 단순한 텍스트 기반 추론을 넘어, 실제 환경의 시각적 정보를 에이전트의 의사결정 과정에 통합함으로써 멀티모달 AI 에이전트의 활용 범위를 넓히는 데 중점을 두고 있습니다.