Paper
deepseek-ai/DeepSeek-V4-Flash-0731 · Hugging Face
2026.07.31
·Hugging Face·by Mineru#Agent#DeepSeek#LLM#Text Generation#Transformers
핵심 포인트
- 1DeepSeek-V4-Flash-0731은 이전 버전을 대체하는 모델로, 활성 파라미터 수를 줄이면서도 향상된 에이전트 성능과 추론 능력을 제공합니다.
- 2이 모델은 DSpark speculative decoding 모듈을 탑재하여 효율성을 극대화했으며, vLLM을 통해 손쉽게 배포 및 구동할 수 있습니다.
- 3다수의 벤치마크 평가 결과, DeepSeek-V4-Flash-0731은 훨씬 큰 규모의 기존 모델들을 능가하는 경쟁력을 입증했습니다.
DeepSeek-V4-Flash-0731은 "DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence" 연구의 일환으로 발표된 고효율 언어 모델로, 이전의 Preview 버전을 대체하며 에이전트 성능이 대폭 향상된 모델입니다. 본 모델은 사후 분석 및 추론을 위한 Speculative Decoding 모듈인 DSpark가 탑재된 아키텍처를 공유합니다.
핵심 방법론 및 기술적 특징
- DSpark Speculative Decoding:
--speculative-config 파라미터를 통해 구현되며, 추론 시 draft 모델이 미리 토큰을 생성하여 검증하는 방식을 통해 처리량을 극대화합니다. 설정 예시는 다음과 같습니다:--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'- 추론 최적화 및 파라미터 제어:
- Reasoning Effort:
reasoning_effort파라미터(low,high,max)를 통해 모델이 답변 생성 전 수행하는 숙고(deliberation) 과정을 조절할 수 있습니다. - Sampling Parameters: 에이전트 시나리오에서는 , 를 권장하며, 고도의 추론이 필요한 상황에서는 최대 384K 토큰의 출력 길이를 지원합니다.
- 하드웨어 가속:
moe-backend로deep_gemm_mega_moe를 사용하고,KV Cache를fp8로 설정하여 연산 효율성을 높였습니다.
- Reasoning Effort:
- 성능 지표:
DSBench-Hard와 같은 고난도 코딩 에이전트 문제에서 뛰어난 효율성과 정확도를 입증했습니다.- 입출력 처리:
reasoning_content 필드를 통해 모델의 내부 사고 과정을 구조적으로 관리하며, encode_messages 함수를 사용하여 thinking_mode와 reasoning_effort를 사전에 정의하여 입력을 생성합니다.이 모델은 MIT License를 따르며, 대규모 문맥(Million-token context) 환경에서의 지능형 처리를 위해 최적화된 아키텍처와 추론 프레임워크를 결합한 최신 기술 구현체입니다.