deepseek-ai/DeepSeek-V4-Flash-0731 · Hugging Face
Paper

deepseek-ai/DeepSeek-V4-Flash-0731 · Hugging Face

2026.07.31
·Hugging Face·by Mineru
#Agent#DeepSeek#LLM#Text Generation#Transformers

핵심 포인트

  • 1DeepSeek-V4-Flash-0731은 이전 버전을 대체하는 모델로, 활성 파라미터 수를 줄이면서도 향상된 에이전트 성능과 추론 능력을 제공합니다.
  • 2이 모델은 DSpark speculative decoding 모듈을 탑재하여 효율성을 극대화했으며, vLLM을 통해 손쉽게 배포 및 구동할 수 있습니다.
  • 3다수의 벤치마크 평가 결과, DeepSeek-V4-Flash-0731은 훨씬 큰 규모의 기존 모델들을 능가하는 경쟁력을 입증했습니다.

DeepSeek-V4-Flash-0731은 "DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence" 연구의 일환으로 발표된 고효율 언어 모델로, 이전의 Preview 버전을 대체하며 에이전트 성능이 대폭 향상된 모델입니다. 본 모델은 사후 분석 및 추론을 위한 Speculative Decoding 모듈인 DSpark가 탑재된 아키텍처를 공유합니다.

핵심 방법론 및 기술적 특징

  1. DSpark Speculative Decoding:
본 모델은 효율적인 추론을 위해 DSpark 기술을 활용합니다. 이는 vLLM 프레임워크 내에서 --speculative-config 파라미터를 통해 구현되며, 추론 시 draft 모델이 미리 토큰을 생성하여 검증하는 방식을 통해 처리량을 극대화합니다. 설정 예시는 다음과 같습니다:
--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'

  1. 추론 최적화 및 파라미터 제어:
    • Reasoning Effort: reasoning_effort 파라미터(low, high, max)를 통해 모델이 답변 생성 전 수행하는 숙고(deliberation) 과정을 조절할 수 있습니다.
    • Sampling Parameters: 에이전트 시나리오에서는 temperature=1.0temperature = 1.0, topp=0.95top_p = 0.95를 권장하며, 고도의 추론이 필요한 상황에서는 최대 384K 토큰의 출력 길이를 지원합니다.
    • 하드웨어 가속: moe-backenddeep_gemm_mega_moe를 사용하고, KV Cachefp8로 설정하여 연산 효율성을 높였습니다.
  1. 성능 지표:
DeepSeek-V4-Flash-0731은 활성화 파라미터 수(activated parameter count)가 적음에도 불구하고, Terminal Bench, NL2Repo, Cybergym, DeepSWE 등 주요 에이전트 벤치마크에서 이전 버전 및 경쟁 모델을 상회하는 성과를 보였습니다. 특히 DSBench-Hard와 같은 고난도 코딩 에이전트 문제에서 뛰어난 효율성과 정확도를 입증했습니다.

  1. 입출력 처리:
Jinja 기반의 표준 템플릿 대신 OpenAI 호환 포맷을 따르는 별도의 인코딩 스크립트를 제공합니다. reasoning_content 필드를 통해 모델의 내부 사고 과정을 구조적으로 관리하며, encode_messages 함수를 사용하여 thinking_modereasoning_effort를 사전에 정의하여 입력을 생성합니다.

이 모델은 MIT License를 따르며, 대규모 문맥(Million-token context) 환경에서의 지능형 처리를 위해 최적화된 아키텍처와 추론 프레임워크를 결합한 최신 기술 구현체입니다.