DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence
Paper

DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence

Chenze Shao
2026.07.31
·Arxiv·by Mineru
#AI Research#Attention Mechanism#LLM#Long Context#MoE

핵심 포인트

  • 1DeepSeek-V4 시리즈는 Mixture-of-Experts(MoE) 구조를 기반으로 Manifold-Constrained Hyper-Connections(mHC)와 Muon optimizer를 도입하여 학습 효율성과 모델 안정성을 대폭 향상시켰습니다.
  • 2하이브리드 어텐션 기술인 Compressed Sparse Attention(CSA)과 Heavily Compressed Attention(HCA)을 통해 100만 토큰의 긴 문맥 처리 시 필요한 KV cache와 연산량을 획기적으로 절감했습니다.
  • 3최첨단 추론 능력과 긴 문맥 지원 역량을 겸비한 DeepSeek-V4-Pro-Max는 다양한 벤치마크에서 기존 오픈 소스 모델을 상회하며, 실용적인 에이전트 워크플로우와 테스트 타임 스케일링의 새로운 가능성을 제시합니다.

DeepSeek-V4 시리즈는 160만 개(1.6T) 및 284B 파라미터를 갖춘 Mixture-of-Experts (MoE) 기반 언어 모델로, 100만 토큰의 컨텍스트 길이를 효율적으로 처리하기 위해 설계된 모델이다. 이 모델은 기존 DeepSeek-V3의 아키텍처를 계승하되, 하이퍼 파라미터 최적화, 효율적인 어텐션 메커니즘, 그리고 고성능 최적화 기법을 도입하여 대규모 추론 및 장문 컨텍스트 처리에 최적화된 성능을 제공한다.

1. 핵심 아키텍처 혁신

  • Manifold-Constrained Hyper-Connections (mHC): 기존의 잔차 연결(residual connections)을 고도화하여 신호 전파의 안정성을 극대화한다. mHC는 잔차 매핑 행렬 BlB_l을 Birkhoff polytope인 doubly stochastic matrices의 다양체(manifold) MM에 투영시킨다.
BlM={MRnhc×nhcM1n=1n,1nTM=1nT,M0}B_l \in M = \{M \in \mathbb{R}^{n_{hc} \times n_{hc}} \mid M1_n = 1_n, 1_n^T M = 1_n^T, M \geqslant 0\}
이 제약 조건을 통해 BlB_l의 spectral norm을 1 이하로 유지하여 깊은 층에서도 수치적 안정성을 확보하고, Sigmoid 함수를 통해 입력 및 출력 매핑(Al,ClA_l, C_l)의 비음수성과 유계성을 보장한다.

  • Hybrid Attention (CSA & HCA):
    • Compressed Sparse Attention (CSA): 시퀀스를 mm 단위로 압축하여 KV cache 크기를 줄인 뒤, DeepSeek Sparse Attention (DSA)을 적용한다. 쿼리 토큰과 압축된 KV 엔트리 간의 점수는 저랭크(low-rank) 방식으로 생성된 indexer queries와 Lightning Indexer를 통해 결정되며, 상위 kk개의 압축된 KV 엔트리만을 선별하여 어텐션을 수행한다.
    • Heavily Compressed Attention (HCA): 더 큰 단위(mmm' \gg m)로 압축하여 장거리 컨텍스트에서의 연산 효율을 극대화한다.

2. 최적화 및 인프라

  • Muon Optimizer: 학습 수렴 속도와 안정성을 높이기 위해 Muon 옵티마이저를 도입하였다.
  • 인프라 기술:
    • TileLang: 생산성과 런타임 효율을 균형 있게 맞춘 DSL(Domain-Specific Language)을 활용하여 커널을 개발하였다.
    • Fine-Grained Communication-Computation Overlap: MoE 모듈에서 연산과 통신을 완벽히 중첩시키는 단일 융합 커널을 구현하였다.
    • FP4 Quantization-Aware Training: MoE 전문가 가중치와 인덱서 QK 경로에 FP4 정밀도를 적용하여 메모리 사용량과 연산 비용을 획기적으로 낮췄다.

3. 학습 파이프라인

  • 사전 학습: 32T 이상의 토큰을 사용하여 대규모 학습을 진행하였다.
  • 사후 학습 (Post-Training): 도메인별 전문가 모델을 개별적으로 학습(SFT 및 GRPO 사용)시킨 뒤, On-Policy Distillation을 통해 단일 통합 모델로 지식을 결합하는 2단계 파이프라인을 채택하였다. 이를 통해 수학, 코딩, 에이전트 등 다양한 영역에서 높은 범용성과 전문성을 동시에 확보하였다.

4. 성능 및 효율성

DeepSeek-V4는 100만 토큰 설정에서 기존 DeepSeek-V3.2 대비 단일 토큰 추론 FLOPs를 27%(Pro 모델 기준)로 감소시키고, KV cache 사용량은 10% 수준으로 절감하였다. 특히 테스트 타임 스케일링(test-time scaling)을 위한 추론 과정에서 100만 토큰의 컨텍스트를 효율적으로 지원함으로써, 복잡한 에이전트 작업 및 대규모 문서 분석에서 SOTA급 성능을 달성하였다.