
Paper
이 제약 조건을 통해 의 spectral norm을 1 이하로 유지하여 깊은 층에서도 수치적 안정성을 확보하고, Sigmoid 함수를 통해 입력 및 출력 매핑()의 비음수성과 유계성을 보장한다.
DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence
Chenze Shao
2026.07.31
·Arxiv·by Mineru#AI Research#Attention Mechanism#LLM#Long Context#MoE
핵심 포인트
- 1DeepSeek-V4 시리즈는 Mixture-of-Experts(MoE) 구조를 기반으로 Manifold-Constrained Hyper-Connections(mHC)와 Muon optimizer를 도입하여 학습 효율성과 모델 안정성을 대폭 향상시켰습니다.
- 2하이브리드 어텐션 기술인 Compressed Sparse Attention(CSA)과 Heavily Compressed Attention(HCA)을 통해 100만 토큰의 긴 문맥 처리 시 필요한 KV cache와 연산량을 획기적으로 절감했습니다.
- 3최첨단 추론 능력과 긴 문맥 지원 역량을 겸비한 DeepSeek-V4-Pro-Max는 다양한 벤치마크에서 기존 오픈 소스 모델을 상회하며, 실용적인 에이전트 워크플로우와 테스트 타임 스케일링의 새로운 가능성을 제시합니다.
DeepSeek-V4 시리즈는 160만 개(1.6T) 및 284B 파라미터를 갖춘 Mixture-of-Experts (MoE) 기반 언어 모델로, 100만 토큰의 컨텍스트 길이를 효율적으로 처리하기 위해 설계된 모델이다. 이 모델은 기존 DeepSeek-V3의 아키텍처를 계승하되, 하이퍼 파라미터 최적화, 효율적인 어텐션 메커니즘, 그리고 고성능 최적화 기법을 도입하여 대규모 추론 및 장문 컨텍스트 처리에 최적화된 성능을 제공한다.
1. 핵심 아키텍처 혁신
- Manifold-Constrained Hyper-Connections (mHC): 기존의 잔차 연결(residual connections)을 고도화하여 신호 전파의 안정성을 극대화한다. mHC는 잔차 매핑 행렬 을 Birkhoff polytope인 doubly stochastic matrices의 다양체(manifold) 에 투영시킨다.
이 제약 조건을 통해 의 spectral norm을 1 이하로 유지하여 깊은 층에서도 수치적 안정성을 확보하고, Sigmoid 함수를 통해 입력 및 출력 매핑()의 비음수성과 유계성을 보장한다.
- Hybrid Attention (CSA & HCA):
- Compressed Sparse Attention (CSA): 시퀀스를 단위로 압축하여 KV cache 크기를 줄인 뒤, DeepSeek Sparse Attention (DSA)을 적용한다. 쿼리 토큰과 압축된 KV 엔트리 간의 점수는 저랭크(low-rank) 방식으로 생성된 indexer queries와 Lightning Indexer를 통해 결정되며, 상위 개의 압축된 KV 엔트리만을 선별하여 어텐션을 수행한다.
- Heavily Compressed Attention (HCA): 더 큰 단위()로 압축하여 장거리 컨텍스트에서의 연산 효율을 극대화한다.
2. 최적화 및 인프라
- Muon Optimizer: 학습 수렴 속도와 안정성을 높이기 위해 Muon 옵티마이저를 도입하였다.
- 인프라 기술:
- TileLang: 생산성과 런타임 효율을 균형 있게 맞춘 DSL(Domain-Specific Language)을 활용하여 커널을 개발하였다.
- Fine-Grained Communication-Computation Overlap: MoE 모듈에서 연산과 통신을 완벽히 중첩시키는 단일 융합 커널을 구현하였다.
- FP4 Quantization-Aware Training: MoE 전문가 가중치와 인덱서 QK 경로에 FP4 정밀도를 적용하여 메모리 사용량과 연산 비용을 획기적으로 낮췄다.
3. 학습 파이프라인
- 사전 학습: 32T 이상의 토큰을 사용하여 대규모 학습을 진행하였다.
- 사후 학습 (Post-Training): 도메인별 전문가 모델을 개별적으로 학습(SFT 및 GRPO 사용)시킨 뒤, On-Policy Distillation을 통해 단일 통합 모델로 지식을 결합하는 2단계 파이프라인을 채택하였다. 이를 통해 수학, 코딩, 에이전트 등 다양한 영역에서 높은 범용성과 전문성을 동시에 확보하였다.