DeepSeek-V3
DeepSeek-V3는 총 6,710억 개의 파라미터(토큰당 370억 개 활성화)를 갖춘 강력한 Mixture-of-Experts(MoE) 언어 모델입니다. 효율적인 추론과 비용 효율적인 학습을 위해 Multi-head Latent Attention(MLA) 및 DeepSeekMoE 아키텍처를 채택했으며, 부가 손실이 없는(auxiliary-loss-free) 부하 분산 전략과 멀티 토큰 예측(Multi-Token Prediction) 학습 목표를 도입했습니다. 14조 8,000억 개의 다양하고 고품질의 토큰으로 사전 학습되었으며, 철저한 평가 결과 오픈소스 모델 중 최고 수준의 성능과 선도적인 클로즈드 소스 모델에 필적하는 성능을 보여줍니다. 학습에는 총 278만 8,000 H800 GPU 시간이 소요되었습니다.
파일 탐색기
최종 버전 다운로드 (.zip)- bug_report.md
- feature_request.md
- stale.yml
- benchmark.png
- niah.png
- config_16B.json
- config_236B.json
- config_671B.json
- config_v3.1.json
- convert.py
- fp8_cast_bf16.py
- generate.py
- kernel.py
- model.py
- requirements.txt
- .gitignore
- LICENSE-CODE
- LICENSE-MODEL
- README.md
- README_WEIGHTS.md
// repository documentation
Was this content helpful?
(0 ratings)
