DeepSeek-V3

(★ 104,379)

DeepSeek-V3는 총 6,710억 개의 파라미터(토큰당 370억 개 활성화)를 갖춘 강력한 Mixture-of-Experts(MoE) 언어 모델입니다. 효율적인 추론과 비용 효율적인 학습을 위해 Multi-head Latent Attention(MLA) 및 DeepSeekMoE 아키텍처를 채택했으며, 부가 손실이 없는(auxiliary-loss-free) 부하 분산 전략과 멀티 토큰 예측(Multi-Token Prediction) 학습 목표를 도입했습니다. 14조 8,000억 개의 다양하고 고품질의 토큰으로 사전 학습되었으며, 철저한 평가 결과 오픈소스 모델 중 최고 수준의 성능과 선도적인 클로즈드 소스 모델에 필적하는 성능을 보여줍니다. 학습에는 총 278만 8,000 H800 GPU 시간이 소요되었습니다.

  • .gitignore
  • LICENSE-CODE
  • LICENSE-MODEL
  • README.md
  • README_WEIGHTS.md
// repository documentation