DeepSeek 模型谱系
从代码模型与稠密 LLM 起步,经 MoE、MLA、稀疏注意力到开放推理与超长上下文,DeepSeek 把训练/推理效率写成持续主线。
历代模型
DeepSeek-V4-Pro 正式版(V4-Pro-0813)
Pro 预览转正:1.6T 总参 MoE、1M 上下文、最大输出 38.4 万 token,首次原生支持图像推理;DeepSWE 12.8→62.7 超过 Opus 4.8,V4 系列全部 GA;同日开源 Agent 框架 DeepSeek Harness v0.1。
DeepSeek-V4-Flash 正式版(V4-Flash-0731)
Flash 预览转正:思考/非思考双模式、1M 上下文、Agent 能力增强与推测解码;8 月 6 日公告整体上调 API 定价,低价策略进入转折期。
DeepSeek-V4 Pro / Flash
开放 1M 上下文预览:Pro(约 1.6T 总参)主打高难度推理与 Agent 编程,Flash(约 284B)以更小激活提供接近能力与更高效率。
DeepSeek-V3.2
稀疏注意力与推理效率正式版,并附 Speciale 等强化推理变体。
DeepSeek-Math-V2
基于 V3.2-Exp 骨干的数学增强,延续自验证与可验证奖励训练思路。
DeepSeek-V3.2-Exp
引入 DeepSeek Sparse Attention,为更长上下文与更低注意力成本做实验性落地。
DeepSeek-V3.1-Terminus
修复中英混杂与异常字符等问题,提升生产可用性。
DeepSeek-V3.1
同一模型整合思考/非思考模式,并显著强化工具使用与 Agent 编程相关基准。
DeepSeek-R1-0528
R1 增量更新,在多项基准上超过初代 R1 与 V3-0324。
DeepSeek-Prover-V2
形式化证明专用系列,把可验证数学推向独立模型线。
DeepSeek-V3-0324
V3 后训练升级(MIT),强化推理、代码与工具使用,并吸收 R1 阶段经验。
DeepSeek-R1
以强化学习驱动长链条推理并开放权重(含蒸馏小模型),重新定价推理模型能力与获取门槛。
DeepSeek-V3
671B MoE(约 37B 激活),低精度训练与高数据效率展示开放前沿模型的成本优势。
DeepSeek-VL2
视觉—语言系列,把多模态理解并入 DeepSeek 效率架构路线。
DeepSeek-V2.5
合并通用对话与代码能力,单一 chat 端点覆盖开发者日常工作流。
DeepSeek-Coder-V2
基于 V2 MoE 骨干的代码系列,覆盖更多编程语言与更长上下文,面向仓库级开发。
DeepSeek-V2
MLA(多头潜在注意力)+ MoE,大幅降低 KV 缓存与训练/推理成本,并扩展长上下文。
DeepSeek-Math
在 Coder 基座上强化数学;配套 GRPO 等强化学习算法,为后续推理训练埋线。
DeepSeek-MoE
引入共享专家 + 路由专家的 MoE 变体,以约 2.7B 激活逼近更大稠密模型表现。
DeepSeek-LLM
7B/67B 中英通用模型(Base/Chat),架构接近 Llama 路线,补齐通用对话与知识能力。
DeepSeek Coder
首个公开模型系列(约 1.3B–33B Base/Instruct),以代码预训练为主,奠定「先做开发者工具」的路径。