🐋 DeepSeek 架构精讲:从 V3 到 V4

一条主线讲完 MoE 王者.evolution:V3 底座 → R1 推理强化 → V3.1 混合推理 → V3.2 稀疏注意力,以及为什么机器人圈都在用它做底座
MLAGRPOMTPFP8纯RL觉醒
🎯 本页学习目标
1. 画出 V3 四大架构创新(MoE 均衡/MLA/MTP/FP8)
2. 讲清 R1「纯 RL 催生推理」与四阶段管线
3. 知道 V3.1/V3.2/V4 各自解决什么
建议用时:30 分钟

1 V3 底座:四大架构创新

创新解决什么一句话原理
细粒度 MoE(256+1 专家)知识容量与算力解耦每 token 路由 8 个细分专家 + 1 共享专家;用「辅助损失免费」的均衡策略替代强惩罚,不牺牲性能换均衡
MLA 多头潜在注意力KV Cache 太贵把 KV 压缩到低维隐向量缓存,推理时长上下文显存降一个量级,效果对齐全注意力
MTP 多 token 预测训练信号密度/推理加速一次预测未来多个 token:训练时多份监督信号,推理时可配投机解码加速
FP8 混合精度训练训练成本首个在超大规模验证 FP8 训练的主流开源模型;V3 全量训练成本约 557.6 万美元(GPU 时租口径,不含研发/缓存等——第三方推算口径不同,详见 SemiAnalysis 争议)
📌 参数口径(重要):V3 = 671B 总参 / 约 37B 激活 / 61 层 / 128K 上下文。所有第三方「实际成本 ×N」的推算都只计 GPU 租金口径,与全成本口径不矛盾——面试答到这层区分即满分。
MHA 标准多头:每头各自缓存 KV Cache = 头数 × 每头维度 × 词数 × 2(K与V) —— 长文迅速爆显存 MLA 潜在压缩:联合压成低维隐向量 缓存 = 隐维 × 词数(≈1/10) 用时经上投影「升维重建」K/V,效果对齐全注意力 类比:以前每层每头都存完整笔记;现在只存一份压缩摘要,要用时再展开
图 1:MHA 与 MLA 的 KV Cache 占用对比——MLA 只缓存低秩投影,显存显著瘦身

2 MLA 低秩投影数学:KV Cache 怎么瘦下来的

MLA 的全部魔法一句话:别再逐头缓存 K 和 V,缓存它们低秩压缩后的「摘要」c_kv,用时再上投影重建

c_{k v}=W_{U K V}\, h_t, \qquad K,V = \text{UpProj}(c_{k v}), \qquad \mathrm{Cache}_{MLA} \approx \tfrac{1}{10}\,\mathrm{Cache}_{MHA}

逐项说人话:h_t 是第 t 个 token 的隐向量;W_UKV 是一个「压缩投影」,把每个头各自的 K/V 联合压进一个低维隐空间得到 c_kv;注意力计算时再经上投影「升维重建」出各头要用的 K 和 V。推理时只需缓存 c_kv——它的维度远小于「头数×每头维度×2」,所以 KV Cache 约降为 MHA 的 1/10 量级(128K 上下文场景从几十 GB 压到几 GB 级),效果对齐全注意力。RoPE 解耦一句话:RoPE 旋转位置编码直接作用在压缩后的 c_kv 上会破坏「压缩后仍可重建」的性质,所以 MLA 把每个 q/k 拆成两半——位置分量(一小维,单独走 RoPE、不参与压缩)与内容分量(走低秩压缩),两条通道各司其职,位置信息与压缩收益兼得。

3 R1:纯强化学习「觉醒」推理

R1-Zero 证明了行业级震撼结论:不做任何监督微调,直接用可验证奖励(数学/代码对错)做纯 RL,模型自己学会「先写长思考再给答案」——中途出现顿悟时刻(aha moment):自我怀疑、回溯重验。R1 在此基础上加冷启动数据与可读性约束,推理性能对齐 OpenAI o1,论文登 Nature,并把 6 个 1.5B~70B 蒸馏小模型开源。

① 冷启动少量长思考SFT ② 推理 RL可验证奖励+语言一致 ③ 拒绝采样 SFT全场景数据重冷启 ④ 全场景 RL推理+有用+无害 输出:R1(对齐 o1)+ 6 个蒸馏小模型开源 · 登 Nature
图 2:DeepSeek-R1 推理管线——思考/非思考双模式按需切换

4 V3.1 / V3.2 / V4:三条进化线

5 常见误区

🚫 误区 1 · 把 MLA 等同于 MQA/GQA:MQA 是所有头共享一份KV,GQA 是分组共享——思路都是「砍头数」,精度随共享比例下降;MLA 走的是另一条路:低秩压缩+上投影重建,所有头从同一隐向量恢复,压缩率更高且效果对齐全注意力。三者同属「省 KV Cache」,数学机制完全不同,面试别混为一谈。
🚫 误区 2 · 「R1 纯 RL=全程无监督」:「纯 RL」指的是 R1-Zero 验证、以及正式 R1 管线中的推理 RL 阶段不依赖 SFT 冷启动,不是「整个训练全程无监督」——正式版 R1 恰恰有①冷启动 SFT 与③拒绝采样 SFT(见上图四阶段)。把「纯 RL 觉醒」外推成「大模型不需要 SFT」是典型以偏概全。
🚫 误区 3 · 「557.6 万美元=DeepSeek 总投入」:该数字只覆盖最终训练 run 的 GPU 时租口径,不含前期研究、失败实验、infra 建设与人力;SemiAnalysis 等第三方的「×N 倍」推算走的是全周期投入口径。两个口径说的是不同的东西、不矛盾——正确答法是先问「哪个口径」,再给数字。

6 本节自测

1. MLA 解决的核心问题是?
💡 解析: B 正确——MLA 把 KV 压进低维隐向量 c_kv,缓存体积降一个量级,长上下文+高并发才能在有限显存里跑起来(见第 2 节数学)。A 错在「专家负载不均」是 MoE 路由的问题(上一页的辅助损失/偏置调节管它),与注意力缓存无关;C 「训练不稳定」主要靠优化器、精度策略与超参解决,MLA 是推理期显存优化;D 「词表过大」影响 embedding 参数量,和 KV Cache 的膨胀机制完全是两码事。
2. R1-Zero 最震撼的结论是?
💡 解析: C 正确——R1-Zero 证明:不做任何 SFT,只用可验证奖励(数学/代码对错)做纯 RL,长思考、自我回溯等推理行为会自发涌现,不是教出来的。A 错在「MoE 比 Dense 强」是架构路线对比,与 RL 催生推理的结论无关;B 错在「FP8 可以训练」是 V3 的工程贡献,属于训练成本故事;D 错在「蒸馏比 RL 好」——两者互补而非对立,R1 自己也蒸馏了 6 个小模型,蒸馏的正是 RL 训出的能力。
3. GRPO 相比 PPO 去掉了什么?
💡 解析: A 正确——同一题采样一组答案,以组内平均当基线,critic(价值网络)整个省掉,显存减半、调参减半(详见下一页三大目标函数)。B 错在「策略网络」是 RL 的优化主体,去掉它就没有可训练的对象;C 错在奖励来源(奖励模型或可验证奖励)仍然必需——没有奖励信号,组内比较无从算起;D 错在「环境交互」照旧进行,GRPO 改变的只是「基线怎么估」,不是「数据怎么采」。
4. V3.1「混合推理」指的是?
💡 解析: B 正确——同一模型「思考/非思考」双模式合一:简单问题直出答案省 token,难题先长思考再作答,V3.1 合并了 R1 与 V3 两条产品线。A 错在「MoE+Dense 混合」是架构拼凑的误解,V3.1 底座仍是 MoE,混合的是回答模式不是专家结构;C 错在「FP8+FP16 混合」是数值精度方案(V3 训练侧的事),与推理模式无关;D 错在「文本+图像混合」是多模态能力的范畴,V3.1 的「混合」一词指的是思考模式切换。
5. MTP(多 token 预测)的收益是?
💡 解析: D 正确——每个位置同时预测未来多个 token:训练时多份监督信号、学得更密;推理时主模型+MTP 头组成投机解码组合,草稿接受率可观、生成加速。A 错在「只为省显存」——MTP 不动权重与 KV Cache 的大头,省显存是 MLA 的活;B 错在「只为加上下文」——上下文长度是位置编码/外推方案的事,MTP 管的是「一次看多远」的训练信号;C 错在「代替 MoE」——MTP 与 MoE 正交:一个管预测目标与解码加速,一个管 FFN 结构,V3 两者同时用。
6. 「557.6 万美元训练成本」的正确理解?
💡 解析: B 正确——557.6 万美元仅覆盖正式训练阶段(final run)的 GPU 时租,不含研究/实验/infra/人力;第三方高倍率推算走的是全周期投入口径,两者口径不同、并不矛盾。A 错在「全部研发投入」——把 GPU 租金当总账,忽略了无数失败实验与人力成本;C 错在「官方承认的全部成本」同样是口径拔高,论文只声明了训练 run 这一段;D 错在量级都不对,这是训练集群的总租金而非单卡价格。面试标准动作:先问「哪个口径」,再谈数字。
7. DSA(DeepSeek 稀疏注意力)的本质?
💡 解析: A 正确——DSA 用「闪电索引器」先挑出最相关的少量 token,注意力从「看全部」变「精准看少量」,长上下文成本大降且效果对标 Dense 注意力。B 错在「减少层数」是架构深度的选择,DSA 改的是注意力计算方式,层数不动;C 错在「换掉 MoE」无中生有——DSA 只动注意力模块,MoE 底座原样保留;D 错在「量化权重」是数值压缩(INT4 之类),DSA 是计算稀疏化,一个压精度、一个省计算,手段和对象都不同。
8. 机器人团队选 DeepSeek 做具身底座的主要理由?
💡 解析: C 正确——选底座的三角是能力×成本×可控性:开源权重可私有部署(数据不出域)、MoE/MLA 让推理成本低、推理 RL 充分训练让能力强,三点均衡才便于叠加动作头微调做具身底座。A 错在「便宜就行」太片面——能力不足时便宜没有意义,机器人任务要的是推理与指令跟随;B 错在「参数最大」恰是要避开的口径陷阱:部署成本看激活参数与量化,不看总参数纸面大小;D 错在「只支持中文」与事实相反,DeepSeek 的多语言与代码能力均属第一梯队。
📌 本节小结:V3 用 MoE+MLA+MTP+FP8 把「大知识、低推理成本」做成工程现实;R1 证明纯 RL 能长出推理;V3.1/V3.2 持续把成本与体验往深推。
🤔 思考题:1. 为什么「辅助损失免费」的均衡比强辅助损失更好?2. 如果你的机器人只有 24G 显存,蒸馏小模型与量化 V3 怎么选?

7 参考来源(更新至 2026-08)