🗺️ 大模型演进全景:从 Transformer 到前沿
八年演进一条线:架构怎么变、为什么这么变、当前工程卡在哪——把碎片化的「模型新闻」串成一张可以面试答题的知识网
演进史缩放定律架构工程线工程十大问题2026 前沿
🎯 本页学习目标
1. 能按「三个时代」口述 2017→2026 大模型演进主线,每个时代说出代表模型与关键转折
2. 能解释缩放定律(Kaplan 与 Chinchilla 两种说法)以及「涌现」争议
3. 能独立讲清五条架构工程线(位置编码 / 注意力 / 算子 / 归一化 / 激活)各自解决什么问题
4. 能列举当前大模型工程的十大核心问题,并对每个问题说出「为什么难 + 工业界现状解法」
建议用时:约 40 分钟(精读) |
前置:建议先读
07-01 大模型基础与 MoE
1 一张图看完八年:三个时代
大模型这八年,可以压缩成三个时代:架构奠基期(2017-2019)——大家争先证明「注意力就是一切」,把 Transformer 这台发动机造出来;规模竞赛期(2020-2022)——发动机造好了,大家疯狂加大排量,直到 ChatGPT 发现「好不好开」比「排量大」更关键;工程深化期(2023-2026)——粗放堆料到头,转入精细化工程:稀疏化、省显存、拉长上下文、教会模型「思考」。本页就是沿着这条主线,把每一站的「为什么」讲透。
图① 大模型八年演进时间线(2017-2026):三个时代、九个关键节点。圆点颜色对应所属时代
💡 怎么读这条时间线:注意节点颜色的迁移——蓝色(架构)是「发明工具」,橙色(规模)是「使用工具」,绿色/红色(工程)是「打磨工具」。面试里讲演进,最忌报菜名式罗列模型名;按三个时代讲因果,每句话都有「因为…所以…」,层次立刻不同。
2 起点 Transformer:它到底解决了 RNN 的什么病
2017 年之前,序列建模的主流是 RNN/LSTM:像读报只有一个人、一个字一个字往后念——第 100 个词的记忆要经过 99 次口头转述才能用上,转述路上不断丢失(梯度消失),而且必须念完上一个才能念下一个(串行,无法并行)。Transformer 用自注意力同时根治两个病:任何两个词之间都是一步直达(长程依赖变成 O(1) 条路径),整句话所有位置同时算(训练可以大规模并行,吃满 GPU)。可以说:没有并行化,就没有后来的「大力出奇迹」。
原始论文是 Encoder-Decoder 双塔结构(为机器翻译设计),经典架构如图②:左塔 Encoder 是双向注意力,负责「读懂整个输入句子」,右塔 Decoder 负责「一个词一个词写出输出」;每个子层都带 Add & Norm(残差捷径+归一化),位置信息由底部的 Positional Encoding 注入,堆叠整体重复 N 次。🎯 图中每个英文色块都可以点击朗读对应术语——面试聊 Transformer 时,这一排词就是开口要说的词,边看边读印象最深。
图② 原始 Transformer 经典架构(2017 论文,双语标注):左塔 Encoder 读懂输入,右塔 Decoder 逐词写出输出;色块可点击朗读英文
💡 怎么读这张图(自下而上跟着数据走):① Input Embedding 把词查表变向量,Positional Encoding(旋转符号)给向量盖上「位置戳」;② 左塔每层先 Multi-Head Attention(词与词开会交换信息)再 Feed Forward(独立消化),每步都配 Add & Norm 残差捷径;③ 右塔最底部多了 Masked Multi-Head Attention——「masked」就是不许偷看后面的词(正是上一页实验台②的因果掩码);④ 中间横向箭头把 Encoder 的理解结果(K、V)送给 Decoder 的交叉注意力——「拿 Decoder 的问题去 Encoder 的理解里查资料」;⑤ 最后 Linear 把向量映到词表大小、Softmax 变成概率,得到 Output Probabilities。Outputs (shifted right) 是训练技巧:把标准答案整体右移一位喂给 Decoder,让它永远在「猜下一个词」。
但随后五年,行业实际收敛到了 Decoder-only(纯解码器,自回归生成:只根据已生成的词预测下一个词)一种形态——这是演进史上第一个重要的「为什么」:
图③ 架构收敛:三种形态最终汇聚到 Decoder-only(虚线=式微路线,实线=主流路线)
展开说三条收敛原因:① 训练信号最简单——「预测下一个词」不需要任何人工标注,互联网上任何一段文本都是教材,数据规模可以无限堆;② 与生成任务天然对齐——对话、写作、写代码本质都是「续写」,Decoder 从结构上就是为续写而生的;③ 工程友好——生成时每步只算一个新 token,历史的 K/V 可以缓存增量复用(即 KV Cache,第 9 节会看到它如何成为工程核心矛盾),Encoder-Decoder 的交叉注意力则没这么干净。BERT 那条「理解路线」(偏 NLU 自然语言理解)并没有消失,而是被「生成模型顺便也能理解」吸收了——Decoder-only 一条路同时包揽 NLG(生成)与 NLU(理解)。
⚠️ 常见误解:「Transformer=GPT」。Transformer 是一种积木(自注意力+前馈+残差),GPT/BERT/T5 是用同样积木搭出的不同房子。面试说「Transformer 之后都是 Decoder-only」是准确的;说「Transformer 就是大模型」则暴露没分清积木和房子。
3 规模竞赛期:缩放定律与它的第一次修正
架构定型后,2020-2022 的主旋律只有一个字:大。参数量三年翻了三个数量级,而支撑这种「大力出奇迹」的理论依据,是 2020 年 OpenAI 提出的缩放定律(Scaling Laws)。
| 模型 | 发布 | 参数量 | 训练数据 | 关键意义 |
| GPT-1 | 2018.06 | 约 1.17 亿 | 约 5GB 文本 | 证明「生成式预训练+微调」范式可行 |
| GPT-2 | 2019.02 | 约 15 亿 | 约 40GB(WebText) | 零样本多任务雏形,因「太危险」分阶段发布 |
| GPT-3 | 2020.05 | 约 1750 亿 | 约 3000 亿 token | 上下文学习(in-context learning)涌现 |
| Chinchilla | 2022.03 | 约 700 亿 | 约 1.4 万亿 token | 同算力下反超 GPT-3 级模型,修正缩放定律 |
图④ 缩放定律与 Chinchilla 修正:左为 Kaplan 版「堆就完了」,右为 Chinchilla 版「参数与数据要配平」
Kaplan 版(2020)说:只要算力够,性能提升是可预测的——这给了资本敢砸钱的信心(投入产出可以算账)。Chinchilla 版(2022)修正说:同样的算力预算,与其全砸参数,不如参数和数据按约 1:20 配平——GPT-3 那种「1750 亿参数只喂 3000 亿 token」相当于招了巨人却只给一半口粮。这个修正直接改写了后续路线:Llama 2(70B/2T token)之后的模型几乎全部「喂得远比 Chinchilla 更饱」,因为推理成本让「小参数」永远香,而数据可以靠合成与多轮 epoch 补足。
另一个被频繁引用又争议不断的概念是涌现(Emergence):2022 年有论文称某些能力(多步算术、思维链)在规模越过某个阈值后「突然出现」。2023 年斯坦福的研究则泼了冷水:很多「涌现」是评测指标的假象——把连续评分换成「全对才算对」的非线性指标,平滑进步就会在图上看起来像突变。面试里两个方向都提一句,显得立场成熟:「涌现现象真实存在,但『悬崖式突变』里有相当部分是度量方式的产物」。
4 对齐革命:ChatGPT 为什么是分水岭
2022 年 11 月 30 日 ChatGPT 上线,底层技术(InstructGPT 的三阶段)其实当年年初就发了论文——它没有让模型「更聪明」,只是让模型「更好用」。一个比喻:基座模型是读完了整个图书馆的天才,但你要写周报,他给你背图书馆目录;对齐做的事,是给这位天才做岗前培训——
1SFT 监督微调
人类示范「好回答」长什么样,让模型模仿——相当于给岗位说明书
2Reward Model 奖励建模
人类对多个回答排序,训练出一个「打分器」——相当于把质检标准固化成模型
3RLHF 强化学习
模型生成回答、奖励模型打分,不断朝高分靠拢——按质检标准持续改进
这步之后,「可用性 > 智力」成为行业共识:一个 IQ 140 但说不明白的模型,打不过 IQ 130 且表达清晰的模型。后续演进(DPO 去掉显式奖励模型、GRPO 简化训练流程、可验证奖励用代码/数学题的对错当奖励)都在 07-03〈强化学习与后训练〉有专题,本页只需记住它在时间线上的位置:2022-2023 年的对齐革命,是「基座能力」到「产品体验」的惊险一跃。
5 架构演进工程线:五年打磨一台发动机
2023 年起,裸堆规模边际收益递减,竞争转移到同样算力下怎么把每一个 FLOPs、每一 GB 显存花在刀刃上。这条工程线上有五条相互独立的演进线,面试高频、也最容易被讲混,逐条过:
5.1 位置编码:从「写死地址」到「可旋转的相对坐标」
注意力本身是「无序」的——「猫追狗」和「狗追猫」在纯注意力眼里没区别,必须注入位置信息。演进线:正弦位置编码(2017,固定公式) → 可学习绝对位置(GPT-2,当词表一样学出来) → RoPE 旋转位置编码(2021)——把位置变成 q/k 向量在平面上的旋转角度,两个 token 的注意力得分只依赖「相对转角」,天然表达相对位置;更妙的是训练时只见过 4K 的转角范围,推理时用插值/频率微调(位置插值 PI、NTK-aware、YaRN,2023)就能外推到几十倍长度——这是后来「长上下文军备竞赛」的数学地基。iRoPE(Llama 4,2025)再进一步:部分层干脆不要位置编码、只做全局注意力,换取千万级上下文的泛化。
5.2 注意力变体:MHA→MQA→GQA→MLA,一条「省 KV Cache」的主线
这条线的全部动力来自第 9 节会展开的一个事实:推理时 KV Cache 是显存与带宽的第一大户。四个变体一脉相承:
图⑤ 注意力四变体:上为 Q/KV 头结构示意(蓝=Q 头,橙=KV 头),中柱为 KV Cache 相对占用,下为演进逻辑
面试标准答法:「MQA/GQA/MLA 都在解决同一个问题——KV Cache 太大。MQA 所有 Q 头共享一份 KV,省到极致但掉点;GQA 分组共享,精度几乎无损,是 Llama 系列的标配;MLA(DeepSeek-V2)不砍头,而是把 KV 压缩进一个低维潜向量 c_kv,注意力计算时再投影回来,配合 RoPE 解耦设计做到又省又不掉点。」三者的数学细节在 07-02〈DeepSeek 架构精讲〉有专门展开。
5.3 FlashAttention:不是近似,是「少搬数据」的精确算法
常被误解为「快速但粗糙的注意力」,实际上 FlashAttention(2022)的输出与标准注意力完全一致。它洞察到一个硬件事实:GPU 计算快、显存读写慢,HBM 带宽才是瓶颈。标准实现会把 N×N 的注意力矩阵整个写进显存再读出来;FlashAttention 用「分块+tiling+在线 softmax」让中间结果始终留在高速片上 SRAM 里,显存占用从 O(N²) 降到 O(N),速度提升 2~4 倍。这是「IO-aware 算法设计」的教科书案例,后续 FA-2(2023)、FA-3(2024)持续压榨硬件特性。一句话总结:数学没变,搬运变少。
5.4 归一化与激活函数:稳定性与效率的小改进
归一化走的是 Post-LN(2017,残差之后归一化,深层难训)→ Pre-LN(残差之前归一化,梯度更稳,GPT-2 起)→ RMSNorm(2019,去掉均值中心化只保留缩放,计算更省、效果基本不变,Llama/DeepSeek 等现代模型标配)的路线。激活函数从 GELU 演进到 SwiGLU(门控线性单元,给 FFN 加了一个「开关分支」,同参数量下效果更好)——这两个改动单看都「平平无奇」,但它们是所有 2023 后开源模型配置表里的默认项,看配置表时认识它们是基本功。
6 稀疏化:稠密模型到 MoE
参数继续变大,但每一步推理没必要动用全部参数——这就是 MoE(混合专家)的逻辑:把 FFN 拆成几十到几百个「专家」,路由器为每个 token 只选少数几个(如 8 个)干活,总参数巨大、单次计算量小。类比与四步流程在 07-01〈大模型基础与 MoE〉已用「医院分诊」讲透,这里只补时间线与代表数字:
- 2023.12 Mixtral 8x7B:约 467 亿总参、每 token 激活约 129 亿——MoE 第一次以「开源+效果好+推理便宜」组合进入主流视野;
- 2024.12 DeepSeek-V3:671B 总参、激活 37B,256 个路由专家+1 个共享专家,每 token 选 8,并用「无辅助损失的动态偏置」解决负载均衡老难题;
- 2025 开源 MoE 元年:Llama 4(Scout 约 109B 总参/17B 激活/16 专家)、Qwen3-235B-A22B、Kimi K2(1T 总参/32B 激活/384 专家)——前沿开源模型几乎全部 MoE 化,「稠密模型」退守小尺寸端侧场景。
代价也明确:显存要装下全部专家(哪个 token 选中哪个专家是运行时才知道的)、训练时专家并行的 all-to-all 通信容易变成集群瓶颈——所以 MoE 是「用显存和通信换算力」的生意,只在大集群场景划算。
7 推理范式转变:从「更大」到「想更久」
2024 年 9 月 OpenAI o1 系列开创了一个新轴:除了预训练规模、后训练对齐,「推理时多想几步」成为第三根性能杠杆——让模型先生成一段隐藏的思维链再作答,想得越久答得越好,类似「考试给草稿纸」。2025 年 1 月 DeepSeek-R1 用纯强化学习(GRPO 算法+可验证奖励)复现并开源了这条路,「推理模型」从此成为独立品类。
随后一年这条线快速工程化:GPT-5(2025.8)把快模型(gpt-5-main)和思考模型(gpt-5-thinking)合进一个统一系统,由路由器按题目难度自动分配「想多久」;Qwen3(2025.4)做成「思考/非思考」可开关的混合推理;DeepSeek-V4(2026.4 预览)把思考强度分成 low/high/max 档位。另外两个衍生品:蒸馏(R1 证明了长思维链可以被蒸馏进 7B~70B 小模型)与测试时缩放定律(思考 token 数与正确率的可预测关系)。专题细节在 07-02〈DeepSeek 架构精讲〉与 07-03,本页定位它在演进史里的意义:当预训练的数据与算力都逼近天花板时,「把算力花在推理时」是开辟第二增长曲线的关键转折。
8 长上下文与多模态:两个「必须做但很难做」的方向
长上下文:从 GPT-2 的 1K 到 GPT-4 的 8K/32K,再到 Claude 2 的 100K(2023.7)、GPT-4 Turbo 的 128K、Gemini 1.5 Pro 的 1M(2024)、Llama 4 Scout 宣称的 10M(2025),最后到 DeepSeek-V4 把 1M 做成标配(2026)。背后是三件套的持续工程:RoPE 外推(PI/NTK/YaRN)、注意力算子与稀疏化(下节)、以及「middle 迷失」等数据层面的针对性训练。注意「窗口大」不等于「用得好」——把关键信息埋在 100 万 token 中间,模型能不能找到,是另一回事(评测指标如 NIAH 大海捞针就是干这个的)。
多模态:2021 年 CLIP 用对比学习打通「图文对齐」;2023-2024 年主流做法是「外挂视觉编码器+投影层」;GPT-4o(2024.5)转向原生全模态(文本/图像/音频共用一套 token 空间端到端训练)。对具身智能的延伸是 VLA(视觉-语言-动作模型):RT-2、OpenVLA、π0、GR00T 把「动作」也变成 token——这正好接上本站 07-04〈基座选型与开源生态〉的具身 VLM 谱系。
9 ⭐ 当前工程十大问题(本页重点)
演进讲完,现在回答一个更实际的问题:如果你明天入职一家大模型公司(或要在大模型上做产品),工程团队此刻真正在愁什么?先把全景挂在这里,再逐个展开:
图⑥ 工程十大问题全景:训练侧管「喂什么、怎么验」,推理侧管「跑得动、跑得省」,行为侧管「答得对、靠得住」
下面逐个展开「问题是什么→为什么难→现在怎么办」。其中 ④⑤⑥ 三条是同一根藤上的瓜,先补一张图把推理过程拆开看:
图⑦ 推理两阶段:prefill 是「大灶台一次炒一桌菜」,decode 是「一位一位上菜还要每上一口回锅一次」——瓶颈从算力迁到显存带宽
| 问题 | 为什么难 | 工业界现状解法 |
| ① 数据枯竭 | 高质量公开文本被反复训练过;Chinchilla 式「喂饱」越来越贵;低质数据反而伤模型 | 合成数据(phi 系列「教科书级」合成);RL 自产思维链(R1 后范式);多模态数据扩充;数据配比与清洗工程化 |
| ② 算力与互联墙 | 单次前沿训练成本达亿美元级;GPU 间通信带宽(而非算力)常成真瓶颈;MoE 的 all-to-all 通信尤其凶猛 | 模型/张量/专家多维并行;FP8 混合精度训练(DeepSeek-V3);通信与计算重叠调度;国产算力栈补生态 |
| ③ 注意力 N² 复杂度 | 上下文长度翻倍,注意力计算量翻四倍;1M token 时代裸算注意力不经济 | 稀疏注意力(DeepSeek-V3.2 的 DSA、V4 的 CSA「token 维压缩+稀疏」);线性注意力/SSM(Mamba、MiniMax 闪电注意力);滑窗+少数全局层混合(Gemma 系) |
| ④ KV Cache 显存带宽 | decode 每生成一个字都要读全部 KV(图⑥);长上下文+大并发时显存先爆、带宽先满 | 结构层:GQA/MLA 压 KV;数值层:KV 量化(FP8/INT4);管理层:PagedAttention 按页分配;系统层:前缀缓存复用 |
| ⑤ 延迟与吞吐 | 首字延迟(TTFT)与每字延迟(TPOT)互相牵制;批处理提吞吐但加重单请求延迟 | 连续批处理(新请求即插即入);chunked prefill 把长 prompt 切片穿插;投机解码(小模型起草稿、大模型并行验签);多 token 预测 |
| ⑥ 幻觉 | 模型本质是「按概率续写」,编造一个「听起来对」的句子与说真话的计算成本相同;知识更新滞后于训练截止日 | RAG 检索增强(先查再答);工具调用(算术交给计算器、时效交给搜索);引用溯源与置信度校准;对「不知道」的奖励训练 |
| ⑦ 对齐税与奖励黑客 | RLHF 的奖励模型是代理目标,过度优化后模型学会「讨好打分器」而非真变好(奖励黑客);对齐过强又损伤能力(对齐税) | 可验证奖励(代码能跑、数学有标准答案,黑客无处藏身);DPO 直接偏好优化绕开显式奖励模型;过程奖励 PRM 盯步骤而非只盯结果 |
| ⑧ 评测污染 | 公开基准的题目大概率混进训练数据,分数虚高;「刷榜」与真实能力脱节 | 私域留出集;动态更新题库(LiveBench/LiveCodeBench);真实任务基准(SWE-bench 用真实 GitHub issue);人工盲评 |
| ⑨ Agent 长程可靠性 | 多步任务误差逐步累积,一步错步步错;上下文被中间过程塞满挤掉关键信息;工具调用格式与时机易错 | 任务分解+计划先行;反思与重试机制;代码/命令在沙箱执行;外部记忆与上下文压缩;前沿模型已能连续 200-300 步工具调用(Kimi K2 Thinking 口径) |
| ⑩ 端侧与能耗 | 数据中心功耗成为扩张硬约束;手机/机器人/车载的 NPU 显存与功耗预算比数据中心小几个数量级 | 权重量化(INT4/FP8);蒸馏小模型;云端协同(端侧做简单请求、云端兜底复杂请求);稀疏激活的 MoE 天然适配多核(与 08 板块 NPU 部署相接) |
💡 记忆抓手:十个问题可以按「喂什么(①③)、跑得动(②④⑤)、答得对(⑥⑦⑧)、落得下(⑨⑩)」四组记。面试被问「大模型现在的技术瓶颈」,按这四组各挑一两个展开,比背零散名词体系感强得多。
10 一条直觉主线:从一句话到一次对话
前面九节按时间讲完了「怎么走到今天」;这一节换一条轴——跟着一句话穿过整个系统,把全部知识串成一条线(讲解组织方式参考 B 站/抖音广为流传的闪客《一小时从 Transformer 到大模型》图解串讲,那个视频证明了:大模型完全可以用直觉讲明白)。建议配合 下一页实验室边看边玩:
| 步骤 | 在干什么(一句话) | 类比 | 深入读 |
| ① 文字变数字 | 分词器把「我爱机器人」切成 token,每个 token 查表变成一串数字(向量)——模型世界只有数字 | 把汉字翻译成电报码 | 实验室①④(下一页) |
| ② 盖位置戳 | 位置编码(RoPE)给每个向量盖上「我在第几格」的戳,词序才有意义 | 电影胶片的帧号 | 本页 §5.1 |
| ③ 找关系 | 自注意力:每个词向全场提问(Q),按相关度(K 打分)吸收别人的内容(V)——「它」就是这样找到「小猫」的 | 圆桌会议互相递纸条 | 实验室②(亲手算) |
| ④ 深加工 | 前馈网络(FFN)把交流来的信息逐词独立消化,大部分「知识」存在这一站的参数里 | 散会回工位消化笔记 | 07-01 §2 |
| ⑤ 反复堆叠 | ③④ 一轮算一层,叠几十层,残差捷径保梯度,越上层越抽象 | 逐级提炼的审稿流程 | 实验室③(动画) |
| ⑥ 海量接龙 | 预训练:在万亿 token 上反复练「猜下一个词」,语法/事实/推理全被压进参数 | 读完整座图书馆的接龙练习 | 本页 §3 |
| ⑦ 岗前培训 | 对齐(SFT/RLHF/DPO):用人类示范和偏好教会「好好回答」而不是「接着续写」 | 给天才做岗前培训 | 本页 §4 / 07-03 |
| ⑧ 打草稿 | 推理模型先生成思维链再作答,想得越久越准——「多想」成了第三根性能杠杆 | 考试先打草稿 | 本页 §7 / 07-02 |
| ⑨ 派活查资料 | 接上工具、检索与协议(Agent/RAG/MCP),从「答题者」变「干活的」 | 给配了秘书和图书馆 | 本页 §11 |
| ⑩ 提速省钱 | KV Cache/量化/投机解码/批处理,让以上一切跑得快、装得下、并发高 | 后厨动线优化 | 实验室④ / 本页 §9 |
💡 用法:面试时被问「讲讲大模型原理」,最稳的答法就是按这十步走——每步一句话,被追问再展开对应章节。这条主线也是本站 07 板块五页的目录。
11 从模型到工作流:Agent · 思维链 · MCP · Skills · 提示词
模型只是「引擎」,真正干活的是围着它搭的工作流。这一节的每个英文术语都可以点击朗读(配合导航栏左上角的「?」词卡与全站点读模式):
- Chain-of-Thought(思维链,CoT):在提示里要求「一步一步想」,模型先输出推理过程再给答案,复杂问题正确率显著提升——它是推理模型(§7)在应用层的最小化身,2022 年论文标题就是「大语言模型是零样本思维链推理器」。
- Prompt(提示词) 与 Prompt Engineering(提示词工程):提示词是给模型的输入指令,工程化设计(角色设定+示例+格式约束+验收标准)能稳定榨出模型能力;System Prompt(系统提示词) 是其中最前置、权重最高的一段。
- Context(上下文) 与 上下文压缩:窗口再大也有限,长对话/长文档要靠摘要、裁剪、外部记忆来管理;Prompt Compression(提示词压缩) 更进一步——用小模型把长提示压到几分之一长度同时保住关键信息,是省 token 费用的实用技术。
- AI Agent(智能体):以模型为「大脑」,加上规划(任务分解)、记忆(跨轮状态)与工具(搜索/代码/API),让它自主完成多步任务;典型循环是 ReAct——「想一步→动一步→看结果→再想」,误差累积与长程可靠性是当前主要瓶颈(§9 问题⑩)。
- MCP(Model Context Protocol,模型上下文协议):2024 年 11 月开源的行业标准,统一「模型↔工具/数据源」的接入方式——过去每个工具要为每个模型单独写适配,有了 MCP 就像所有设备都用上了 USB-C:一次开发,处处可用。本站题库、词卡等功能接 Agent 时即可走这类协议。
- Skills(技能包):把某领域的「怎么做」写成说明书+辅助脚本的可复用目录,模型按需加载——例如本站的
svg-diagram-check 技能就是一份「画图-审计-目检循环」的说明书。Skills 管知识复用,MCP 管工具连接,二者是 Agent 生态的互补层。
💡 全站英语点读:本页所有 绿色虚线术语都可以点击朗读;点导航栏左上角 ? 打开全站词卡(83 个术语/5 分类),开启「点读模式」后,任何页面上的英文单词点一下就能听发音——默认美式口音,优先本地音色零延迟。
12 FAQ
大模型到底是「数据库」还是「推理器」?
两者都是,但机制上更接近「有损压缩的世界模型+模式补全器」。预训练把海量文本压缩进参数,存储了海量「知识碎片」;推理时它用注意力检索碎片、按概率补全。它能表现出推理(尤其是推理模型显式生成思维链后),但「按相关性补全」的底色也是幻觉的根源——这解释了为什么 ⑥(幻觉)与 ⑧(可靠性)只能缓解、难以根除。
缩放定律还能继续吗?会不会撞墙?
预训练侧确实在放缓:可用数据见顶(问题①)、单次训练成本失控(问题②),单纯堆预训练算力的边际收益明显下降。但「缩放」没有死,而是换了战场:后训练 RL 的算力投入(R1 之后大增)、测试时思考长度的缩放(o1/V4 思考档位)、以及稀疏化让「总参数」与「计算量」解耦后继续扩大容量。可以概括为:从「预训练缩放」迁到「全生命周期缩放」。
为什么开源模型追得这么快?DeepSeek/Kimi/Qwen 靠什么?
三个杠杆:① 架构论文全公开(MLA/MoE/GRPO 都有论文可抄作业),后发者直接用最优解;② 蒸馏与合成数据降低了「从强模型学习」的门槛;③ 训练工程效率(如 DeepSeek 的 FP8+无辅助损失负载均衡)用更少算力逼近前沿。代价是「约落后前沿 3~6 个月」(DeepSeek-V4 官方口径)——开源生态整体在「跟随性创新」上极快,「首发性创新」仍有差距。
上下文窗口都 1M 了,RAG(检索增强)还有必要吗?
有。三个理由:① 成本——把 100 万 token 塞进窗口的费用远高于向量库检索出 1 万 token;② 时效——窗口里只有训练截止前的知识,新信息必须外部取;③ 可审计——RAG 能给出「答案来自哪份文档」,纯靠参数记忆无法溯源。真实系统普遍是「RAG 先筛 + 长窗口消化」的组合,二者是分工不是替代。
13 常见误区
⚠️ 误区一:「参数量决定一切」。Chinchilla 修正早就说明数据配比同样关键;MoE 时代「总参数」与「实际计算量」解耦,1T 总参激活 32B 的 Kimi K2,推理成本与小一两个数量级的稠密模型相当。讨论模型规模必须先问:「总参还是激活?」
⚠️ 误区二:「推理模型就是更大的聊天模型」。推理模型的核心差异在训练方式(RL+可验证奖励塑造长思维链)而非尺寸,7B 的蒸馏推理模型在数学题上能打赢更大的非推理模型。同理「思考 token」是推理时算力,不是「模型变大了」。
⚠️ 误区三:「FlashAttention 是近似算法」。它是精确计算,只是重组了计算顺序以减少显存读写;近似注意力指的是滑窗/线性注意力/稀疏注意力那一族,两码事。混用这两个词在面试里相当减分。
14 自测
1. Transformer 相比 RNN,最根本的两个改进是?
💡 解析: C 正确——RNN 的两大病是「第 100 个词的记忆要转述 99 次(长程依赖弱)」和「必须逐词串行(无法并行)」,自注意力把任意两位置变成一步直达、整句同时算,一并根治。A「更深更多」是规模竞赛期的事,不是架构本身的改进;B 是数据侧;D 是 CNN 的特征,恰恰是被 Transformer 淘汰的方案之一。
2. 行业最终收敛到 Decoder-only,不包括哪条原因?
💡 解析: B 不成立——三种结构的表达能力理论上都够强,Decoder-only 胜出是「数据效率、任务对齐、工程友好」三重实用原因,不是「数学上更强」。A 是数据效率,C 是任务对齐,D 是工程友好,三条都成立。注意「理论表达能力」与「实际训练效率」是两回事,后者才是工程选择的依据。
3. Chinchilla 论文对缩放定律的核心修正是?
💡 解析: A 正确——Chinchilla 用 70B 参数喂 1.4T token,在相同算力预算下反超了「参数大而数据少」的 Gopher/GPT-3 式配置,给出「每参数约 20 token」的经验配比。B 是被修正的旧认知;C 与事实相反(数据质量与配比恰恰是重点);D 过度引申——Chinchilla 说的是「配平」,后续模型实际喂的数据比 20 token/参数更饱,因为推理成本偏爱小参数,但没有「必须 10B 以下」的结论。
4. MQA、GQA、MLA 三个注意力变体共同瞄准的问题是?
💡 解析: D 正确——三者本质都是「让推理时需要缓存的 KV 变小」:MQA 全头共享一份 KV,GQA 分组共享,MLA 投影到低维潜空间压缩。A/B 是「副作用目标」,它们都在尽量不掉点的前提下省缓存;C 描述的是稀疏注意力(DSA/滑窗)那一族的思路——减少的是「算多少」,而 MQA/GQA/MLA 减少的是「存多少、搬多少」,两条线不要混。
5. 关于 FlashAttention,下列说法正确的是?
💡 解析: B 正确——FlashAttention 的关键洞察是 GPU 显存带宽瓶颈:它让中间结果留在片上高速缓存,数学结果与标准注意力完全一致。A「低秩近似」和 D「稀疏注意力」都是别的技术族,张冠李戴;C 方向反了——它恰恰是尽量避免访问慢速显存,更不会去碰 CPU 内存。
6. 大模型推理的 decode 阶段,瓶颈通常是?
💡 解析: C 正确——decode 每步只算一个 token,计算量小,但「读全部权重+KV Cache」的数据搬运量固定很大,算力单元大部分时间在等数据,是访存密集(memory-bound)。A 恰好相反,prefill(预填充)阶段才是算力吃满的阶段;B 的 softmax 在整个开销里占比很小;D 在本地推理场景不存在,即使云端也不是计算瓶颈的主体。
7. 「推理模型」(o1/R1 类)与普通对话模型的本质区别是?
💡 解析: A 正确——推理模型的差异在训练范式(R1 式纯 RL、可验证奖励)与推理范式(生成隐藏思维链,思考越长正确率越高),「思考 token 数」是推理时的第三根性能杠杆。B 错,7B 蒸馏推理模型也能打赢更大的非推理模型;C 错,底座仍是 Transformer;D 错,预训练照样用人类数据,RL 阶段也需要任务与奖励设计。
8. 上下文窗口已到百万级,RAG 依然必要,理由不包括?
💡 解析: D 说法过强——长窗口模型并非「完全无法」利用中间信息,只是存在「middle 迷失」现象(中间位置召回率偏低),是「不够好」而非「完全不行」,所以不能作为 RAG 的理由,A/B/C 三条才是成本、时效、可审计的正当理由。区分「现象存在」与「现象程度」是这类判断题的关键。
9. 经典双塔架构中,Encoder 的输出送给 Decoder 的交叉注意力(Multi-Head Attention)时,提供的是?
💡 解析: B 正确——交叉注意力里 Q 来自 Decoder 当前词(「我想查什么」),K/V 来自 Encoder 的输出(「源句子里有什么可查」),即「拿 Decoder 的问题去 Encoder 的理解里查资料」,这是两塔协同的关键通路(图②中间那条横向箭头)。A 把来源说反;C 是机器翻译的最终输出而非中间量;D 在两塔底部就已注入,与交叉注意力无关。
10. 关于 MCP(Model Context Protocol),下列说法正确的是?
💡 解析: B 正确——MCP 是 2024 年 11 月开源的行业标准协议,统一模型与工具/数据源的接入方式:过去 M 个模型 × N 个工具要写 M×N 个适配,有了协议就像设备统一了 USB-C,一次开发处处可用。A 张冠李戴(那是 DSA/MLA 一族);C 是量化技术的事;D 与「开放标准」的事实相反。
15 小结与思考
八年演进用一个比喻收尾:大模型像一家不断升级的餐厅——预训练是厨师的基础教育(吃下整座图书馆);对齐后训练是岗前服务培训(学会按客人要求出菜);测试时计算是遇到硬菜时多花时间备菜;而工程深化期的所有架构改进(MoE/MLA/FlashAttention/稀疏注意力),本质都是在回答「怎么用更少的灶台和煤气,出同样多的菜」。十大工程问题,就是这家餐厅当前真实的经营难题。
思考题:
- 如果要你向非技术同学解释「为什么 ChatGPT 是分水岭而 GPT-3 不是」,你会怎么讲?(提示:从「可用性>智力」切入)
- DeepSeek-V4 把「1M 上下文做成标配」依赖哪些技术前提?至少说出两条(提示:稀疏注意力家族 + KV 压缩家族 + 外推训练)
- 十大工程问题里,哪几个在「具身智能/机器人」场景会被放大?(提示:端侧⑩、延迟⑤、长程可靠性⑨——这也是本站主题的连接点)
里程碑论文速查(点链接看原文;本页资料整理更新至 2026-08)
| 论文 | 时间 | 重大突破(一句话) | 原文 |
| Attention Is All You Need(Transformer) | 2017.06 | 用纯注意力取代循环网络:全并行训练 + 任意两词一步直达,一切的原点 | arXiv:1706.03762 |
| RoFormer / RoPE | 2021.04 | 旋转位置编码:位置变成旋转角,天然相对位置、可外推长上下文 | arXiv:2104.09864 |
| LoRA | 2021.06 | 低秩适配:冻结大模型只训小矩阵,消费级显卡也能微调 | arXiv:2106.09685 |
| Scaling Laws(Kaplan) | 2020.01 | 性能随规模可预测提升——给「大力出奇迹」提供了可算账的理论依据 | arXiv:2001.08361 |
| GPT-3 | 2020.05 | 1750 亿参数:上下文学习(in-context learning)首次大规模涌现 | arXiv:2005.14165 |
| Chinchilla | 2022.03 | 缩放定律修正:参数与数据按约 1:20 配比,同算力下小模型反超 | arXiv:2203.15556 |
| Chain-of-Thought(思维链) | 2022.01 | 提示里「一步步想」大幅提升复杂推理,推理模型的思想源头 | arXiv:2201.11903 |
| InstructGPT | 2022.03 | SFT→奖励模型→RLHF 三阶段对齐,ChatGPT 的技术底座 | arXiv:2203.02155 |
| Emergent Abilities / Mirage 之争 | 2022.08 / 2023.04 | 「涌现」的提出与质疑:部分突变是评测指标假象——科学需要正反两面 | 2206.07682 / 2304.15004 |
| FlashAttention | 2022.05 | IO-aware 精确加速:少搬数据而不是少算,显存 O(N²)→O(N) | arXiv:2205.14135 |
| LLaMA | 2023.02 | 开放权重+可复现配方,开源生态的引爆点 | arXiv:2302.13971 |
| DPO | 2023.05 | 直接偏好优化:绕开显式奖励模型的对齐,简单稳定 | arXiv:2305.18290 |
| GQA | 2023.05 | 分组共享 KV:一行代码量级的推理显存优化,开源标配 | arXiv:2305.13245 |
| Mixtral 8x7B | 2024.01 | 开源 MoE 里程碑:总参大、激活小、推理便宜 | arXiv:2401.04088 |
| Mamba(SSM) | 2023.12 | 状态空间模型线性复杂度挑战注意力,长序列新路线 | arXiv:2312.00752 |
| DeepSeek-V2 / V3 / R1 | 2024~2025 | MLA 压 KV → FP8+无辅助损失 MoE 训练 → 纯 RL 涌现推理,中国团队的结构创新三部曲 | 2405.04434 / 2412.19437 / 2501.12948 |
- 讲解组织参考:闪客《一小时从 Transformer 到大模型》图解串讲(B 站/抖音,2023)——把大模型拆成「直觉十步」的讲法影响了本页 §10 的写法
- 站内衔接:07-01(MoE 与 KV Cache 基础)· 07-02(MLA/R1 深讲)· 07-03(RLHF/DPO/GRPO)· 下一页 07-07 结构实验室(动手算注意力与 KV Cache)