1. 阅读导引:先抓住一条主线
大语言模型可以先粗略理解为:把文字切成 token,反复经过很多个 Transformer block,最后预测“下一个 token 是什么”。现代模型的差异,主要体现在注意力如何省 KV cache、FFN 是否用 MoE、训练是否稳定、长上下文如何降复杂度,以及低精度/并行通信如何落地。
对芯片工程师来说,Transformer 不只是数学结构。它最终会变成大量 GEMM/MMA、HBM 读写、KV cache 管理、片间/卡间 all-to-all 通信、低精度数值格式、以及推理服务中的 prefill/decode 调度。理解这些映射,才能判断一个模型架构对 NPU/GPU/互连/存储层次的真实压力。
| 本文档怎么读 | 你会看到的关键词 | 芯片工程相关含义 |
|---|---|---|
| 先读 Transformer 基础 | token、embedding、attention、Q/K/V、FFN、KV cache | 算子形态、访存模式、序列长度带来的复杂度 |
| 再读 DeepSeek V3 | MLA、DeepSeekMoE、MTP、FP8、DualPipe | 用低秩 KV 压缩降低缓存,用 MoE 提升参数规模但引入通信 |
| 最后读 DeepSeek V4 Preview | CSA、HCA、mHC、Muon、1M context、FP4/FP8 | 长上下文下 attention 与 KV cache 成为主瓶颈,需要压缩/稀疏/低精度协同 |
说明:DeepSeek V4 在官方资料中以 DeepSeek-V4 Preview 形式发布。本文按照官方 Preview 技术报告整理,不把非官方传闻写成架构事实。DeepSeek 官方称 V4 Preview 于 2026-04-24 发布并开源,包含 V4-Pro 与 V4-Flash 两个 MoE 模型。[DS-V4-Release][DS-V4-HF]
2. Transformer 基础:从 token 到下一个 token
原始 Transformer 论文《Attention Is All You Need》提出了一种主要基于 attention 的序列建模架构,不再依赖循环神经网络 RNN 或卷积 CNN 作为核心序列处理模块。[Vaswani17] 今天的大语言模型大多是 Transformer 的变体,尤其常见的是 decoder-only Transformer:它只看当前位置之前的 token,自回归地产生下一个 token。
2.1 最小化理解:LLM 在做什么?
Token 是模型处理文本的基本单位,可以是一个汉字、英文词的一部分、标点,甚至换行组合。模型并不直接理解字符串,而是处理 token ID 序列。Embedding 是查表:把 token ID 变成一个高维向量。后续每层 Transformer 都在更新这些向量,使它们逐渐携带上下文语义。
自回归模型每次只预测一个或少量下一个 token。生成一句话时,它会重复执行“根据已有 token 预测下一个 token → 把这个 token 加到上下文中 → 再预测”。这就是为什么推理会分成 prefill 和 decode:prefill 一次性处理已有 prompt,decode 每步生成一个新 token。
2.2 Transformer block 里面有什么?
一个典型 Transformer block 包含两类核心计算:
Self-Attention:跨位置混合信息
让每个 token 位置根据相似度,从上下文中“取回”相关信息。比如“苹果发布芯片”中的“苹果”要根据上下文判断是水果还是公司。
硬件上,attention 包含 Q/K/V 投影 GEMM、QKT 得分、softmax、再乘 V。长上下文下,K/V 缓存与 attention 得分的访存会非常关键。
FFN/MLP:逐位置的非线性计算
对每个 token 的向量独立做两到三个线性层和激活函数,常见结构如 SwiGLU。它不直接跨 token 通信,但参数量和 GEMM 量很大。
MoE 模型会把 FFN 替换成多个专家,每个 token 只激活少数专家,用通信换取更大总参数规模。
2.3 Attention 的 Q/K/V 到底是什么?
Q/K/V 是从同一个 hidden state 通过不同权重矩阵投影得到的三个向量族:
- Q(Query,查询):当前位置想问的问题。
- K(Key,键):上下文中每个位置提供的“可匹配标签”。
- V(Value,值):如果某个位置被匹配上,真正被读取的信息。
对芯片来说,注意力有两个阶段:算分(QKT)和 聚合(score · V)。在 prefill 阶段,序列长度为 n 时,标准全 attention 的得分矩阵规模接近 n×n;在 decode 阶段,每生成一个 token,需要它的 Q 与历史所有 K 做匹配,并从历史 V 聚合。
生成第 t 个 token 时,前面 1…t-1 个 token 的 K/V 不需要重复计算,可以缓存起来。这样 compute 省了,但显存/HBM 占用和读取带宽成为瓶颈。上下文窗口从 128K 扩到 1M 时,KV cache 成本会非常显著,所以 DeepSeek V3 用 MLA 压缩 KV,V4 进一步用 CSA/HCA 压缩和稀疏化。
2.4 Encoder-only、Encoder-Decoder、Decoder-only
| 类型 | 典型用途 | 注意力特点 | 和 LLM 的关系 |
|---|---|---|---|
| Encoder-only | 分类、检索、文本理解 | 双向 attention,所有 token 可互相看 | BERT 类模型常见 |
| Encoder-Decoder | 机器翻译、摘要 | 编码器读输入,解码器自回归输出 | 原始 Transformer 是这种结构[Vaswani17] |
| Decoder-only | 聊天、代码、推理、生成 | 因果 mask,只能看当前位置之前 | 现代通用 LLM 主流形态,DeepSeek V3/V4 属于这一类 Transformer 变体 |
2.5 训练、微调、强化学习:这些词的关系
预训练(pre-training) 是用海量文本做“下一个 token 预测”,学习语言、知识、代码和推理模式。SFT(Supervised Fine-Tuning,有监督微调) 用人工或合成的指令-答案数据,让模型更像助手。RL(Reinforcement Learning,强化学习) 用奖励信号优化模型行为。DeepSeek V3 报告中提到预训练后进行 SFT 和 RL,并从 DeepSeek-R1 系列蒸馏推理能力。[DS-V3-TR]
蒸馏(distillation) 可以理解为“让学生模型模仿老师模型”。如果老师模型会复杂推理,学生模型通过学习老师输出、概率分布或行为模式,获得一部分能力。
3. 核心名词速查:先记这些就能读大部分架构图
参数(parameter)
模型权重,例如矩阵 W。存储在显存/HBM 中,训练时还要存梯度和优化器状态。MoE 中“总参数”可能很大,但每个 token 只用其中一部分。
激活(activation)
中间张量,如 hidden state、Q/K/V、FFN 输出。训练要为反向传播保存或重算;推理主要关注当前步和 KV cache。
上下文窗口(context length)
模型一次能处理的 token 数。128K、1M 指的是 token 数,不是字符数。长上下文会放大 attention 和 KV cache 压力。
隐藏维度(hidden dimension)
每个 token 向量的宽度,如 DeepSeek V3/V4-Pro 的 7168。维度越大,矩阵乘规模越大。
注意力头(head)
把注意力拆成多个子空间并行计算。多头能关注不同关系,但也影响 Q/K/V 形状和 KV cache 大小。
Logits 与 Softmax
logits 是未归一化分数;softmax 把分数变成概率。最后一层 LM head 产生词表大小的 logits。
RoPE
旋转位置编码,把位置信息注入 Q/K。长上下文扩展常与 RoPE 缩放或变体相关。
GEMM/MMA
大矩阵乘/矩阵乘累加,是 Transformer 的主要 compute 形态。Tensor Core/NPU MAC 阵列利用率由矩阵形状、batch、序列长度决定。
HBM / SRAM
HBM 容量大但能耗高、延迟大;片上 SRAM/cache 快但容量小。KV cache、权重、激活的数据搬运常决定端到端性能。
4. 芯片工程师视角:Transformer 的瓶颈在哪里?
4.1 Prefill 与 Decode 是两种很不同的负载
| 阶段 | 模型在做什么 | 典型瓶颈 | 优化方向 |
|---|---|---|---|
| Prefill | 一次性处理 prompt 的所有 token,建立 KV cache | 大 GEMM、attention O(n²) 或近似 O(n²)、显存容量 | 高吞吐矩阵乘、FlashAttention 类 kernel、上下文并行、压缩 attention |
| Decode | 每步生成一个新 token,读取历史 KV cache | KV cache 读带宽、batch 调度、低 batch 下 compute 利用率 | KV 压缩、Paged KV、连续 batching、投机解码、低精度 cache |
很多芯片在训练 benchmark 上看起来很强,但推理 decode 阶段可能因为 batch 小、KV cache 读取大、控制/调度开销高而无法满载。对 1M context 模型,这种差异更明显。
4.2 Dense 模型 vs MoE 模型
Dense 模型 每个 token 都使用全部 FFN 参数,计算规则整齐,硬件利用率相对容易做高。MoE 模型 有很多专家,但每个 token 只路由到少数专家;优点是总参数可大幅增加,而每 token 激活参数相对低,缺点是引入 token 分发、专家负载均衡和 all-to-all 通信。
MoE 的矩阵乘本身仍像 FFN,但 token 需要按专家重排,跨设备时要 all-to-all。工程重点会变成:路由是否均衡、专家并行 EP 的通信是否能与计算 overlap、每个专家的 micro-batch 是否足够大、片间网络是否能支持细粒度 dispatch/combine。
4.3 低精度不只是“少存一点”
FP16/BF16/FP8/FP4/INT8 的差异不仅是位宽。它会影响矩阵乘吞吐、累加精度、scale 的粒度、在线量化/反量化、激活异常值处理、训练稳定性,以及硬件是否能在 Tensor Core/NPU 阵列内部完成带 scale 的 MMA。
DeepSeek V3 技术报告对未来硬件提出过几类建议:提高 FP8 GEMM 累加精度、支持 tile/block 级量化、支持在线量化、支持转置 GEMM 相关的数据访问,以减少 Tensor Core 与 CUDA core/HBM 之间的数据搬运。[DS-V3-HW]
5. DeepSeek V3 架构介绍
DeepSeek V3 是一个大规模 MoE 语言模型。官方技术报告称它有 671B 总参数,每个 token 激活 37B 参数;采用 MLA 与 DeepSeekMoE,并引入 auxiliary-loss-free 负载均衡和 MTP 训练目标。[DS-V3-TR]
5.1 一页概览
| 项目 | DeepSeek V3 | 解释 |
|---|---|---|
| 模型类型 | Decoder-only Transformer + MoE | 自回归生成;FFN 部分主要用专家网络替代。 |
| 总参数 / 激活参数 | 671B / 37B 每 token | 总参数是所有专家加起来;激活参数是一次处理某个 token 实际参与计算的参数。 |
| 层数 / hidden dim | 61 层 / 7168 | 层数影响深度,hidden dim 影响矩阵宽度。 |
| Attention | MLA,128 heads,head dim 128,KV 压缩维 512,Query 压缩维 1536 | MLA 用低秩 latent 表示减少 KV cache。 |
| MoE | 除前 3 层外,FFN 替换为 MoE;每 MoE 层 1 个 shared expert + 256 routed experts;每 token 激活 8 个 routed experts | shared expert 每个 token 都走;routed expert 由 router 选择。 |
| 上下文长度 | 预训练 4K;经 YaRN 两阶段扩展到 128K | 长上下文扩展不是简单改参数,还需要额外训练。 |
| 训练数据 | 14.8T tokens | token 是训练量单位,不等于字符或词。 |
| 训练效率 | 全训练约 2.788M H800 GPU hours;预训练约 2.664M H800 GPU hours | 官方报告口径;不含前期研究/消融实验成本。 |
| 低精度 | FP8 mixed precision training | 通过低精度计算/存储降低成本,需要数值稳定设计。 |
上表关键数字来自 DeepSeek V3 技术报告和官方 GitHub/API 文档。[DS-V3-HW][DS-V3-GitHub][DS-V3-API]
5.2 V3 block 的结构
5.3 MLA:为什么 V3 的 attention 更省 KV cache?
MLA(Multi-head Latent Attention,多头潜在注意力) 的核心是:不要把每一层、每个 token、每个 attention head 的完整 K/V 都缓存下来,而是先把 K/V 压缩成低维 latent,再从 latent 恢复出注意力计算所需的 key/value。DeepSeek V3 报告称 MLA 对 keys/values 做低秩联合压缩,推理时只需缓存压缩 latent 和带 RoPE 的解耦 key,从而显著降低 KV cache。[DS-V3-HW]
MLA 把一部分“存储完整 KV”的成本转化为“每步从 latent 做上投影/组合”的计算成本。对长上下文 decode,KV cache 读写通常很贵,因此这种 compute-for-memory 的交换可能是划算的。芯片侧要关注:latent 维度、恢复 Q/K/V 的 GEMM 形状、RoPE 维度、cache layout、以及是否能把相关算子融合。
5.4 DeepSeekMoE:总参数很大,但每 token 只走少数专家
DeepSeekMoE 使用更细粒度专家,并区分 shared experts 与 routed experts。V3 中每个 MoE 层包含 1 个 shared expert 和 256 个 routed experts,每个 token 激活 8 个 routed experts;前 3 层仍使用普通 FFN,其余 FFN 替换为 MoE。[DS-V3-HW]
名词解释:shared expert、routed expert、router/gate
Shared expert 可以理解为所有 token 都会经过的“公共专家”,保证通用能力。Routed expert 是由 router 选择的专家。Router/Gate 根据 token hidden state 计算每个专家的分数,选 Top-k 专家,并给专家输出加权。
V3 引入 auxiliary-loss-free load balancing。传统 MoE 常通过辅助损失鼓励专家负载均衡,但辅助损失过强可能损害模型能力。V3 通过给专家路由分数加动态 bias 来调节负载;bias 只用于路由选择,最终门控值仍来自原始 affinity score。[DS-V3-HW]
5.5 MTP:多 token 预测为什么有用?
MTP(Multi-Token Prediction,多 token 预测) 是让模型在训练时不仅预测下一个 token,还额外预测更后面的 token。DeepSeek V3 设置 MTP depth = 1,也就是除了精确的 next token,还额外预测一个未来 token。报告认为 MTP 可以加密训练信号、提升数据效率,并可用于推测解码加速。[DS-V3-HW]
推理时,MTP 模块可以丢弃,让主模型正常工作;也可以把 MTP 模块用于 speculative decoding。对硬件来说,speculative decoding 的价值在于一次提出多个候选 token,再用主模型验证,从而减少串行 decode 步数。
5.6 V3 的训练与系统实现重点
DeepSeek V3 在 2048 张 NVIDIA H800 GPU 集群上训练;官方报告提到 16-way pipeline parallelism、64-way expert parallelism(跨 8 个节点)和 ZeRO-1 data parallelism。[DS-V3-HW] 这些并行方式对芯片系统的含义如下:
| 并行方式 | 简单解释 | 硬件/系统关注点 |
|---|---|---|
| DP(Data Parallelism) | 多份模型处理不同 batch 数据,再同步梯度 | 梯度 all-reduce,带宽和同步延迟 |
| PP(Pipeline Parallelism) | 不同层放在不同设备上,像流水线一样运行 | pipeline bubble、跨 stage 激活通信、调度复杂度 |
| EP(Expert Parallelism) | MoE 专家分布在不同设备上,token 路由到对应专家 | all-to-all、token 重排、负载均衡、通信计算重叠 |
| ZeRO | 把优化器状态/梯度/参数分片存储 | 节省显存但引入通信与调度 |
6. DeepSeek V4 Preview 架构介绍
DeepSeek V4 官方资料显示,V4 Preview 包含两个 MoE 模型:V4-Pro(1.6T 总参数 / 49B 激活参数)和 V4-Flash(284B 总参数 / 13B 激活参数),二者都支持 1M token 上下文。[DS-V4-Release][DS-V4-HF]
这里的“V4”按官方发布页和技术报告写作 DeepSeek-V4 Preview。Preview 通常意味着架构和权重已经公开,但未来仍可能出现更新版或正式版。本文不把第三方传闻作为架构依据。
6.1 一页概览
| 项目 | V4-Flash | V4-Pro | 解释 |
|---|---|---|---|
| 定位 | 更快、更经济 | 更强能力 | 两者同属 V4 Preview 系列。 |
| 总参数 / 激活参数 | 284B / 13B | 1.6T / 49B | MoE 模型总参数大,但每 token 只激活部分专家。 |
| 上下文长度 | 1M tokens | 1M tokens | 官方称 1M context 是 V4 系列默认能力。 |
| 层数 / hidden dim | 43 层 / 4096 | 61 层 / 7168 | Pro 深度和宽度接近 V3,但专家规模更大。 |
| Attention | 前 2 层 pure sliding window;后续 CSA/HCA 交错 | 前 2 层 HCA;后续 CSA/HCA 交错 | V4 的核心创新是 hybrid attention:CSA + HCA。 |
| CSA top-k | 512 | 1024 | CSA 在压缩 KV 后再稀疏选择 top-k。 |
| HCA 压缩率 | m′ = 128 | m′ = 128 | 每 128 个 token 的 KV 压成一个 entry,再做 dense compressed attention。 |
| MoE | 1 shared + 256 routed,Top-6 | 1 shared + 384 routed,Top-6 | V4 所有 Transformer block 都用 MoE,但前 3 个 MoE 层使用 Hash routing。 |
| MTP | depth = 1 | depth = 1 | 继承 V3 的多 token 预测策略。 |
| 优化器 | Muon 为主,部分模块 AdamW | Muon 为主,部分模块 AdamW | Muon 用于更快收敛和更稳定训练。 |
| 预训练 tokens | 32T | 33T | 均从 4K 逐步扩展到 16K、64K、1M。 |
V4 模型参数、层数、attention 配置、MoE 配置和训练设置来自 V4 技术报告。[DS-V4-TR]
6.2 V4 相比 V3 继承了什么、改变了什么?
继承自 V3 的主干思想
- 仍是 Transformer / decoder-only 语言模型。
- 仍使用 DeepSeekMoE 思想,让总参数远大于激活参数。
- 仍使用 MTP depth = 1。
- 仍关注低精度训练/推理与工程化并行。
V4 的关键新增
- Hybrid Attention:CSA + HCA,面向 1M 长上下文。
- mHC:强化 residual connection 的稳定传播。
- Muon optimizer:用于多数参数,提升收敛和稳定性。
- FP4 + FP8 mixed:发布模型中 MoE expert 参数可用 FP4,其他多为 FP8。[DS-V4-HF]
6.3 Hybrid Attention:CSA + HCA
V4 技术报告称,随着上下文长度达到极大规模,attention 成为主要计算瓶颈;V4 设计了两种高效 attention 架构:CSA(Compressed Sparse Attention) 和 HCA(Heavily Compressed Attention),并交错使用。[DS-V4-TR]
名词解释:CSA、DSA、HCA、MQA、滑动窗口
CSA 先把每 m 个 token 的 KV 压缩成一个 entry,再用 DSA/DeepSeek Sparse Attention 的思路通过 indexer 选出 top-k 压缩 KV entry 做核心 attention。HCA 用更大的压缩率 m′,但不做 sparse top-k,而是在压缩后的 KV 上做 dense attention。MQA/Multi-Query Attention 是多个 query heads 共享一组 key/value 的注意力形式,可减少 KV 存储。滑动窗口 attention 额外保留最近 n 个 token 的未压缩 KV,补偿压缩带来的局部细节损失。
V4 报告还提到两类细节:对 query 和 compressed KV entry 在 core attention 前做 RMSNorm,避免 attention logits 爆炸;对 CSA/HCA 部分维度使用 RoPE,并加入 attention sink,使某些 head 可把总 attention 质量调低到接近 0。[DS-V4-TR]
CSA/HCA 把 1M context 的压力从“完整 KV + 全量 attention”变成“压缩 KV + indexer/top-k + 局部窗口 + 低精度存储”。这会改变 kernel 形态:不再只有规则大矩阵乘,还包括压缩、top-k 选择、gather/scatter、稀疏 attention、滑窗拼接和分组输出投影。芯片/编译器需要处理更复杂的数据流与动态选择。
6.4 mHC:加强 residual connection
Residual connection(残差连接) 是 Transformer 稳定训练深层网络的关键:每层不是完全替换输入,而是在输入上加一个变换结果。V4 引入 mHC(Manifold-Constrained Hyper-Connections) 来强化传统 residual connection。技术报告称,mHC 把 residual mapping matrix 约束到双随机矩阵流形(Birkhoff polytope),使谱范数有界,从而增强前向和反向传播的数值稳定性。[DS-V4-TR]
名词解释:双随机矩阵、Sinkhorn-Knopp、谱范数
双随机矩阵 指每行和每列之和都为 1、元素非负的矩阵。这样的约束可防止 residual 映射不断放大信号。Sinkhorn-Knopp 是一种通过交替行/列归一化把正矩阵近似投影为双随机矩阵的算法。谱范数 可理解为矩阵对向量最大放大倍数的度量;把它控制在 1 附近有利于稳定深层堆叠。
6.5 Muon optimizer:训练稳定和收敛
V4 采用 Muon optimizer 作为多数参数的优化器,但 embedding、prediction head、RMSNorm 权重、mHC 的部分静态 bias/gate 等仍使用 AdamW。报告描述了 Muon 中的 Newton-Schulz 近似正交化过程,并称使用 Muon 是为了更快收敛和更好的训练稳定性。[DS-V4-TR]
从芯片角度看,优化器主要影响训练而非纯推理。Muon/AdamW 的区别不仅在数学,也在优化器状态存储、矩阵正交化计算、分布式状态分片和训练框架的实现复杂度。
6.6 V4 的 KV cache 与 1M context
V4 技术报告称,在 1M-token context 场景,DeepSeek-V4-Pro 的单 token 推理 FLOPs 约为 DeepSeek-V3.2 的 27%,KV cache 约为 V3.2 的 10%;V4-Flash 进一步降到约 10% FLOPs 和 7% KV cache。[DS-V4-TR]
官方发布页也将 V4 的结构创新概括为“Token-wise compression + DSA”,并称 1M context 成为官方服务默认能力。[DS-V4-Release]
从公开报告看,V4 目标是“高效百万 token 上下文”。MLA 已能降低 KV cache,但当 context 从 128K 扩到 1M,attention 的序列维度仍然非常大。V4 因此进一步在序列维度上压缩 KV,并引入 sparse top-k 选择和重压缩 dense attention,以降低长上下文下的计算和存储。
6.7 V4 的训练稳定措施
V4 技术报告承认 trillion-parameter MoE 训练存在稳定性挑战,并介绍了两种实用措施:Anticipatory Routing 和 SwiGLU Clamping。前者在出现 loss spike 时用历史参数提前计算/缓存路由索引,打断 routing 与 backbone 同步更新导致的恶性循环;后者限制 SwiGLU 的线性分量和 gate 上界,抑制异常值。[DS-V4-TR]
7. DeepSeek V3 vs V4 Preview:架构差异表
| 维度 | DeepSeek V3 | DeepSeek V4 Preview | 对芯片/系统的含义 |
|---|---|---|---|
| 目标 | 高性能 MoE LLM,128K context | 高效 1M context intelligence | V4 更明显地把长上下文作为一等目标。 |
| 参数规模 | 671B total / 37B active | Flash: 284B / 13B;Pro: 1.6T / 49B | V4-Pro 总参数更大,V4-Flash 更轻;都依赖 MoE 保持每 token 成本可控。 |
| Attention | MLA:低秩 KV latent 压缩 | CSA + HCA:序列维压缩、稀疏选择、重压缩 dense attention | V4 对 KV cache 和 attention FLOPs 做更激进的长上下文优化。 |
| FFN/MoE | 前 3 层普通 FFN,其余 MoE;Top-8 routed experts | 所有 block 用 MoE;前 3 个 MoE 层 Hash routing;Top-6 routed experts | 路由、all-to-all、专家 micro-batch 仍是关键。 |
| Residual/连接 | 传统 residual + RMSNorm | mHC 强化 residual connection | 提升深层稳定,但引入动态映射和 Sinkhorn-Knopp 相关计算。 |
| 训练目标 | MTP depth = 1 | MTP depth = 1 | 有助于性能,也可能支持 speculative decoding。 |
| 优化器 | AdamW | Muon 为主 + AdamW 局部模块 | 训练框架和优化器状态/计算更复杂。 |
| 低精度 | FP8 mixed precision training | 发布模型含 FP4 + FP8 mixed;专家参数 FP4,其他多为 FP8 | 未来硬件若原生支持 FP4×FP8、细粒度 scale,会更能释放模型收益。 |
| 上下文 | 4K 预训练,扩展到 32K、128K | 从 4K 逐步扩展到 16K、64K、1M | KV cache、压缩 attention、磁盘/分层缓存与上下文并行变重要。 |
一句话总结:V3 的核心是“MoE + MLA + FP8 + 高效训练系统”;V4 Preview 的核心是“在 MoE 主干上,为 1M 上下文重做 attention 与 residual/训练稳定设计”。
8. 读论文/评估芯片时的检查清单
模型架构检查
- 是 dense 还是 MoE?每 token 激活多少参数?
- attention 是 MHA、MQA、GQA、MLA、sparse、sliding-window,还是混合?
- KV cache 每 token 每层需要多少字节?是否压缩?精度是多少?
- 上下文窗口是训练原生支持,还是 RoPE/YaRN 后扩展?
- 推理是否使用 speculative decoding、MTP、chunked prefill?
芯片/系统检查
- GEMM/MMA 的矩阵形状是否适配阵列大小?小 batch decode 利用率如何?
- HBM 容量是否能容纳权重 + KV cache + batch?HBM 带宽是否够?
- 是否原生支持 BF16/FP16/FP8/FP4/INT8 及细粒度 scale?累加精度如何?
- MoE all-to-all 是否能用互连隐藏在专家计算之下?
- 编译器/runtime 是否支持 dynamic routing、top-k、gather/scatter、paged KV?
不要只看“TOPS/FLOPS 峰值”。大模型端到端性能往往受限于数据搬运、KV cache、路由通信、kernel fusion、动态 shape、batch 调度和服务策略。架构论文里的每一个“压缩”“稀疏”“MoE”“低精度”都可能改变芯片瓶颈。
9. 详细术语表
基础模型术语
| 术语 | 解释 | 硬件类比/关注点 |
|---|---|---|
| Token | 文本被 tokenizer 切分后的最小处理单位。中文常接近字或词片段,英文常是词片段。 | 序列长度 n 的单位,决定 attention/KV cache 规模。 |
| Vocabulary / 词表 | 所有 token 的集合,常见规模几十 K 到数百 K。 | LM head 输出维度等于词表大小,影响最后投影成本。 |
| Embedding | token ID 到向量的查表。 | 随机/稀疏读取,训练时 embedding 梯度更新也有通信问题。 |
| Hidden state | 每层中每个 token 的向量表示。 | 形状通常为 batch × seq_len × hidden_dim。 |
| Layer | 一个 Transformer block。 | 层数越多,流水线并行和激活存储越重要。 |
| Context window | 一次能读入的最大 token 数。 | 直接放大 KV cache 与 attention 工作量。 |
| Logit | softmax 前的未归一化分数。 | 最后一层通常是 hidden_dim × vocab_size GEMM。 |
Attention 术语
| 术语 | 解释 | 硬件类比/关注点 |
|---|---|---|
| Q/K/V | Query、Key、Value,是 attention 的三组投影。 | QKV projection 是 GEMM;K/V 会进入 cache。 |
| Attention head | 把 attention 拆成多个子空间。 | 影响并行粒度、head_dim、KV layout。 |
| Softmax | 把 attention logits 归一化为权重。 | 需要 max/sum/reduce,数值稳定和内存访问很重要。 |
| Causal mask | 防止当前位置看到未来 token。 | decode 自然满足,prefill 需要 mask 或专门 kernel。 |
| KV cache | 缓存历史 K/V,避免每步重复计算。 | decode 阶段常成为 HBM 容量/带宽瓶颈。 |
| MHA/MQA/GQA | 多头、多查询、分组查询注意力。 | MQA/GQA 通过共享 K/V 减少 cache。 |
| MLA | 低秩 latent 压缩 K/V 的 attention。 | 用额外计算换少量 KV cache。 |
| CSA/HCA | V4 中的压缩稀疏/重压缩 attention。 | 引入压缩、top-k、gather/scatter 与稀疏模式。 |
MoE 与训练术语
| 术语 | 解释 | 硬件类比/关注点 |
|---|---|---|
| MoE | Mixture-of-Experts,多个专家网络,每个 token 只激活少数专家。 | 总参数增大但每 token compute 可控;通信复杂。 |
| Router/Gate | 决定 token 去哪些专家。 | top-k、负载均衡、token dispatch。 |
| Shared expert | 所有 token 都经过的专家。 | 更像 dense FFN 的公共路径。 |
| Routed expert | 由 router 选择的专家。 | 专家并行时需要 all-to-all。 |
| Token dropping | 专家拥塞时丢弃部分 token 的训练/推理策略。 | 会影响质量;DeepSeek V3 报告称不 drop token。 |
| MTP | Multi-Token Prediction,训练时额外预测未来 token。 | 可能支持推测解码,减少串行生成步数。 |
| SFT | 有监督微调,用指令数据训练助手行为。 | 训练量小于预训练,但数据质量要求高。 |
| RL/GRPO | 强化学习及 DeepSeek 系列常用的 Group Relative Policy Optimization。 | 需要 rollout、奖励评估、分布式训练框架。 |
| Distillation | 学生模型学习老师模型输出或行为。 | 可把强推理模式迁移给更便宜模型。 |
芯片/系统术语
| 术语 | 解释 | 硬件类比/关注点 |
|---|---|---|
| GEMM | General Matrix Multiply,通用矩阵乘。 | Transformer 的主算子;阵列利用率关键。 |
| MMA | Matrix Multiply-Accumulate,矩阵乘累加。 | Tensor Core/NPU MAC 的核心指令/微架构。 |
| HBM | 高带宽显存。 | 权重/KV cache/激活读写能耗和带宽瓶颈。 |
| FP8/FP4 | 8 位/4 位浮点格式。 | 吞吐和容量收益大,但需要 scale、累加精度和异常值处理。 |
| Quantization | 量化,把高精度数值映射为低精度。 | per-tensor、per-channel、tile/block 粒度影响精度和硬件复杂度。 |
| All-to-all | 多个设备互相发送不同数据。 | MoE expert parallelism 中 token dispatch/combine 关键通信。 |
| Pipeline bubble | 流水线并行中设备空等的时间。 | 影响多卡训练效率。 |
| Kernel fusion | 把多个小算子融合成一个 kernel。 | 减少 HBM 往返和 launch 开销,改善端到端延迟。 |
10. 资料来源与可靠性
本文优先使用官方技术报告、官方发布页、官方 GitHub/Hugging Face 模型卡。部分内容是对这些资料的工程化解释,而非源文逐字翻译。
- [Vaswani17] Vaswani et al., “Attention Is All You Need,” arXiv:1706.03762, 2017. https://arxiv.org/abs/1706.03762
- [DS-V3-TR] DeepSeek-AI, “DeepSeek-V3 Technical Report,” arXiv:2412.19437. https://arxiv.org/abs/2412.19437
- [DS-V3-HW] DeepSeek-V3 Technical Report HTML version, architecture / hardware sections. https://arxiv.org/html/2412.19437v1
- [DS-V3-GitHub] deepseek-ai/DeepSeek-V3 GitHub repository. https://github.com/deepseek-ai/DeepSeek-V3
- [DS-V3-API] DeepSeek API Docs, “Introducing DeepSeek-V3,” 2024-12-26. https://api-docs.deepseek.com/news/news1226
- [DS-V4-Release] DeepSeek API Docs, “DeepSeek V4 Preview Release,” 2026-04-24. https://api-docs.deepseek.com/news/news260424
- [DS-V4-HF] deepseek-ai/DeepSeek-V4-Pro model card on Hugging Face. https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro
- [DS-V4-TR] DeepSeek-AI, “DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence,” technical report PDF. https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro/resolve/main/DeepSeek_V4.pdf
打印提示:浏览器中使用“打印 → 另存为 PDF”可生成 PDF 版本。