AI architecture briefing for chip engineers

Transformer 基础与 DeepSeek V3 / V4 架构介绍

从“token → attention → MoE → 长上下文 → 低精度与通信”这条主线出发,解释大模型术语、硬件瓶颈,以及 DeepSeek V3/V4 Preview 的关键架构变化。

面向对象:芯片 / SoC / NPU / GPU 工程师 资料核对时间:2026-06-06 形式:单文件 HTML,可离线阅读 重点:基础概念 + 架构 + 硬件视角

1. 阅读导引:先抓住一条主线

大语言模型可以先粗略理解为:把文字切成 token,反复经过很多个 Transformer block,最后预测“下一个 token 是什么”。现代模型的差异,主要体现在注意力如何省 KV cache、FFN 是否用 MoE、训练是否稳定、长上下文如何降复杂度,以及低精度/并行通信如何落地。

为什么这份文档特别强调硬件?

对芯片工程师来说,Transformer 不只是数学结构。它最终会变成大量 GEMM/MMA、HBM 读写、KV cache 管理、片间/卡间 all-to-all 通信、低精度数值格式、以及推理服务中的 prefill/decode 调度。理解这些映射,才能判断一个模型架构对 NPU/GPU/互连/存储层次的真实压力。

本文档怎么读你会看到的关键词芯片工程相关含义
先读 Transformer 基础token、embedding、attention、Q/K/V、FFN、KV cache算子形态、访存模式、序列长度带来的复杂度
再读 DeepSeek V3MLA、DeepSeekMoE、MTP、FP8、DualPipe用低秩 KV 压缩降低缓存,用 MoE 提升参数规模但引入通信
最后读 DeepSeek V4 PreviewCSA、HCA、mHC、Muon、1M context、FP4/FP8长上下文下 attention 与 KV cache 成为主瓶颈,需要压缩/稀疏/低精度协同

说明:DeepSeek V4 在官方资料中以 DeepSeek-V4 Preview 形式发布。本文按照官方 Preview 技术报告整理,不把非官方传闻写成架构事实。DeepSeek 官方称 V4 Preview 于 2026-04-24 发布并开源,包含 V4-Pro 与 V4-Flash 两个 MoE 模型。[DS-V4-Release][DS-V4-HF]

2. Transformer 基础:从 token 到下一个 token

原始 Transformer 论文《Attention Is All You Need》提出了一种主要基于 attention 的序列建模架构,不再依赖循环神经网络 RNN 或卷积 CNN 作为核心序列处理模块。[Vaswani17] 今天的大语言模型大多是 Transformer 的变体,尤其常见的是 decoder-only Transformer:它只看当前位置之前的 token,自回归地产生下一个 token。

2.1 最小化理解:LLM 在做什么?

输入文字 例如:芯片设计... Tokenizer 切成 token ID Embedding ID → 向量 N 层 Transformer block attention + FFN/MoE + norm + residual LM Head + Softmax 得到下一个 token 的概率分布 采样/选择 输出一个 token 把新 token 接回输入,循环生成

Token 是模型处理文本的基本单位,可以是一个汉字、英文词的一部分、标点,甚至换行组合。模型并不直接理解字符串,而是处理 token ID 序列。Embedding 是查表:把 token ID 变成一个高维向量。后续每层 Transformer 都在更新这些向量,使它们逐渐携带上下文语义。

自回归(autoregressive)是什么意思?

自回归模型每次只预测一个或少量下一个 token。生成一句话时,它会重复执行“根据已有 token 预测下一个 token → 把这个 token 加到上下文中 → 再预测”。这就是为什么推理会分成 prefilldecode:prefill 一次性处理已有 prompt,decode 每步生成一个新 token。

2.2 Transformer block 里面有什么?

输入 hidden states RMSNorm Self-Attention 每个位置读取其它位置的信息 Residual Add RMSNorm FFN / MLP / MoE 逐 token 的非线性变换,GEMM-heavy Residual Add → 输出

一个典型 Transformer block 包含两类核心计算:

Self-Attention:跨位置混合信息

让每个 token 位置根据相似度,从上下文中“取回”相关信息。比如“苹果发布芯片”中的“苹果”要根据上下文判断是水果还是公司。

硬件上,attention 包含 Q/K/V 投影 GEMM、QKT 得分、softmax、再乘 V。长上下文下,K/V 缓存与 attention 得分的访存会非常关键。

FFN/MLP:逐位置的非线性计算

对每个 token 的向量独立做两到三个线性层和激活函数,常见结构如 SwiGLU。它不直接跨 token 通信,但参数量和 GEMM 量很大。

MoE 模型会把 FFN 替换成多个专家,每个 token 只激活少数专家,用通信换取更大总参数规模。

2.3 Attention 的 Q/K/V 到底是什么?

Q/K/V 是从同一个 hidden state 通过不同权重矩阵投影得到的三个向量族:

  • Q(Query,查询):当前位置想问的问题。
  • K(Key,键):上下文中每个位置提供的“可匹配标签”。
  • V(Value,值):如果某个位置被匹配上,真正被读取的信息。
Attention(Q,K,V) = Softmax(QKᵀ / √dhead) · V

对芯片来说,注意力有两个阶段:算分(QKT)和 聚合(score · V)。在 prefill 阶段,序列长度为 n 时,标准全 attention 的得分矩阵规模接近 n×n;在 decode 阶段,每生成一个 token,需要它的 Q 与历史所有 K 做匹配,并从历史 V 聚合。

KV cache 为什么重要?

生成第 t 个 token 时,前面 1…t-1 个 token 的 K/V 不需要重复计算,可以缓存起来。这样 compute 省了,但显存/HBM 占用和读取带宽成为瓶颈。上下文窗口从 128K 扩到 1M 时,KV cache 成本会非常显著,所以 DeepSeek V3 用 MLA 压缩 KV,V4 进一步用 CSA/HCA 压缩和稀疏化。

2.4 Encoder-only、Encoder-Decoder、Decoder-only

类型典型用途注意力特点和 LLM 的关系
Encoder-only分类、检索、文本理解双向 attention,所有 token 可互相看BERT 类模型常见
Encoder-Decoder机器翻译、摘要编码器读输入,解码器自回归输出原始 Transformer 是这种结构[Vaswani17]
Decoder-only聊天、代码、推理、生成因果 mask,只能看当前位置之前现代通用 LLM 主流形态,DeepSeek V3/V4 属于这一类 Transformer 变体

2.5 训练、微调、强化学习:这些词的关系

预训练(pre-training) 是用海量文本做“下一个 token 预测”,学习语言、知识、代码和推理模式。SFT(Supervised Fine-Tuning,有监督微调) 用人工或合成的指令-答案数据,让模型更像助手。RL(Reinforcement Learning,强化学习) 用奖励信号优化模型行为。DeepSeek V3 报告中提到预训练后进行 SFT 和 RL,并从 DeepSeek-R1 系列蒸馏推理能力。[DS-V3-TR]

蒸馏(distillation) 可以理解为“让学生模型模仿老师模型”。如果老师模型会复杂推理,学生模型通过学习老师输出、概率分布或行为模式,获得一部分能力。

3. 核心名词速查:先记这些就能读大部分架构图

参数(parameter)

模型权重,例如矩阵 W。存储在显存/HBM 中,训练时还要存梯度和优化器状态。MoE 中“总参数”可能很大,但每个 token 只用其中一部分。

激活(activation)

中间张量,如 hidden state、Q/K/V、FFN 输出。训练要为反向传播保存或重算;推理主要关注当前步和 KV cache。

上下文窗口(context length)

模型一次能处理的 token 数。128K、1M 指的是 token 数,不是字符数。长上下文会放大 attention 和 KV cache 压力。

隐藏维度(hidden dimension)

每个 token 向量的宽度,如 DeepSeek V3/V4-Pro 的 7168。维度越大,矩阵乘规模越大。

注意力头(head)

把注意力拆成多个子空间并行计算。多头能关注不同关系,但也影响 Q/K/V 形状和 KV cache 大小。

Logits 与 Softmax

logits 是未归一化分数;softmax 把分数变成概率。最后一层 LM head 产生词表大小的 logits。

RoPE

旋转位置编码,把位置信息注入 Q/K。长上下文扩展常与 RoPE 缩放或变体相关。

GEMM/MMA

大矩阵乘/矩阵乘累加,是 Transformer 的主要 compute 形态。Tensor Core/NPU MAC 阵列利用率由矩阵形状、batch、序列长度决定。

HBM / SRAM

HBM 容量大但能耗高、延迟大;片上 SRAM/cache 快但容量小。KV cache、权重、激活的数据搬运常决定端到端性能。

4. 芯片工程师视角:Transformer 的瓶颈在哪里?

4.1 Prefill 与 Decode 是两种很不同的负载

阶段模型在做什么典型瓶颈优化方向
Prefill一次性处理 prompt 的所有 token,建立 KV cache大 GEMM、attention O(n²) 或近似 O(n²)、显存容量高吞吐矩阵乘、FlashAttention 类 kernel、上下文并行、压缩 attention
Decode每步生成一个新 token,读取历史 KV cacheKV cache 读带宽、batch 调度、低 batch 下 compute 利用率KV 压缩、Paged KV、连续 batching、投机解码、低精度 cache

很多芯片在训练 benchmark 上看起来很强,但推理 decode 阶段可能因为 batch 小、KV cache 读取大、控制/调度开销高而无法满载。对 1M context 模型,这种差异更明显。

4.2 Dense 模型 vs MoE 模型

Dense 模型 每个 token 都使用全部 FFN 参数,计算规则整齐,硬件利用率相对容易做高。MoE 模型 有很多专家,但每个 token 只路由到少数专家;优点是总参数可大幅增加,而每 token 激活参数相对低,缺点是引入 token 分发、专家负载均衡和 all-to-all 通信。

Token hidden 每个 token 的向量 Router/Gate 选择 Top-k 专家 Expert 17 Expert 91 Expert ... 加权合并输出 Combine / all-to-all 返回
MoE 对芯片/系统的挑战

MoE 的矩阵乘本身仍像 FFN,但 token 需要按专家重排,跨设备时要 all-to-all。工程重点会变成:路由是否均衡、专家并行 EP 的通信是否能与计算 overlap、每个专家的 micro-batch 是否足够大、片间网络是否能支持细粒度 dispatch/combine。

4.3 低精度不只是“少存一点”

FP16/BF16/FP8/FP4/INT8 的差异不仅是位宽。它会影响矩阵乘吞吐、累加精度、scale 的粒度、在线量化/反量化、激活异常值处理、训练稳定性,以及硬件是否能在 Tensor Core/NPU 阵列内部完成带 scale 的 MMA。

DeepSeek V3 技术报告对未来硬件提出过几类建议:提高 FP8 GEMM 累加精度、支持 tile/block 级量化、支持在线量化、支持转置 GEMM 相关的数据访问,以减少 Tensor Core 与 CUDA core/HBM 之间的数据搬运。[DS-V3-HW]

5. DeepSeek V3 架构介绍

DeepSeek V3 是一个大规模 MoE 语言模型。官方技术报告称它有 671B 总参数,每个 token 激活 37B 参数;采用 MLA 与 DeepSeekMoE,并引入 auxiliary-loss-free 负载均衡和 MTP 训练目标。[DS-V3-TR]

5.1 一页概览

项目DeepSeek V3解释
模型类型Decoder-only Transformer + MoE自回归生成;FFN 部分主要用专家网络替代。
总参数 / 激活参数671B / 37B 每 token总参数是所有专家加起来;激活参数是一次处理某个 token 实际参与计算的参数。
层数 / hidden dim61 层 / 7168层数影响深度,hidden dim 影响矩阵宽度。
AttentionMLA,128 heads,head dim 128,KV 压缩维 512,Query 压缩维 1536MLA 用低秩 latent 表示减少 KV cache。
MoE除前 3 层外,FFN 替换为 MoE;每 MoE 层 1 个 shared expert + 256 routed experts;每 token 激活 8 个 routed expertsshared expert 每个 token 都走;routed expert 由 router 选择。
上下文长度预训练 4K;经 YaRN 两阶段扩展到 128K长上下文扩展不是简单改参数,还需要额外训练。
训练数据14.8T tokenstoken 是训练量单位,不等于字符或词。
训练效率全训练约 2.788M H800 GPU hours;预训练约 2.664M H800 GPU hours官方报告口径;不含前期研究/消融实验成本。
低精度FP8 mixed precision training通过低精度计算/存储降低成本,需要数值稳定设计。

上表关键数字来自 DeepSeek V3 技术报告和官方 GitHub/API 文档。[DS-V3-HW][DS-V3-GitHub][DS-V3-API]

5.2 V3 block 的结构

Input tokens Embedding 61 × Transformer Blocks MLA Attention 低秩 KV latent + RoPE 解耦 key/query DeepSeekMoE FFN 1 shared expert + 256 routed experts,Top-8 RMSNorm + Residual 稳定深层信号传播 ... LM Head 预测下一个 token MTP module 额外预测一个未来 token

5.3 MLA:为什么 V3 的 attention 更省 KV cache?

MLA(Multi-head Latent Attention,多头潜在注意力) 的核心是:不要把每一层、每个 token、每个 attention head 的完整 K/V 都缓存下来,而是先把 K/V 压缩成低维 latent,再从 latent 恢复出注意力计算所需的 key/value。DeepSeek V3 报告称 MLA 对 keys/values 做低秩联合压缩,推理时只需缓存压缩 latent 和带 RoPE 的解耦 key,从而显著降低 KV cache。[DS-V3-HW]

硬件含义

MLA 把一部分“存储完整 KV”的成本转化为“每步从 latent 做上投影/组合”的计算成本。对长上下文 decode,KV cache 读写通常很贵,因此这种 compute-for-memory 的交换可能是划算的。芯片侧要关注:latent 维度、恢复 Q/K/V 的 GEMM 形状、RoPE 维度、cache layout、以及是否能把相关算子融合。

5.4 DeepSeekMoE:总参数很大,但每 token 只走少数专家

DeepSeekMoE 使用更细粒度专家,并区分 shared experts 与 routed experts。V3 中每个 MoE 层包含 1 个 shared expert 和 256 个 routed experts,每个 token 激活 8 个 routed experts;前 3 层仍使用普通 FFN,其余 FFN 替换为 MoE。[DS-V3-HW]

名词解释:shared expert、routed expert、router/gate

Shared expert 可以理解为所有 token 都会经过的“公共专家”,保证通用能力。Routed expert 是由 router 选择的专家。Router/Gate 根据 token hidden state 计算每个专家的分数,选 Top-k 专家,并给专家输出加权。

V3 引入 auxiliary-loss-free load balancing。传统 MoE 常通过辅助损失鼓励专家负载均衡,但辅助损失过强可能损害模型能力。V3 通过给专家路由分数加动态 bias 来调节负载;bias 只用于路由选择,最终门控值仍来自原始 affinity score。[DS-V3-HW]

5.5 MTP:多 token 预测为什么有用?

MTP(Multi-Token Prediction,多 token 预测) 是让模型在训练时不仅预测下一个 token,还额外预测更后面的 token。DeepSeek V3 设置 MTP depth = 1,也就是除了精确的 next token,还额外预测一个未来 token。报告认为 MTP 可以加密训练信号、提升数据效率,并可用于推测解码加速。[DS-V3-HW]

推理时,MTP 模块可以丢弃,让主模型正常工作;也可以把 MTP 模块用于 speculative decoding。对硬件来说,speculative decoding 的价值在于一次提出多个候选 token,再用主模型验证,从而减少串行 decode 步数。

5.6 V3 的训练与系统实现重点

DeepSeek V3 在 2048 张 NVIDIA H800 GPU 集群上训练;官方报告提到 16-way pipeline parallelism、64-way expert parallelism(跨 8 个节点)和 ZeRO-1 data parallelism。[DS-V3-HW] 这些并行方式对芯片系统的含义如下:

并行方式简单解释硬件/系统关注点
DP(Data Parallelism)多份模型处理不同 batch 数据,再同步梯度梯度 all-reduce,带宽和同步延迟
PP(Pipeline Parallelism)不同层放在不同设备上,像流水线一样运行pipeline bubble、跨 stage 激活通信、调度复杂度
EP(Expert Parallelism)MoE 专家分布在不同设备上,token 路由到对应专家all-to-all、token 重排、负载均衡、通信计算重叠
ZeRO把优化器状态/梯度/参数分片存储节省显存但引入通信与调度

6. DeepSeek V4 Preview 架构介绍

DeepSeek V4 官方资料显示,V4 Preview 包含两个 MoE 模型:V4-Pro(1.6T 总参数 / 49B 激活参数)和 V4-Flash(284B 总参数 / 13B 激活参数),二者都支持 1M token 上下文。[DS-V4-Release][DS-V4-HF]

版本说明

这里的“V4”按官方发布页和技术报告写作 DeepSeek-V4 Preview。Preview 通常意味着架构和权重已经公开,但未来仍可能出现更新版或正式版。本文不把第三方传闻作为架构依据。

6.1 一页概览

项目V4-FlashV4-Pro解释
定位更快、更经济更强能力两者同属 V4 Preview 系列。
总参数 / 激活参数284B / 13B1.6T / 49BMoE 模型总参数大,但每 token 只激活部分专家。
上下文长度1M tokens1M tokens官方称 1M context 是 V4 系列默认能力。
层数 / hidden dim43 层 / 409661 层 / 7168Pro 深度和宽度接近 V3,但专家规模更大。
Attention前 2 层 pure sliding window;后续 CSA/HCA 交错前 2 层 HCA;后续 CSA/HCA 交错V4 的核心创新是 hybrid attention:CSA + HCA。
CSA top-k5121024CSA 在压缩 KV 后再稀疏选择 top-k。
HCA 压缩率m′ = 128m′ = 128每 128 个 token 的 KV 压成一个 entry,再做 dense compressed attention。
MoE1 shared + 256 routed,Top-61 shared + 384 routed,Top-6V4 所有 Transformer block 都用 MoE,但前 3 个 MoE 层使用 Hash routing。
MTPdepth = 1depth = 1继承 V3 的多 token 预测策略。
优化器Muon 为主,部分模块 AdamWMuon 为主,部分模块 AdamWMuon 用于更快收敛和更稳定训练。
预训练 tokens32T33T均从 4K 逐步扩展到 16K、64K、1M。

V4 模型参数、层数、attention 配置、MoE 配置和训练设置来自 V4 技术报告。[DS-V4-TR]

6.2 V4 相比 V3 继承了什么、改变了什么?

继承自 V3 的主干思想

  • 仍是 Transformer / decoder-only 语言模型。
  • 仍使用 DeepSeekMoE 思想,让总参数远大于激活参数。
  • 仍使用 MTP depth = 1。
  • 仍关注低精度训练/推理与工程化并行。

V4 的关键新增

  • Hybrid Attention:CSA + HCA,面向 1M 长上下文。
  • mHC:强化 residual connection 的稳定传播。
  • Muon optimizer:用于多数参数,提升收敛和稳定性。
  • FP4 + FP8 mixed:发布模型中 MoE expert 参数可用 FP4,其他多为 FP8。[DS-V4-HF]

6.3 Hybrid Attention:CSA + HCA

V4 技术报告称,随着上下文长度达到极大规模,attention 成为主要计算瓶颈;V4 设计了两种高效 attention 架构:CSA(Compressed Sparse Attention)HCA(Heavily Compressed Attention),并交错使用。[DS-V4-TR]

DeepSeek V4 Hybrid Attention 简化图 历史 token 的 K/V 长度可达 1M CSA 路径 每 m=4 个 token 压缩为 1 个 KV entry Lightning indexer 选 top-k,再做 sparse attention 选中的压缩 KV + 滑窗 KV 保留长程与局部依赖 历史 token 的 K/V 同样可达 1M HCA 路径 每 m′=128 个 token 压缩为 1 个 KV entry 不做 sparse top-k,直接在压缩序列上 dense attention 重压缩 KV + 滑窗 KV 极低 KV cache,牺牲细粒度 Grouped output projection → attention output CSA:压缩较轻 + 稀疏选择,适合保留更多长程信息 HCA:压缩很重 + dense compressed attention,适合进一步降低 cache/FLOPs
名词解释:CSA、DSA、HCA、MQA、滑动窗口

CSA 先把每 m 个 token 的 KV 压缩成一个 entry,再用 DSA/DeepSeek Sparse Attention 的思路通过 indexer 选出 top-k 压缩 KV entry 做核心 attention。HCA 用更大的压缩率 m′,但不做 sparse top-k,而是在压缩后的 KV 上做 dense attention。MQA/Multi-Query Attention 是多个 query heads 共享一组 key/value 的注意力形式,可减少 KV 存储。滑动窗口 attention 额外保留最近 n 个 token 的未压缩 KV,补偿压缩带来的局部细节损失。

V4 报告还提到两类细节:对 query 和 compressed KV entry 在 core attention 前做 RMSNorm,避免 attention logits 爆炸;对 CSA/HCA 部分维度使用 RoPE,并加入 attention sink,使某些 head 可把总 attention 质量调低到接近 0。[DS-V4-TR]

硬件含义

CSA/HCA 把 1M context 的压力从“完整 KV + 全量 attention”变成“压缩 KV + indexer/top-k + 局部窗口 + 低精度存储”。这会改变 kernel 形态:不再只有规则大矩阵乘,还包括压缩、top-k 选择、gather/scatter、稀疏 attention、滑窗拼接和分组输出投影。芯片/编译器需要处理更复杂的数据流与动态选择。

6.4 mHC:加强 residual connection

Residual connection(残差连接) 是 Transformer 稳定训练深层网络的关键:每层不是完全替换输入,而是在输入上加一个变换结果。V4 引入 mHC(Manifold-Constrained Hyper-Connections) 来强化传统 residual connection。技术报告称,mHC 把 residual mapping matrix 约束到双随机矩阵流形(Birkhoff polytope),使谱范数有界,从而增强前向和反向传播的数值稳定性。[DS-V4-TR]

名词解释:双随机矩阵、Sinkhorn-Knopp、谱范数

双随机矩阵 指每行和每列之和都为 1、元素非负的矩阵。这样的约束可防止 residual 映射不断放大信号。Sinkhorn-Knopp 是一种通过交替行/列归一化把正矩阵近似投影为双随机矩阵的算法。谱范数 可理解为矩阵对向量最大放大倍数的度量;把它控制在 1 附近有利于稳定深层堆叠。

6.5 Muon optimizer:训练稳定和收敛

V4 采用 Muon optimizer 作为多数参数的优化器,但 embedding、prediction head、RMSNorm 权重、mHC 的部分静态 bias/gate 等仍使用 AdamW。报告描述了 Muon 中的 Newton-Schulz 近似正交化过程,并称使用 Muon 是为了更快收敛和更好的训练稳定性。[DS-V4-TR]

从芯片角度看,优化器主要影响训练而非纯推理。Muon/AdamW 的区别不仅在数学,也在优化器状态存储、矩阵正交化计算、分布式状态分片和训练框架的实现复杂度。

6.6 V4 的 KV cache 与 1M context

V4 技术报告称,在 1M-token context 场景,DeepSeek-V4-Pro 的单 token 推理 FLOPs 约为 DeepSeek-V3.2 的 27%,KV cache 约为 V3.2 的 10%;V4-Flash 进一步降到约 10% FLOPs 和 7% KV cache。[DS-V4-TR]

官方发布页也将 V4 的结构创新概括为“Token-wise compression + DSA”,并称 1M context 成为官方服务默认能力。[DS-V4-Release]

为什么 V4 没有直接继续用 V3 的 MLA?

从公开报告看,V4 目标是“高效百万 token 上下文”。MLA 已能降低 KV cache,但当 context 从 128K 扩到 1M,attention 的序列维度仍然非常大。V4 因此进一步在序列维度上压缩 KV,并引入 sparse top-k 选择和重压缩 dense attention,以降低长上下文下的计算和存储。

6.7 V4 的训练稳定措施

V4 技术报告承认 trillion-parameter MoE 训练存在稳定性挑战,并介绍了两种实用措施:Anticipatory RoutingSwiGLU Clamping。前者在出现 loss spike 时用历史参数提前计算/缓存路由索引,打断 routing 与 backbone 同步更新导致的恶性循环;后者限制 SwiGLU 的线性分量和 gate 上界,抑制异常值。[DS-V4-TR]

7. DeepSeek V3 vs V4 Preview:架构差异表

维度DeepSeek V3DeepSeek V4 Preview对芯片/系统的含义
目标高性能 MoE LLM,128K context高效 1M context intelligenceV4 更明显地把长上下文作为一等目标。
参数规模671B total / 37B activeFlash: 284B / 13B;Pro: 1.6T / 49BV4-Pro 总参数更大,V4-Flash 更轻;都依赖 MoE 保持每 token 成本可控。
AttentionMLA:低秩 KV latent 压缩CSA + HCA:序列维压缩、稀疏选择、重压缩 dense attentionV4 对 KV cache 和 attention FLOPs 做更激进的长上下文优化。
FFN/MoE前 3 层普通 FFN,其余 MoE;Top-8 routed experts所有 block 用 MoE;前 3 个 MoE 层 Hash routing;Top-6 routed experts路由、all-to-all、专家 micro-batch 仍是关键。
Residual/连接传统 residual + RMSNormmHC 强化 residual connection提升深层稳定,但引入动态映射和 Sinkhorn-Knopp 相关计算。
训练目标MTP depth = 1MTP depth = 1有助于性能,也可能支持 speculative decoding。
优化器AdamWMuon 为主 + AdamW 局部模块训练框架和优化器状态/计算更复杂。
低精度FP8 mixed precision training发布模型含 FP4 + FP8 mixed;专家参数 FP4,其他多为 FP8未来硬件若原生支持 FP4×FP8、细粒度 scale,会更能释放模型收益。
上下文4K 预训练,扩展到 32K、128K从 4K 逐步扩展到 16K、64K、1MKV cache、压缩 attention、磁盘/分层缓存与上下文并行变重要。

一句话总结:V3 的核心是“MoE + MLA + FP8 + 高效训练系统”;V4 Preview 的核心是“在 MoE 主干上,为 1M 上下文重做 attention 与 residual/训练稳定设计”。

8. 读论文/评估芯片时的检查清单

模型架构检查

  • 是 dense 还是 MoE?每 token 激活多少参数?
  • attention 是 MHA、MQA、GQA、MLA、sparse、sliding-window,还是混合?
  • KV cache 每 token 每层需要多少字节?是否压缩?精度是多少?
  • 上下文窗口是训练原生支持,还是 RoPE/YaRN 后扩展?
  • 推理是否使用 speculative decoding、MTP、chunked prefill?

芯片/系统检查

  • GEMM/MMA 的矩阵形状是否适配阵列大小?小 batch decode 利用率如何?
  • HBM 容量是否能容纳权重 + KV cache + batch?HBM 带宽是否够?
  • 是否原生支持 BF16/FP16/FP8/FP4/INT8 及细粒度 scale?累加精度如何?
  • MoE all-to-all 是否能用互连隐藏在专家计算之下?
  • 编译器/runtime 是否支持 dynamic routing、top-k、gather/scatter、paged KV?
特别提醒

不要只看“TOPS/FLOPS 峰值”。大模型端到端性能往往受限于数据搬运、KV cache、路由通信、kernel fusion、动态 shape、batch 调度和服务策略。架构论文里的每一个“压缩”“稀疏”“MoE”“低精度”都可能改变芯片瓶颈。

9. 详细术语表

基础模型术语
术语解释硬件类比/关注点
Token文本被 tokenizer 切分后的最小处理单位。中文常接近字或词片段,英文常是词片段。序列长度 n 的单位,决定 attention/KV cache 规模。
Vocabulary / 词表所有 token 的集合,常见规模几十 K 到数百 K。LM head 输出维度等于词表大小,影响最后投影成本。
Embeddingtoken ID 到向量的查表。随机/稀疏读取,训练时 embedding 梯度更新也有通信问题。
Hidden state每层中每个 token 的向量表示。形状通常为 batch × seq_len × hidden_dim。
Layer一个 Transformer block。层数越多,流水线并行和激活存储越重要。
Context window一次能读入的最大 token 数。直接放大 KV cache 与 attention 工作量。
Logitsoftmax 前的未归一化分数。最后一层通常是 hidden_dim × vocab_size GEMM。
Attention 术语
术语解释硬件类比/关注点
Q/K/VQuery、Key、Value,是 attention 的三组投影。QKV projection 是 GEMM;K/V 会进入 cache。
Attention head把 attention 拆成多个子空间。影响并行粒度、head_dim、KV layout。
Softmax把 attention logits 归一化为权重。需要 max/sum/reduce,数值稳定和内存访问很重要。
Causal mask防止当前位置看到未来 token。decode 自然满足,prefill 需要 mask 或专门 kernel。
KV cache缓存历史 K/V,避免每步重复计算。decode 阶段常成为 HBM 容量/带宽瓶颈。
MHA/MQA/GQA多头、多查询、分组查询注意力。MQA/GQA 通过共享 K/V 减少 cache。
MLA低秩 latent 压缩 K/V 的 attention。用额外计算换少量 KV cache。
CSA/HCAV4 中的压缩稀疏/重压缩 attention。引入压缩、top-k、gather/scatter 与稀疏模式。
MoE 与训练术语
术语解释硬件类比/关注点
MoEMixture-of-Experts,多个专家网络,每个 token 只激活少数专家。总参数增大但每 token compute 可控;通信复杂。
Router/Gate决定 token 去哪些专家。top-k、负载均衡、token dispatch。
Shared expert所有 token 都经过的专家。更像 dense FFN 的公共路径。
Routed expert由 router 选择的专家。专家并行时需要 all-to-all。
Token dropping专家拥塞时丢弃部分 token 的训练/推理策略。会影响质量;DeepSeek V3 报告称不 drop token。
MTPMulti-Token Prediction,训练时额外预测未来 token。可能支持推测解码,减少串行生成步数。
SFT有监督微调,用指令数据训练助手行为。训练量小于预训练,但数据质量要求高。
RL/GRPO强化学习及 DeepSeek 系列常用的 Group Relative Policy Optimization。需要 rollout、奖励评估、分布式训练框架。
Distillation学生模型学习老师模型输出或行为。可把强推理模式迁移给更便宜模型。
芯片/系统术语
术语解释硬件类比/关注点
GEMMGeneral Matrix Multiply,通用矩阵乘。Transformer 的主算子;阵列利用率关键。
MMAMatrix Multiply-Accumulate,矩阵乘累加。Tensor Core/NPU MAC 的核心指令/微架构。
HBM高带宽显存。权重/KV cache/激活读写能耗和带宽瓶颈。
FP8/FP48 位/4 位浮点格式。吞吐和容量收益大,但需要 scale、累加精度和异常值处理。
Quantization量化,把高精度数值映射为低精度。per-tensor、per-channel、tile/block 粒度影响精度和硬件复杂度。
All-to-all多个设备互相发送不同数据。MoE expert parallelism 中 token dispatch/combine 关键通信。
Pipeline bubble流水线并行中设备空等的时间。影响多卡训练效率。
Kernel fusion把多个小算子融合成一个 kernel。减少 HBM 往返和 launch 开销,改善端到端延迟。

10. 资料来源与可靠性

本文优先使用官方技术报告、官方发布页、官方 GitHub/Hugging Face 模型卡。部分内容是对这些资料的工程化解释,而非源文逐字翻译。

  1. [Vaswani17] Vaswani et al., “Attention Is All You Need,” arXiv:1706.03762, 2017. https://arxiv.org/abs/1706.03762
  2. [DS-V3-TR] DeepSeek-AI, “DeepSeek-V3 Technical Report,” arXiv:2412.19437. https://arxiv.org/abs/2412.19437
  3. [DS-V3-HW] DeepSeek-V3 Technical Report HTML version, architecture / hardware sections. https://arxiv.org/html/2412.19437v1
  4. [DS-V3-GitHub] deepseek-ai/DeepSeek-V3 GitHub repository. https://github.com/deepseek-ai/DeepSeek-V3
  5. [DS-V3-API] DeepSeek API Docs, “Introducing DeepSeek-V3,” 2024-12-26. https://api-docs.deepseek.com/news/news1226
  6. [DS-V4-Release] DeepSeek API Docs, “DeepSeek V4 Preview Release,” 2026-04-24. https://api-docs.deepseek.com/news/news260424
  7. [DS-V4-HF] deepseek-ai/DeepSeek-V4-Pro model card on Hugging Face. https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro
  8. [DS-V4-TR] DeepSeek-AI, “DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence,” technical report PDF. https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro/resolve/main/DeepSeek_V4.pdf