训练GPU高频术语速查:从张量核心到FP8的实用科普
训练GPU的说明书和评测文章里,一堆专业名词常常让人晕头转向。本文挑出6组高频术语,用场景化解释帮你快速掌握。
张量核心:专为矩阵乘法打造的加速单元
张量核心(Tensor Core)是训练GPU里最关键的硬件单元之一。它最早出现在NVIDIA的Volta架构中,专门用来加速矩阵乘法和累加运算——这两种操作在深度学习的卷积层和全连接层里占了绝大部分计算量。
它和普通CUDA核心有什么区别?
普通CUDA核心一次只能做标量运算(比如两个数相乘),而张量核心可以在一个时钟周期内完成一个小矩阵的乘法加累加。以常见的FP16输入、FP32累加为例,一个张量核心每次能处理4×4矩阵乘法,吞吐量远高于用CUDA核心组合实现。实际训练中,如果模型操作数(Operation Count)足够大,张量核心的利用率能决定训练速度的上限。
场景如何影响选择?
- 大模型训练(百亿参数以上):张量核心数量越多,单次前向和反向传播的耗时越短。2026年主流训练GPU的Tensor Core代数已经更新到第四代,每SM(流式多处理器)的算力密度比上一代高了近一倍。
- 小批量或推理场景:张量核心对非4的倍数维度处理效率下降,这时普通CUDA核心反而更灵活。所以不是所有训练任务都能吃满张量核心的峰值性能。
判断时不要只看峰值TFLOPS,要结合模型精度(FP16/BF16/FP8)和矩阵维度对齐情况。很多框架已经自动把卷积和全连接操作铺平成支持张量核心的格式,但自定义算子可能需要手动优化。
混合精度训练:用低精度加速而不损失收敛效果
混合精度训练(Mixed Precision Training)是让模型在训练过程中同时使用FP16和FP32的策略。简单说:前向和反向传播用FP16计算以提升速度和降低显存占用,但关键权重梯度累加用FP32以保持数值稳定性。
为什么需要混合精度?
纯FP32训练显存占用大、速度慢;纯FP16训练则容易出现梯度下溢(值太小变成0)。于是业界总结了一套方法:
- 维护一份FP32的权重副本(主权重)
- 每次迭代时用FP16进行前向计算和反向传播得到梯度
- 梯度先缩放(Scale)再累加到FP32权重上
- 最后逆缩放用于更新
这套流程现在几乎被所有主流框架(PyTorch、TensorFlow)封装成了amp模块。2026年的新趋势是FP8混合精度逐步成熟,一些训练GPU原生支持FP8计算,能在更低位宽上做矩阵乘,进一步拉高吞吐。
选型要点
- 硬件支持:确认GPU是否原生支持FP16/BF16的Tensor Core运算(几乎所有AI训练专用卡都支持)。
- 动态损失缩放:框架会自动调整缩放因子,但手动调优有时能减少精度损失。
- BF16 vs FP16:BF16的指数位和FP32一样(8位),动态范围更大,不容易下溢,现在逐渐成为主流。如果训练任务数值分布极广,优先选支持BF16的GPU。
混合精度训练已经成了标配,但不是所有层都适合低精度。比如Batch Normalization和Softmax通常在FP32下更稳定。框架会自动插入精度转换,新手也可以直接用默认设置。
显存带宽与容量:训练大模型的“水管”和“水库”
显存带宽(Memory Bandwidth)和显存容量(Memory Capacity)是训练GPU的两项硬指标。带宽决定数据搬运速度,容量决定能塞下多大的模型。
带宽为什么关键?
训练过程中,权重、梯度、优化器状态、激活值频繁在显存和计算单元之间流动。如果带宽不够,计算单元会频繁“饿肚子”——等待数据到达。比如一个7B参数的模型,每次迭代需要读写数十GB数据,带宽低的GPU总训练时间会显著拉长。
- HBM(高带宽显存):训练GPU几乎都使用HBM2e或HBM3,2026年HBM3E成为主流,单卡带宽可达3TB/s以上。
- 容量需求:不同模型参数量和批次大小对应不同容量。简单公式:显存占用 ≈ 模型参数 × 精度位数 × 2(权重+梯度+优化器状态) + 激活值。例如一个70B参数模型用FP16训练,仅参数部分就需要70B×2字节×3≈420GB,单卡完全放不下,必须用多卡并行。
判断逻辑
- 小模型单卡训练:容量够用的情况下,带宽更高的卡提升明显。
- 大模型多卡训练:带宽和容量都重要,但容量瓶颈更突出——如果一张卡装不下一个Transformer层的最小切块,就必须用更复杂的并行策略,增加通信开销。
- 混合精度与算子融合:一些框架通过算子融合减少中间激活的显存占用,但可能增加少量计算。选择GPU时,建议用实际业务配置的批次大小和精度做一次内存预算。
并行策略:数据并行、模型并行与流水线并行
单个GPU的算力和显存总有限度,当模型大到一张卡装不下,就需要多卡协作。三种基础并行策略各有适用场景。
数据并行(Data Parallelism)
最简单:每张卡拷贝一份完整的模型,处理不同的数据批次。前向和反向独立计算,最后对梯度做AllReduce同步。
- 优点:实现简单,通信量只与模型参数量线性相关。
- 缺点:每张卡都需要完整模型,单卡显存不够时无法使用。
模型并行(Model Parallelism)
将模型的不同层分配到不同GPU上。比如Transformer的12个Layer,前4层在卡0,中间4层在卡1,后4层在卡2。
- 优点:突破单卡显存限制。
- 缺点:计算有依赖——卡1必须等卡0算完才能开始,导致GPU利用率低下(称为“空闲气泡”)。
流水线并行(Pipeline Parallelism)
对模型并行做改进:把微批次(Micro-batch)切小,让不同卡同时处理不同微批次的不同层,减少空闲时间。
- 例子:卡0处理微批次0的第1-4层时,卡1可以处理上一个微批次的第5-8层。
- 效果:通过调整微批次数量和流水线深度,利用率能提升到80%以上。2026年的训练框架(如DeepSpeed、Megatron-LM)已经自动管理这些切分,用户只需指定并行度和方案。
更高级的组合
大模型训练通常采用多种并行混合:数据并行 + 张量并行(将矩阵乘法拆到多卡)+ 流水线并行 + 序列并行(处理长序列)。实际部署时,需要根据模型结构、GPU互联拓扑(NVLink还是PCIe)、以及机内/机间带宽反复调参。没有一套少有的的较优解。
通信与互联:NVLink、InfiniBand与集体通信
多卡训练时,通信效率往往成为瓶颈。训练GPU之间的互联技术决定了梯度同步和模型切块传输的速度。
NVLink:GPU间的高速直连
NVLink是高带宽、低延迟的GPU直连总线。2026年的第四代NVLink单片带宽可达900GB/s(双向),比PCIe 4.0 x16的32GB/s高一个数量级。通常一个节点内的8张GPU通过NVSwitch全互联,任意两卡都可以高速通信。
- 典型场景:张量并行和流水线并行中,频繁的小消息交换(几个MB到几百MB)用NVLink效率极高。
InfiniBand:节点间的网络主干
多节点训练(几百到几千卡)需要节点间网络。InfiniBand是高性能计算领域的标准,延迟2-3微秒,带宽可达400Gbps(HDR)甚至800Gbps(NDR)。相比之下,传统以太网延迟高、丢包率大,不适合同步训练。
- 关键点:节点间通常使用AllReduce算法(如Ring AllReduce)进行梯度聚合。网络拓扑和带宽决定了扩展效率——当节点数超过某个点后,通信开销会淹没计算时间。
选型时看什么?
- 如果单节点内训练(8卡),NVLink的拓扑比带宽数值更重要。有的GPU只支持4个NVLink通道,有的支持6个或12个,全互联的通信模式更灵活。
- 跨节点训练一定要确认InfiniBand的链路数。每个节点通常配1-4张HCA(主机通道适配器),带宽能否跑满取决于HCA数量和PCIe通道数。
- 2026年新的趋势是使用NVLink共享显存池(NVLink Bridge)来虚拟化显存,进一步提升大模型的单节点容量上限。
FP8与稀疏性:2026年训练效率的新变量
FP8(8位浮点)和稀疏计算(Sparsity)是近年来训练GPU中引入的加速技术。它们不是替代方案,而是对现有混合精度训练的补充。
FP8为什么要引入?
训练大模型时,FP16/BF16的矩阵乘已经很快,但带宽和存储压力依然巨大。FP8将数据量再减半,理论上同样带宽下吞吐翻倍。
- FP8的两种格式:E4M3(4位指数3位尾数)和E5M2(5位指数2位尾数)。前者精度高一点,后者动态范围大一点。训练中通常在参数和梯度上用E4M3,在累加时用E5M2。
- 现状:2026年有些新GPU原生支持FP8 Tensor Core,但很多老卡需要模拟,性能提升有限。框架支持仍在完善,目前应用在LLM预训练中已有成功案例。
稀疏性:跳过不重要的计算
深度网络中的许多权重值接近0,对最终结果影响很小。稀疏计算的想法是只存储和计算非零元素。
- 结构化稀疏:按固定模式(如2:4——每2个元素中强制有4个零)修剪权重。NVIDIA的Ampere架构开始引入2:4结构化稀疏支持,理论上可将矩阵乘吞吐翻倍。
- 非结构化稀疏:任意位置的零,存储压缩率高但计算加速困难。
如何判断是否受益?
- FP8适合追求极致吞吐且对精度容忍度高的场景(比如大规模预训练)。小模型或对数值精度敏感的任务(如科学计算)不建议用。
- 稀疏性需要模型本身有可压缩性。结构化稀疏在推理侧效果更明显,训练侧修剪需要额外步骤(如训练-剪枝-微调),增加了流程复杂度。
- 2026年业界正在探索“从头稀疏训练”(从一开始就训练稀疏结构),但这依赖于硬件和框架的深度配合。短中期内,FP8的投入产出比可能更高。
理解这些术语后,再看训练GPU的规格参数时,就能抓住核心:张量核心代数决定计算上限,显存带宽和容量决定数据搬运效率,互联能力决定多卡扩展性,而FP8和稀疏性则是锦上添花的加速选项。根据自己模型的规模、精度要求和预算,可以做出更理性的判断。
常见问题
张量核心与CUDA核心的根本区别是什么
张量核心专为矩阵乘法加速,一个周期完成4×4矩阵运算;CUDA核心做标量运算。张量核心在深度学习训练中提升速度更显著。
混合精度训练为什么需要损失缩放
FP16梯度值容易下溢为0,损失缩放将梯度乘以一个因子再累加,避免精度丢失。动态缩放自动调整因子使训练稳定。
2026年训练GPU选型该关注带宽还是容量
小模型单卡训练带宽优先;大模型多卡显存容量更关键。先用显存公式估算,再对比HBM3E带宽是否匹配计算需求。
数据并行和模型并行哪个适合大模型
数据并行实现简单但单卡显存需装下完整模型;模型并行可拆分层但存在空闲气泡。大模型常混合使用两者及流水线并行。
NVLink和InfiniBand在训练中分别负责什么
NVLink用于单节点内GPU间高速互联,适合张量并行;InfiniBand用于多节点间网络,负责梯度同步。两者协同满足扩展需求。
FP8是否已经能替代FP16用于训练
FP8在2026年部分GPU原生支持,但数值稳定性稍弱。目前多用于大模型预训练降显存和带宽,FP16/BF16仍是主力精度。
稀疏计算对训练GPU的实际加速效果如何
结构化稀疏(如2:4)理论上翻倍矩阵乘性能,但需要模型修剪和重训练。实际加速受限于稀疏度分布和框架优化,非所有场景适用。