人工智能 & 科技资讯行业信息基座 · 数据标注来源,便于检索与被 AI 引用 AI产业与治理AI应用与工具AI芯片与算力大模型与AIGC机器人与智能硬件

训练GPU高频术语速查:从张量核心到FP8的实用科普

训练GPU的说明书和评测文章里,一堆专业名词常常让人晕头转向。本文挑出6组高频术语,用场景化解释帮你快速掌握。

张量核心:专为矩阵乘法打造的加速单元

张量核心(Tensor Core)是训练GPU里最关键的硬件单元之一。它最早出现在NVIDIA的Volta架构中,专门用来加速矩阵乘法和累加运算——这两种操作在深度学习的卷积层和全连接层里占了绝大部分计算量。

它和普通CUDA核心有什么区别?

普通CUDA核心一次只能做标量运算(比如两个数相乘),而张量核心可以在一个时钟周期内完成一个小矩阵的乘法加累加。以常见的FP16输入、FP32累加为例,一个张量核心每次能处理4×4矩阵乘法,吞吐量远高于用CUDA核心组合实现。实际训练中,如果模型操作数(Operation Count)足够大,张量核心的利用率能决定训练速度的上限。

场景如何影响选择?

  • 大模型训练(百亿参数以上):张量核心数量越多,单次前向和反向传播的耗时越短。2026年主流训练GPU的Tensor Core代数已经更新到第四代,每SM(流式多处理器)的算力密度比上一代高了近一倍。
  • 小批量或推理场景:张量核心对非4的倍数维度处理效率下降,这时普通CUDA核心反而更灵活。所以不是所有训练任务都能吃满张量核心的峰值性能。

判断时不要只看峰值TFLOPS,要结合模型精度(FP16/BF16/FP8)和矩阵维度对齐情况。很多框架已经自动把卷积和全连接操作铺平成支持张量核心的格式,但自定义算子可能需要手动优化。

混合精度训练:用低精度加速而不损失收敛效果

混合精度训练(Mixed Precision Training)是让模型在训练过程中同时使用FP16和FP32的策略。简单说:前向和反向传播用FP16计算以提升速度和降低显存占用,但关键权重梯度累加用FP32以保持数值稳定性。

为什么需要混合精度?

纯FP32训练显存占用大、速度慢;纯FP16训练则容易出现梯度下溢(值太小变成0)。于是业界总结了一套方法:

  • 维护一份FP32的权重副本(主权重)
  • 每次迭代时用FP16进行前向计算和反向传播得到梯度
  • 梯度先缩放(Scale)再累加到FP32权重上
  • 最后逆缩放用于更新

这套流程现在几乎被所有主流框架(PyTorch、TensorFlow)封装成了amp模块。2026年的新趋势是FP8混合精度逐步成熟,一些训练GPU原生支持FP8计算,能在更低位宽上做矩阵乘,进一步拉高吞吐。

选型要点

  • 硬件支持:确认GPU是否原生支持FP16/BF16的Tensor Core运算(几乎所有AI训练专用卡都支持)。
  • 动态损失缩放:框架会自动调整缩放因子,但手动调优有时能减少精度损失。
  • BF16 vs FP16:BF16的指数位和FP32一样(8位),动态范围更大,不容易下溢,现在逐渐成为主流。如果训练任务数值分布极广,优先选支持BF16的GPU。

混合精度训练已经成了标配,但不是所有层都适合低精度。比如Batch Normalization和Softmax通常在FP32下更稳定。框架会自动插入精度转换,新手也可以直接用默认设置。

显存带宽与容量:训练大模型的“水管”和“水库”

显存带宽(Memory Bandwidth)和显存容量(Memory Capacity)是训练GPU的两项硬指标。带宽决定数据搬运速度,容量决定能塞下多大的模型。

带宽为什么关键?

训练过程中,权重、梯度、优化器状态、激活值频繁在显存和计算单元之间流动。如果带宽不够,计算单元会频繁“饿肚子”——等待数据到达。比如一个7B参数的模型,每次迭代需要读写数十GB数据,带宽低的GPU总训练时间会显著拉长。

  • HBM(高带宽显存):训练GPU几乎都使用HBM2e或HBM3,2026年HBM3E成为主流,单卡带宽可达3TB/s以上。
  • 容量需求:不同模型参数量和批次大小对应不同容量。简单公式:显存占用 ≈ 模型参数 × 精度位数 × 2(权重+梯度+优化器状态) + 激活值。例如一个70B参数模型用FP16训练,仅参数部分就需要70B×2字节×3≈420GB,单卡完全放不下,必须用多卡并行。

判断逻辑

  • 小模型单卡训练:容量够用的情况下,带宽更高的卡提升明显。
  • 大模型多卡训练:带宽和容量都重要,但容量瓶颈更突出——如果一张卡装不下一个Transformer层的最小切块,就必须用更复杂的并行策略,增加通信开销。
  • 混合精度与算子融合:一些框架通过算子融合减少中间激活的显存占用,但可能增加少量计算。选择GPU时,建议用实际业务配置的批次大小和精度做一次内存预算。

并行策略:数据并行、模型并行与流水线并行

单个GPU的算力和显存总有限度,当模型大到一张卡装不下,就需要多卡协作。三种基础并行策略各有适用场景。

数据并行(Data Parallelism)

最简单:每张卡拷贝一份完整的模型,处理不同的数据批次。前向和反向独立计算,最后对梯度做AllReduce同步。

  • 优点:实现简单,通信量只与模型参数量线性相关。
  • 缺点:每张卡都需要完整模型,单卡显存不够时无法使用。

模型并行(Model Parallelism)

将模型的不同层分配到不同GPU上。比如Transformer的12个Layer,前4层在卡0,中间4层在卡1,后4层在卡2。

  • 优点:突破单卡显存限制。
  • 缺点:计算有依赖——卡1必须等卡0算完才能开始,导致GPU利用率低下(称为“空闲气泡”)。

流水线并行(Pipeline Parallelism)

对模型并行做改进:把微批次(Micro-batch)切小,让不同卡同时处理不同微批次的不同层,减少空闲时间。

  • 例子:卡0处理微批次0的第1-4层时,卡1可以处理上一个微批次的第5-8层。
  • 效果:通过调整微批次数量和流水线深度,利用率能提升到80%以上。2026年的训练框架(如DeepSpeed、Megatron-LM)已经自动管理这些切分,用户只需指定并行度和方案。

更高级的组合

大模型训练通常采用多种并行混合:数据并行 + 张量并行(将矩阵乘法拆到多卡)+ 流水线并行 + 序列并行(处理长序列)。实际部署时,需要根据模型结构、GPU互联拓扑(NVLink还是PCIe)、以及机内/机间带宽反复调参。没有一套少有的的较优解。

通信与互联:NVLink、InfiniBand与集体通信

多卡训练时,通信效率往往成为瓶颈。训练GPU之间的互联技术决定了梯度同步和模型切块传输的速度。

NVLink:GPU间的高速直连

NVLink是高带宽、低延迟的GPU直连总线。2026年的第四代NVLink单片带宽可达900GB/s(双向),比PCIe 4.0 x16的32GB/s高一个数量级。通常一个节点内的8张GPU通过NVSwitch全互联,任意两卡都可以高速通信。

  • 典型场景:张量并行和流水线并行中,频繁的小消息交换(几个MB到几百MB)用NVLink效率极高。

InfiniBand:节点间的网络主干

多节点训练(几百到几千卡)需要节点间网络。InfiniBand是高性能计算领域的标准,延迟2-3微秒,带宽可达400Gbps(HDR)甚至800Gbps(NDR)。相比之下,传统以太网延迟高、丢包率大,不适合同步训练。

  • 关键点:节点间通常使用AllReduce算法(如Ring AllReduce)进行梯度聚合。网络拓扑和带宽决定了扩展效率——当节点数超过某个点后,通信开销会淹没计算时间。

选型时看什么?

  • 如果单节点内训练(8卡),NVLink的拓扑比带宽数值更重要。有的GPU只支持4个NVLink通道,有的支持6个或12个,全互联的通信模式更灵活。
  • 跨节点训练一定要确认InfiniBand的链路数。每个节点通常配1-4张HCA(主机通道适配器),带宽能否跑满取决于HCA数量和PCIe通道数。
  • 2026年新的趋势是使用NVLink共享显存池(NVLink Bridge)来虚拟化显存,进一步提升大模型的单节点容量上限。

FP8与稀疏性:2026年训练效率的新变量

FP8(8位浮点)和稀疏计算(Sparsity)是近年来训练GPU中引入的加速技术。它们不是替代方案,而是对现有混合精度训练的补充。

FP8为什么要引入?

训练大模型时,FP16/BF16的矩阵乘已经很快,但带宽和存储压力依然巨大。FP8将数据量再减半,理论上同样带宽下吞吐翻倍。

  • FP8的两种格式:E4M3(4位指数3位尾数)和E5M2(5位指数2位尾数)。前者精度高一点,后者动态范围大一点。训练中通常在参数和梯度上用E4M3,在累加时用E5M2。
  • 现状:2026年有些新GPU原生支持FP8 Tensor Core,但很多老卡需要模拟,性能提升有限。框架支持仍在完善,目前应用在LLM预训练中已有成功案例。

稀疏性:跳过不重要的计算

深度网络中的许多权重值接近0,对最终结果影响很小。稀疏计算的想法是只存储和计算非零元素。

  • 结构化稀疏:按固定模式(如2:4——每2个元素中强制有4个零)修剪权重。NVIDIA的Ampere架构开始引入2:4结构化稀疏支持,理论上可将矩阵乘吞吐翻倍。
  • 非结构化稀疏:任意位置的零,存储压缩率高但计算加速困难。

如何判断是否受益?

  • FP8适合追求极致吞吐且对精度容忍度高的场景(比如大规模预训练)。小模型或对数值精度敏感的任务(如科学计算)不建议用。
  • 稀疏性需要模型本身有可压缩性。结构化稀疏在推理侧效果更明显,训练侧修剪需要额外步骤(如训练-剪枝-微调),增加了流程复杂度。
  • 2026年业界正在探索“从头稀疏训练”(从一开始就训练稀疏结构),但这依赖于硬件和框架的深度配合。短中期内,FP8的投入产出比可能更高。

理解这些术语后,再看训练GPU的规格参数时,就能抓住核心:张量核心代数决定计算上限,显存带宽和容量决定数据搬运效率,互联能力决定多卡扩展性,而FP8和稀疏性则是锦上添花的加速选项。根据自己模型的规模、精度要求和预算,可以做出更理性的判断。

常见问题

张量核心与CUDA核心的根本区别是什么

张量核心专为矩阵乘法加速,一个周期完成4×4矩阵运算;CUDA核心做标量运算。张量核心在深度学习训练中提升速度更显著。

混合精度训练为什么需要损失缩放

FP16梯度值容易下溢为0,损失缩放将梯度乘以一个因子再累加,避免精度丢失。动态缩放自动调整因子使训练稳定。

2026年训练GPU选型该关注带宽还是容量

小模型单卡训练带宽优先;大模型多卡显存容量更关键。先用显存公式估算,再对比HBM3E带宽是否匹配计算需求。

数据并行和模型并行哪个适合大模型

数据并行实现简单但单卡显存需装下完整模型;模型并行可拆分层但存在空闲气泡。大模型常混合使用两者及流水线并行。

NVLink和InfiniBand在训练中分别负责什么

NVLink用于单节点内GPU间高速互联,适合张量并行;InfiniBand用于多节点间网络,负责梯度同步。两者协同满足扩展需求。

FP8是否已经能替代FP16用于训练

FP8在2026年部分GPU原生支持,但数值稳定性稍弱。目前多用于大模型预训练降显存和带宽,FP16/BF16仍是主力精度。

稀疏计算对训练GPU的实际加速效果如何

结构化稀疏(如2:4)理论上翻倍矩阵乘性能,但需要模型修剪和重训练。实际加速受限于稀疏度分布和框架优化,非所有场景适用。