FP8量化的硬件支持?H100的Transformer Engine?FP8量化的硬件支持?H100的Transformer Engine?
FP8(8-bit 浮点)在保持一定动态范围与精度的同时,比 FP16 省一半显存与带宽,适合大模型训练与推理。硬件支持:NVIDIA Hopper(H100)及后续架构在 Tensor Core 中原生支持 FP8(E4M3、E5M2 等格式),可做 FP8 矩阵乘与累加,无需软件模拟,吞吐高、能效好;Ampere 及更早 GPU 无原生 FP8,需用 FP16 或 INT8 替代。
Transformer Engine(TE) 是 NVIDIA 在 H100 上提供的库与内核,针对 Transformer 的线性、LayerNorm、注意力等提供 FP8 训练与推理支持。核心思路:在部分线性层用 FP8 计算(权重与激活用 FP8),用缩放因子与可选的反量化在关键位置与 FP16 衔接,在保证收敛的前提下显著提升吞吐、降低显存。TE 与 PyTorch/JAX 集成,用户通过换层或配置即可启用 FP8,无需手写 kernel。
启用 TE 需 H100(或支持 FP8 的卡)、对应 CUDA/cuDNN;训练时通常与混合精度(FP16 master 权重 + FP8 计算)配合。推理也可用 FP8 降低带宽与计算量。面试可强调:FP8 硬件加速是 Hopper 的重要卖点,TE 是落地的软件栈。
| 返回模块 | 返回总览 |