ai-infra-interview-305

第 121 题:FP8量化的硬件支持?H100Transformer Engine

题目

FP8量化的硬件支持?H100Transformer Engine


完整讲解

一、FP8 与硬件支持

FP8(8-bit 浮点)在保持一定动态范围与精度的同时,比 FP16 省一半显存与带宽,适合大模型训练与推理。硬件支持:NVIDIA Hopper(H100)及后续架构在 Tensor Core 中原生支持 FP8(E4M3、E5M2 等格式),可做 FP8 矩阵乘与累加,无需软件模拟,吞吐高、能效好;Ampere 及更早 GPU 无原生 FP8,需用 FP16 或 INT8 替代。

二、H100 Transformer Engine

Transformer Engine(TE) 是 NVIDIA 在 H100 上提供的库与内核,针对 Transformer 的线性、LayerNorm、注意力等提供 FP8 训练与推理支持。核心思路:在部分线性层用 FP8 计算(权重与激活用 FP8),用缩放因子与可选的反量化在关键位置与 FP16 衔接,在保证收敛的前提下显著提升吞吐、降低显存。TE 与 PyTorch/JAX 集成,用户通过换层或配置即可启用 FP8,无需手写 kernel。

三、工程要点

启用 TE 需 H100(或支持 FP8 的卡)、对应 CUDA/cuDNN;训练时通常与混合精度(FP16 master 权重 + FP8 计算)配合。推理也可用 FP8 降低带宽与计算量。面试可强调:FP8 硬件加速是 Hopper 的重要卖点,TE 是落地的软件栈。


面试要点


记忆要点

  1. FP8 硬件 = Hopper(H100)Tensor Core 原生;更早架构无。
  2. Transformer Engine = H100 上 FP8 Transformer 库,线性/注意力等 FP8 + 缩放与混合精度。
  3. 用途:训练与推理省带宽与算力;需对应 GPU 与 CUDA 栈。
返回模块 返回总览