ai-infra-interview-305

第 55 题:如何排查分布式训练中的hang问题?NCCL_DEBUG=INFO的输出如何解读?

题目

如何排查分布式训练中的hang问题?NCCL_DEBUG=INFO的输出如何解读?


完整讲解

一、分布式 hang 的常见原因


二、NCCL_DEBUG=INFO 能看什么?

设置 NCCL_DEBUG=INFO(或 WARN)后,NCCL 会打印每次 collective 的参与信息、transport 选择、超时等。典型输出包括:


三、如何用这些信息排查?


四、小结


面试要点


记忆要点

  1. Hang ≈ collective 不同步或网络/进程挂;NCCL_DEBUG 看 op、transport、超时。
  2. 最后输出看谁在等;对照代码找多/少调用的 rank。
  3. TORCH_DISTRIBUTED_DEBUG=DETAIL + NCCL_DEBUG 组合定位;网络问题试 TCP-only。
返回模块 返回总览