ai-infra-interview-305

08-通信优化(第 86–95 题)

| 题号 | 主题 | 文章 | |——|——|——| | 86 | NCCL的Tree算法和Ring算法分别在什么场景下更快? | 086-NCCL的Tree算法和Ring算法分别在什么场景下更快.md | | 87 | 如何计算all-reduce的通信量?公式是什么? | 087-如何计算all-reduce的通信量.md | | 88 | NVLinkInfiniBandTCP的带宽和延迟差异? | 088-NVLink、InfiniBand、TCP的带宽和延迟差异.md | | 89 | 多机训练中的网络拓扑感知?NCCL_TOPO_FILE? | 089-多机训练中的网络拓扑感知.md | | 90 | 通信和计算重叠(overlap)的技术手段?double buffer… | [090-通信和计算重叠(overlap)的技术手段.md](/ai-infra-interview-305/08-%E9%80%9A%E4%BF%A1%E4%BC%98%E5%8C%96/090-%E9%80%9A%E4%BF%A1%E5%92%8C%E8%AE%A1%E7%AE%97%E9%87%8D%E5%8F%A0%EF%BC%88overlap%EF%BC%89%E7%9A%84%E6%8A%80%E6%9C%AF%E6%89%8B%E6%AE%B5.html) | | 91 | torch.distributedbackend选择:ncc… | 091-torch.distributed的backend选择:nccl、gloo、.md | | 92 | RDMA技术原理?RoCE v1 vs RoCE v2 vs … | [092-RDMA技术原理.md](/ai-infra-interview-305/08-%E9%80%9A%E4%BF%A1%E4%BC%98%E5%8C%96/092-RDMA%E6%8A%80%E6%9C%AF%E5%8E%9F%E7%90%86.html) | | 93 | 如何诊断网络拥塞导致的训练卡顿?iftopnicstat? | [093-如何诊断网络拥塞导致的训练卡顿.md](/ai-infra-interview-305/08-%E9%80%9A%E4%BF%A1%E4%BC%98%E5%8C%96/093-%E5%A6%82%E4%BD%95%E8%AF%8A%E6%96%AD%E7%BD%91%E7%BB%9C%E6%8B%A5%E5%A1%9E%E5%AF%BC%E8%87%B4%E7%9A%84%E8%AE%AD%E7%BB%83%E5%8D%A1%E9%A1%BF.html) | | 94 | 自定义通信算子的实现?torch.distributedredu… | 094-自定义通信算子的实现.md | | 95 | 异构网络环境下的通信优化策略? | 095-异构网络环境下的通信优化策略.md |

返回总览