| 题号 | 主题 | 文章 |
|——|——|——|
| 86 | NCCL的Tree算法和Ring算法分别在什么场景下更快? | 086-NCCL的Tree算法和Ring算法分别在什么场景下更快.md |
| 87 | 如何计算all-reduce的通信量?公式是什么? | 087-如何计算all-reduce的通信量.md |
| 88 | NVLink、InfiniBand、TCP的带宽和延迟差异? | 088-NVLink、InfiniBand、TCP的带宽和延迟差异.md |
| 89 | 多机训练中的网络拓扑感知?NCCL_TOPO_FILE? | 089-多机训练中的网络拓扑感知.md |
| 90 | 通信和计算重叠(overlap)的技术手段?double buffer… | [090-通信和计算重叠(overlap)的技术手段.md](/ai-infra-interview-305/08-%E9%80%9A%E4%BF%A1%E4%BC%98%E5%8C%96/090-%E9%80%9A%E4%BF%A1%E5%92%8C%E8%AE%A1%E7%AE%97%E9%87%8D%E5%8F%A0%EF%BC%88overlap%EF%BC%89%E7%9A%84%E6%8A%80%E6%9C%AF%E6%89%8B%E6%AE%B5.html) |
| 91 | torch.distributed的backend选择:ncc… | 091-torch.distributed的backend选择:nccl、gloo、.md |
| 92 | RDMA技术原理?RoCE v1 vs RoCE v2 vs … | [092-RDMA技术原理.md](/ai-infra-interview-305/08-%E9%80%9A%E4%BF%A1%E4%BC%98%E5%8C%96/092-RDMA%E6%8A%80%E6%9C%AF%E5%8E%9F%E7%90%86.html) |
| 93 | 如何诊断网络拥塞导致的训练卡顿?iftop、nicstat? | [093-如何诊断网络拥塞导致的训练卡顿.md](/ai-infra-interview-305/08-%E9%80%9A%E4%BF%A1%E4%BC%98%E5%8C%96/093-%E5%A6%82%E4%BD%95%E8%AF%8A%E6%96%AD%E7%BD%91%E7%BB%9C%E6%8B%A5%E5%A1%9E%E5%AF%BC%E8%87%B4%E7%9A%84%E8%AE%AD%E7%BB%83%E5%8D%A1%E9%A1%BF.html) |
| 94 | 自定义通信算子的实现?torch.distributed的redu… | 094-自定义通信算子的实现.md |
| 95 | 异构网络环境下的通信优化策略? | 095-异构网络环境下的通信优化策略.md |