ai-infra-interview-305

03-自定义算子开发(第 21–30 题)

题号 主题 文章
21 用CUDA写一个简单的vector add,如何绑定到Python? 021-用CUDA写一个简单的vector-add,如何绑定到Python.md
22 Triton和CUDA的区别?什么时候用Triton更合适? 022-Triton和CUDA的区别.md
23 如何编写一个融合算子(fused op)?以`layernorm + r… 023-如何编写一个融合算子(fused-op).md
24 CUTLASS是什么?什么时候需要用它而不是手写CUDA? 024-CUTLASS是什么.md
25 算子优化中的memory coalescing、bank conflic… 025-算子优化中的memory-coalescing、bank-conflict、.md
26 如何用Nsight Compute分析kernel性能?关注哪些metr… 026-如何用Nsight-Compute分析kernel性能.md
27 编写CUDA时如何平衡register使用和occupancy? 027-编写CUDA时如何平衡register使用和occupancy.md
28 什么是warp divergence?如何检测和避免? 028-什么是warp-divergence.md
29 动态shape的算子如何优化?vllm中的`PagedAttenti… 029-动态shape的算子如何优化.md
30 算子融合的收益如何评估?什么时候融合反而变慢? 030-算子融合的收益如何评估.md

返回总览