| 21 |
用CUDA写一个简单的vector add,如何绑定到Python? |
021-用CUDA写一个简单的vector-add,如何绑定到Python.md |
| 22 |
Triton和CUDA的区别?什么时候用Triton更合适? |
022-Triton和CUDA的区别.md |
| 23 |
如何编写一个融合算子(fused op)?以`layernorm + r… |
023-如何编写一个融合算子(fused-op).md |
| 24 |
CUTLASS是什么?什么时候需要用它而不是手写CUDA? |
024-CUTLASS是什么.md |
| 25 |
算子优化中的memory coalescing、bank conflic… |
025-算子优化中的memory-coalescing、bank-conflict、.md |
| 26 |
如何用Nsight Compute分析kernel性能?关注哪些metr… |
026-如何用Nsight-Compute分析kernel性能.md |
| 27 |
编写CUDA时如何平衡register使用和occupancy? |
027-编写CUDA时如何平衡register使用和occupancy.md |
| 28 |
什么是warp divergence?如何检测和避免? |
028-什么是warp-divergence.md |
| 29 |
动态shape的算子如何优化?vllm中的`PagedAttenti… |
029-动态shape的算子如何优化.md |
| 30 |
算子融合的收益如何评估?什么时候融合反而变慢? |
030-算子融合的收益如何评估.md |