| 题号 | 主题 | 文章 |
|——|——|——|
| 96 | TensorRT的builder和runtime工作流程?pl… | [096-TensorRT的builder和runtime工作流程.md](/ai-infra-interview-305/09-%E6%8E%A8%E7%90%86%E5%BC%95%E6%93%8E/096-TensorRT%E7%9A%84builder%E5%92%8Cruntime%E5%B7%A5%E4%BD%9C%E6%B5%81%E7%A8%8B.html) |
| 97 | TensorRT的dynamic shape优化技巧?optimi… | 097-TensorRT的dynamic-shape优化技巧.md |
| 98 | TensorRT的plugin开发中,IPluginV2Dynam… | [098-TensorRT的plugin开发中,IPluginV2DynamicExt.md](/ai-infra-interview-305/09-%E6%8E%A8%E7%90%86%E5%BC%95%E6%93%8E/098-TensorRT%E7%9A%84plugin%E5%BC%80%E5%8F%91%E4%B8%AD%EF%BC%8CIPluginV2DynamicExt.html) |
| 99 | ONNX Runtime的execution provider有哪些… | [099-ONNX-Runtime的execution-provider有哪些.md](/ai-infra-interview-305/09-%E6%8E%A8%E7%90%86%E5%BC%95%E6%93%8E/099-ONNX-Runtime%E7%9A%84execution-provider%E6%9C%89%E5%93%AA%E4%BA%9B.html) |
| 100 | torch.compile的推理优化模式?reduce-overh… | 100-torch.compile的推理优化模式.md |
| 101 | vLLM的PagedAttention核心思想?block tab… | [101-vLLM的PagedAttention核心思想.md](/ai-infra-interview-305/09-%E6%8E%A8%E7%90%86%E5%BC%95%E6%93%8E/101-vLLM%E7%9A%84PagedAttention%E6%A0%B8%E5%BF%83%E6%80%9D%E6%83%B3.html) |
| 102 | vLLM的continuous batching如何实现?和sta… | 102-vLLM的continuous-batching如何实现.md |
| 103 | vLLM的prefix caching机制?命中率如何提升? | 103-vLLM的prefix-caching机制.md |
| 104 | TensorRT-LLM的in-flight batching原理? | 104-TensorRT-LLM的in-flight-batching原理.md |
| 105 | FasterTransformer的decoder优化技术?mem… | [105-FasterTransformer的decoder优化技术.md](/ai-infra-interview-305/09-%E6%8E%A8%E7%90%86%E5%BC%95%E6%93%8E/105-FasterTransformer%E7%9A%84decoder%E4%BC%98%E5%8C%96%E6%8A%80%E6%9C%AF.html) |
| 106 | Hugging Face的text-generation-infere… | 106-Hugging-Face的text-generation-inference.md |
| 107 | llama.cpp的量化策略?Q4_0、Q5_K_M的区别? | 107-llama.cpp的量化策略.md |
| 108 | 移动端推理框架选择?MNN、TNN、Paddle Lite对… | 108-移动端推理框架选择.md |
| 109 | 推理引擎的warmup为什么重要?如何设计warmup策略? | 109-推理引擎的warmup为什么重要.md |
| 110 | 多stream推理的实现?CUDA stream的同步机制? | 110-多stream推理的实现.md |
| 111 | 推理batching的padding和packing策略?Fl… | [111-推理batching的padding和packing策略.md](/ai-infra-interview-305/09-%E6%8E%A8%E7%90%86%E5%BC%95%E6%93%8E/111-%E6%8E%A8%E7%90%86batching%E7%9A%84padding%E5%92%8Cpacking%E7%AD%96%E7%95%A5.html) |
| 112 | 如何评估推理引擎的延迟分布?P50、P90、P99的优化重点? | [112-如何评估推理引擎的延迟分布.md](/ai-infra-interview-305/09-%E6%8E%A8%E7%90%86%E5%BC%95%E6%93%8E/112-%E5%A6%82%E4%BD%95%E8%AF%84%E4%BC%B0%E6%8E%A8%E7%90%86%E5%BC%95%E6%93%8E%E7%9A%84%E5%BB%B6%E8%BF%9F%E5%88%86%E5%B8%83.html) |
| 113 | 推理服务的auto-scaling策略?基于GPU利用率还是请求队列… | [113-推理服务的auto-scaling策略.md](/ai-infra-interview-305/09-%E6%8E%A8%E7%90%86%E5%BC%95%E6%93%8E/113-%E6%8E%A8%E7%90%86%E6%9C%8D%E5%8A%A1%E7%9A%84auto-scaling%E7%AD%96%E7%95%A5.html) |
| 114 | 多模型混部的资源隔离?MPS(Multi-Process Servi… | [114-多模型混部的资源隔离.md](/ai-infra-interview-305/09-%E6%8E%A8%E7%90%86%E5%BC%95%E6%93%8E/114-%E5%A4%9A%E6%A8%A1%E5%9E%8B%E6%B7%B7%E9%83%A8%E7%9A%84%E8%B5%84%E6%BA%90%E9%9A%94%E7%A6%BB.html) |
| 115 | 推理引擎的debug`模式?如何定位精度下降问题? | 115-推理引擎的debug模式.md |