ai-infra-interview-305

第 20 题:TF Serving的batching策略如何配置?遇到过哪些坑?

题目

TF Serving的batching策略如何配置?遇到过哪些坑?


完整讲解

一、TF Serving 的 batching 在做什么?

请求到达后不是「一个请求立刻推理一次」,而是先入队,由 Batch Scheduler 按策略攒成一批再一起送进模型,从而提高 GPU 利用率、降低单请求平均延迟(在吞吐优先时)。策略包括:多久等一批(batch timeout)、最多多少个(max batch size)、以及可选的优先级等。


二、如何配置?


三、常见坑


四、建议


面试要点


记忆要点

  1. 参数:max_batch_size、batch_timeout、max_enqueued_batches;模型需支持 batch 输入。
  2. 坑:大 timeout → 高尾延迟;小 → 批小利用率低;OOM、shape/padding、队列满。
  3. 按显存与延迟压测定参;监控队列与 batch 分布。
返回模块 返回总览