ai-infra-interview-305

第 103 题:vLLM的prefix caching机制?命中率如何提升?

题目

vLLM的prefix caching机制?命中率如何提升?


完整讲解

一、Prefix Caching 机制

Prefix caching:多个请求若共享相同前缀(如 system prompt、长 context),则只算一次该前缀的 KV,并缓存起来;后续请求直接复用这些 KV block,只算「前缀之后」的 decode。与 PagedAttention 的 block 结合:共享前缀对应同一组 block,多请求引用同一 block 表前缀部分,省显存与算力。

二、命中率提升

三、与 PagedAttention 的关系

PagedAttention 的 block 表天然支持「多序列指向同一 block」;prefix caching 就是在逻辑上识别「相同前缀」并复用这些 block,实现上即多序列的 block table 前缀段指向同一组物理 block。


面试要点


记忆要点

  1. 共享前缀 = 共享 KV block;只算一次前缀,后续复用。
  2. 命中率 = 路由 + 规范化 + 缓存策略 + 业务复用。
  3. Block 表前缀段指向同一物理 block 即实现 prefix cache。
返回模块 返回总览