ai-infra-interview-305

第 101 题:vLLM的PagedAttention核心思想?block table的数据结构?

题目

vLLM的PagedAttention核心思想?block table的数据结构?


完整讲解

一、PagedAttention 核心思想

PagedAttention 借鉴 OS 的分页内存:把 KV cache 按「块」(block)管理,每块固定大小(如 16/64 token 的 KV),物理上不连续;逻辑上每个序列的 KV 用 block 指针列表 串联。这样可 按需分配/回收块、减少外部碎片、便于不同序列共享前缀块(prefix caching)。

二、Block 与 Block Table

三、收益


面试要点


记忆要点

  1. KV 分块存储;每序列 block table 记录 block 列表。
  2. 块可复用、可共享(前缀);减少碎片。
  3. 与 continuous batching 配合,按需分配/回收 block。
返回模块 返回总览