ai-infra-interview-305

第 107 题:llama.cpp的量化策略?Q4_0Q5_K_M的区别?

题目

llama.cpp的量化策略?Q4_0Q5_K_M的区别?


完整讲解

一、llama.cpp 的量化体系

llama.cpp 支持多种 权重量化 格式,用于在 CPU/低显存 GPU 上跑大模型。命名规则通常为 **Q<位数>_<子类型>**:位数表示权重的 bit 数,子类型表示分组、对称/非对称、scale 等。

二、Q4_0 与 Q5_K_M 等

三、选择建议


面试要点


记忆要点

  1. Q4_0 = 4bit 简单快;Q5_K_M = 5bit 中等精度与速度。
  2. 数字大 = 更准更重;K/S/M/L 为细档位。
  3. 省显存用 Q4 系;平衡用 Q5_K_M。
返回模块 返回总览