ai-infra-interview-305

第 240 题:边缘推理的model caching策略?CDN for models?

题目

边缘推理的model caching策略?CDN for models?


完整讲解

一、边缘推理的特点

边缘:在 靠近数据源或用户 的节点(机房、基站、设备侧)部署推理,低延迟、省带宽、隐私;但 资源有限模型需适配(小模型、量化、剪枝)。Model caching:模型 从中心下发到边缘本地缓存,避免每次请求都回源;版本更新 时再拉新模型或增量。

二、Model caching 策略

拉取按需(首次请求某模型时拉取)、预拉(部署时或定时从中心拉)、推送(中心按策略推送到边缘)。存储:边缘节点 本地盘或内存 存模型文件;容量有限 时需 淘汰(LRU、按版本、按热度)。一致性版本号或 digest 校验;更新时 原子替换蓝绿,避免推理用旧版。多边缘CDN 思路— 中心为源、边缘为缓存;P2P 边缘间互拉减少回源。

三、CDN for models

CDN for models:把 模型文件 当静态资源,通过 CDN 分发到边缘节点;就近 拉取、减轻中心带宽加速冷启动。与 对象存储 + 边缘节点缓存 类似;CDN 提供 全球分布、缓存策略、失效 等。注意:模型大、更新频率低,CDN 缓存命中高;权限与加密 需与 CDN 能力结合(如 signed URL、私有 bucket)。

面试要点


记忆要点

  1. 边缘 = 就近;caching = 本地存模型、减少回源。
  2. 按需/预拉/推送;淘汰与版本一致。
  3. CDN 分发模型;权限与加密。
返回模块 返回总览