第 240 题:边缘推理的model caching策略?CDN for models?
题目
边缘推理的model caching策略?CDN for models?
完整讲解
一、边缘推理的特点
边缘:在 靠近数据源或用户 的节点(机房、基站、设备侧)部署推理,低延迟、省带宽、隐私;但 资源有限、模型需适配(小模型、量化、剪枝)。Model caching:模型 从中心下发到边缘 并 本地缓存,避免每次请求都回源;版本更新 时再拉新模型或增量。
二、Model caching 策略
拉取:按需(首次请求某模型时拉取)、预拉(部署时或定时从中心拉)、推送(中心按策略推送到边缘)。存储:边缘节点 本地盘或内存 存模型文件;容量有限 时需 淘汰(LRU、按版本、按热度)。一致性:版本号或 digest 校验;更新时 原子替换 或 蓝绿,避免推理用旧版。多边缘:CDN 思路— 中心为源、边缘为缓存;P2P 边缘间互拉减少回源。
三、CDN for models
CDN for models:把 模型文件 当静态资源,通过 CDN 分发到边缘节点;就近 拉取、减轻中心带宽、加速冷启动。与 对象存储 + 边缘节点缓存 类似;CDN 提供 全球分布、缓存策略、失效 等。注意:模型大、更新频率低,CDN 缓存命中高;权限与加密 需与 CDN 能力结合(如 signed URL、私有 bucket)。
面试要点
- 边缘推理:就近、低延迟;model caching 使模型本地可用、减少回源。
- 策略:按需/预拉/推送;本地存储与淘汰(LRU、版本);版本一致与原子更新。
- CDN for models:模型当静态资源、CDN 分发;就近、减中心带宽;注意权限与加密。
记忆要点
- 边缘 = 就近;caching = 本地存模型、减少回源。
- 按需/预拉/推送;淘汰与版本一致。
- CDN 分发模型;权限与加密。