第 77 题:模型切片(Model Slicing),不同设备算力的自适应子网络选择?
题目
模型切片(Model Slicing),不同设备算力的自适应子网络选择?
完整讲解
一、模型切片(Model Slicing)的含义
模型切片指将一个大模型拆成多个子网络或不同规模的副本,在推理时根据设备算力、延迟要求或请求类型选择其中一个子网络执行,从而在弱设备上跑小模型、在强设备上跑大模型,实现「一份训练、多档部署」。
二、不同设备算力的自适应子网络选择
- 按设备选子网:例如同一推荐模型训练时包含「小塔」「中塔」「大塔」(不同层数/宽度),或通过剪枝/蒸馏得到小中大三个版本;边缘/手机请求走小塔,云端走大塔。路由可由接入层根据设备 ID、能力标签或延迟预算决定。
- 自适应选择:也可根据请求内容动态选:简单 query 或低价值请求走小模型,复杂 query 或高价值请求走大模型,在保证整体效果的前提下降低平均算力与成本。
- 训练方式:可先训大模型再蒸馏/剪枝得到小模型;或训练时就用多出口/多子网(如 slimmable network),共享大部分参数,仅部分层宽度不同,一次训练得到多档。
三、与早退、动态网络的关系
- 早退:同一条计算路径,按置信度提前停。
- 模型切片:多条不同规模的路径,按设备或请求选一条完整执行。
- 可结合:先按设备选切片,再在该切片内做早退,进一步细粒度控延迟。
面试要点
- 能解释模型切片:大模型拆成多档子网络,推理时按设备算力或请求选一档执行,一份训练多档部署。
- 能说明自适应选择:按设备 ID/能力或按请求难度选小/中/大塔;训练可多档联合训或大模型蒸馏/剪枝得小模型。
- 能区分早退(同路径提前停)与切片(多路径选一档)。
记忆要点
- 模型切片:多档子网络,按设备/请求选一档;弱设备小塔、强设备大塔。
- 自适应:按设备或请求难度选子网;多档可联合训或蒸馏/剪枝得到。
- 与早退:切片选路径,早退在同路径上提前停;可叠加使用。