ai-infra-interview-305

第 229 题:训练平台的cost model?预测任务耗时和资源需求?

题目

训练平台的cost model?预测任务耗时和资源需求?


完整讲解

一、Cost model 的目的

Cost model:根据 任务配置(模型规模、batch、GPU 数、数据量等)预测「运行时长、资源占用、费用」。用于 排队预估、预算控制、资源建议(如「建议 8 卡、预计 10 小时」)、以及 调度与优先级 的辅助决策。

二、预测任务耗时与资源

耗时:可基于 历史同配置 jobwall time 做回归(如按参数量、batch、卡数建简单模型);或 profiling 得到单 step 时间,再乘以 总 step 数(由数据量、batch、epoch 推出)。资源显存 可由 profiling 或公式(按模型结构、batch、优化器状态)估算;GPU 数 由「总显存需求 / 单卡显存」或「目标吞吐与单卡吞吐」推导。数据:需 历史 job 的 config + 实际耗时/资源 做训练或拟合;新配置 可插值或用相似 job 的统计。

三、工程要点

特征:模型参数量、batch、seq_len、GPU 类型与数量、数据量、是否混合精度等。更新:随新 job 完成 持续更新 统计或模型;不确定性 可给出区间(如 P50/P90 耗时)。与 调度器 结合:预估时长用于 backfill预留;与 计费 结合做预算告警。

面试要点


记忆要点

  1. Cost model = 预测耗时/资源/费用。
  2. 耗时:历史或 profiling×step;资源:显存、GPU 数。
  3. 特征+更新;与调度、计费联动。
返回模块 返回总览