ai-infra-interview-305

第 219 题:训练容器的镜像管理?layer cachingregistry优化?

题目

训练容器的镜像管理?layer cachingregistry优化?


完整讲解

一、镜像管理需求

训练任务需统一环境(CUDA、PyTorch、依赖);镜像 大(数十 GB)、拉取慢 会拖慢任务启动。需 layer 复用、就近拉取、版本与安全 管理。

二、Layer caching

Layer caching:镜像由 多层 组成;相同 layer 只拉一次,后续任务复用本地缓存。实现:节点本地 image cache(如 containerd 的 snapshot、Dragonfly 的 P2P 缓存);registry 返回 layer digest,节点按需拉缺失层。多节点P2P 分发(如 Dragonfly、Kraken)让节点间互拉 layer,减轻 registry 与带宽压力;首拉仍可能慢,可 预热 常用镜像到节点。

三、Registry 优化

Registry:用 Harbor 或云厂商 镜像仓库,支持 多副本、CDN、就近 region优化:训练镜像 按基础层与业务层 拆分,基础层(CUDA、PyTorch)大但复用高,业务层小且常变;这样多数任务只拉增量层安全:镜像扫描、签名与准入;避免不可信镜像进生产。

面试要点


记忆要点

  1. Layer cache = 同层复用;P2P 多节点互拉。
  2. Registry 就近、分层镜像(基础+业务)。
  3. 预热、安全扫描。
返回模块 返回总览