ai-infra-interview-305

第 155 题:多模态大模型的训练基础设施挑战?图文数据的加载?

题目

多模态大模型的训练基础设施挑战?图文数据的加载?


完整讲解

一、多模态训练的基础设施挑战

数据异构:图像、视频、文本、音频等格式与大小差异大,存储、索引与采样策略需统一抽象。加载与解码:图像/视频解码耗 CPU、耗内存,高分辨率时更明显;需与 GPU 计算流水线重叠、避免成为瓶颈。对齐与打包:图文对、视频-文本等需按 pair 或 sequence 打包,tokenization 与 padding 策略复杂(如图像 patch、变长序列)。规模:数据量常更大、单样本更大,对 IO 带宽、缓存与 sharding 要求高。

二、图文数据加载要点

存储:常用对象存储 + 索引(JSON/Parquet 等)存 path 与 caption;或 WebDataset 式 tar 内嵌图像与文本。解码:图像用 PIL/decord 等多进程解码,或预解码成 tensor 存 tfrecord/WebDataset 减少训练时 CPU;视频按帧或 clip 采样、控制分辨率与帧数。Batch:同 batch 内图像尺寸不一需 padding 或 resize,或按 bucket 分组;文本侧 tokenize 后与图像 tensor 一起组成 batch,注意 max_len 与 padding。流水线:多 worker、预取、可选 DALI 等 GPU 解码,与 backbone 计算重叠。

三、与单模态的差异

多模态需统一 dataloader 返回 (image, text, …);存储与 metadata 设计要支持多类型与过滤;解码与打包逻辑更重,常单独模块化;监控上区分图像/视频/文本的 IO 与解码耗时。


面试要点


记忆要点

  1. 多模态 = 异构数据 + 重解码 + 对齐打包 + 大规模 IO。
  2. 图文 = 存储+索引、多进程/预解码、padding/bucket、多 worker 预取。
  3. 统一 dataloader、metadata、解码模块化;监控分类型。
返回模块 返回总览