ai-infra-interview-305

第 244 题:多模态推理的pipeline设计?图文、视频?

题目

多模态推理的pipeline设计?图文、视频?


完整讲解

一、多模态推理场景

多模态图文、视频、语音 等混合输入或输出;需 多模型/多阶段 协同(如 图像编码 → 文本生成视频抽帧 → 图像理解 → 文本)。Pipeline:把多步串成 有向图,每步为 一个服务或模型数据与格式 在步间传递。

二、Pipeline 设计

阶段划分:按 模态与模型 拆成 stage(如 preprocess、image_encoder、fusion、llm、postprocess)。数据流:上游输出为下游输入;格式 统一(如 tensor、JSON、base64 图);大对象(图、视频)可 传 URL 或 ID,下游再拉取,避免经网关传大 body。调度同步 串行调用各 stage,或 异步 队列 + worker;错误与重试 在 stage 边界处理。资源:不同 stage 可能 不同硬件(如 GPU 编码、CPU 后处理);扩缩容 可按 stage 独立。

三、图文、视频示例

图文图 → 图像编码器 → 向量文本 + 向量 → 多模态 LLM → 文本;可拆为 encode 服务 + LLM 服务,网关或编排层串起来。视频视频 → 抽帧 → 图像编码 → 序列时序模型或 LLM;抽帧与编码可单独服务、可批处理。统一:用 DAG 编排(如 K8s Workflow、Argo、自研)描述 pipeline;每节点为 HTTP/gRPC 服务任务

面试要点


记忆要点

  1. 多模态 = 多阶段;pipeline = 有向图、数据在 stage 间传递。
  2. 格式统一、大对象传引用;按 stage 扩缩容。
  3. DAG 编排、节点即服务。
返回模块 返回总览