第 245 题:推理服务的safety guardrails?内容过滤、速率限制?
题目
推理服务的safety guardrails?内容过滤、速率限制?
完整讲解
一、Safety guardrails 的含义
安全护栏:在推理 输入与输出 上做 内容过滤、滥用检测、速率限制,保证 合规、防滥用、可控风险。例如:禁止违法/违规内容、限速防刷、敏感信息脱敏。
二、内容过滤
输入:Prompt 过滤— 检测并拒绝 越狱、恶意指令、敏感词;可用 规则 + 分类模型(如敏感词表、小模型分类)。输出:Response 过滤— 对生成结果做 敏感内容、PII、违规 检测;截断或替换 后再返回,或 拒绝生成 并返回安全提示。多模态:图/视频输入也需 内容审核(暴恐、违规图);可调用 审核 API 或模型 做前置或后置。
三、速率限制
限速:按 user_id、API key、IP 等维度限制 QPS 或并发,防止 单用户占满 或 恶意刷量。实现:网关层 或 推理网关 用 令牌桶/漏桶 或 滑动窗口 计数;超限返回 429 或排队。分级:不同用户/套餐 不同限速;与 计费与 quota 一致。Guardrails 与 业务策略 结合:过滤规则可配置、可 A/B;限速与套餐与成本挂钩。
面试要点
- Safety guardrails:内容过滤(输入/输出)、速率限制;合规、防滥用。
- 内容过滤:prompt 与 response 的敏感/违规检测;规则+模型;多模态需审核。
- 速率限制:按 user/key/IP 限 QPS 或并发;令牌桶等;超限 429;与套餐一致。
记忆要点
- Guardrails = 内容过滤 + 限速。
- 输入/输出过滤;多模态审核。
- 限速按维度;429;可配置、与套餐一致。