第 149 题:会话上下文的短周期,Session边界检测算法?
题目
会话上下文的短周期,Session边界检测算法?
完整讲解
一、会话与短周期上下文
会话(Session) 通常指用户在一段连续、有意图的浏览/操作,会话内行为相关性强、会话间可能意图切换。短周期强调会话时间较短(几分钟到几十分钟),与「长期兴趣」区分。Session 边界检测即从连续行为流中切分出「哪里是会话开始/结束」,便于做会话内序列建模、会话级统计与上下文特征。
二、Session 边界检测算法
- 时间阈值:相邻两次行为间隔超过 $\Delta t$(如 30 分钟)则视为新会话开始。优点:简单、可解释;缺点:固定阈值不适应所有场景(有的用户间隔长但仍同一意图)。
- 混合规则:时间间隔 + 页面/场景(如从首页跳到搜索算新会话)+ referrer(从外链进入算新会话)。多条件组合,任一满足则切分。
- 模型:用二分类模型预测「当前行为是否为新会话开始」:特征为间隔、行为类型、页面、时间等,标签为人工或启发式规则标注的边界。训练后对线上流式行为做边界预测。
- 无监督:用行为序列的嵌入或表示做聚类或变点检测(change point),表示突变处视为边界;或用隐马尔可夫模型(状态=会话阶段)推断边界。
三、实现要点
- 流式:在线检测时每来一条行为,用当前间隔、上一行为类型等判断是否为新会话;若为新会话则重置会话内状态(如清空会话序列、重置会话级计数)。
- 一致性:训练(离线构造会话)与推理(在线边界)的规则或模型需一致,否则会话特征分布会 skew。
- 超参:时间阈值 $\Delta t$ 常用 30min~2h,按业务与 A/B 调;模型法可输出概率,按阈值或 top-1 决策。
四、用途
- 会话内序列做 next-item、会话内 CTR;会话级统计(会话长度、会话内类目分布)作为特征;会话边界也用于「会话上下文」的起止定义。
面试要点
- 能说明会话与短周期上下文的含义,以及边界检测对序列建模与特征的作用。
- 能列举检测方法:时间阈值、混合规则、二分类模型、无监督变点/聚类,及各自优缺点。
- 能说清流式实现、训练与推理一致、阈值与超参。
记忆要点
- Session=连续有意图的短周期行为;边界检测=切分会话起止。
- 方法:时间阈值、时间+页面/referrer、二分类模型、无监督变点/聚类。
- 流式判断、训练与推理一致;$\Delta t$ 常用 30min~2h。