sgr-interview-300

第 172 题:上下文老虎机(LinUCB),特征维度的探索效率?

题目

上下文老虎机(LinUCB),特征维度的探索效率?


完整讲解

一、上下文 Bandit 与 LinUCB

上下文 Bandit:每轮有一个上下文向量(用户/物品特征)$\boldsymbol{x}$,奖励与 $\boldsymbol{x}$ 和所选臂相关。LinUCB:假设奖励关于上下文线性,即 $r_a \approx \boldsymbol{x}^\top \boldsymbol{\theta}a + \epsilon$,用岭回归估计 $\boldsymbol{\theta}_a$ 并构造置信上界,选 $a^* = \arg\max_a \boldsymbol{x}^\top \hat{\boldsymbol{\theta}}_a + \alpha |\boldsymbol{x}|{A_a^{-1}}$($A_a$ 为设计矩阵),$\alpha$ 控制探索强度。

二、特征维度的探索效率

三、与 Thompson Sampling 对比


面试要点


记忆要点

返回模块 返回总览