第 121 题:连续特征分桶,等频 vs 等宽 vs 基于树的自适应分桶?
题目
连续特征分桶,等频 vs 等宽 vs 基于树的自适应分桶?
完整讲解
一、连续特征分桶的目的
连续特征(价格、年龄、时长等)若直接进模型,线性项只能学线性关系、且易受尺度与异常值影响。分桶将连续值映射为离散 bin,再做嵌入或 one-hot,使模型能学非线性与分段模式,且对尺度与异常值更鲁棒。
二、等频(Quantile)分桶
- 做法:按分位数划分,使每个桶内样本数大致相等。如 10 桶则取 10%, 20%, …, 90% 分位数为边界。
- 优点:各桶样本量均衡,训练稳定;对长尾分布友好,尾部不会挤在一桶。
- 缺点:边界依赖当前数据分布,分布漂移时边界需重算;相同数值间隔在不同区间可能落入不同桶数(如 [0,1] 与 [99,100] 桶宽差很多)。
三、等宽(Equal Width)分桶
- 做法:按值域均匀划分,$\Delta = (\max - \min) / K$,桶边界为 $\min + i\Delta$。
- 优点:实现简单、边界直观;对近似均匀分布友好。
- 缺点:长尾时多数样本挤在少数桶、多数桶空,训练不均衡;对异常值敏感(一个极大值拉高 max、其他桶变宽)。
四、基于树的自适应分桶
- 做法:用树模型(如 CART、GBDT)在目标变量(点击率、转化等)上对连续特征做分裂,分裂点即为桶边界。即按「对目标区分度」找切分点,而非按样本数或值域均匀。
- 优点:边界与目标强相关、信息量高;自动适应分布与非线性;可结合特征重要性做筛选。
- 缺点:依赖标签与树训练;分布或目标漂移时需重训树与边界;实现比等频/等宽复杂。
- 工程:常用 GBDT 的分裂点或单变量 CART 的分裂点;可定期用近期数据重算边界。
五、选型建议
- 无标签或快速上线:等频较稳;等宽仅当分布较均匀时用。
- 有标签、追求效果:树分裂边界通常优于等频/等宽;可与等频结合(先等频粗分再树细分,或树边界用于在线、等频用于兜底)。
面试要点
- 能说明等频(分位数)、等宽(值域均分)、树分裂(按目标找切分点)三种方式及各自优缺点。
- 能说清等频样本均衡、等宽易受长尾影响、树边界与目标相关且自适应。
- 能根据有无标签、分布与工程成本选型;能提及边界随分布漂移需更新。
记忆要点
- 等频:按分位数、样本均衡;等宽:值域均分、简单但对长尾差;树:按目标分裂、自适应、依赖标签。
- 等频稳、等宽慎用、有标签优先树边界;边界需随分布/目标更新。