sgr-interview-300

第 122 题:交叉特征的自动发现,GBDT特征重要性的阈值选择?

题目

交叉特征的自动发现,GBDT特征重要性的阈值选择?


完整讲解

一、交叉特征的自动发现

交叉特征(如 user_age × item_category)能刻画组合模式,但人工枚举成本高、易遗漏。自动发现即用数据与模型自动筛选「哪些单特征或组合对目标有用」,常用 GBDT:树每层分裂即一次特征(或阈值)选择,分裂带来的增益可视为该特征/该点的贡献,汇总为特征重要性(如 gain、split count、cover)。重要性高的特征可视为「自动发现」的强特征,进一步可构造交叉:取重要性 Top 的特征两两或高阶组合作为新特征,或直接用 GBDT 的叶子索引/路径作为交叉表示。

二、GBDT 特征重要性的计算

重要性可用于排序特征、做自动筛选:只保留重要性高于某阈值的特征或交叉项,或按重要性加权输入下游 DNN。

三、阈值选择

四、工程要点


面试要点


记忆要点

返回模块 返回总览