知识点标签

推荐系统面试题解析

推荐系统相关面试题解析,按真实面经题目沉淀核心机制、易错点和面试官追问。

95 道题 7 个岗位 18 个公司

推荐系统相关面试题

DSIN 中特征是如何做交叉的?

DSIN 的特征交叉不是一句“把稠密特征和稀疏特征拼接后送 DNN”就能解释清楚的。它的核心是先把用户历史行为按会话切分,在会话内用自注意力抽取局部兴趣,在会话间建模兴趣演化,再用目标物品对各个会话兴趣做激活。稠密特征通常经过归一化、分桶或线性投影后与稀疏 embedding 融合,交叉既包括注意力中的目标相关交互,也包括 DNN、乘积、差分、CrossNet 等可选显式交叉。

推荐系统里除了位置偏置,还有哪些常见偏置?

推荐系统中的偏置不只来自排序位置,还来自曝光机制、用户选择、物料流行度、展示样式、来源信任、样本构造、反馈回路、时间变化、用户活跃度和反馈标注方式。面试回答要把偏置讲成数据如何被观察到、反馈如何被产生、模型如何被训练和评估的系统性问题,并进一步说明可用随机化实验、因果估计、逆倾向加权、重采样、多目标约束和更谨慎的在线评估来缓解。

推荐或检索系统里的低频过滤如何实现?

低频过滤不是简单按次数删除,而是在明确业务目标和统计口径后,对样本、特征、query、item、用户行为或候选实体中频次过低、统计不稳定、噪声占比高的部分进行降权、合并、兜底或过滤。高质量回答要覆盖目标、口径、阈值、离线与在线实现、滑动窗口、长尾保护、冷启动、指标评估和工程风险。

特征交叉和 One Epoch 现象之间有什么联系?

这道题的核心不是问“特征交叉是什么”,而是问候选人能否把一次工程观察解释成可验证的推荐系统规律。可以把 One Epoch 现象理解为:某些交叉特征在训练早期或首轮曝光中贡献了主要收益,后续继续训练的边际增益快速下降。它通常暗示交叉特征捕捉了强相关但稀疏的记忆型模式,需要用消融、频次分桶、时效性、泄漏排查和泛化验证来证明联系。

推荐系统的召回、排序和重排链路如何理解?

这道题考察候选人是否能从工程链路而不是单点模型理解推荐系统:召回负责从海量候选中高覆盖地捞出可能感兴趣的内容,排序负责用特征和模型估计用户行为价值,重排负责在最终曝光前加入多样性、新鲜度、去重、业务规则和体验约束,同时还要兼顾在线延迟、离线评估和 A/B 实验闭环。

同题还出现在 1 个公司岗位

机器学习模型训练和评估的基本流程是什么?

机器学习模型训练和评估的基本流程,本质是在业务目标约束下,把原始数据转化为可泛化模型,并通过离线验证、线上实验和持续监控判断模型是否真正有效。回答时不能只背训练步骤,还要说明数据质量、切分方式、指标选择、过拟合与数据泄漏控制,以及上线后的反馈闭环。

同题还出现在 2 个公司岗位

推荐系统中如何解决冷启动问题?

推荐系统中如何解决冷启动问题?这道腾讯牛客题的关键是围绕“推荐系统冷启动”讲清概念、机制、取舍和边界。推荐系统冷启动要先区分用户冷启动、物品冷启动和系统冷启动。用户没有行为时依赖注册画像、地理位置、设备、兴趣选择和热门兜底;物品没有交互时依赖内容特征、类目、文本/图像 embedding 和小流量探索;系统冷启动则要先靠规则、运营种子数据和快速反馈闭环建立初始样本。

高维稀疏特征为什么不适合直接用神经网络训练?

高维稀疏特征为什么不适合直接用神经网络训练?这道腾讯牛客题的关键是围绕“高维稀疏特征直接训练神经网络的风险”讲清概念、机制、取舍和边界。高维稀疏特征如果直接 one-hot 输入神经网络,会带来参数巨大、有效梯度稀疏、长尾类别训练不足、过拟合和线上存储/延迟成本。工程上通常先做 embedding、特征哈希、频次截断、交叉特征或用适合稀疏输入的线性/树模型做基线。

推荐系统中引入向量索引召回时,在线 serving 链路应该如何改造?

这道题考察的不是向量索引原理,而是把向量召回接入推荐在线 serving 后,链路、模块边界、延迟、降级、索引更新和实验评估应该怎样设计。回答要把它放在召回层讲清楚,并说明 query vector 如何生成、ANN 服务如何调用、候选如何回到后续粗排/精排。

同题还出现在 2 个公司岗位