标签题目
模型训练相关面试题第 2 页
文本分类有哪些模型?
文本分类有哪些模型?这道腾讯牛客题的关键是围绕“文本分类模型选择”讲清概念、机制、取舍和边界。文本分类可以从传统机器学习到深度模型分层回答:朴素贝叶斯、LR/SVM 配 TF-IDF 适合轻量基线;TextCNN 捕捉局部 n-gram;RNN/LSTM 建模序列;Transformer/BERT 通过上下文表示处理语义和长距离依赖。
如果文本按词粒度处理可不可以用BN?
如果文本按词粒度处理可不可以用BN?这道腾讯牛客题的关键是围绕“NLP 场景中的 BatchNorm 与 LayerNorm”讲清概念、机制、取舍和边界。文本按词粒度处理时不是绝对不能用 BN,而是 BN 的统计维度和序列数据特性经常不匹配。BN 依赖 batch 维度统计均值方差,NLP 中 batch 大小、序列长度、padding mask 和 token 分布变化会让统计不稳定,因此 Transformer 更常用 LayerNorm。
MHA 中的 Dropout 和 MLP 中的 Dropout 有什么区别?
MHA 中的 Dropout 和 MLP 中的 Dropout 有什么区别?这道腾讯牛客题的关键是围绕“Transformer 中不同位置的 Dropout”讲清概念、机制、取舍和边界。MHA 中的 Dropout 和 MLP 中的 Dropout 目标都是正则化,但作用位置不同。MHA 里常见 Dropout 作用在 attention probabilities 或 attention output 上,影响 token 之间信息汇聚;MLP/FFN 中 Dropout 作用在隐藏层激活或输出上,影响逐 token 的非线性特征变换。
Transformer 中 Q、K、V 是如何得到的,注意力公式如何理解?
Transformer 中 Q、K、V 是如何得到的,注意力公式如何理解?这道腾讯牛客题的关键是围绕“Transformer Q/K/V 与注意力公式”讲清概念、机制、取舍和边界。Q、K、V 是同一输入表示经过三组可学习线性投影得到的查询、键和值。Q 用来发起查询,K 用来被匹配,V 是最终被加权汇聚的信息。
Adam 优化器的基本原理是什么?
Adam 优化器的基本原理是什么?这道腾讯牛客题的关键是围绕“Adam 优化器原理”讲清概念、机制、取舍和边界。Adam 是把 Momentum 和 RMSProp 思路结合起来的自适应优化器。它维护梯度一阶矩 m 和二阶矩 v 的指数滑动平均,经过偏差修正后按参数维度自适应调整更新步长。
DBNet 和 CTC 分别解决 OCR 中的什么问题,核心原理是什么?
这题考 OCR 检测和识别两段核心链路:DBNet 负责把文字区域找出来,CTC 负责在无字符级对齐标注时训练序列识别。
KG embedding 如何支持 mini-batch 训练,图谱属性缺失怎么处理?
这题考知识图谱表示学习的工程训练能力:mini-batch 训练要处理三元组采样、负采样和邻域依赖,属性缺失要区分未知、不可用和真实为空。
InfoNCE 的温度系数有什么作用?
温度系数控制 InfoNCE 对相似度差异的敏感程度,本质是在调 softmax 分布的尖锐度、梯度强度和难负样本权重。
YOLOv3 的结构、多尺度预测和损失函数是什么,YOLOv4 相比 YOLOv3 有哪些改进?
这题考 YOLO 系列检测器的完整理解:YOLOv3 的 backbone、neck、head、多尺度 anchor 预测、损失组成,以及 YOLOv4 的训练和结构增强。
XGBoost 如何处理缺失值,为什么目标函数要二阶展开?
这题聚焦 XGBoost 两个核心机制:缺失值通过学习默认分裂方向处理,二阶展开用梯度和 Hessian 近似目标函数以高效评估分裂收益。
MTCNN 的模型结构和训练过程是怎样的?
MTCNN 是级联式人脸检测和关键点定位框架,核心是 P-Net、R-Net、O-Net 逐级候选、筛选、精修,并用多任务损失联合训练。
个激光雷达的车如何设计点云分割算法?
这题考多激光雷达点云感知方案,重点是标定同步、多雷达融合、点云表示、分割网络、时序和实时性。
Wide&Deep 的原理是什么,为什么适合推荐系统?
Wide&Deep 将线性 wide 部分和深度 deep 部分联合训练。wide 侧擅长记住高频、明确的交叉规则,deep 侧通过 embedding 和多层网络学习稀疏特征的泛化表示,因此适合同时需要记忆历史共现和泛化到新组合的推荐系统。
膨胀卷积和模型压缩分别解决什么问题?
膨胀卷积主要在不增加太多参数和不降低特征图分辨率的情况下扩大感受野,常用于分割、检测等需要上下文的视觉任务。模型压缩主要解决模型体积、推理延迟、显存和功耗问题,常见方法包括剪枝、量化、蒸馏、低秩分解和轻量化结构设计。
XGBoost 是决策树还是回归树,训练过程怎样?
XGBoost 是梯度提升树框架,基学习器通常是 CART 回归树。即使用于分类任务,每棵树的叶子输出也是连续分数,用来拟合当前目标函数的一阶、二阶梯度残差方向。训练过程是逐轮加树,每轮基于当前预测计算梯度统计,枚举分裂点最大化增益,确定树结构和叶子权重,再更新整体预测。
万用户数据中有 5% 标签错误,如何用算法找出错误样本并赋予正确类别?
这道题考察 label noise 场景下的数据质量诊断和训练闭环。回答时要先区分“找出疑似错标样本”和“给出可信新标签”两个目标,再用交叉验证预测、模型分歧、邻域一致性和人工或高置信规则校验构建可控流程。
LDA 是什么,Dirichlet 分布和共轭分布在主题模型中有什么作用?
LDA 是 Latent Dirichlet Allocation,用文档-主题分布和主题-词分布解释文本集合。Dirichlet 分布为多项分布参数提供先验,控制主题和词分布的稀疏程度;共轭性质让后验更新和 Gibbs 采样、变分推断更容易处理。
VAE 中的 V 表示什么,KL 散度在 VAE 里起什么作用?
VAE 的 V 是 Variational,表示用可学习的近似后验 q(z|x) 去逼近真实后验 p(z|x)。KL 散度是 ELBO 中的正则项,约束编码得到的潜变量分布接近先验,保证隐空间连续、可采样,同时与重构项形成清晰的生成质量和分布规整取舍。
意图识别使用 LR、命名实体识别使用 HMM 时,实体如何提取,模型如何训练?
这道题考察经典 NLP 任务拆分:LR 适合把句子级特征映射到意图类别,HMM 适合把 token 序列映射到 BIO 实体标签序列。回答要讲清文本预处理、特征构造、HMM 初始/转移/发射概率训练、Viterbi 解码和实体字段回收。
决策树的分裂准则有哪些?最大信息增益和最大信息增益比有什么不同,为什么最大信息增益有缺陷?
决策树分裂准则用于选择让子节点更纯的特征和切分点。信息增益看熵下降,容易偏向取值多的特征;信息增益比用特征自身的分裂信息做归一化,缓解多值特征偏置,但也可能偏向分裂信息过小的特征,需要结合阈值和验证效果判断。
DQN 有哪些常见优化版本,DDQN、Dueling DQN、PER 与 PPO 在调参和训练速度上有什么差异?
DQN 是基于值函数的 off-policy 强化学习方法,DDQN、Dueling DQN 和 PER 分别缓解 Q 值过估计、状态价值与动作优势混合、经验采样效率低等问题。PPO 是 on-policy 策略优化方法,调参重点、样本复用和训练速度与 DQN 系列明显不同。
为什么 XGB+LR 可以提高模型效果,XGB 在其中充当什么角色?
XGB+LR 中 XGB 通常充当自动特征组合和非线性分桶器,把样本映射到各棵树的叶子节点,再将叶子索引 one-hot 后交给 LR 学线性权重。它能把原始特征空间中的非线性关系转成稀疏组合特征,同时保留 LR 训练快、可校准、部署简单的优点。
广告排序中 eCPM 如何融合 pCTR、pCVR 和出价,ESMM/MMoE 如何支撑多目标预估?
这道题考察广告排序目标和多目标预估的连接。回答时要先讲清 eCPM 是期望收益排序信号,再说明 pCTR、pCVR、出价分别来自不同任务,ESMM 解决点击后转化的样本选择偏差,MMoE 用共享专家和任务门控支撑多目标学习。
同公司岗位有 2 条面经记录
CVR 建模遇到转化回传延时高时怎么处理,CTR/CVR 的特征和模型结构有什么不同?
这道题考察广告 CVR 的延迟反馈和任务差异。回答要先说明 CVR 标签更稀疏、更延迟、更受点击选择偏差影响,再给出标签窗口、样本成熟、延迟建模、回填训练和离线评估的完整处理方式。
推荐系统中特征生产、样本快照和线上实时特征如何保持一致?
这道题考察推荐系统特征工程化能力。回答要围绕同一套特征定义、同一时间点语义、同一版本治理和同一监控闭环展开,核心是防止训练样本看到线上拿不到的未来信息,或线上实时特征和离线训练特征口径不一致。
粗排打分样本空间与精排样本空间不一致时,推荐模型如何训练和校正?
这道题考察多阶段推荐的分布偏移。粗排要面对召回池,精排只看到粗排之后的候选;如果用精排曝光样本直接训练粗排,模型会学到被上游筛选后的分布,导致召回池打分不准,需要从样本构造、校正、蒸馏和评估上处理。
教育自动批改纠错任务如何设计 seq2seq 方案,并在最少人力下构造正负样本?
这道题考察教育批改纠错任务如何从“文本生成”落到可训练、可评估的纠错系统。回答要把 seq2seq 的输入输出、正负样本来源、低人力标注策略、过度纠错控制和机器翻译差异讲成一个闭环。
Thompson Sampling 和 UCB 在推荐探索中分别适用什么场景,CTR 预估模型如何配合?
这道题考察推荐场景里的探索利用权衡。回答要以 Thompson Sampling 和 UCB 的选择为主轴,把 CTR 预估模型放在奖励估计、特征表征和不确定性建模的位置,而不是展开成 CTR 模型百科。
LLM 微调项目里新数据加入后离线评估掉点,应该如何排查数据、训练和评估口径?
这道题考察 LLM 微调项目的掉点诊断能力。回答重点不是背 SFT 或 LoRA 方法名,而是把新数据引入后的数据 pipeline diff、质量和格式漂移、分布混合比例、训练 schedule、评估集回归、指标切片、Recall/Precision 取舍和上线决策串成一套可执行排查流程。
MoE 一般加在大模型哪里,从训练和推理角度有什么收益与代价?
这题考 LLM MoE 的位置和训练推理取舍,回答要讲清 FFN 专家、router、稀疏激活、负载均衡和服务成本。
同题还出现在 1 个公司岗位
文生 3D 任务中,Stable Diffusion 输出如何与 NeRF / SDF 重建方法结合?
这题考文生 3D 中 2D diffusion 先验和 3D 表示优化的结合,回答要讲清 SDS、多视角一致性、NeRF/SDF 取舍和评估。
Teacher forcing 为什么会带来训练和推理不一致,如何缓解 exposure bias?
这题考序列模型训练中的 teacher forcing 和 exposure bias,回答要解释训练推理输入分布不一致、误差累积和常见缓解方法。
LoRA 微调能否注入领域知识,应该如何验证效果边界?
这题考 LoRA 微调能否注入领域知识及其边界。答案要区分格式/风格/任务适配与事实知识注入,并比较 LoRA、SFT、继续预训练和 RAG 的验证方法。
同公司岗位有 2 条面经记录
对话摘要生成任务如何设计评估指标,并处理长度控制、角色呼应和数据增强?
这题考对话摘要生成的评估和训练细节,答案要同时覆盖内容覆盖、事实一致、角色归因、长度控制、ROUGE 局限和数据增强风险。
AI 用例分析工具调用大模型时,如何选择模型并评估识别准确率?
这题考测试开发场景下 LLM 用例分析工具的模型选择和准确率评估,答案要覆盖任务定义、模型取舍、标注基准、识别指标、阈值和错误分析。
从零构建 VLA 模型时,视觉、语言和动作模块应如何设计?
这题考从零设计 Vision-Language-Action 模型的系统拆解,重点是感知编码、语言 grounding、动作表示、策略头、数据闭环、仿真到真实迁移和评估。
VLA 模型和世界模型有什么区别,VLA+RL 适合哪些具身智能场景?
这题考 VLA、世界模型和强化学习在具身智能中的边界,回答要区分动作条件策略、环境动力学建模、规划想象和 RL 微调的适用场景。
多模态 Agentic RL 中用 VERL 做强化学习时,如何判断训练进度和收敛质量?
这题考多模态 Agentic RL 训练过程的可观测和收敛判断,回答要覆盖奖励曲线、成功率分层、KL/熵、rollout 质量、视觉 grounding 和回归评测。
同题还出现在 1 个公司岗位
GRPO 中序列级 reward / loss 如何分配到 token,为什么这是信用分配问题?
这题考 GRPO 里序列级奖励如何影响 token 级更新,重点是序列 reward、token log-prob、组内相对优势、信用分配歧义和训练稳定性。
DeepResearch 类 Agent 如何和 RL 后训练结合,整体训练流程是什么?
这题考 DeepResearch 类 Agent 的 RL 后训练流程,重点是轨迹采集、工具动作、奖励设计、偏好或结果信号、策略优化、评测和防止研究型 Agent 走偏。
Agent 系统如何把用户反馈接入 DPO/PPO 训练,并用 ELO 评估版本效果?
这题考 Agent 反馈闭环和版本评估,回答重点是如何把用户反馈转成偏好数据、用于 DPO/PPO 优化,并用 ELO 或对战评估做版本选择。
PPO 和 GRPO 有什么区别,PPO 中的 Critic 模型如何训练?
这题考 PPO、GRPO 在大模型 RL 后训练中的优化框架差异,以及 PPO 里 Critic 如何用 rollout 回报学习价值估计。
同题还出现在 1 个公司岗位
RLHF/PPO 中为什么要用 KL 散度约束,过强或过弱会带来什么问题?
这题考 RLHF/PPO 中 KL 约束的作用,核心是限制策略偏离参考模型,平衡 reward 优化、语言质量、安全边界和训练稳定性。
大模型强化学习中 Reward 什么时候用规则,什么时候用奖励模型?
这题考大模型 RL 后训练中奖励信号的选型,重点是按可验证性、主观性、成本、覆盖范围和被投机风险决定用规则还是奖励模型。
大模型 RL 后训练中如何识别并缓解 reward hacking 和奖励坍缩?
这题考 RL 后训练的失效模式,回答重点是识别训练 reward 与真实质量背离,并用 reward 审计、约束、数据更新和独立评测缓解。
同题还出现在 2 个公司岗位
Agentic RL 项目中,如何判断 SFT 阶段已经可以进入 RL 后训练?
这题考 Agentic RL 的训练阶段判断,重点是 SFT 是否已经让模型具备稳定轨迹、工具协议、基础成功率和可评估 reward,再决定进入 RL。
GRPO 的 loss 如何计算,训练数据应如何组织?
这题考 GRPO 的目标函数直觉和训练样本组织方式,重点是同 prompt 多回答、组内相对优势、token logprob 更新和 KL 约束。
BGE/GTE 这类 Embedding 模型如何训练,为什么不能直接用 BERT-base 余弦召回?
这题考检索向量模型的训练目标差异,重点是 BGE/GTE 这类 embedding 模型面向语义召回训练,而原始 BERT-base 不天然适合直接做余弦检索。