知识点标签

模型训练面试题解析第 5 页

模型训练相关面试题解析,按真实面经题目沉淀核心机制、易错点和面试官追问。

230 道题 9 个岗位 21 个公司

模型训练相关面试题第 5 页

大模型的“大”体现在哪些方面,如何从参数、数据、算力、上下文和能力边界理解?

大模型的“大”不能只理解为参数多,还包括训练数据规模和多样性、算力投入、上下文窗口、推理成本、多模态能力和复杂任务能力边界。规模扩大通常提升表示能力、泛化能力和复杂任务处理能力,但效果仍依赖数据质量、训练方法、对齐方式和任务分布。

大模型微调时,7B 和 70B 模型的学习率应如何设置,为什么模型规模会影响学习率选择?

大模型微调时,70B 通常要比 7B 使用更保守的学习率,因为大模型参数多、预训练能力强、对分布扰动更敏感,过大学习率更容易导致灾难性遗忘、loss 震荡和能力退化。但这不是绝对规则,还要区分全参微调、LoRA、数据规模、batch size、warmup、scheduler 和任务差异。

常见预训练模型可以如何分类?它们在架构、训练目标和适用任务上有什么差别?

常见预训练模型可以按架构分为 encoder-only、decoder-only、encoder-decoder,以及对比学习或多模态模型。核心差别来自信息流方向、训练目标和下游任务形态:BERT 类 encoder 更适合理解、分类、抽取;GPT 类 decoder 更适合生成和对话;T5/BART 类 encoder-decoder 更适合输入到输出的转换;CLIP 等对比学习模型更适合检索、匹配和跨模态对齐。

垂类大模型主要解决哪些通用大模型难以满足的业务问题,产品上如何判断投入价值?

垂类大模型主要解决通用大模型在特定行业里准确性不足、术语理解不深、流程规则不熟、合规约束不稳定、输出一致性不够的问题。产品上判断是否值得投入,不能只看模型效果,而要综合领域知识密度、错误成本、数据闭环、评测集、替代方案、ROI、成本、延迟和上线风险。

大模型 SFT 从数据构建到训练通常怎么做,SFT 之后 DPO、RLHF/PPO、RL 等 Post-Training 分别解决什么问题?

这题考察候选人是否真正理解大模型对齐训练链路,而不是只会背 SFT、DPO、RLHF 这些名词。好的回答要先讲 SFT 的数据构建、清洗、格式化、训练和评估流程,再解释 SFT 主要让模型学会按指令输出,DPO/RLHF/PPO 等 Post-Training 进一步处理偏好对齐、安全边界、复杂任务奖励和人类反馈优化。面试重点是区分每个阶段解决的问题、依赖的数据形态和带来的风险。

如何判断一个机器学习任务已经训练充分,可以从离线指标、泛化能力、过拟合、线上验证和业务门槛验收?

这题考察的是候选人是否能从测试和工程视角判断机器学习模型“训练好了”。好的回答不能只说 loss 收敛,而要覆盖目标指标、训练/验证曲线、泛化能力、过拟合排查、基线对比、鲁棒性测试、线上验证和业务验收门槛。

XGBoost 主要缓解偏差还是方差问题?它如何通过 Boosting、正则化、Shrinkage、采样和树结构约束影响泛化?

这题的标准回答不是简单选偏差或方差,而是说明 Boosting 主体上通过逐轮拟合残差或负梯度降低偏差,同时 XGBoost 又用正则化、Shrinkage、采样、树深限制和早停来控制方差。回答要能讲出二阶梯度、叶子权重、分裂增益、复杂度惩罚等机制,并结合验证集曲线判断模型是在欠拟合还是过拟合。

DNN 与传统机器学习方法有什么不同?为什么深度网络在表示学习、端到端训练和复杂数据建模上更有优势?

这题要比较 DNN 和传统机器学习在特征表达、训练方式、数据需求、泛化风险和工程落地上的差异。DNN 的优势主要来自表示学习、层次化非线性组合、端到端优化和对图像、语音、文本等复杂数据的适配,但它不是所有场景都优于传统方法。好的回答要同时讲清楚传统模型在小数据、结构化表格、可解释性、训练成本和稳定性上的优势。

为什么梯度下降在机器学习优化中有效?如何理解梯度方向、学习率、局部最优和非凸损失?

这题考的是对梯度下降有效性的本质理解:在可微损失函数附近,负梯度方向是一阶近似下让损失下降最快的方向,小步更新可以逐步降低目标函数。回答要进一步解释学习率、凸与非凸、随机梯度、鞍点、局部最优、归一化和收敛诊断,不能停在一句沿着梯度反方向走。

推荐系统中做采样后样本分布被改变,点击率预估值应该如何校准?

采样会改变训练样本中的先验点击率,模型在采样分布上学到的概率通常不是线上真实曝光分布的 CTR。回答时要先说明校准目标是把 sampled posterior 还原到 target posterior,再给出 odds/prior correction 公式,并补充用未采样验证集做 Platt、isotonic、温度缩放或分桶校准,最后用可靠性曲线、ECE、Brier/logloss 和线上 A/B 验证。

DCN 和 DeepFM 的特征交叉机制有什么异同?

DCN 和 DeepFM 都用于稀疏特征推荐排序,都试图同时建模低阶和高阶交叉。DeepFM 用 FM 显式建模二阶 pairwise 交叉,再用 DNN 隐式学习高阶非线性交叉;DCN 用 cross network 递推地把原始特征 x0 与当前层 xl 做显式交叉,得到有界阶数的多项式交叉。回答重点是公式、显式/隐式、交叉阶数、参数效率、可解释性和工程选型。

推荐系统中多任务学习有哪些常见结构,PLE 主要优化了共享底座或 MMoE 的哪些问题?

推荐多任务常见结构包括 hard parameter sharing/shared-bottom、独立塔、ESMM、soft sharing、MMoE、PLE 等。核心矛盾是任务相关性不均、梯度冲突、负迁移、任务跷跷板和样本空间差异。PLE 在共享专家之外引入任务专属专家,并通过多层 CGC/门控逐层抽取 shared 与 task-specific 表征,主要缓解 shared-bottom 的过度共享和 MMoE 的专家混用、任务干扰问题。

推荐模型离线 AUC 与线上效果不一致时,可能有哪些原因,如何定位和修正?

离线 AUC 与线上效果不一致通常不是单点问题,而是数据分布、样本构造、标签口径、特征一致性、评估指标、候选集、系统链路和实验统计共同造成。回答要先说明 AUC 衡量 P(score_pos > score_neg),不等于线上业务收益;再按数据、模型、评估、服务、实验五层排查,并给出 replay、shadow scoring、切片、A/A、A/B 和监控修正路径。

LoRA 和 Adapter 在微调机制、参数插入位置和推理阶段开销上有什么区别?

这道题考察参数高效微调的结构理解,而不是只背 LoRA 和 Adapter 都是 PEFT。好的回答要先说明二者都冻结大部分基座模型、只训练少量新增参数;再区分 LoRA 是给已有线性层增加低秩权重增量,Adapter 是在 Transformer block 中插入小型瓶颈模块;最后落到推理开销:LoRA 可合并进原权重,单任务部署几乎无额外算子,Adapter 通常保留额外前向路径,会增加延迟、显存和 serving 复杂度。

DeepSpeed ZeRO 中哪些训练状态会占用 GPU 显存,为什么 activation 通常用 checkpoint/recompute 而不是像参数或优化器状态一样分页?

这道题考察大模型训练显存构成和 ZeRO 的边界。回答要先把 GPU 显存里的主要训练状态拆清楚:参数、梯度、优化器状态、激活、通信/临时 buffer 和碎片;再说明 ZeRO 主要分片的是模型状态,Stage 1/2/3 分别处理优化器状态、梯度和参数;最后解释 activation 为什么通常用 checkpoint/recompute:它是 batch/sequence 相关的短生命周期中间结果,反向依赖层级顺序,分页到 CPU/NVMe 会引入高带宽低延迟瓶颈,而重计算能用额外 FLOPs 换显存,通常更可控。

主场景数据充足但抢购等小样本场景 CTR/CVR 分布不同,推荐模型如何用增量学习或 PPNet 做适配?

这题的关键是小样本场景不是简单“数据少”,而是抢购等场景的用户意图、价格敏感度、库存稀缺、时间压力和 CTR/CVR 分布都与主场景不同。只用主场景大数据训练一个统一模型,容易在小场景上校准偏、排序目标错或过度拟合主场景。可行方案包括增量学习、样本重加权、多任务/多场景建模、场景特征注入和 PPNet。PPNet 的核心是用场景/人群/上下文作为 gating 或 personalized parameter generator,对底层网络的 hidden units 或专家输出做个性化缩放,让主模型共享大样本知识,小场景通过参数调制适配分布差异。回答还要覆盖数据构造、冷启动、负迁移、校准、在线 A/B 和防遗忘。

推荐系统中用召回模型蒸馏粗排模型时,如何评价蒸馏后的召回效果?

这题考察召回模型蒸馏粗排模型后的评价方法。核心在于区分“学生模型是否拟合了粗排老师”和“蒸馏后的召回是否真的更好”。召回蒸馏粗排通常是把粗排模型对候选的打分、排序关系或 top item 偏好迁移到召回侧,使召回阶段更早拿到高质量候选。但评价不能只看蒸馏 loss 或 teacher-student 分数相关性,因为召回的职责是从海量 item 中找回后链路需要的候选。高质量答案应覆盖:离线召回指标、与 teacher 排序一致性、下游粗排/精排漏斗贡献、系统性能成本、在线 A/B 以及失败模式,如过度模仿粗排导致多样性下降、覆盖变窄、训练候选偏差和 teacher 错误被放大。

ASR 语音识别流程中,WFST、HMM、GMM-HMM、DNN-HMM 和 CTC 分别解决什么问题?

这道题考察候选人是否理解传统 ASR 到深度学习 ASR 的主线:语音识别不是一个单一模型,而是从声学信号到文字序列的建模与搜索问题。HMM 负责把连续语音拆成带隐状态的时间序列;GMM-HMM 用高斯混合建模每个声学状态的观测概率;DNN-HMM 用神经网络替代 GMM 做更强的声学判别;WFST 把发音词典、语言模型、上下文相关音素和解码约束组合成可搜索图;CTC 则用 blank 和条件独立假设直接学习帧到标签序列的对齐,弱化了 HMM 依赖的人工状态对齐。高质量答案要能讲清“各模块解决的问题、它们在链路中的位置、为什么从 GMM-HMM 演进到 DNN-HMM/CTC、以及评估时如何看 WER、RTF、延迟和 OOV”等指标。

MODNet 这类弱监督图像分割/抠图方法的主要流程是什么,如何利用类别相关背景信息?

这道题考察的是候选人对弱监督视觉分割或抠图流程的理解,而不是要求复述某家公司内部论文实现。可以把 MODNet 这类方法理解为:在缺少像素级精标注时,利用图像级标签、类别激活、伪掩码、背景先验和一致性约束,逐步训练出能区分前景对象、相关背景和无关背景的分割模型。类别相关背景信息的价值在于,弱监督方法容易把与目标共现的背景误当成前景,例如车和道路、船和水面、人物和舞台;如果能显式挖掘类别相关背景并在训练中建模,就能减少前景扩张和背景误分。回答要覆盖弱标签来源、伪标签生成、背景类挖掘、模型训练、噪声控制、迭代优化和评估指标,同时避免声称任何未公开的公司细节。

大模型训练或微调时,batch size 过大或过小分别会带来哪些收敛、泛化、吞吐和显存问题?当有效 batch size 改变时,学习率是否需要结合 scaling rule、warmup 和梯度累积一起调整?

这道题考察大模型训练/微调中 batch size 与学习率、显存、吞吐、泛化和稳定性的联动。好的回答要区分 micro batch、global batch、梯度累积,并说明 scaling rule 只能作为起点,必须配合 warmup 和验证集监控。

微调 Qwen 这类大模型时,learning rate scheduler 应如何设计?如何确定 step 口径、warmup、cosine/linear decay、最小学习率和峰值学习率?

这题考察的不是背诵某个 scheduler,而是能否把 Qwen 微调中的学习率设计拆成训练稳定性、收敛效率、泛化效果和版本选择四件事。好的回答要明确 step 口径、warmup 比例、衰减曲线、最小学习率和峰值学习率。

DPO 为什么可能导致回答过长,SimPO 如何缓解长度偏置?

这题考察对偏好优化目标的细节理解。核心不是简单说“DPO 会变啰嗦,SimPO 会变短”,而是要解释 DPO 的隐式 reward 如何由整段回答的 logprob 差构成,为什么长度、参考模型、偏好数据和评测方式会共同放大长回答倾向,以及 SimPO 如何用平均 log probability 和目标间隔缓解这种偏置。

Function Call / Agent 工具调用不正确时,如何用 SFT 或 GRPO 设计数据与奖励函数来提升能力?

这题考 Agent 工具调用能力的训练闭环。回答要先把错误分型讲清,再说明 SFT 如何构造正负样本和多轮轨迹,GRPO 如何用可执行环境中的细粒度奖励优化工具选择、参数填写、调用顺序、结果使用和最终回答,同时要覆盖离线评测、在线灰度和安全护栏。

已有数字人视频生成模型如何定向训练为只生成指定人物,并设计身份一致性数据、参考图注入、训练约束和评估指标?

这题考数字人视频生成的定向个性化训练方案。重点要覆盖指定人物数据集、参考图像注入、微调策略、身份约束、时序一致性、安全合规和评估指标。好的回答会说明如何让模型只生成目标人物,同时避免过拟合、身份漂移、动作僵硬和未经授权的人脸生成风险。

构建大模型预训练语料时,如何用 OCR 和版面分析处理 PDF 公式、双栏排版与阅读顺序,并保证语料质量?

这题考的是把 PDF 论文、教材、技术文档转成大模型预训练语料的工程闭环。高质量回答不能只说 OCR,而要覆盖 PDF 类型识别、版面检测、公式识别与表示、双栏阅读顺序恢复、去重和质量过滤,以及用人工标注集和下游训练信号评估语料是否真正可用。