标签题目
模型训练相关面试题第 5 页
垂类大模型从通用模型到业务落地通常要经历哪些训练和迭代步骤?
垂类大模型不是把通用模型直接接入业务就结束,而是从业务任务定义、领域数据建设、模型适配训练、评测 badcase、灰度上线到反馈闭环的一整套工程化迭代。本题聚焦完整训练和落地链路,不是产品经理个人贡献分工。
大模型的“大”体现在哪些方面,如何从参数、数据、算力、上下文和能力边界理解?
大模型的“大”不能只理解为参数多,还包括训练数据规模和多样性、算力投入、上下文窗口、推理成本、多模态能力和复杂任务能力边界。规模扩大通常提升表示能力、泛化能力和复杂任务处理能力,但效果仍依赖数据质量、训练方法、对齐方式和任务分布。
大模型时代,小模型还有哪些价值,如何在效果、成本和延迟之间取舍?
大模型时代小模型仍然有价值,尤其在低延迟、低成本、高并发、端侧部署、隐私保护和专用任务上。合理方案通常不是二选一,而是用小模型承担高频、确定、轻量任务,用大模型处理复杂、开放、低置信或需要强推理的请求。
大模型微调时,7B 和 70B 模型的学习率应如何设置,为什么模型规模会影响学习率选择?
大模型微调时,70B 通常要比 7B 使用更保守的学习率,因为大模型参数多、预训练能力强、对分布扰动更敏感,过大学习率更容易导致灾难性遗忘、loss 震荡和能力退化。但这不是绝对规则,还要区分全参微调、LoRA、数据规模、batch size、warmup、scheduler 和任务差异。
常见预训练模型可以如何分类?它们在架构、训练目标和适用任务上有什么差别?
常见预训练模型可以按架构分为 encoder-only、decoder-only、encoder-decoder,以及对比学习或多模态模型。核心差别来自信息流方向、训练目标和下游任务形态:BERT 类 encoder 更适合理解、分类、抽取;GPT 类 decoder 更适合生成和对话;T5/BART 类 encoder-decoder 更适合输入到输出的转换;CLIP 等对比学习模型更适合检索、匹配和跨模态对齐。
垂类大模型主要解决哪些通用大模型难以满足的业务问题,产品上如何判断投入价值?
垂类大模型主要解决通用大模型在特定行业里准确性不足、术语理解不深、流程规则不熟、合规约束不稳定、输出一致性不够的问题。产品上判断是否值得投入,不能只看模型效果,而要综合领域知识密度、错误成本、数据闭环、评测集、替代方案、ROI、成本、延迟和上线风险。
大模型 SFT 从数据构建到训练通常怎么做,SFT 之后 DPO、RLHF/PPO、RL 等 Post-Training 分别解决什么问题?
这题考察候选人是否真正理解大模型对齐训练链路,而不是只会背 SFT、DPO、RLHF 这些名词。好的回答要先讲 SFT 的数据构建、清洗、格式化、训练和评估流程,再解释 SFT 主要让模型学会按指令输出,DPO/RLHF/PPO 等 Post-Training 进一步处理偏好对齐、安全边界、复杂任务奖励和人类反馈优化。面试重点是区分每个阶段解决的问题、依赖的数据形态和带来的风险。
如何判断一个机器学习任务已经训练充分,可以从离线指标、泛化能力、过拟合、线上验证和业务门槛验收?
这题考察的是候选人是否能从测试和工程视角判断机器学习模型“训练好了”。好的回答不能只说 loss 收敛,而要覆盖目标指标、训练/验证曲线、泛化能力、过拟合排查、基线对比、鲁棒性测试、线上验证和业务验收门槛。
XGBoost 主要缓解偏差还是方差问题?它如何通过 Boosting、正则化、Shrinkage、采样和树结构约束影响泛化?
这题的标准回答不是简单选偏差或方差,而是说明 Boosting 主体上通过逐轮拟合残差或负梯度降低偏差,同时 XGBoost 又用正则化、Shrinkage、采样、树深限制和早停来控制方差。回答要能讲出二阶梯度、叶子权重、分裂增益、复杂度惩罚等机制,并结合验证集曲线判断模型是在欠拟合还是过拟合。
DNN 与传统机器学习方法有什么不同?为什么深度网络在表示学习、端到端训练和复杂数据建模上更有优势?
这题要比较 DNN 和传统机器学习在特征表达、训练方式、数据需求、泛化风险和工程落地上的差异。DNN 的优势主要来自表示学习、层次化非线性组合、端到端优化和对图像、语音、文本等复杂数据的适配,但它不是所有场景都优于传统方法。好的回答要同时讲清楚传统模型在小数据、结构化表格、可解释性、训练成本和稳定性上的优势。
为什么梯度下降在机器学习优化中有效?如何理解梯度方向、学习率、局部最优和非凸损失?
这题考的是对梯度下降有效性的本质理解:在可微损失函数附近,负梯度方向是一阶近似下让损失下降最快的方向,小步更新可以逐步降低目标函数。回答要进一步解释学习率、凸与非凸、随机梯度、鞍点、局部最优、归一化和收敛诊断,不能停在一句沿着梯度反方向走。
卷积层为什么能抽取图像特征,如何从局部连接、权重共享、感受野、平移等变性和多层组合解释?
卷积层能抽取图像特征,核心在于用局部连接和权重共享把同一个模式检测器滑过整张图,再通过多通道卷积、非线性、多层感受野扩张和下采样,把边缘、纹理、部件逐步组合成更高层语义特征。
机器学习中的偏差和方差分别指什么,如何判断并降低它们?
这题考偏差-方差分解和模型泛化诊断,重点是能用欠拟合、过拟合、训练/验证误差曲线解释问题,并给出对应降低方法。
1x1 卷积核在 CNN 中有什么作用?
这道题考察 CNN 中 1x1 卷积的真实作用。它不是用来扩大空间感受野,而是在每个空间位置上做通道维度的线性组合,常用于通道融合、升降维、减少计算量、构造瓶颈层,以及在合适网络结构中增强表达效率。
Dropout 在训练和推理阶段分别如何处理,为什么测试时通常关闭随机丢弃?
这题考 Dropout 的训练和推理差异。高质量回答要说明训练期采样 Bernoulli mask,常用 inverted dropout 按 1/(1-p) 放大保留激活;推理期切到 eval 模式关闭随机丢弃,使用完整网络并保持期望一致,同时补充 MC Dropout 例外和框架常见坑。
超分辨率模型中,上采样层放在网络前面还是后面,各自有什么速度、显存和效果取舍?
这题考超分辨率网络中上采样位置的架构取舍。高质量回答要对比 SRCNN 式前置上采样和 FSRCNN/ESPCN 式后置上采样,讲清计算量、显存、速度、感受野、重建质量、尺度适配和棋盘伪影,并说明 sub-pixel、transpose convolution、resize-conv 等方案差异。
SIM 在推荐系统长序列兴趣建模中改进了什么问题?
这题考推荐系统长序列兴趣建模的核心矛盾。SIM 改进的问题不是多任务学习本身,而是传统 DIN/DIEN 等模型通常只能使用较短历史行为,直接建模超长序列又计算重、噪声多、目标相关性弱。
推荐系统中做采样后样本分布被改变,点击率预估值应该如何校准?
采样会改变训练样本中的先验点击率,模型在采样分布上学到的概率通常不是线上真实曝光分布的 CTR。回答时要先说明校准目标是把 sampled posterior 还原到 target posterior,再给出 odds/prior correction 公式,并补充用未采样验证集做 Platt、isotonic、温度缩放或分桶校准,最后用可靠性曲线、ECE、Brier/logloss 和线上 A/B 验证。
DCN 和 DeepFM 的特征交叉机制有什么异同?
DCN 和 DeepFM 都用于稀疏特征推荐排序,都试图同时建模低阶和高阶交叉。DeepFM 用 FM 显式建模二阶 pairwise 交叉,再用 DNN 隐式学习高阶非线性交叉;DCN 用 cross network 递推地把原始特征 x0 与当前层 xl 做显式交叉,得到有界阶数的多项式交叉。回答重点是公式、显式/隐式、交叉阶数、参数效率、可解释性和工程选型。
推荐系统中多任务学习有哪些常见结构,PLE 主要优化了共享底座或 MMoE 的哪些问题?
推荐多任务常见结构包括 hard parameter sharing/shared-bottom、独立塔、ESMM、soft sharing、MMoE、PLE 等。核心矛盾是任务相关性不均、梯度冲突、负迁移、任务跷跷板和样本空间差异。PLE 在共享专家之外引入任务专属专家,并通过多层 CGC/门控逐层抽取 shared 与 task-specific 表征,主要缓解 shared-bottom 的过度共享和 MMoE 的专家混用、任务干扰问题。
推荐模型离线 AUC 与线上效果不一致时,可能有哪些原因,如何定位和修正?
离线 AUC 与线上效果不一致通常不是单点问题,而是数据分布、样本构造、标签口径、特征一致性、评估指标、候选集、系统链路和实验统计共同造成。回答要先说明 AUC 衡量 P(score_pos > score_neg),不等于线上业务收益;再按数据、模型、评估、服务、实验五层排查,并给出 replay、shadow scoring、切片、A/A、A/B 和监控修正路径。
LoRA 和 Adapter 在微调机制、参数插入位置和推理阶段开销上有什么区别?
这道题考察参数高效微调的结构理解,而不是只背 LoRA 和 Adapter 都是 PEFT。好的回答要先说明二者都冻结大部分基座模型、只训练少量新增参数;再区分 LoRA 是给已有线性层增加低秩权重增量,Adapter 是在 Transformer block 中插入小型瓶颈模块;最后落到推理开销:LoRA 可合并进原权重,单任务部署几乎无额外算子,Adapter 通常保留额外前向路径,会增加延迟、显存和 serving 复杂度。
DeepSpeed ZeRO 中哪些训练状态会占用 GPU 显存,为什么 activation 通常用 checkpoint/recompute 而不是像参数或优化器状态一样分页?
这道题考察大模型训练显存构成和 ZeRO 的边界。回答要先把 GPU 显存里的主要训练状态拆清楚:参数、梯度、优化器状态、激活、通信/临时 buffer 和碎片;再说明 ZeRO 主要分片的是模型状态,Stage 1/2/3 分别处理优化器状态、梯度和参数;最后解释 activation 为什么通常用 checkpoint/recompute:它是 batch/sequence 相关的短生命周期中间结果,反向依赖层级顺序,分页到 CPU/NVMe 会引入高带宽低延迟瓶颈,而重计算能用额外 FLOPs 换显存,通常更可控。
主场景数据充足但抢购等小样本场景 CTR/CVR 分布不同,推荐模型如何用增量学习或 PPNet 做适配?
这题的关键是小样本场景不是简单“数据少”,而是抢购等场景的用户意图、价格敏感度、库存稀缺、时间压力和 CTR/CVR 分布都与主场景不同。只用主场景大数据训练一个统一模型,容易在小场景上校准偏、排序目标错或过度拟合主场景。可行方案包括增量学习、样本重加权、多任务/多场景建模、场景特征注入和 PPNet。PPNet 的核心是用场景/人群/上下文作为 gating 或 personalized parameter generator,对底层网络的 hidden units 或专家输出做个性化缩放,让主模型共享大样本知识,小场景通过参数调制适配分布差异。回答还要覆盖数据构造、冷启动、负迁移、校准、在线 A/B 和防遗忘。
推荐系统中用召回模型蒸馏粗排模型时,如何评价蒸馏后的召回效果?
这题考察召回模型蒸馏粗排模型后的评价方法。核心在于区分“学生模型是否拟合了粗排老师”和“蒸馏后的召回是否真的更好”。召回蒸馏粗排通常是把粗排模型对候选的打分、排序关系或 top item 偏好迁移到召回侧,使召回阶段更早拿到高质量候选。但评价不能只看蒸馏 loss 或 teacher-student 分数相关性,因为召回的职责是从海量 item 中找回后链路需要的候选。高质量答案应覆盖:离线召回指标、与 teacher 排序一致性、下游粗排/精排漏斗贡献、系统性能成本、在线 A/B 以及失败模式,如过度模仿粗排导致多样性下降、覆盖变窄、训练候选偏差和 teacher 错误被放大。
ASR 语音识别流程中,WFST、HMM、GMM-HMM、DNN-HMM 和 CTC 分别解决什么问题?
这道题考察候选人是否理解传统 ASR 到深度学习 ASR 的主线:语音识别不是一个单一模型,而是从声学信号到文字序列的建模与搜索问题。HMM 负责把连续语音拆成带隐状态的时间序列;GMM-HMM 用高斯混合建模每个声学状态的观测概率;DNN-HMM 用神经网络替代 GMM 做更强的声学判别;WFST 把发音词典、语言模型、上下文相关音素和解码约束组合成可搜索图;CTC 则用 blank 和条件独立假设直接学习帧到标签序列的对齐,弱化了 HMM 依赖的人工状态对齐。高质量答案要能讲清“各模块解决的问题、它们在链路中的位置、为什么从 GMM-HMM 演进到 DNN-HMM/CTC、以及评估时如何看 WER、RTF、延迟和 OOV”等指标。
MODNet 这类弱监督图像分割/抠图方法的主要流程是什么,如何利用类别相关背景信息?
这道题考察的是候选人对弱监督视觉分割或抠图流程的理解,而不是要求复述某家公司内部论文实现。可以把 MODNet 这类方法理解为:在缺少像素级精标注时,利用图像级标签、类别激活、伪掩码、背景先验和一致性约束,逐步训练出能区分前景对象、相关背景和无关背景的分割模型。类别相关背景信息的价值在于,弱监督方法容易把与目标共现的背景误当成前景,例如车和道路、船和水面、人物和舞台;如果能显式挖掘类别相关背景并在训练中建模,就能减少前景扩张和背景误分。回答要覆盖弱标签来源、伪标签生成、背景类挖掘、模型训练、噪声控制、迭代优化和评估指标,同时避免声称任何未公开的公司细节。
大模型训练或微调时,batch size 过大或过小分别会带来哪些收敛、泛化、吞吐和显存问题?当有效 batch size 改变时,学习率是否需要结合 scaling rule、warmup 和梯度累积一起调整?
这道题考察大模型训练/微调中 batch size 与学习率、显存、吞吐、泛化和稳定性的联动。好的回答要区分 micro batch、global batch、梯度累积,并说明 scaling rule 只能作为起点,必须配合 warmup 和验证集监控。
在小目标检测且数据量较小的场景下,如何用深度学习方案改造传统检测流程,并围绕 Faster R-CNN、多尺度特征和数据增强提升效果?
这道题考察小目标检测和小样本场景的方案设计。回答要覆盖传统流程改造、Faster R-CNN 选型、多尺度特征、数据增强、迁移学习、样本不均衡和评估误差分析。
短视频推荐精排模型上线时,如何在冷启动和热启动之间取舍,并评估收敛周期、资源消耗和线上风险?
这道题考察推荐精排模型上线方式选择。回答要区分冷启动全新训练和热启动继承已有模型,并围绕收敛、资源、线上风险、灰度和回滚制定方案。
微调 Qwen 这类大模型时,learning rate scheduler 应如何设计?如何确定 step 口径、warmup、cosine/linear decay、最小学习率和峰值学习率?
这题考察的不是背诵某个 scheduler,而是能否把 Qwen 微调中的学习率设计拆成训练稳定性、收敛效率、泛化效果和版本选择四件事。好的回答要明确 step 口径、warmup 比例、衰减曲线、最小学习率和峰值学习率。
DPO 为什么可能导致回答过长,SimPO 如何缓解长度偏置?
这题考察对偏好优化目标的细节理解。核心不是简单说“DPO 会变啰嗦,SimPO 会变短”,而是要解释 DPO 的隐式 reward 如何由整段回答的 logprob 差构成,为什么长度、参考模型、偏好数据和评测方式会共同放大长回答倾向,以及 SimPO 如何用平均 log probability 和目标间隔缓解这种偏置。
Function Call / Agent 工具调用不正确时,如何用 SFT 或 GRPO 设计数据与奖励函数来提升能力?
这题考 Agent 工具调用能力的训练闭环。回答要先把错误分型讲清,再说明 SFT 如何构造正负样本和多轮轨迹,GRPO 如何用可执行环境中的细粒度奖励优化工具选择、参数填写、调用顺序、结果使用和最终回答,同时要覆盖离线评测、在线灰度和安全护栏。
已有数字人视频生成模型如何定向训练为只生成指定人物,并设计身份一致性数据、参考图注入、训练约束和评估指标?
这题考数字人视频生成的定向个性化训练方案。重点要覆盖指定人物数据集、参考图像注入、微调策略、身份约束、时序一致性、安全合规和评估指标。好的回答会说明如何让模型只生成目标人物,同时避免过拟合、身份漂移、动作僵硬和未经授权的人脸生成风险。
构建大模型预训练语料时,如何用 OCR 和版面分析处理 PDF 公式、双栏排版与阅读顺序,并保证语料质量?
这题考的是把 PDF 论文、教材、技术文档转成大模型预训练语料的工程闭环。高质量回答不能只说 OCR,而要覆盖 PDF 类型识别、版面检测、公式识别与表示、双栏阅读顺序恢复、去重和质量过滤,以及用人工标注集和下游训练信号评估语料是否真正可用。
AI 产品经理如何评价一次模型训练结果是否值得上线?
这题考 AI 产品经理能否把模型训练结果翻译成上线决策。回答不能只看离线准确率,要同时看业务任务、评测集代表性、badcase、成本延迟、安全风险、灰度效果和回滚条件。
多模态 CoT 场景下,如何构造用于 DPO 的偏好数据,并保证推理过程与图文证据一致?
这题考多模态偏好数据构造。回答要讲正负样本、图文证据一致性、推理链标注、偏好质量、DPO 训练和评估闭环。
统一生成理解多模态模型做下游微调时,如何为分类、VQA、OCR、定位和生成任务设计统一样本格式,同时保留各任务的专属监督,并控制混训比例、数据质量和能力退化风险?
这题考统一生成理解模型的下游微调数据设计。回答要讲任务格式统一、数据混合、采样比例、模态对齐、质量控制和评测。