标签题目
模型训练相关面试题第 3 页
多模态大模型预训练通常分哪些阶段,ViT 视觉编码器如何参与训练?
这题考多模态大模型预训练的阶段拆解,以及 ViT 视觉编码器如何把图片变成可与语言模型对齐的视觉 token。
同公司岗位有 2 条面经记录
LoRA 初始化和 rank 应如何选择,rank 过大或过小有什么影响?
这题考 LoRA 的低秩增量参数如何初始化和选 rank,重点是保持初始等价、控制容量成本,并用验证集判断欠拟合或过拟合。
BLIP-2 的两阶段训练流程和损失函数如何把视觉编码器接入语言模型?
这题考 BLIP-2 如何用两阶段训练把冻结视觉编码器接入冻结语言模型,回答重点是 Q-Former、图文对齐损失和语言建模损失的职责分工。
大模型基础训练阶段为什么不能直接用 SFT 代替预训练?
这题考基础预训练和 SFT 的目标差异,重点是预训练用海量多样语料学习通用能力,SFT 只是在已有底座上教指令格式和偏好行为。
CLIP 和 BEiT v3 在训练目标、输入建模和图文对齐方式上有什么区别?
这题考 CLIP 和 BEiT v3 的建模范式差异,回答重点是双塔对比学习、统一多模态建模、输入交互方式和适用任务取舍。
CLIP 的图文对比学习流程如何用伪代码表示?
这题考 CLIP 图文对比学习的训练流程,回答重点是 batch 内配对、图像/文本归一化向量、相似度矩阵、温度系数和对称交叉熵损失。
同题还出现在 1 个公司岗位
从产品经理视角看,垂类大模型训练中能贡献哪些数据、场景、评测和业务闭环?
这题考产品经理在垂类大模型训练中的贡献边界,重点不是讲训练算法细节,而是讲场景定义、数据建设、评测体系和业务闭环。
LLM 训练或推理中 FP8 和 BF16 如何按吞吐、显存和稳定性取舍?
这题考 LLM 训练或推理中 FP8 和 BF16 的精度格式取舍,回答重点是显存、带宽、吞吐、数值稳定性和工程校准,不应断言所有 DeepSeek 或 Qwen 版本的内部实现。
为什么 RMSNorm 在大模型中比 LayerNorm 更常见?
这题考 RMSNorm 为什么在大模型中常见,回答重点是它去掉均值中心化,只按均方根做尺度归一化,计算更简单且通常足够稳定。
分布式 MoE 中 Gate 网络如何完成路由通信,容易出现哪些通信瓶颈?
这题考分布式 MoE 的真实执行链路,重点不是只说 Gate 选专家,而是讲清 token 路由、all-to-all dispatch、专家计算、结果回传以及负载不均带来的通信瓶颈。
MoE 专家数量远超过 GPU 数量时,专家调度和放置策略如何设计?
这题考专家并行的资源放置和运行时调度,回答要围绕专家驻留、冷热专家、token 分桶、负载均衡、通信拓扑和训练推理差异展开。
Soft MoE 和 Hard MoE 有什么区别,为什么工程上更常见 Hard MoE?
这题考 MoE 路由形式和工程取舍,重点是区分软混合的平滑训练优势与硬路由的稀疏计算优势,并解释为什么大模型部署更偏向 Hard MoE。
BLIP 如何通过数据清洗和多任务损失提升图文训练数据质量?
这题考 BLIP 里数据 bootstrapping、噪声图文对清洗和多任务预训练目标的关系。回答要聚焦原始 BLIP,不要讲成 BLIP-2 的 Q-Former 两阶段训练。
多模态或大模型微调数据做质量过滤时,如何选择过滤模型和质量标准?
这题考数据质量治理,而不是问某家公司内部过滤器。回答要从规则、专用模型、跨模态一致性模型、LLM judge/reward model 和人工抽检的组合讲起。
同题还出现在 1 个公司岗位
训练长文本翻译模型时,数据集应如何构建以保证上下文一致性和译文质量?
这题考开放场景下的 document-level translation 数据构建。回答重点是文档级平行语料、分段对齐、上下文窗口、术语一致性、质量过滤和长文评估。
训练 Qwen 这类大语言模型时,训练数据集如何设计才能兼顾质量、多样性和覆盖度?
这题考大语言模型训练数据体系设计,核心是把数据质量、多样性、覆盖度和评测闭环放在同一套可度量的配比与治理流程里,而不是简单说多收集数据或多做清洗。
同公司岗位有 2 条面经记录
Qwen 这类图文多模态大模型接入图像理解时,视觉编码、图文对齐和 token 成本有哪些技术难点?
这题考图文多模态大模型接入图像理解的关键工程和算法难点,重点是视觉特征如何进入语言模型、图文语义如何对齐,以及视觉 token 成本如何在效果和延迟之间取舍。
Qwen 这类大模型如何做压缩和蒸馏,评估时应关注哪些效果损失?
这题考大模型压缩与蒸馏的端到端方法论,关键是同时说明模型怎么变小、能力怎么迁移、成本怎么下降,以及哪些能力和安全边界最容易损失。
训练 Qwen 这类大模型时,分布式训练的通信瓶颈如何优化?
这题考大模型训练中的通信瓶颈定位与优化,重点是理解数据并行、张量并行、流水线并行和 ZeRO/FSDP 等策略如何产生不同通信模式,并用 profiling 指标做取舍。
评估 Qwen 这类大模型的泛化能力和鲁棒性时,评测集与切片指标应如何设计?
这题考大模型评测体系设计,核心是把泛化和鲁棒性定义成可切片、可统计、可回归的问题,避免只用一个公开 benchmark 总分判断模型好坏。
PPO 后训练中,GAE 的 lambda 参数如何影响优势估计的偏差和方差?
这题考 PPO 后训练里优势估计的稳定性来源:GAE lambda 通过控制 TD 残差的有效累积长度,在低方差高偏差和低偏差高方差之间取舍。
用 Prompt Engineering 构造评测或训练数据效果不理想时,如何迭代任务定义、样本分布和质检标准?
这题考 Prompt Engineering 构造数据的迭代能力:先判断数据用途,再从任务定义、prompt 模板、样本分布、人工质检、失败切片和真实数据混合上优化。
BLIP 在图文理解和生成任务中如何组织视觉编码、文本编码和跨模态学习目标?
这题考 BLIP 作为图文预训练框架的整体理解:视觉编码器提取图像 token,文本模块在编码和解码模式间复用,并通过对比、匹配和语言建模目标同时支持理解与生成。
AIGC 图像生成中 GAN 和 Diffusion Model 的训练目标、生成过程和优劣势有什么区别?
这题考的是能否从训练目标、推理路径、质量多样性、稳定性、可控性和成本把 GAN 与 Diffusion Model 讲成两类生成范式,而不是只背“GAN 快、Diffusion 好”。
Diffusion 模型常见采样方法 DDIM、DPM++、LCM 和 Turbo 的核心思路与取舍是什么?
这题考的是能否把 Diffusion 采样讲成从多步去噪到数值求解、再到蒸馏加速的质量-速度取舍,而不是把 DDIM、DPM++、LCM、Turbo 只当成模型菜单。
SDXL 相比 Stable Diffusion 主要改进了哪些模块,这些改动分别解决什么生成质量问题?
这题考的是能否把 SDXL 相比 Stable Diffusion 的改进拆到模型容量、文本条件、分辨率训练、尺寸条件、refiner 和数据训练策略,并说明每一项在解决什么生成质量问题。
Sora 或 Diffusion 3 这类生成模型要实现图像/视频中的精准文字生成,训练和评估上要解决哪些问题?
这题考的是能否把图像/视频中文字生成当作数据、条件控制、分辨率、OCR/字形监督、时序一致性和评估闭环问题来分析,同时避免臆造 Sora 或 Diffusion 3 的闭源内部实现。
Stable Diffusion 为什么使用 VAE 的 latent space,而不是直接在像素空间做扩散生成?
这题考 Stable Diffusion 的 latent diffusion 设计取舍:VAE 把高维像素压到较低维潜空间,让扩散模型更省算力,同时保留足够语义和空间结构,但会引入重建损失、细节上限和 latent 分布约束。
为什么主流大语言模型多采用 Decoder-only 架构?相比 Encoder-only 和 Encoder-Decoder,它在训练目标、推理效率和产品能力上有哪些取舍?
这题考候选人是否能把 Decoder-only 的流行讲清楚:它不是单纯结构更先进,而是在自回归训练、生成式推理、规模化训练和产品通用能力之间形成了更顺手的工程取舍。
大语言模型的涌现能力是什么,可能受模型规模、数据分布、训练目标和评测方式哪些因素影响?
这题考候选人能否把“涌现能力”讲成规模、数据、训练目标和评测共同作用下的现象,并能区分真实能力跃迁、连续改进被指标放大、以及评测设计造成的表象。
大模型如何让生成文本更丰富而不单调?解码参数、训练数据、指令微调和重复惩罚分别起什么作用?
这题考候选人是否能把“回答更丰富”拆成推理时的采样控制、训练数据的表达覆盖、指令微调的任务风格、以及重复惩罚的局部去重,而不是只调高 temperature。
StyleGAN 相比普通 GAN 做了哪些结构改进,mapping network、style modulation / AdaIN、噪声注入等分别解决什么问题?
这题考的是能否从生成器结构角度解释 StyleGAN:它把潜变量先映射到更可解耦的中间空间,再用逐层风格调制控制语义尺度,用噪声注入补充随机细节。
CycleGAN 如何用无配对数据做图像风格迁移,循环一致性损失为什么关键?
这题考的是能否说明 CycleGAN 为什么不需要成对样本:它用两个方向的生成器和判别器匹配目标域分布,再用循环一致性约束保留原图内容,避免任意映射。
Faster R-CNN 相比 R-CNN / Fast R-CNN 改进了什么,RPN 为什么能让目标检测更快?
这题考的是两阶段检测器的演进逻辑:R-CNN 慢在每个候选框重复跑 CNN,Fast R-CNN 共享卷积但仍依赖外部候选框,Faster R-CNN 用 RPN 在共享特征上生成候选框从而端到端加速。
端到端语音增强模型为什么可以直接在时域建模,相比基于 STFT/频域掩码的方法有哪些优势、代价和适用场景?
这题考语音增强建模路线取舍:时域端到端模型直接学习带噪波形到干净波形的映射,优势是联合学习分析基和相位细节,代价是训练、解释、延迟和泛化边界更难控制。
语音增强模型常用哪些损失函数,时域损失、频域损失、感知指标和多任务损失应如何取舍?
这题考语音增强目标函数设计:时域损失约束波形和尺度,频域损失约束谱结构,感知或识别相关损失对齐用户体验,多任务损失则要防止辅助目标压过主目标。
音频模型从 QAT 量化感知训练到板端部署的完整流程是什么,遇到算子不支持、精度回退或性能不达标时如何排查?
这题考的是能否把 QAT 从训练技巧讲成完整工程闭环:先确定板端约束和浮点基线,再做 fake quant 训练、图转换、算子适配、板端对齐、精度回归和性能功耗压测。
音频端侧模型做训练后量化(PTQ)时如何实现,校准集的分布、数量和场景覆盖为什么会影响最终精度?
这题考的是 PTQ 的本质:用少量代表性样本估计激活动态范围并固化量化参数;校准集分布越偏、数量越少、场景覆盖越窄,越容易导致裁剪、分辨率浪费和真实场景精度下降。
音频端侧模型为什么常选 INT8 量化,如何在速度、内存、硬件算子支持和精度损失之间权衡?
这题的核心不是喊 INT8 更快,而是解释 INT8 为什么通常是端侧部署的平衡点:显著降内存和带宽、硬件支持成熟、速度收益可观,同时精度损失通常能用 PTQ/QAT 和混合精度控制。
如何手写实现一维卷积算子?给定输入序列 [1,2,3,4] 和卷积核 [1,2,3] 时,如何约定 kernel 翻转、valid/full 输出、padding 和 stride?
这题考的是能否先把卷积约定说清楚再写代码:深度学习里的 Conv1D 通常实际做 cross-correlation 不翻转 kernel;数学卷积会翻转 kernel;valid/full、padding 和 stride 会直接改变输出长度和数值。
Chain-of-Thought 为什么能提升复杂推理任务表现,它的收益、风险和生产可控性如何理解?
这题考 Chain-of-Thought 的机制理解:它通过显式或隐式中间步骤降低复杂任务的一次性求解难度,但上线时要控制答案暴露、成本、稳定性和可验证性。
同题还出现在 1 个公司岗位
为什么聊天大模型通常不能跳过 SFT 直接做强化学习后训练,Reward Model、DPO/PPO 和稳定性约束分别解决什么问题?
这题考大模型后训练的稳定性理解:SFT 先把模型带到可对话、可遵循指令的分布,强化学习或偏好优化再做对齐;直接 RL 容易稀疏奖励、探索失控和能力退化。
大模型微调为什么会出现灾难性遗忘,如何用数据混合、正则、回放、冻结参数和评测回归缓解?
这题考的是微调稳定性:目标不是背几个缓解方法,而是能解释窄域训练为什么会覆盖旧能力,并给出数据、参数更新和回归评测三条防线。
多模态图像分支使用最大池化时,反向传播的梯度如何分配,工程实现需要注意哪些边界?
这题考最大池化的反向传播机制:输出梯度只回传给前向窗口中的最大值位置,非最大位置梯度为 0;工程上还要处理重叠窗口、并列最大值、padding、mask 记录和数值边界。
大模型与 2020 年前传统模型的本质区别是什么?
这题考的是对大模型范式变化的理解:本质区别不只是参数更多,而是从任务专用模型转向大规模预训练、通用表示、自然语言交互、上下文学习和工程化治理并存的基础模型范式。
同题还出现在 1 个公司岗位
催生大模型出现的核心原因是什么?
这题考的是能否把大模型出现解释为多因素合流:海量数据、可扩展算力、Transformer 架构、自监督预训练、工程生态、对齐技术和产品需求共同把通用模型推到可用临界点。
大模型 SFT 微调效果不好时,可以从哪些数据、模板、训练配置、参数高效微调和评估闭环维度优化?
这题考的是 SFT 效果诊断和优化方法论:要把问题拆成数据质量、任务分布、指令模板、训练超参、PEFT 配置、基座能力和评估闭环,而不是只说多清洗数据。
LoRA 微调不收敛或输出格式异常时,如何从数据、模板、学习率、rank 和 alpha 排查?
这题考的是 LoRA 训练故障诊断能力:候选人要能把不收敛和输出格式失控拆成数据、模板、损失、超参、adapter 容量和评测回归几个层面逐步定位。