分页题目
算法工程师相关题目第 3 页
AIGC 图像生成中 GAN 和 Diffusion Model 的训练目标、生成过程和优劣势有什么区别?
这题考的是能否从训练目标、推理路径、质量多样性、稳定性、可控性和成本把 GAN 与 Diffusion Model 讲成两类生成范式,而不是只背“GAN 快、Diffusion 好”。
Diffusion 模型常见采样方法 DDIM、DPM++、LCM 和 Turbo 的核心思路与取舍是什么?
这题考的是能否把 Diffusion 采样讲成从多步去噪到数值求解、再到蒸馏加速的质量-速度取舍,而不是把 DDIM、DPM++、LCM、Turbo 只当成模型菜单。
SDXL 相比 Stable Diffusion 主要改进了哪些模块,这些改动分别解决什么生成质量问题?
这题考的是能否把 SDXL 相比 Stable Diffusion 的改进拆到模型容量、文本条件、分辨率训练、尺寸条件、refiner 和数据训练策略,并说明每一项在解决什么生成质量问题。
Sora 或 Diffusion 3 这类生成模型要实现图像/视频中的精准文字生成,训练和评估上要解决哪些问题?
这题考的是能否把图像/视频中文字生成当作数据、条件控制、分辨率、OCR/字形监督、时序一致性和评估闭环问题来分析,同时避免臆造 Sora 或 Diffusion 3 的闭源内部实现。
做人脸 AIGC 反欺诈时,如何利用 GAN、Stable Diffusion 原理理解伪造样本生成和检测思路?
这题考的是能否把 GAN、Stable Diffusion 的生成机制转成反欺诈检测思路:既要懂伪造样本怎么来,也要能从人脸一致性、活体线索、频域纹理、阈值和对抗更新讲出可落地的检测闭环。
Stable Diffusion 为什么使用 VAE 的 latent space,而不是直接在像素空间做扩散生成?
这题考 Stable Diffusion 的 latent diffusion 设计取舍:VAE 把高维像素压到较低维潜空间,让扩散模型更省算力,同时保留足够语义和空间结构,但会引入重建损失、细节上限和 latent 分布约束。
StyleGAN 相比普通 GAN 做了哪些结构改进,mapping network、style modulation / AdaIN、噪声注入等分别解决什么问题?
这题考的是能否从生成器结构角度解释 StyleGAN:它把潜变量先映射到更可解耦的中间空间,再用逐层风格调制控制语义尺度,用噪声注入补充随机细节。
CycleGAN 如何用无配对数据做图像风格迁移,循环一致性损失为什么关键?
这题考的是能否说明 CycleGAN 为什么不需要成对样本:它用两个方向的生成器和判别器匹配目标域分布,再用循环一致性约束保留原图内容,避免任意映射。
Faster R-CNN 相比 R-CNN / Fast R-CNN 改进了什么,RPN 为什么能让目标检测更快?
这题考的是两阶段检测器的演进逻辑:R-CNN 慢在每个候选框重复跑 CNN,Fast R-CNN 共享卷积但仍依赖外部候选框,Faster R-CNN 用 RPN 在共享特征上生成候选框从而端到端加速。
Transformer 和 CNN 的核心区别是什么,在视觉任务中如何从局部归纳偏置、全局建模、数据规模和计算成本做选择?
这题考的是能否把 CNN 和 Transformer 的差异讲到建模假设与工程选择:CNN 强局部归纳偏置、参数共享和高效滑动计算,Transformer 强全局关系建模和可扩展表征但更依赖数据与算力。
多头注意力相比单头注意力有什么优势,各个 head 的输出如何拼接并通过输出投影融合?
这题考多头注意力的表示机制和实现细节,重点是说明多个 head 在不同子空间独立做注意力,输出先按特征维拼接,再由输出投影学习跨 head 融合。
GAN 的训练要注意什么?
GAN 训练要重点关注生成器和判别器的平衡、模式崩溃、梯度不稳定、损失解释困难和样本质量评估,不能只看 loss 是否下降。
同题还出现在 1 个公司岗位
Transformer 中绝对位置编码和相对位置编码如何实现,各自适合什么场景?
这题考 Transformer 位置信息注入方式,重点是绝对位置编码直接表示当前位置,相对位置编码在注意力中建模 token 间距离和方向。
同题还出现在 1 个公司岗位
为什么聊天大模型通常不能跳过 SFT 直接做强化学习后训练,Reward Model、DPO/PPO 和稳定性约束分别解决什么问题?
这题考大模型后训练的稳定性理解:SFT 先把模型带到可对话、可遵循指令的分布,强化学习或偏好优化再做对齐;直接 RL 容易稀疏奖励、探索失控和能力退化。
大模型微调为什么会出现灾难性遗忘,如何用数据混合、正则、回放、冻结参数和评测回归缓解?
这题考的是微调稳定性:目标不是背几个缓解方法,而是能解释窄域训练为什么会覆盖旧能力,并给出数据、参数更新和回归评测三条防线。
从 MHA 到 MLA,注意力机制为什么要改进,DeepSeek MLA 解决什么问题?
这题考注意力机制从效果优先到推理效率优先的演进,重点是 KV cache 压力、MHA/MQA/GQA/MLA 的取舍和工程评估。
同题还出现在 1 个公司岗位
连接视觉编码器和 LLM 时,Q-Former 与 LLaVA MLP Adaptor 各有什么优缺点,如何选择?
这题考多模态大模型里视觉特征到语言模型 token 空间的连接器设计。好的回答要说明二者都在解决维度对齐、语义对齐、信息压缩和训练稳定性问题,但 Q-Former 更像带可学习查询的语义压缩器,MLP projector 更像简单直接的视觉 token 映射器,选择取决于数据规模、视觉细节需求、上下文预算、延迟和冻结策略。
如何手写 Multi-Head Self-Attention,Q/K/V 投影、分头、mask 和输出拼接如何实现?
这题考 Transformer 注意力层的可实现细节。好的回答不能只背公式,而要讲清输入输出形状、Q/K/V 一次投影或三次投影、head 维度拆分、scaled dot-product attention、padding/causal mask 广播、softmax/dropout、head 合并、输出投影以及常见数值和 shape bug。
同题还出现在 1 个公司岗位
大模型推理变慢时,如何从序列长度、batch、KV Cache、量化、FlashAttention 和 GPU 资源排查?
这题考 LLM 推理性能诊断闭环。高质量回答应先定义慢在哪里,再拆分队列、prefill、decode、KV Cache、batch 调度、attention kernel、量化、GPU 利用率和服务链路,用指标定位瓶颈,而不是一上来堆优化名词。
同题还出现在 1 个公司岗位
多模态 Agentic RL 中用 VERL 做强化学习时,如何判断训练进度和收敛质量?
这题考多模态 Agentic RL 训练过程的可观测和收敛判断,回答要覆盖奖励曲线、成功率分层、KL/熵、rollout 质量、视觉 grounding 和回归评测。
同题还出现在 1 个公司岗位
Qwen 这类大模型中的 SwiGLU 激活函数有什么作用,相比传统 FFN 激活函数有哪些优势?
这题考的是候选人是否理解现代 Transformer 前馈网络里的门控激活机制:SwiGLU 不是一个简单替换 GELU 的名字,而是通过 gate/value 两路投影和逐元素乘法提升 FFN 的表达能力与训练效果。
同公司岗位有 2 条面经记录
Qwen 这类大模型训练中,混合精度训练如何实现,为什么能提升吞吐并降低显存?
这题考的是大模型训练数值与系统效率的结合:混合精度不是简单把所有张量改成 FP16,而是在前向、反向、梯度、权重、优化器状态和通信之间选择合适精度来兼顾吞吐、显存和稳定性。
Qwen 这类大模型如何设计安全策略,减少有害内容和偏见输出?
这题考的是大模型安全治理的系统观:减少有害内容和偏见输出不能只靠一句安全提示词,而要把政策定义、数据治理、对齐训练、运行时护栏、红队评测和线上反馈做成闭环。
Qwen 支持 128K 长上下文时,如何降低显存占用和注意力计算复杂度?
Qwen 这类支持 128K 长上下文的大模型,不能只靠把最大位置编码拉长来解决问题,核心挑战是注意力计算随序列长度接近平方增长、KV cache 随层数和上下文长度线性增长、训练激活和通信也会放大。常见工程组合包括 RoPE 外推或缩放、FlashAttention 类内存高效注意力、GQA/MQA 降低 KV cache、paged/quantized KV cache、chunked prefill、序列并行或 context parallel、激活重计算,以及在可接受的质量边界内使用滑窗、稀疏或分块注意力。回答时要区分降低显存峰值、降低 KV cache、降低真实计算复杂度三件事。
Qwen 这类大模型做多语言支持时,数据配比、分词、对齐训练和评估应如何设计?
Qwen 这类大模型做多语言支持时,设计重点不是简单增加几种语言语料,而是要在数据配比、tokenizer 覆盖、跨语言指令对齐、偏好训练、安全策略和评估体系之间做平衡。高资源语言提供通用能力和知识密度,低资源语言需要通过采样温度、质量过滤、合成数据和翻译增强避免被淹没;tokenizer 要兼顾不同文字系统的压缩率和 byte fallback;对齐训练要避免只对中文或英文有效;评估也要覆盖语言质量、任务能力、文化语境、安全和 code-switch 等真实场景。
大模型训练显存如何估算,参数、梯度、优化器状态、激活和临时缓存各占哪些部分?
大模型训练显存可以先拆成 model states、activations、temporary buffers、通信缓存和碎片/框架开销。model states 包括参数、梯度和优化器状态;以 Adam 混合精度训练为例,常见粗估是参数 bf16/fp16 2P、梯度 2P、Adam 一阶和二阶矩 fp32 8P、可选 fp32 master weights 4P,总计约 12P 到 16P bytes。除此之外,activation 随 batch、sequence length、hidden size 和层数增长,长上下文 attention 还可能带来平方项;临时缓存包括 attention workspace、GEMM workspace、logits、通信 bucket、all-gather buffer 和内存碎片。估算时要同时考虑并行策略、ZeRO 分片、activation checkpointing、精度和 micro-batch。
同题还出现在 1 个公司岗位
FlashAttention 的核心原理是什么,为什么能降低长序列 attention 的显存和 IO 开销?
这题考 FlashAttention 的 IO-aware 原理,回答重点是它不改变标准 attention 数学结果,而是通过分块、在线 softmax 和重计算减少显存读写。
同题还出现在 1 个公司岗位
RLHF、DPO、PPO 或 GRPO 中 reference model 起什么作用?如果不能保留完整 reference,可以用哪些替代或近似约束?
这题考的是对齐训练里 reference model 的约束本质:它不是装饰性的第二个模型,而是定义“不要偏离初始策略太远”的行为锚点。在 PPO、DPO、GRPO 等方法中,reference 通过 KL、log probability ratio 或隐式 reward 基线抑制奖励黑客、语言退化和安全边界漂移;如果不能完整保留,也要知道哪些近似能替代、哪些只能部分约束。
PPO 和 GRPO 有什么区别,PPO 中的 Critic 模型如何训练?
这题考 PPO、GRPO 在大模型 RL 后训练中的优化框架差异,以及 PPO 里 Critic 如何用 rollout 回报学习价值估计。
同题还出现在 1 个公司岗位
DeepSeek-R1 的后训练流程如何从 SFT、RL 到可验证推理能力逐步构建?
这题考的是候选人是否能按公开技术报告复述 DeepSeek-R1 的后训练逻辑,而不是泛泛说“先 SFT 再 RL”。好答案要区分 DeepSeek-R1-Zero 和 DeepSeek-R1:前者直接从 base model 做大规模 RL,展示可验证推理奖励能诱导反思、验证和更长 CoT;后者用少量冷启动长 CoT 数据改善可读性和训练稳定性,再经过推理 RL、拒绝采样生成 SFT 数据、通用能力 SFT、全场景 RL,并把大模型推理模式蒸馏到小模型。边界是只描述公开论文/官方报告内容,不扩展到未公开训练细节或其它机构的具体做法。
同题还出现在 1 个公司岗位
如何将已有 MHA 大模型改造成 GQA?KV Head 权重合并初始化和继续训练分别解决什么问题?
这题考察的不是“GQA 是什么”这一层概念,而是如何把一个已经训练好的 MHA checkpoint 工程化迁移成 GQA,并解释初始化和继续训练各自承担的职责。核心答案应先说明结构变化:MHA 中每个 Query Head 通常有独立的 K/V Head,而 GQA 把多个 Query Head 分成一组,共享同一组 K/V 投影,从而减少 KV Cache、显存带宽和解码阶段访存。迁移时不能随机初始化 K/V,否则模型等于突然丢失大量注意力记忆能力;因此通常用 KV Head 合并做 warm start,例如按组平均、加权平均、选择代表头或用聚类合并 K/V 权重。这个初始化解决“结构对齐和功能尽量连续”的问题;继续训练或 uptraining 解决“合并带来的表达能力损失、注意力分布偏移和层间统计不匹配”的问题。高质量回答还要补充训练数据配比、学习率、冻结策略、评估指标和推理收益验证。
多模态/RAG 项目上线前如何设计评价指标,如何拆分整体效果与 RAG 子模块指标?
这题考察的不是“能不能背几个指标名”,而是能否把多模态/RAG 项目上线前的评价体系拆成可决策、可归因、可监控的指标框架。来源只支持“项目上线前评价指标”和“RAG 子模块评价指标”这两个面试追问,因此回答应聚焦通用方法论,不编造任何阿里内部指标。高质量答案要先定义上线目标和风险边界,再把评价拆成三层:端到端业务效果、模型回答质量、RAG 链路子模块效果。最终要能回答三个问题:整体效果好不好、如果不好是哪一段坏了、达到什么阈值才能灰度上线。
已有数字人视频生成模型如何定向训练为只生成指定人物,并设计身份一致性数据、参考图注入、训练约束和评估指标?
这题考数字人视频生成的定向个性化训练方案。重点要覆盖指定人物数据集、参考图像注入、微调策略、身份约束、时序一致性、安全合规和评估指标。好的回答会说明如何让模型只生成目标人物,同时避免过拟合、身份漂移、动作僵硬和未经授权的人脸生成风险。
多模态或大模型微调数据做质量过滤时,如何选择过滤模型和质量标准?
这题考数据质量治理,而不是问某家公司内部过滤器。回答要从规则、专用模型、跨模态一致性模型、LLM judge/reward model 和人工抽检的组合讲起。
同题还出现在 1 个公司岗位