知识点标签

模型训练面试题解析

模型训练相关面试题解析,按真实面经题目沉淀核心机制、易错点和面试官追问。

230 道题 9 个岗位 21 个公司

模型训练相关面试题

MMDiT 如何处理双流、单流输入并融合文本和图像模态?

MMDiT 的核心不是把文本和图像粗暴拼成一种特征,而是先保留两种模态各自的处理路径,再在注意力层里做联合交互。文本 token 和图像 latent patch token 通常有各自的投影、归一化、调制和前馈网络;进入注意力时分别生成 Q/K/V,再拼接到同一个注意力计算中,让文本与图像能够双向通信。部分架构还会在前面的双流阶段之后进入单流阶段,用统一 Transformer block 继续处理拼接后的 token,但仍通过位置、类型、掩码或前后处理保留模态身份。

图像特征处理用什么网络?

图像特征处理没有单一固定网络,核心是根据任务目标、数据规模、实时性和部署环境选择特征提取骨干网络、任务头和训练策略。传统通用选择是 CNN 骨干,如 ResNet、EfficientNet、MobileNet;如果数据规模较大、需要全局建模或与文本对齐,可以选择 ViT、Swin Transformer 或 CLIP 类多模态编码器;如果是检测、分割、OCR 等结构化任务,还需要 FPN、YOLO、Faster R-CNN、Mask R-CNN、OCR encoder-decoder 等任务头。

卷积神经网络原理?

卷积神经网络的核心思想,是利用局部感受野和权重共享,从图像或网格数据中逐层提取特征。卷积核在空间上滑动,对局部区域做加权求和,生成特征图;不同卷积核学习不同模式,浅层常捕捉边缘、纹理和颜色变化,深层逐渐组合成部件、形状和语义概念。CNN 并不是简单记住像素,而是学习从局部到整体的层次化表示。

高维稀疏特征为什么不适合直接用神经网络训练?

高维稀疏特征为什么不适合直接用神经网络训练?这道腾讯牛客题的关键是围绕“高维稀疏特征直接训练神经网络的风险”讲清概念、机制、取舍和边界。高维稀疏特征如果直接 one-hot 输入神经网络,会带来参数巨大、有效梯度稀疏、长尾类别训练不足、过拟合和线上存储/延迟成本。工程上通常先做 embedding、特征哈希、频次截断、交叉特征或用适合稀疏输入的线性/树模型做基线。

BatchNorm 和 LayerNorm 有什么区别?

BatchNorm 和 LayerNorm 有什么区别?这道腾讯牛客题的关键是围绕“BatchNorm 与 LayerNorm 的统计维度”讲清概念、机制、取舍和边界。BatchNorm 和 LayerNorm 都是归一化手段,但核心差异在统计维度。BN 通常沿 batch 维度统计某个通道或特征的均值方差,训练时还维护 moving average;LN 在单个样本内部沿 hidden dimension 归一化,不依赖同一个 batch 里的其他样本。

音频包络如何计算?

音频包络如何计算?这道腾讯牛客题的关键是围绕“音频包络计算”讲清概念、机制、取舍和边界。音频包络描述的是声音幅度随时间变化的外轮廓,常用于响度变化、起音检测和节奏特征。常见做法是先把波形取绝对值、平方能量或 Hilbert 变换得到瞬时幅度,再用滑动窗口、RMS 或低通滤波做平滑。

MFCC 特征如何计算,是否可逆?

MFCC 特征如何计算,是否可逆?这道腾讯牛客题的关键是围绕“MFCC 特征计算与不可逆性”讲清概念、机制、取舍和边界。MFCC 是把语音短时频谱映射到符合人耳感知的倒谱特征。典型流程是预加重、分帧、加窗、FFT、Mel 滤波器组、取 log 能量、DCT,最后保留前若干维系数。

DDSP 模型的核心思想是什么?

DDSP 模型的核心思想是什么?这道腾讯牛客题的关键是围绕“DDSP 可微数字信号处理”讲清概念、机制、取舍和边界。DDSP 的核心是把传统数字信号处理模块做成可微分组件,让神经网络预测可解释的合成参数,再通过谐波合成器、噪声合成器和滤波器生成音频。它不是普通 representation learning,而是把声学先验嵌入神经生成模型。

词向量如何生成,常见训练方法有哪些?

词向量如何生成,常见训练方法有哪些?这道腾讯牛客题的关键是围绕“词向量生成方法”讲清概念、机制、取舍和边界。词向量是把离散词映射到稠密向量,使语义或上下文相似的词在向量空间里更接近。常见训练方法包括 Word2Vec 的 CBOW/Skip-gram、负采样或层次 softmax、GloVe 的全局共现矩阵分解,以及 FastText 的子词建模。