标签题目
计算机视觉相关面试题第 2 页
MVS 点云采样和 NeRF 采样在 3D 重建中各有什么优势和局限,如何按场景选择?
这题考的是 3D 重建方法取舍:MVS 更偏显式几何和多视图匹配点云,NeRF 更偏沿射线做体渲染采样和隐式辐射场优化,选择要看视角密度、纹理、材质、速度、输出形态和下游需求。
如何用 PyTorch/CUDA 思路实现四线性插值,说明索引、权重计算和边界处理伪代码?
这题考实现思路而不是背库函数:先声明把“四线性插值”按 4D/quadrilinear interpolation 理解,即 4 个连续维度上各取 floor/ceil 共 16 个邻居,再讲索引映射、权重乘积、边界策略、CUDA 并行和反向传播验证。
StyleGAN 相比普通 GAN 做了哪些结构改进,mapping network、style modulation / AdaIN、噪声注入等分别解决什么问题?
这题考的是能否从生成器结构角度解释 StyleGAN:它把潜变量先映射到更可解耦的中间空间,再用逐层风格调制控制语义尺度,用噪声注入补充随机细节。
CycleGAN 如何用无配对数据做图像风格迁移,循环一致性损失为什么关键?
这题考的是能否说明 CycleGAN 为什么不需要成对样本:它用两个方向的生成器和判别器匹配目标域分布,再用循环一致性约束保留原图内容,避免任意映射。
Faster R-CNN 相比 R-CNN / Fast R-CNN 改进了什么,RPN 为什么能让目标检测更快?
这题考的是两阶段检测器的演进逻辑:R-CNN 慢在每个候选框重复跑 CNN,Fast R-CNN 共享卷积但仍依赖外部候选框,Faster R-CNN 用 RPN 在共享特征上生成候选框从而端到端加速。
Transformer 和 CNN 的核心区别是什么,在视觉任务中如何从局部归纳偏置、全局建模、数据规模和计算成本做选择?
这题考的是能否把 CNN 和 Transformer 的差异讲到建模假设与工程选择:CNN 强局部归纳偏置、参数共享和高效滑动计算,Transformer 强全局关系建模和可扩展表征但更依赖数据与算力。
如何手写实现一维卷积算子?给定输入序列 [1,2,3,4] 和卷积核 [1,2,3] 时,如何约定 kernel 翻转、valid/full 输出、padding 和 stride?
这题考的是能否先把卷积约定说清楚再写代码:深度学习里的 Conv1D 通常实际做 cross-correlation 不翻转 kernel;数学卷积会翻转 kernel;valid/full、padding 和 stride 会直接改变输出长度和数值。
多模态图像分支使用最大池化时,反向传播的梯度如何分配,工程实现需要注意哪些边界?
这题考最大池化的反向传播机制:输出梯度只回传给前向窗口中的最大值位置,非最大位置梯度为 0;工程上还要处理重叠窗口、并列最大值、padding、mask 记录和数值边界。
AIGC 画本产品如何保证角色、风格和场景一致性,ComfyUI 工作流、参考图、种子、ControlNet 和后处理分别起什么作用?
这题考 AIGC 产品经理是否理解图像生成一致性不是单靠提示词,而是由角色设定、参考资产、工作流编排、可控生成、种子复现、后处理和质量评估共同保证。
连接视觉编码器和 LLM 时,Q-Former 与 LLaVA MLP Adaptor 各有什么优缺点,如何选择?
这题考多模态大模型里视觉特征到语言模型 token 空间的连接器设计。好的回答要说明二者都在解决维度对齐、语义对齐、信息压缩和训练稳定性问题,但 Q-Former 更像带可学习查询的语义压缩器,MLP projector 更像简单直接的视觉 token 映射器,选择取决于数据规模、视觉细节需求、上下文预算、延迟和冻结策略。
视觉 Transformer 处理非均匀采样 3D 点云时,Patch Embedding 应如何改进?
这题考的是把 2D ViT 的 Patch Embedding 思路迁移到 3D 点云时,如何处理点云无序、非均匀密度、局部几何和变长邻域。好的回答不能只说把点云分块后送 Transformer,而要讲清采样中心、邻域构造、密度归一、局部聚合、3D 位置编码和多尺度鲁棒性。
多模态模型中跨模态注意力机制如何设计,如何举例说明不同模态 token 的对齐和融合?
这题考多模态 Transformer 中跨模态注意力的设计能力。好的回答要讲清楚不同模态 token 如何产生、如何注入位置和类型信息、如何做 cross-attention 或 co-attention、如何处理长度差异和噪声、如何训练对齐,并用图文例子说明文字 token 通过 query 关注图像 patch 或 object token,从而把语义、空间位置和细粒度属性融合起来。
文生图模型的核心框架如何设计,文本编码器、生成主干和图像解码器如何协同?
这题考文生图模型的整体框架理解。好的回答要讲清楚文本编码器把 prompt 变成条件表示,生成主干通常在像素或 latent 空间逐步生成图像,图像解码器把 latent 还原为像素;同时要说明 cross-attention、扩散噪声预测、时间步条件、classifier-free guidance、VAE 编解码、训练损失和推理采样如何协同。
图纸类视觉内容没有文本描述时,如何依托视觉特征、多模态 Embedding 和向量检索实现精准召回?
这题考无文本图纸检索系统设计:要能从图纸预处理、视觉和多模态 embedding、向量索引、混合召回、重排、评估和工程更新链路讲清楚如何提高精准召回。
CV 任务中的注意力机制有哪些应用,通道注意力、空间注意力和自注意力分别解决什么问题?
这题考的是对视觉注意力的结构化理解:注意力不是一个单一模块,而是从通道、空间、像素/patch 关系、跨尺度和跨模态等角度重新分配特征权重。好的回答要能区分通道注意力解决“看哪些语义特征”、空间注意力解决“关注哪些空间位置”、自注意力解决“建模长距离关系”,并结合分类、检测、分割、ReID、视频和 OCR 讲应用与代价。
ReID 训练采样时如何保证每个身份的图像数一致,为什么这种 P-K 采样有利于度量学习?
这题考的是 ReID 训练中 batch 构造和度量学习损失的关系。P-K 采样不是简单凑 batch,而是每个 batch 选 P 个身份、每个身份取 K 张图,保证 anchor 有正样本、batch 内有足够负身份,并让 triplet、contrastive、circle、batch-hard 等损失能够稳定挖掘正负样本,同时缓解身份样本数不均衡带来的训练偏置。
目标检测任务的损失函数如何设计,分类、框回归、IoU 和样本匹配各解决什么问题?
目标检测损失不是把分类和框坐标简单相加,而是在解决四类不同问题:哪些位置有目标、目标属于什么类别、预测框和真实框如何几何对齐、哪些候选样本应该接受哪一个真实框监督。好的回答要先拆检测头输出,再解释分类损失、回归损失、IoU 类损失和样本匹配之间的依赖关系,最后讨论正负样本不平衡、损失权重、匹配策略变化对收敛和 AP 的影响。
图像滤波如何通过卷积实现,如何从频域理解低频平滑和高频边缘信息?
图像滤波可以从空间域和频域两条线理解:空间域里,卷积核在局部邻域加权求和,改变每个像素与周围像素的关系;频域里,卷积等价于频谱相乘,滤波器是在保留或抑制不同频率成分。低频通常对应缓慢变化的亮度和大块结构,低通滤波会平滑噪声和细节;高频通常对应边缘、纹理和突变,高通或梯度滤波会强化轮廓但也可能放大噪声。
高斯卷积核如何用可分离卷积等方式优化,时间复杂度和效果会怎样变化?
高斯卷积核优化的核心是利用数学结构和硬件特性减少重复计算。二维高斯核可分解为横向一维高斯和纵向一维高斯的外积,因此一次 K×K 卷积可以改成两次长度 K 的一维卷积,理论复杂度从每像素 O(K²) 降到 O(2K),效果在同一离散核和边界策略下基本等价。进一步还可以通过截断半径、缓存、SIMD、定点化、近似盒滤波或递归滤波继续提速,但要说明精度、边缘和伪影取舍。
积分图如何实现均值滤波,为什么能把窗口求和从面积相关降到常数时间?
积分图用于均值滤波的关键是把每个像素左上方矩形区域的累计和预先存起来。这样任意轴对齐窗口的像素和都可以由四个角的积分值相加相减得到,不再需要逐个遍历窗口内所有像素。对半径为 r 的均值滤波,朴素方法每个像素要累加 (2r+1)² 个值,而积分图在预处理 O(HW) 后,每个窗口求和只需常数次读取和加减,再除以窗口面积即可得到均值。
文本搜图场景如何设计图片搜索系统,让用户搜“小狗”时能召回包含小狗的图片?
文本搜图系统要让用户输入“小狗”时召回包含小狗的图片,核心不是只按文件名搜索,而是建立图片内容理解、文本语义表示、索引召回和排序评估的完整链路。图片侧需要离线或实时提取对象标签、检测框、caption、OCR、视觉向量和多模态向量;查询侧需要把文本解析成语义向量和关键词;召回侧结合倒排索引、向量检索和元数据过滤;排序侧再按语义匹配、对象置信度、图片质量和用户意图重排。
图像融合算法怎么实现?像素级、特征级和决策级融合分别适合什么场景?
这题考的是对图像融合任务的完整建模能力:不仅要说把多张图加权平均,还要能区分像素级、特征级和决策级融合在信息粒度、配准要求、鲁棒性、可解释性、计算代价和适用场景上的差异,并给出可落地的实现、评估和故障排查思路。
BEVDet 这类纯视觉 BEV 感知算法如何通过 View Transformer 把图像特征转换到 BEV 空间?
这道题考察纯视觉 BEV 感知中从多相机图像特征到鸟瞰图特征的几何建模能力。好答案要讲清 BEVDet 的三段式链路:Image-view Encoder 提取每个相机的 2D 特征,View Transformer 结合深度分布、相机内外参和数据增强矩阵,把像素特征 lift 到三维 frustum,再 splat 或 pooling 到 ego 坐标系下的 BEV 网格,最后 BEV Encoder 在鸟瞰空间做融合和检测。回答边界应覆盖深度离散、特征加权、标定误差、分辨率取舍、遮挡和验证指标,不能把 View Transformer 误讲成普通 NLP Transformer。
FCOS 作为 anchor-free 目标检测算法,整体流程和正负样本分配如何设计?
这题考的是候选人是否真正理解 anchor-free 检测从“预设框匹配”切换到“特征图位置预测”的建模方式。好答案不能只说 FCOS 不用 anchor,而要讲清 backbone 与 FPN 生成多尺度特征、每个位置预测类别和到框四边距离、正负样本如何由位置落入目标中心区域和尺度范围决定、重叠目标如何消歧、centerness 如何压低低质量框,以及训练损失和推理 NMS 的完整闭环。边界是以公开 FCOS 机制为准,不把其它 anchor-free 方法的关键点检测或 Transformer 查询机制混进来。
卷积层为什么能抽取图像特征,如何从局部连接、权重共享、感受野、平移等变性和多层组合解释?
卷积层能抽取图像特征,核心在于用局部连接和权重共享把同一个模式检测器滑过整张图,再通过多通道卷积、非线性、多层感受野扩张和下采样,把边缘、纹理、部件逐步组合成更高层语义特征。
1x1 卷积核在 CNN 中有什么作用?
这道题考察 CNN 中 1x1 卷积的真实作用。它不是用来扩大空间感受野,而是在每个空间位置上做通道维度的线性组合,常用于通道融合、升降维、减少计算量、构造瓶颈层,以及在合适网络结构中增强表达效率。
超分辨率模型中,上采样层放在网络前面还是后面,各自有什么速度、显存和效果取舍?
这题考超分辨率网络中上采样位置的架构取舍。高质量回答要对比 SRCNN 式前置上采样和 FSRCNN/ESPCN 式后置上采样,讲清计算量、显存、速度、感受野、重建质量、尺度适配和棋盘伪影,并说明 sub-pixel、transpose convolution、resize-conv 等方案差异。
MODNet 这类弱监督图像分割/抠图方法的主要流程是什么,如何利用类别相关背景信息?
这道题考察的是候选人对弱监督视觉分割或抠图流程的理解,而不是要求复述某家公司内部论文实现。可以把 MODNet 这类方法理解为:在缺少像素级精标注时,利用图像级标签、类别激活、伪掩码、背景先验和一致性约束,逐步训练出能区分前景对象、相关背景和无关背景的分割模型。类别相关背景信息的价值在于,弱监督方法容易把与目标共现的背景误当成前景,例如车和道路、船和水面、人物和舞台;如果能显式挖掘类别相关背景并在训练中建模,就能减少前景扩张和背景误分。回答要覆盖弱标签来源、伪标签生成、背景类挖掘、模型训练、噪声控制、迭代优化和评估指标,同时避免声称任何未公开的公司细节。
如果 CLIP 主要学到全局图文对齐,如何优化它以提取更细粒度的视觉特征?
这道题考察对 CLIP 全局对比学习局限和细粒度视觉表征优化的理解。好的回答要从数据标注、区域/patch 对齐、损失设计、模型结构和评估任务多个层面改造。
在小目标检测且数据量较小的场景下,如何用深度学习方案改造传统检测流程,并围绕 Faster R-CNN、多尺度特征和数据增强提升效果?
这道题考察小目标检测和小样本场景的方案设计。回答要覆盖传统流程改造、Faster R-CNN 选型、多尺度特征、数据增强、迁移学习、样本不均衡和评估误差分析。
视觉感知多任务网络(如检测、分割、车道线、关键点等)如何处理任务间和类别间数据不平衡,并说明网络结构、数据加载、损失权重和评估策略?
这道题考察感知多任务网络在任务间和类别间不平衡时的系统治理。回答要覆盖共享骨干、多任务头、采样、损失权重、梯度冲突和分任务评估。
OCR 检测阶段遇到相邻或重叠文字时,如何分离文字区域,并与识别和后处理链路联动?
这道题考察 OCR 检测阶段对相邻或重叠文字的实例分离能力。好的回答要从检测表示、后处理、识别反馈和业务规则联动,而不是只说调阈值。
已有数字人视频生成模型如何定向训练为只生成指定人物,并设计身份一致性数据、参考图注入、训练约束和评估指标?
这题考数字人视频生成的定向个性化训练方案。重点要覆盖指定人物数据集、参考图像注入、微调策略、身份约束、时序一致性、安全合规和评估指标。好的回答会说明如何让模型只生成目标人物,同时避免过拟合、身份漂移、动作僵硬和未经授权的人脸生成风险。
统一生成理解多模态模型做下游微调时,如何为分类、VQA、OCR、定位和生成任务设计统一样本格式,同时保留各任务的专属监督,并控制混训比例、数据质量和能力退化风险?
这题考统一生成理解模型的下游微调数据设计。回答要讲任务格式统一、数据混合、采样比例、模态对齐、质量控制和评测。
多模态大模型如何支持动态分辨率输入,位置编码应如何设计以兼顾长宽比、局部细节和视觉 token 成本?
这题考 VLM 视觉输入工程。回答要讲动态分辨率切分、视觉 token 预算、位置编码、长宽比保留、局部细节和训练推理一致性。