标签题目
质量工程相关面试题
如何验证XML文件的正确性?
验证 XML 文件的正确性不能只理解为“能被解析器打开”。完整答案应分层判断:先检查 XML 是否满足 well-formed 语法约束,再根据 DTD、XSD 或其他 schema 验证结构和数据类型,随后确认编码、命名空间、业务规则和安全解析策略,最后通过覆盖性测试样例和明确的错误定位机制保证问题可复现、可修复。
自动化测试流程和工具底层原理是什么?
自动化测试不是把手工步骤录制成脚本,而是围绕需求风险、用例分层、框架能力、工具协议、稳定性治理和持续集成建立一套可重复验证体系。工具底层通常通过浏览器调试协议、WebDriver 协议、移动端自动化驱动或操作系统辅助能力来发现元素、计算可操作状态、注入事件、采集结果并回传执行状态。
大模型输出准确度测试应该覆盖哪些测试点和评估口径?
这题考测试开发视角下的大模型输出准确度测试,答案要覆盖测试 oracle、评测集、规则断言、人工标注、LLM-as-judge 校准、回归测试和非确定性处理。
AI 用例分析工具调用大模型时,如何选择模型并评估识别准确率?
这题考测试开发场景下 LLM 用例分析工具的模型选择和准确率评估,答案要覆盖任务定义、模型取舍、标注基准、识别指标、阈值和错误分析。
医疗手写表格场景中,如何提升多模态模型对字段和值的识别准确度?
这题考医疗手写表格的多模态识别链路,重点是图像预处理、版面检测、字段和值配对、领域词表、人机校正和字段级评估。
抖音点赞功能如何设计测试用例,并在弱网、重试和状态一致性下验证结果?
这题考测试开发能否把一个看似简单的点赞按钮拆成状态机、一致性、弱网、并发和观测问题。好的答案要覆盖正常路径、边界路径、异常网络、重复操作、最终状态校验、自动化与监控,而不是只列点击前后图标变化。
Selenium WebDriver 的工作原理是什么,自动化脚本如何通过 WebDriver 协议驱动浏览器并定位元素?
这题考测试开发对 Selenium WebDriver 的机制理解。高质量回答要说明客户端脚本、WebDriver 协议、浏览器驱动、浏览器会话、元素引用、定位器、交互命令和等待同步之间的关系,并指出 Selenium 能做什么、不能保证什么。
有一个状态机模型时,如何设计状态、转移、异常路径和覆盖率测试?
这题考状态机测试的建模能力。高质量答案要先把状态机拆成状态、事件、转移、守卫条件和动作,再说明如何覆盖正常路径、非法转移、异常恢复、并发和持久化一致性,最后用覆盖矩阵和运行证据证明测试有效。
热搜应展示 10 条但页面只展示 9 条时,测试开发应如何定位前端、接口、排序和过滤链路问题?
这题考端到端定位能力。答案不能停留在“前端或后端都有可能”,而要说明如何固定复现条件,逐层核对接口响应、过滤去重、排序补位、客户端解析、渲染和日志,最终把缺失的一条定位到具体链路和可验证证据。
视频播放页面播放不出来时,如何从资源、播放器、网络、权限和兼容性角度设计排查测试?
这题考媒体播放链路的排查能力。答案要从资源是否可访问、媒体格式是否支持、播放器生命周期是否正确、网络和缓存是否异常、权限和设备策略是否阻断几层逐步定位,并说明每层可采集的断言和回归用例。
微信转账功能如何设计安全测试用例,并验证转账过程中密码不泄露?
这题考安全测试深度。答案要从转账资产和威胁模型出发,覆盖认证、授权、参数完整性、支付密码保护、传输存储脱敏、重放幂等、风控和审计,并说明如何用抓包、日志扫描、测试桩和服务端审计证明密码没有泄露。
抖音上下滑动视频流如何设计测试用例,覆盖加载、预取、播放状态、手势和弱网?
这题考短视频信息流的综合测试设计。回答要覆盖数据加载和预取、播放器状态切换、手势识别、缓存与资源回收、弱网和性能指标,并给出可观测断言,例如当前 item、播放事件、首帧时间、曝光、卡顿和内存。
使用 AI 编程时,如果模型生成了严重错误代码,应如何定位、修复并建立工程防护?
这题考 AI Coding 不是只会提高效率,还要能处理模型误生成带来的工程事故。高质量回答应从复现、定位、最小修复、测试补齐、流程护栏和团队经验沉淀展开。
AI 生成代码进入工程仓库前,如何用沙箱分支、最小改动范围、测试和 review 防止污染主分支?
这题考 AI 生成代码的分支治理和合入门禁。优秀回答要把主分支保护、沙箱隔离、diff 范围、自动化检查、人工 review、回滚审计串成一条工程流程。
Agent 的 think-execute 循环如何控制规划路径,避免偏离业务预期或无限循环?
这题考 Agent 循环规划的可控性,重点是说明为什么需要 think-execute,以及如何用目标约束、状态机、校验器、评估器、停止条件和测试回放确保路径不跑偏。
同题还出现在 1 个公司岗位
RAG 外部知识库分片过大时,如何重新切分、保留语义边界并控制召回噪声?
这题考 RAG 知识库切分的工程细节,重点是说明分片过大会稀释 embedding、挤占上下文、引入噪声,并给出递归切分、层级索引、元数据继承、召回重排和回归评测方案。
同题还出现在 1 个公司岗位
AI 标注数据质量不稳定且标注团队不认可评估标准时,产品经理如何对齐口径并推动改进?
这题不是普通职场沟通题,而是 AI 数据质量治理题;核心是用明确 rubric、样本证据、一致性指标、校准机制和改进闭环化解标准争议。
Agent 微调中如何选择和清洗训练样本,哪些样本质量问题最容易改变模型行为?
这题考 Agent 微调数据的样本选择与清洗能力。与普通 SFT 不同,Agent 样本不仅有问答文本,还包含意图、计划、工具选择、参数、工具结果、状态变化、安全边界和最终回复。回答要说明哪些样本值得训练、哪些噪声会改变模型行为,以及如何用指标验证。
同题还出现在 1 个公司岗位
从用户行为日志抽取 Agent 训练对话时,如何做归一化和事件抽象?
这题考从用户行为日志构造 Agent 训练对话的能力。关键不是把日志拼成聊天记录,而是做会话切分、事件抽象、状态归一、隐私脱敏、目标推断、轨迹标注和质量过滤,让低层行为事件变成可训练、可审计、可评估的 Agent 对话样本。
Qwen 这类大模型做多语言支持时,数据配比、分词、对齐训练和评估应如何设计?
Qwen 这类大模型做多语言支持时,设计重点不是简单增加几种语言语料,而是要在数据配比、tokenizer 覆盖、跨语言指令对齐、偏好训练、安全策略和评估体系之间做平衡。高资源语言提供通用能力和知识密度,低资源语言需要通过采样温度、质量过滤、合成数据和翻译增强避免被淹没;tokenizer 要兼顾不同文字系统的压缩率和 byte fallback;对齐训练要避免只对中文或英文有效;评估也要覆盖语言质量、任务能力、文化语境、安全和 code-switch 等真实场景。
RAG 中如何评估 Rerank 的有效性,应该看哪些离线指标和线上指标?
这题考的是候选人能否把 rerank 评估从“看排序模型分数高不高”讲成完整闭环:离线看相关性排序和证据覆盖,线上看答案质量、用户行为、延迟成本和系统稳定性,并注意 rerank 可能改善排序但损害整体 RAG 体验。
Agent 工具调用失败后,如何通过 trace 定位是意图识别、工具选择、参数生成还是工具服务本身的问题?
这题考的是 Agent 工具调用失败后的分层定位能力。好的回答不能只说看日志,而要把一次请求拆成意图识别、工具检索与选择、参数生成、执行前校验、工具服务调用、结果解释几个 span,并让每一层都有输入、输出、置信度、候选集、错误码、耗时和重试信息。定位时先判断用户意图是否被理解错,再看工具候选和最终选择是否合理,然后检查参数 schema、枚举、时间范围、权限上下文等是否正确,最后才归因到工具服务的网络、鉴权、超时、限流或业务错误。
Agent 系统可观测性平台应记录哪些 trace,LangSmith 和 Langfuse 如何用于调试与评估?
这题考 Agent 可观测平台该记录什么,以及如何把 trace 用于调试和评估。好的回答要覆盖请求级 trace、LLM 调用、工具调用、检索、记忆、planner、guardrail、人工反馈、成本延迟和评测结果,并说明 LangSmith 与 Langfuse 都可以承载调试和评估闭环,但选型应基于技术栈、部署合规、数据治理、评测流程、成本和集成方式,而不是简单说谁更强。
模型做 W4A8 量化或模型迁移后,如何验证激活值、梯度和权重是否正确,并用校准数据控制误差?
这题考量化和迁移后的数值正确性验证:要能从权重映射、激活分布、梯度流、逐层误差、校准集覆盖和端到端指标几层建立质量闭环,而不是只跑一遍精度评测。
RAG 什么时候只用静态知识库,什么时候需要接入动态网页检索?
这道题考察 RAG 检索源选择和系统边界设计。回答要说明静态知识库适合权威、可治理、更新频率低或组织受控知识,优势是稳定、可审计、低延迟、低风险;动态网页检索适合新闻、政策、价格、版本、故障状态、市场信息等变化快且静态库无法覆盖的问题,优势是新鲜度和覆盖面。高质量回答应给出 query 路由、混合检索、来源可信度、成本延迟、安全合规、冲突处理、引用和评估方案,而不是简单说“静态不够就联网”。
在现有 LangGraph Agent 上新增功能时,如何设计节点、边、state schema、工具注册和回归测试?
这题考的是把 Agent 功能扩展做成可维护的状态机工程,而不是在一个大 prompt 或一个大节点里继续堆逻辑。高质量回答应说明如何先界定新功能的触发条件和输出契约,再决定是否新增节点、边、state 字段和工具,并用可回放测试证明新增路径没有破坏原有 Agent 行为。
Agent 项目中的 harness engineering 是什么,如何支撑工具模拟、回放、评测、回归和线上前验证?
这题考的是 Agent 工程里的验证基础设施意识。harness engineering 不是写几个单测,而是为不稳定的模型输出、外部工具、副作用和多轮状态机建立可控运行环境,让开发者能模拟工具、回放真实轨迹、做离线评测、跑回归并在上线前发现风险。
内容安全类 Agent 需求如何从“万能问答”拆成可评测的原子能力、输入输出契约和停止条件?
这题考的是把模糊的内容安全 Agent 需求工程化。不能把它做成什么都能问、什么都回答的聊天助手,而要拆成可独立评测的能力单元,例如分类、证据抽取、规则匹配、风险解释、处置建议和人工复核触发,并为每个能力定义输入、输出、置信度和停止条件。
LLM 预训练数据清洗中,如何结合质量模型、PPL、去重和领域规则过滤更适合模型学习的数据?
这题考的是预训练数据治理的系统性判断:不能只说按 PPL 阈值删除,也不能只依赖一个质量分类器,而要把数据规范化、质量打分、PPL 异常检测、重复样本压制、领域规则、分布保留和下游验证串成闭环,目标是在降低噪声和污染的同时保留对模型能力真正有贡献的多样知识。
LLM 预训练或 SFT 的数据配比如何量化评估?如何用实验、领域切片和评测指标判断一个 mixture 是否更好?
这题考的是把数据配比从经验拍脑袋变成可实验、可度量、可解释的优化问题。好的回答应覆盖目标能力定义、候选 mixture 设计、token 级采样权重、短程代理实验、领域切片评测、统计显著性、负迁移排查和 Pareto 取舍,而不是只说多放高质量数据或按业务重要性调比例。
Agent 的 self-refine 自我修正如何处理 API 返回字段缺失、冗余或结构不符合预期?
这道题考察 Agent 自我修正是否能和工程化 API 契约治理结合起来。好答案不能把 self-refine 说成让模型再想一遍,而要说明先用确定性 schema 校验发现字段缺失、冗余字段、类型错误和结构不匹配,再根据错误类型决定丢弃、补默认值、结构化转换、重调 API、降级或交给模型生成修复计划。边界是不能让模型凭空编造缺失事实;所有修复都要可追溯、有限重试、重新校验,并用错误率、修复成功率和幻觉字段率验证效果。
如何评价并落地 AI 辅助开发:它能提升哪些开发环节,开发者仍必须承担哪些工程责任?
这道题考候选人对 AI 编程工具的工程判断。好答案要说明 AI 能提升需求拆解、代码阅读、样板代码、测试、排错和文档效率,也要明确架构决策、正确性、安全、隐私、性能、代码审查和最终交付责任仍在开发者。
同题还出现在 1 个公司岗位
大模型反欺诈项目从开发、测试到部署应如何设计流程,Agent 框架选型需要关注哪些工程约束?
这题考大模型反欺诈项目的端到端工程化能力,不是只问“用了哪个 Agent 框架”。高质量回答要从业务边界、数据合规、Agent 工具链、离线评测、测试门禁、灰度部署、监控回流和框架选型约束讲清楚,体现反欺诈场景对准确性、可解释性、安全和稳定性的要求。
教育 AI 产品项目如何设计效果测试和评估标准,并与研发、算法、教研团队协作推动落地?
这道题考察 AI 产品经理如何设计效果评估并推动算法、研发协作落地。好的回答要把业务目标、模型指标、用户体验、测试集、灰度和跨团队机制串起来。
Agent 或 LLM 应用的评估数据集规模如何确定,bad case 应按任务类型、工具链路、检索、生成、成本和风险哪些维度分析?
这题考察 Agent 或 LLM 应用评估体系。数据集规模不应拍脑袋,而要按任务复杂度、风险等级、链路覆盖、指标置信度和迭代阶段确定;bad case 分析要覆盖任务类型、工具调用、检索、生成、成本和风险。
AI Agent 遇到上下文污染、任务过长或工具结果不可靠时,如何用上下文裁剪、状态机拆分和工具链治理提升稳定性?
这题考 Agent 稳定性治理。关键是把上下文污染、长任务失控和工具不可靠拆开处理:上下文裁剪保证输入干净,状态机拆分保证任务可控,工具链治理保证外部结果可验证,再用 trace、回放、评测和恢复策略形成生产闭环。
构建复杂 LLM Agent 时最主要的挑战是什么,如何处理可靠性、规划、工具调用和可观测性?
这题考复杂 Agent 的生产可靠性理解。高质量回答要说明最大的挑战不是“会不会用框架”,而是 LLM 非确定性、规划漂移、工具误调用、上下文污染、循环失控、成本延迟和问题定位困难,并给出工程化治理方案。