标签题目
性能测试相关面试题
如何保障服务稳定性?
这题考服务稳定性体系化思维,回答要从目标、风险预防、运行时止损、恢复复盘四层展开,而不是只背限流熔断。
怎么查看OS的负载?
查看 OS 负载不能只报一个命令,要说明 Linux load average 的含义、采集入口、判断标准和定位路径。核心是先用 uptime、top、w 或 /proc/loadavg 看 1/5/15 分钟平均负载,再结合 CPU 核数、运行队列、不可中断任务、IO 等待、上下文切换和进程级指标判断是 CPU 饱和、IO 阻塞还是调度压力。
内存泄漏如何定位和排查?
内存泄漏如何定位和排查?这道腾讯牛客题的关键是围绕“内存泄漏定位与排查”讲清概念、机制、取舍和边界。内存泄漏排查要先确认是进程常驻内存持续增长、堆对象无法释放,还是缓存、连接、文件句柄等资源增长。Java 场景重点看堆转储、GC Roots 和对象引用链;C/C++ 场景还要看 malloc/new 未释放和越界破坏。
Linux中,如何查询系统负载情况?
Linux中,如何查询系统负载情况?这道腾讯牛客题的关键是围绕“Linux 系统负载查询”讲清概念、机制、取舍和边界。Linux 查询系统负载常用 uptime、top、w 或 cat /proc/loadavg。load average 的 1/5/15 分钟值表示一段时间内处于可运行 R 或不可中断睡眠 D 状态的任务平均数。
压测过程中关注哪些核心指标?
压测过程中关注哪些核心指标?这道腾讯牛客题的关键是围绕“压测核心指标”讲清概念、机制、取舍和边界。压测要关注吞吐、延迟、错误率、资源利用率、饱和点和稳定性。核心指标包括 QPS/TPS、P50/P95/P99、超时率、错误码、CPU、内存、GC、磁盘 I/O、网络、连接池、队列长度和依赖服务耗时。
LLM 服务在 500 并发下如何把 TTFT P99 从 3s 优化到 1.5s?
这题考高并发 LLM 服务的首 token 长尾优化,回答要先建立可观测性,再从排队、调度、prefill/decode、批处理、KV 缓存、prompt 长度、容量和流式链路逐层处理。
LLM 多卡并行推理中,显存占用和通信开销如何影响吞吐与延迟?
这题考 LLM 多卡并行推理的性能瓶颈,回答重点是权重显存、KV Cache、prefill/decode 差异、并行切分通信、批处理调度和长尾延迟。
当 MoE 专家数量增至上千时,如何优化路由决策延迟?
这题考 MoE 专家规模扩大后的路由扩展性,回答要把 router 计算、top-k 选择、候选专家缩小、设备映射和 dispatch 准备放在一条低延迟链路里分析。
LLM 推理算子中,Tensor Core、WMMA 和 MMA 分别是什么,工程上如何选择使用层级?
这题考候选人是否理解 NVIDIA GPU 矩阵乘加的硬件、CUDA C++ 抽象和更底层指令接口。回答要能说明 Tensor Core 是硬件单元,WMMA 是较高层 CUDA API,MMA 是更贴近指令和 PTX 的矩阵乘加操作。
抖音上下滑动视频流如何设计测试用例,覆盖加载、预取、播放状态、手势和弱网?
这题考短视频信息流的综合测试设计。回答要覆盖数据加载和预取、播放器状态切换、手势识别、缓存与资源回收、弱网和性能指标,并给出可观测断言,例如当前 item、播放事件、首帧时间、曝光、卡顿和内存。
AI 平台接口上线前,如何验证模型降级、Prompt 版本追踪、配置回滚和缓存一致性?
这题考 AI 平台接口的上线准备,不是普通接口冒烟测试,而是围绕模型降级、Prompt 可追踪、配置回滚、缓存一致性、灰度观测和事故演练建立发布门禁。
音频模型从 QAT 量化感知训练到板端部署的完整流程是什么,遇到算子不支持、精度回退或性能不达标时如何排查?
这题考的是能否把 QAT 从训练技巧讲成完整工程闭环:先确定板端约束和浮点基线,再做 fake quant 训练、图转换、算子适配、板端对齐、精度回归和性能功耗压测。
TensorRT-LLM(TRT-LLM)和 vLLM 在 LLM 推理部署中有什么区别,TRT-LLM 主要靠哪些机制加速?
这题考 LLM 推理部署中的系统取舍。好的回答要把 vLLM 和 TensorRT-LLM 区分为不同工程侧重点:vLLM 更像面向在线服务的通用推理引擎和调度系统,强调 PagedAttention、连续批处理、OpenAI 兼容服务和模型接入灵活性;TensorRT-LLM 更贴近 NVIDIA GPU 上的编译优化与高性能运行时,强调 TensorRT engine、算子融合、专用 kernel、量化、KV cache、in-flight batching 和多 GPU 通信优化。不能简单说谁一定更快,要看模型、硬件、batch、延迟目标和工程成本。
LLM 推理引擎中 GPU 内存管理机制应如何设计,如何管理 KV Cache、显存碎片、并发 batch 和 OOM 降级?
这题考的是推理引擎的显存资源治理能力:不能只会调用 CUDA malloc,而要能把 KV Cache、临时 workspace、权重、并发请求、碎片控制和 OOM 降级统一成可预测、可观测、可调度的内存系统。
大模型推理时出现 OOM,如何从 batch、输入长度、KV Cache、临时张量峰值和算子实现排查?
这题考推理 OOM 的系统化排障能力:要能把显存占用拆成权重、KV Cache、prefill 临时峰值、decode 并发、算子 workspace 和碎片,并用可复现实验逐步定位,而不是一句降低 batch size。
生产中的 AI 服务如何保障全天稳定运行,覆盖资源、限流、降级、监控和模型依赖治理?
这道题考 AI 服务稳定性治理。好答案要覆盖容量、GPU/模型资源、流量控制、依赖失败、降级策略、监控告警、灰度发布和故障演练。
如何评价并落地 AI 辅助开发:它能提升哪些开发环节,开发者仍必须承担哪些工程责任?
这道题考候选人对 AI 编程工具的工程判断。好答案要说明 AI 能提升需求拆解、代码阅读、样板代码、测试、排错和文档效率,也要明确架构决策、正确性、安全、隐私、性能、代码审查和最终交付责任仍在开发者。
同题还出现在 1 个公司岗位
投机解码如何通过 draft model 和 target model 的接受/拒绝机制降低大模型推理延迟?服务化落地时如何评估吞吐、首 token 延迟、接受率、显存和成本收益?
这道题考察投机解码原理与服务化评估。回答要讲清 draft model 先生成多个 token,target model 并行验证接受/拒绝,并用接受率、吞吐、TTFT、显存和成本衡量收益。
客服 Agent 从通用 Agent 拆成 Expert Agent 后,如何设计 A/B 测试与指标归因,判断提升来自路由、Prompt 还是 Workflow,并监控是否引入泛化损失?
这题考架构改造后的实验归因能力。回答要说明如何设计 A/B 测试、拆指标、定位 Expert Agent 带来的收益,同时监控幻觉下降和泛化性损失。
235B MoE 模型每 token 只激活约千分之三参数时,如何估算推理 FLOPs、显存占用、KV Cache 和吞吐瓶颈?
这题考 MoE 推理部署估算。回答要区分总参数、每 token 激活参数、权重存储、专家 FLOPs、KV Cache、专家并行通信,以及 prefill 和 decode 阶段的不同瓶颈。