Skip to content

面试题型分类

真实面试不一定按章节顺序提问,可以按题型进行专项训练。

题型入口
概念辨析题概念辨析题
场景判断题场景判断题
方案取舍题方案取舍题
容量估算题容量估算题
连环追问题连环追问题
开放问答题开放问答题
踩坑排查题踩坑排查题

学习清单与详细参考答案

  • 我能按题型切换回答方式,而不是把每题都答成概念解释吗?

    **参考答案:**概念辨析先讲边界和错用后果,场景判断先问约束再选规则/工具/RAG/Agent,方案取舍要说质量、成本、延迟和安全,连环追问要一路落到接口、状态、失败和指标,踩坑排查则按输入、检索、模型、工具、状态和权限逐层定位。

  • 我能用一个具体场景练完五层追问吗?

    **参考答案:**以“企业客服查订单并申请退款”为例,先说是否需要 Agent,再讲订单查询和退款工具、身份权限、确认和幂等;追问时补充超时未知状态、转人工、审计、P95 与成本。这样答案从业务目标走到工程约束,而不是只报框架名称。

容量估算题的迁移清单

  • 我能从日活、请求次数和活跃时段推导平均 QPS 与峰值 QPS 吗?

    **参考答案:**先用日请求数除以 86,400 得到全天平均 QPS,再按活跃时段占比和短时峰值系数计算峰值,并标明哪些数字来自业务假设、历史观测或压测。平均值不能直接当生产容量。

  • 我能拆出一次 LLM 请求的完整 Token 和成本账本吗?

    **参考答案:**把系统提示、工具定义、历史消息、用户问题、RAG 上下文、输出、推理 token、缓存和重试分开统计,再加入 embedding、rerank、搜索、工具、GPU/API 费用,并记录模型、价格版本和租户。

  • 我能解释 GPU 容量为什么不能只看参数量吗?

    **参考答案:**权重只是显存的一部分,还要容纳激活、KV Cache、通信和框架开销;KV Cache 随序列长度和并发增长,Prefill 与 Decode 的瓶颈也不同。最终机器数要用目标 P95 下的稳定吞吐压测,并留 N+1 余量。

  • 我能估算 RAG 向量库容量吗?

    **参考答案:**从有效文本量和 chunk 大小估算 chunk 数,再计算向量原始大小,加入 ANN/倒排索引、metadata、ACL、副本、版本和备份;原文与冷热历史通常放对象存储或分层存储。

  • 我能说明 P50、P95、P99 在容量规划里的不同用途吗?

    **参考答案:**P50 表示典型体验,P95 常用于用户 SLO,P99 暴露少量严重长尾。要从 trace 拆开排队、检索、rerank、TTFT、生成和工具等待,在峰值与故障场景下验收,而不是只看平均值。

  • GPU 不足或 API 限额下降时,我能给出有边界的降级方案吗?

    **参考答案:**先限流并保护关键租户,关闭非必要 rewrite、multi-query、rerank,把批处理转异步,使用已评估的小模型或稳定缓存;超过容量要快速失败并说明重试时间。权限、引用、人工确认和高风险写操作不能被降级绕过。

  • 我能把 ASR/TTS 容量从文本 QPS 换算到音频时长和实时流吗?

    **参考答案:**离线 ASR 看音频总分钟数和完成窗口,实时 ASR 看并发流数和实时率;TTS 还要看文本量、首音频延迟、播放并发、转码、出口带宽和录音保留策略。

  • 我能用敏感性分析决定下一步该压测什么吗?

    **参考答案:**改变 token 长度、峰值系数、Agent 调用放大、缓存命中率、单实例吞吐、索引膨胀率和队列速率的上下界,观察 GPU、成本、存储和 P99 变化,优先压测影响最大且最不确定的变量。

持续学习,持续实践。