Skip to content

面试题库

题库按知识主题组织。建议先看章节总览,再选择自己的薄弱方向逐题练习。

主题入口
大模型基础大模型基础
大模型工程大模型工程
通用工程基础通用工程基础
提示词与工具调用提示词与工具调用
智能体核心智能体核心
数据流追踪与端到端可观测性数据流追踪与端到端可观测性
RAG 数据工程与企业知识库RAG 数据工程与企业知识库
检索增强生成检索增强生成
多模态与实时交互多模态与实时交互
多智能体与框架多智能体与框架
Agent 运行时与长任务Agent 运行时与长任务
工具安全与企业应用工具安全与企业应用
评估与质量闭环评估与质量闭环
评估安全与可观测性评估安全与可观测性

学习清单与详细参考答案

题库文章中的学习检查统一放在这里。先闭卷回答问题,再回到对应文章核对细节;答案中的场景是练习用例,不代表固定业务结论。

大模型基础与工程

  • 我能解释一次回答为什么会被上下文、缓存和采样共同影响吗?

    **参考答案:**输入 token 决定上下文长度和主要输入成本,输出 token 影响生成成本和总延迟;Prompt Cache/KV Cache 只在特定前缀、会话和版本条件下复用,不能当成永久记忆;温度、top-p 等采样参数改变结果稳定性。面对“同一问题今天答案变了”,应同时查模型版本、prompt、检索资料、采样和缓存命中,而不是只怪模型。

  • 我能从模型结构讲到部署容量,而不只背参数量吗?

    **参考答案:**要区分权重显存、激活、KV Cache、通信和框架开销,再看 Prefill/Decode、batch、并发和 P95。一个 70B 模型即使权重能放进机器,也可能因为长上下文和并发导致 KV Cache 爆掉;容量要靠目标负载压测和冗余设计确认。

提示词与工具调用

  • 我能说明模型给出工具参数后,哪几步必须由代码完成吗?

    **参考答案:**代码负责 JSON/schema 校验、业务范围校验、权限、审批、超时、幂等、执行和结果回传。比如退款工具即使参数格式正确,也要验证订单归属、金额上限和当前状态,不能因为模型说“已退款”就当业务事实成立。

智能体核心

  • 我能区分 tool loop、规划、记忆和任务状态吗?

    **参考答案:**tool loop 是一次请求内的决策—执行循环,规划把复杂目标拆成可执行步骤,记忆管理跨轮上下文,任务状态记录可恢复的业务进度。问“帮我查资料并发邮件”时,规划可以拆成检索和草稿,状态机要保存审批与发送结果,不能把聊天记录当成恢复依据。

RAG 数据工程与检索增强生成

  • 我能把一次企业知识库问答讲成离线链路和在线链路吗?

    **参考答案:**离线链路包含快照、解析、清洗、切分、metadata/ACL、embedding、索引校验与发布;在线链路从服务端身份出发,先做权限过滤,再召回、去重、重排、证据裁剪和引用生成。文档被撤权或删除时,缓存、索引和引用入口都要失效,不能只在答案末尾脱敏。

多模态与实时交互

  • 我能解释“图片能搜到”与“答案可复核”的差别吗?

    **参考答案:**caption 或视觉 embedding 适合候选召回,但可能漏掉小字、坐标和单位;最终答案应回到原图、页面区域、表格单元格或音频时间段,并保存版本和权限。比如财报中的一个数字,即使 OCR 找到,也要能点击回原页核对。

多智能体与框架

  • 我能给出拆分 Agent 的必要条件和代价吗?

    **参考答案:**只有职责清晰、输入输出可独立验收、上下文需要隔离或并行能带来收益时才拆。代价包括协调 token、延迟、状态一致性和冲突;“调研—写作—审校”可以拆,“回答天气”通常不值得拆。

Agent 运行时与长任务

  • 我能处理超时但无法确认外部副作用的状态吗?

    **参考答案:**网络超时不等于下游未执行,任务应进入 UNKNOWN,保留幂等键和供应商 request ID,优先查询、回调或对账;不能盲目重试发邮件、扣款等写操作。确认结果后再进入成功、失败或人工处理。

工具安全与企业应用

  • 我能说明为什么权限、审批和沙箱不能只写在 system prompt 里吗?

    **参考答案:**模型会受上下文污染、提示词注入和参数错误影响,system prompt 不能提供强制隔离。权限要在服务端按用户、租户、资源和动作校验,危险工具要确认/审批,执行放在受限沙箱并留下审计;模型拒绝只是最后一层提示。

评估、质量闭环与可观测性

  • 我能把“效果好”拆成可复现的评估与线上信号吗?

    **参考答案:**离线评估覆盖正常、边界、无答案、冲突、工具失败和安全样本;线上分别看任务成功率、引用支持率、P95/TTFT、成本、重试、转人工和安全事件。每次发布固定模型、Prompt、索引和工具版本,失败轨迹脱敏回流为回归样本。

通用工程基础

  • 我能设计一个不会因异步、缓存或队列而失控的 AI API 吗?

    **参考答案:**阻塞 SDK 放入隔离线程/进程池,入口有 deadline、并发上限和背压;缓存键带租户、版本和权限范围;队列消费者用事件 ID、状态机和动作 ledger 做幂等;SSE 通过事件序号支持重连。客户端断开不自动等于长任务取消。

数据流追踪

  • 我能沿 Gateway → Runtime → Prompt → RAG → Tool → DB → Artifact 解释一条 trace 吗?

    **参考答案:**入口生成 trace_id,长任务用 task_id,模型意图用 tool_call_id,具体副作用用 idempotency_key;每层记录版本、权限、状态、耗时、成本和错误,但敏感原文只保留受控引用。这样才能区分模型慢、检索慢、工具超时和业务动作未知。

通用工程基础的迁移清单

  • 为什么异步代码仍可能把服务拖死?

    **参考答案:**同步 HTTP、文件解析、CPU 计算、阻塞锁和无超时 SDK 都会卡住事件循环;协程数量过多还会耗尽连接、内存和下游配额。要做阻塞调用审计,用线程/进程池隔离,并配合信号量、连接池、deadline 和事件循环延迟指标。

  • 超时后为什么不能直接重试所有 Agent 工具调用?

    **参考答案:**调用方没收到响应不代表下游没执行。查询可以有限重试,发邮件、退款、建工单等副作用必须先用幂等键查询;未知时进入核验或人工队列,重试还要有退避、抖动、次数和总预算。

  • SSE 流式接口最少需要哪些可靠性设计?

    **参考答案:**事件 ID/单调序列、心跳、断线游标、补发接口、终态事件和取消处理是最低要求。短请求断线可取消生成,长任务依靠事件和快照恢复,不能把 HTTP 连接当任务状态。

  • 缓存怎样避免过期数据和跨租户泄露?

    **参考答案:**键包含租户/主体范围、资源过滤、模型或索引版本、配置版本和时效参数;用 TTL、版本切换、事件失效控制陈旧。命中前仍做权限检查,敏感答案默认不跨用户共享。

  • 队列至少一次投递时,消费者如何保证结果正确?

    **参考答案:**以事件 ID、业务版本、唯一约束和状态机做幂等写入;临时错误有限重试,永久错误进可重放的死信队列。跨外部系统的副作用还要有动作 ledger、查询、对账或补偿,队列本身不提供全局恰好一次。

  • 如何区分 liveness、readiness 和 startup?

    **参考答案:**liveness 判断进程是否死锁,失败通常重启;readiness 判断是否接流量,失败则摘流量;startup 给模型加载和缓存预热留时间。探针要轻量有超时,不能把普通下游故障误判成进程死亡。

  • AI 应用的 trace 至少要串起哪些 ID?

    **参考答案:**入口用 trace_id/request_id,长任务用 task_id,模型/工具调用用 span 或 tool_call_id,外部动作再用幂等键;队列与回调传播关联信息,原文按敏感级别脱敏或只存引用。

  • 第一版企业 Agent 为什么要优先做窄工具和可停止?

    **参考答案:**工具越多,选择、权限、校验、评估和副作用组合越复杂。窄工具便于授权、幂等、审计和回归;可停止意味着有 deadline、取消、禁用工具、队列暂停和人工接管。

多模态与实时交互的迁移清单

  • PDF RAG 为什么要保存 page + bbox + document_version

    **参考答案:**页码、区域坐标和版本共同保证用户能复核正确快照;还应保存坐标原点、单位和旋转,并在打开引用时重新授权。

  • OCR 低置信度时系统应该怎么回答?

    **参考答案:**保留原图和置信度,结合版面/表格规则交叉校验;数字、公式和印章无法确认时只引用区域并说明不确定,不能因为进了向量库就当成事实。

  • 表格问题什么时候用结构化查询而不是向量检索?

    **参考答案:**过滤、排序、求和、分组和单位换算应走结构化查询,向量检索负责找到正确表和指标定义。SQL 需经过 AST、列白名单、租户谓词、参数化、成本/行数限制,并带快照和引用。

  • 多模态证据统一模型至少包含什么?

    **参考答案:**证据 ID、模态、内容/结构化载荷、来源 URI/版本、定位器、有效/观察时间、授权决策、解析器/查询版本和质量分数。PDF 用页码与 bbox,音频用时间段,代码用 commit 与行号。

  • 为什么 caption 不能替代图片引用?

    **参考答案:**caption 是派生摘要,可能漏掉小字、颜色、数量和空间关系,也可能幻觉;它只能辅助召回,最终结论要回原图或裁剪区域,并受 ACL 约束。

  • 多模态 RAG 如何防止间接 Prompt Injection?

    **参考答案:**把网页、PDF、图片文字和 OCR 当不可信数据,与系统指令分区;工具最小权限、白名单和参数校验,危险动作要确认;用隐藏文字、恶意 QR、网页注入样本做回归。

  • VAD 的起始阈值、结束阈值和 hangover 分别解决什么问题?

    **参考答案:**起始阈值防噪声误触发,结束阈值判断停说,hangover 保留短尾避免截断;需按噪声、语言和风险评估误触发、漏检和额外等待。

  • interim ASR 结果可以触发工具吗?

    **参考答案:**只能做低风险预取;interim 带 revision,后续修订要取消或过期。金额、账号、地址等最终执行要等稳定文本、实体校验、权限和确认。

  • TTFT、TTFA 和总响应时间有什么区别?

    **参考答案:**TTFT 是首个文本 token,TTFA 是首个可播放音频,包含 TTS 和缓冲;总响应时间是 turn 完成。实时优化要分开看首字、首音频、可理解内容、打断和尾延迟。

  • WebSocket、SSE、WebRTC 各适合什么?

    **参考答案:**SSE 适合服务端事件和进度,WebSocket 适合双向控制与音频帧,WebRTC 适合低延迟媒体。生产上常把 WebRTC 媒体面和 WebSocket/HTTPS 控制面组合。

  • 打断时为什么要同时取消 LLM、TTS、工具和播放器?

    **参考答案:**只停播放器会让后台继续产出 token、音频或副作用,迟到结果可能覆盖新 turn。取消令牌、turn 版本和 fencing 要贯穿各层;已提交写操作要查询或补偿,不能假装撤销。

  • 断线重连怎样避免重复执行写操作?

    **参考答案:**持久化会话和工具调用,客户端带最后确认序号,服务端补发事件并返回权威状态;写操作用会话/turn/tool 的幂等键,未知结果先查询,旧 Worker 用租约和 fencing 防迟到写入。

  • 什么时候应该转人工?交接包包含什么?

    **参考答案:**高风险动作、连续低置信/失败、投诉、权限争议、工具未知和 SLA 风险都可转人工。交接包含最小身份、目标、已确认事实、证据 ID、工具结果、未完成步骤和风险;人工接管期间暂停 Agent 写权限。

  • 多模态与实时系统的发布门禁有哪些?

    **参考答案:**未授权暴露、高风险未经确认、取消后迟到写入和重复副作用必须为零;质量看 OCR/ASR、表格数值、区域引用、工具成功率和无答案拒答;体验看 TTFA、打断、卡顿和重连;指标按版本、风险和场景分桶并可回滚。

数据流追踪的迁移清单

  • 我能解释 trace_idtask_idtool_call_idspan_ididempotency_key 的区别吗?

    **参考答案:**trace 关联调用树,task 关联跨请求任务,span 描述一个时间区间,tool_call 表示模型意图,幂等键绑定具体业务动作。它们有关联但不能互相替代。

  • 我能画出 Gateway → Runtime → Prompt → RAG → Tool → DB → Artifact 的追踪链路吗?

    **参考答案:**Gateway 认证、租户和限流;Runtime 管任务、状态和预算;Prompt 固化模板与来源;RAG 记查询、过滤、索引和证据;Tool Gateway 做授权、审批、幂等和隔离;DB 记事务;Artifact 保存不可变产物、哈希、引用和交付权限。

  • 为什么客户端断开不等于任务取消?

    **参考答案:**socket 断开只改变传输状态,后台模型、工具或外部写可能仍在执行。系统要记录断开,根据策略协作取消;不可中断动作需查询/对账,最终进入成功、取消、未知或人工,并支持游标重连。

  • 如何防止 RAG 缓存跨租户泄露?

    **参考答案:**缓存键包含租户、主体/权限版本、查询策略、知识库和索引 release;命中后仍查 ACL、TTL 和撤权失效,日志只保留引用和哈希,不把未授权全文写入缓存或日志。

  • 外部 API 超时后的正确处理是什么?

    **参考答案:**超时可能表示已接受请求,动作先标记 UNKNOWN,保留幂等键和供应商 request ID,优先查询、回调或对账;只有确认未生效且策略允许才重试。

  • 如何做可复现但不产生真实副作用的 Trace 重放?

    **参考答案:**冻结 manifest、输入和事件,在隔离环境使用录制模型响应、索引快照、只读数据库和工具模拟器;写工具只 dry-run 和断言,不用生产凭据,比较状态、证据、成本和安全决策。

  • Checkpoint 至少应保存哪些字段?

    **参考答案:**任务/步骤状态、事件序号、轮次、已确认动作、外部状态、预算、deadline、权限/模型/Prompt/RAG/工具版本、消息和 Artifact 引用、重试次数及下一步条件。大内容用加密引用和哈希。

  • 观测数据如何脱敏?

    **参考答案:**采集前识别 PII、密钥、令牌和财务自由文本;稳定关联字段用隔离密钥 HMAC;普通 trace 保存摘要、哈希和引用,原文只在受控加密库短期保存并审计查看。

  • Trace、日志、指标和业务事件分别解决什么问题?

    **参考答案:**Trace 看单请求时序,日志做结构化诊断,指标做低维聚合告警,业务事件保存长期事实、审计和恢复。四者用 ID 关联,但日志不能代替业务事实,也不能把高基数原文塞进指标。

  • 如何用数据流追踪定位 TTFT 高?

    **参考答案:**记录入口、认证、排队、Worker、Prompt、RAG、模型发送、供应商首 token、网关首字节和客户端有效时间,比较改写、串行检索、rerank、上下文、冷启动、连接和缓冲,再做并行化/缓存消融并检查质量。

  • 发布门禁至少应包含什么?

    **参考答案:**schema/字段完整率、Trace 与任务关联、权限与脱敏硬门禁、幂等和未知副作用测试、版本 manifest、P95 延迟/成本、灰度停止条件和回滚版本;线上失败要脱敏回流为回归样本。

持续学习,持续实践。