Skip to content

08 — 评估与安全

学习路径

目录内容
质量、安全与可观测性评估、tracing、工具权限、注入防护、隐私隔离和故障保护

为什么单独成章

Agent 的输出有随机性,最终答案正确也不代表执行过程正确。它可能多调了三个工具、读到了不该读取的客户资料,或者在一次超时后重复创建了工单。只在演示页面里试几次,发现不了这些问题。

这一章把问题拆成六块:先用评测集判断效果,再用 trace 还原过程;然后把权限检查放到工具执行边界,处理直接和间接 Prompt Injection,隔离租户数据,最后给循环、重试、费用和副作用加上硬限制。

这一章要解决什么

  • 用固定评测集比较模型、提示词和工具策略,避免只凭几次手工试用下结论。
  • 用 trace、结构化日志和 usage 还原一次任务的路径、耗时、缓存与费用。
  • 在工具入口执行身份、权限、参数和审批检查,而不是相信模型会自觉遵守提示词。
  • 区分用户指令、检索资料和工具返回,阻断 Prompt Injection 和数据外传。
  • 让记忆、检索、日志和 trace 都遵守租户与用户的数据边界。
  • 在模型、工具和下游服务失败时有限重试、及时停止,并保留人工接管入口。

持续学习,持续实践。