AI 学习知识库
Knowledge Base & Mindmap
首页
学习地图
笔记库
实验室
搜索
登录 / 注册
快速切换模块
准备知识
经典机器学习
深度学习
Transformer 与大语言模型
AI 智能体工程实战
章节目录 (AI 智能体工程实战)
展开目录 ▼
AI 智能体工程实战
26 章节
智能体开发基础
4 篇
01. Agent 工程全景:能力、边界与架构
02. Agent 提示词工程
03. Function Calling:让模型安全调用工具
04. LangChain 基础:组件化构建 Agent
LangChain 与 LangGraph 编排
4 篇
01. ReAct Agent:推理与行动循环
02. LangChain Agent:工具编排与运行时
03. LangGraph:状态化 Agent 工作流
04. 记忆与 Human-in-the-Loop
检索增强生成
3 篇
01. Agentic RAG:让检索成为可决策工具
02. RAG Pipeline:构建知识检索流水线
03. RAG 检索与回答评测
FastAPI 服务化
4 篇
01. FastAPI 入门:构建 Agent 服务接口
02. FastAPI 路由、依赖与 API 设计
03. FastAPI Agent API:运行、状态与任务管理
04. FastAPI 流式响应:SSE 与实时 Agent 事件
权限与智能体安全
2 篇
01. 流式服务的认证、授权与可观测性
02. 工具权限策略与安全执行
MCP 工具生态
2 篇
01. MCP 概览:模型上下文协议与工具互联
02. MCP Server:设计、实现与发布
部署、观测与运维
3 篇
01. Docker 部署 Agent 服务
02. CI/CD:测试、发布与回滚 Agent
03. 结课项目:部署可信 Agent 平台
评测与成本治理
1 篇
01. Agent 评测、安全与红队测试
必做项目实战
3 篇
01. 项目:客户服务 Agent
02. 项目:工单路由与 Agent Supervisor
03. 项目:可引用的研究助手
本模块进度
0%
已完成 0 / 26 个章节
查看知识全景图
AI 智能体工程实战
26 章节
智能体开发基础
01. Agent 工程全景:能力、边界与架构
02. Agent 提示词工程
03. Function Calling:让模型安全调用工具
04. LangChain 基础:组件化构建 Agent
LangChain 与 LangGraph 编排
01. ReAct Agent:推理与行动循环
02. LangChain Agent:工具编排与运行时
03. LangGraph:状态化 Agent 工作流
04. 记忆与 Human-in-the-Loop
检索增强生成
01. Agentic RAG:让检索成为可决策工具
02. RAG Pipeline:构建知识检索流水线
03. RAG 检索与回答评测
FastAPI 服务化
01. FastAPI 入门:构建 Agent 服务接口
02. FastAPI 路由、依赖与 API 设计
03. FastAPI Agent API:运行、状态与任务管理
04. FastAPI 流式响应:SSE 与实时 Agent 事件
权限与智能体安全
01. 流式服务的认证、授权与可观测性
02. 工具权限策略与安全执行
MCP 工具生态
01. MCP 概览:模型上下文协议与工具互联
02. MCP Server:设计、实现与发布
部署、观测与运维
01. Docker 部署 Agent 服务
02. CI/CD:测试、发布与回滚 Agent
03. 结课项目:部署可信 Agent 平台
评测与成本治理
01. Agent 评测、安全与红队测试
必做项目实战
01. 项目:客户服务 Agent
02. 项目:工单路由与 Agent Supervisor
03. 项目:可引用的研究助手
本模块进度
0%
已完成 0 / 26 个章节
查看知识全景图
笔记库
/
AI 智能体工程实战
/
01. Agent 评测、安全与红队测试
← 返回知识地图
01. Agent 评测、安全与红队测试
难度: 进阶
预计阅读 60 分钟
学习进度 0%
标记为已完成
核心导读
建立覆盖任务质量、工具安全、鲁棒性与发布门槛的 Agent 评测体系。
学习目标
为 Agent 定义可复现的离线评测集与通过阈值。
将工具安全、权限和提示注入纳入评测。
用线上反馈持续发现和修复失败模式。
大纲
任务评测:成功率、步骤效率、格式合规、成本、延迟和人工接管率。
轨迹评测:是否选择正确工具、是否遵守策略、是否无效循环。
安全评测:提示注入、越权、数据泄漏、危险工具调用、社会工程学。
评判方式:规则断言、人工标注、模型裁判及其校准与偏差控制。
发布治理:基线、回归测试、阻断阈值、灰度发布和事件复盘。
实践产出
建立一套包含正常任务、失败恢复与攻击样本的 Agent 评测清单。
检查清单
测试样本可追溯到真实风险或业务目标。
关键安全失败会阻断发布。
线上异常会回流为新的回归用例。
本页目录
学习目标
大纲
实践产出
检查清单
关联推荐笔记
查看全部
01. Agent 工程全景:能力、边界与架构
agent
30 分钟
02. Agent 提示词工程
agent
40 分钟
03. Function Calling:让模型安全调用工具
agent
45 分钟