AI 学习知识库
Knowledge Base & Mindmap
首页
学习地图
笔记库
实验室
搜索
登录 / 注册
快速切换模块
准备知识
经典机器学习
深度学习
Transformer 与大语言模型
AI 智能体工程实战
章节目录 (AI 智能体工程实战)
展开目录 ▼
AI 智能体工程实战
26 章节
智能体开发基础
4 篇
01. Agent 工程全景:能力、边界与架构
02. Agent 提示词工程
03. Function Calling:让模型安全调用工具
04. LangChain 基础:组件化构建 Agent
LangChain 与 LangGraph 编排
4 篇
01. ReAct Agent:推理与行动循环
02. LangChain Agent:工具编排与运行时
03. LangGraph:状态化 Agent 工作流
04. 记忆与 Human-in-the-Loop
检索增强生成
3 篇
01. Agentic RAG:让检索成为可决策工具
02. RAG Pipeline:构建知识检索流水线
03. RAG 检索与回答评测
FastAPI 服务化
4 篇
01. FastAPI 入门:构建 Agent 服务接口
02. FastAPI 路由、依赖与 API 设计
03. FastAPI Agent API:运行、状态与任务管理
04. FastAPI 流式响应:SSE 与实时 Agent 事件
权限与智能体安全
2 篇
01. 流式服务的认证、授权与可观测性
02. 工具权限策略与安全执行
MCP 工具生态
2 篇
01. MCP 概览:模型上下文协议与工具互联
02. MCP Server:设计、实现与发布
部署、观测与运维
3 篇
01. Docker 部署 Agent 服务
02. CI/CD:测试、发布与回滚 Agent
03. 结课项目:部署可信 Agent 平台
评测与成本治理
1 篇
01. Agent 评测、安全与红队测试
必做项目实战
3 篇
01. 项目:客户服务 Agent
02. 项目:工单路由与 Agent Supervisor
03. 项目:可引用的研究助手
本模块进度
0%
已完成 0 / 26 个章节
查看知识全景图
AI 智能体工程实战
26 章节
智能体开发基础
01. Agent 工程全景:能力、边界与架构
02. Agent 提示词工程
03. Function Calling:让模型安全调用工具
04. LangChain 基础:组件化构建 Agent
LangChain 与 LangGraph 编排
01. ReAct Agent:推理与行动循环
02. LangChain Agent:工具编排与运行时
03. LangGraph:状态化 Agent 工作流
04. 记忆与 Human-in-the-Loop
检索增强生成
01. Agentic RAG:让检索成为可决策工具
02. RAG Pipeline:构建知识检索流水线
03. RAG 检索与回答评测
FastAPI 服务化
01. FastAPI 入门:构建 Agent 服务接口
02. FastAPI 路由、依赖与 API 设计
03. FastAPI Agent API:运行、状态与任务管理
04. FastAPI 流式响应:SSE 与实时 Agent 事件
权限与智能体安全
01. 流式服务的认证、授权与可观测性
02. 工具权限策略与安全执行
MCP 工具生态
01. MCP 概览:模型上下文协议与工具互联
02. MCP Server:设计、实现与发布
部署、观测与运维
01. Docker 部署 Agent 服务
02. CI/CD:测试、发布与回滚 Agent
03. 结课项目:部署可信 Agent 平台
评测与成本治理
01. Agent 评测、安全与红队测试
必做项目实战
01. 项目:客户服务 Agent
02. 项目:工单路由与 Agent Supervisor
03. 项目:可引用的研究助手
本模块进度
0%
已完成 0 / 26 个章节
查看知识全景图
笔记库
/
AI 智能体工程实战
/
03. RAG 检索与回答评测
← 返回知识地图
03. RAG 检索与回答评测
难度: 进阶
预计阅读 50 分钟
学习进度 0%
标记为已完成
核心导读
分层评估 RAG 的检索、引用、真实性与端到端任务表现。
学习目标
建立有代表性的 RAG 评测集。
分别定位检索失败与生成失败。
使用离线评测、人工抽检和线上反馈持续改进。
大纲
评测集:真实问题、期望证据、答案要点、难度标签和更新时间。
检索指标:Recall@K、MRR、nDCG、覆盖率、过滤准确性和延迟。
生成指标:答案正确性、忠实性、引用完整性、拒答正确性与可读性。
诊断:未检索到、检索噪声、上下文截断、错误归纳和过度自信。
发布门槛:基线对比、回归阈值、失败样本复盘和线上监控。
实践产出
创建一份 30 题的评测集,输出检索与回答分层报告,并提出三项改进实验。
检查清单
指标能定位问题在检索端还是生成端。
评测集中包含无法回答与冲突知识案例。
新版本不会降低已通过的关键场景表现。
本页目录
学习目标
大纲
实践产出
检查清单
关联推荐笔记
查看全部
01. Agent 工程全景:能力、边界与架构
agent
30 分钟
02. Agent 提示词工程
agent
40 分钟
03. Function Calling:让模型安全调用工具
agent
45 分钟