000.知识体系总览

009.赋范 AI 知识体系总览

本笔记是 009.赋范 AI 学习系列的全景地图。

模块一:基础入门

模块二:Agent 智能体

模块三:LangChain 1.0 体系

知识体系关联图谱

API 快速上手 → 本地部署基础 → Agent 基础实战 → LangChain 基础 + Agent 搭建 → 中间件实战 → DeepAgents


一、整体架构概览

学习路径:API 调用 → Agent 智能体 → LangChain 框架 → DeepAgents,难度逐级提升。

二、模块一:基础入门

[[001.大模型 API 快速上手指南]]

[[002.大模型本地部署基础]]

三、模块二:Agent 智能体

[[003. 大模型 Agent 基础入门实战]]

四、模块三:LangChain 1.0 体系

[[001.LangChain v1.0 基础入门]]

Runnable 接口、LCEL 管道、Chain、Prompt Template、Output Parser

[[002.LangChain v1.0 框架搭建智能体 Agent]]

create_agent()、@tool 装饰器、checkpointer、context_schema

[[003.Agent 智能体中间件应用实战]] ⭐

洋葱模型:before_agent → before_model → wrap_model_call → after_model → after_agent

四大分类:Monitor / Modify / Control / Enforce

六大约定钩子

after_model / after_agent 按注册顺序逆序执行

内置中间件速查

编排黄金法则:先安全后业务,先读再写,轻量在前

[[004.DeepAgents 框架介绍与应用实战]]

四大支柱:系统提示词 / 规划系统(TodoListMiddleware) / 文件系统(FilesystemMiddleware) / 子代理(SubAgentMiddleware)

五种后端:默认(内存) / FilesystemBackend / DockerBackend / E2BBackend / StoreBackend / CompositeBackend

Backend(环境层) → Checkpointer(状态层) → Store(记忆层)

Human-in-the-Loop:interrupt_on 暂停 + Approve/Edit/Reject

五、学习建议

  1. 动手实战:Function Calling 管线 + 中间件自定义
  2. 中间件编排:组合 SummarizationMiddleware + ModelCallLimitMiddleware + PIIMiddleware
  3. DeepAgents 综合项目:真实场景使用规划 + 文件系统 + 子代理
  4. 后续方向:RAG 入门/进阶(005、006)和 MCP 协议(007)

测试


六、模块四:RAG 入门(知识增强检索)

📖 [[001.基础架构介绍]]

知识点 要点
RAG 定义 Retrieval-Augmented Generation,检索增强生成
核心思想 先检索外部知识,再让 LLM 基于检索结果生成回答
双阶段流程 ① 离线建库(文档解析→切分→向量化→存入向量库)② 在线问答(提问→检索→召回→拼接 Prompt→生成)
解决的核心问题 LLM 幻觉、知识截止日期限制、私有知识利用

RAG vs 微调:RAG 知识可热更新、可溯源、成本低,适合知识密集型场景;微调改变模型行为,适合风格/格式定制。

📖 [[002.多格式文档解析]]

格式 解析工具/方法 要点
PDF PyMuPDF / pdfplumber / Unstructured 注意表格提取和多栏布局
Word (.docx) python-docx 保留段落、表格、样式
HTML BeautifulSoup / lxml 去除标签、保留关键结构
图片/扫描件 OCR(Tesseract / PaddleOCR) 识别图片中的文字
PPT python-pptx 提取文本框和备注

💡 文档解析是 RAG 的入口,解析质量决定最终效果上限——"垃圾进,垃圾出"。

📖 [[003.大模型 RAG 文档切分进阶实战]]

一、数据清洗:纯文本(去标记/修复断行)、表格(去空去重)、图片(降噪+OCR)、代码(保持格式)、混合文档(按类型分发)。

二、切分粒度("第一性变量"):细粒度检索准但上下文少、中等粒度最均衡、粗粒度噪声多。

三、Document vs Node:Document 是顶层容器,Node 是分块后的基础单元,支持 SOURCE/PREVIOUS/NEXT/PARENT/CHILD 五种关系。

四、切分工具速查:TokenTextSplitter(token 精确)/ SentenceSplitter(默认)/ CodeSplitter(AST)/ SemanticSplitterNodeParser(准确率↑27%)/ SentenceWindowNodeParser(窗口上下文)/ HierarchicalNodeParser(多层粒度)/ MarkdownNodeParser / JSONNodeParser。

五、混合策略:Unstructured+chunk_by_title / Hierarchical+Semantic / Metadata 增强。

📖 [[004.大模型 RAG 嵌入向量数据库实战]]

Embedding 选型:OpenAI(text-embedding-3)、BGE-M3(1024维/中英文强)、M3E(中文入门)、Cohere(多语言+Rerank)、Jina(性价比)。

向量库对比:Chroma(本地友好) / Pinecone(云Serverless) / Milvus(亿级) / Weaviate/Qdrant(混合检索) / Faiss(纯向量)。

入库方式:内存→Chroma→Pinecone→Milvus→Faiss+MongoDB混合。

检索封装:VectorDB(Agent工具) / QueryEngineTool / RetrieverTool。

📖 [[005.大模型 RAG 检索生成和评估实战]]

混合检索(向量+BM25) → Rerank重排序(BGE-Reranker) → 评估(Hit Rate/MRR/NDCG + Faithfulness/RAGAS)。


七、模块五:RAG 进阶


八、更新后知识体系图谱

API 上手 → 本地部署 → Agent 基础实战(TAO/ReAct/FnCalling) → LangChain+中间件+DeepAgents → RAG 入门(解析→切分→Embedding→向量库→检索评估) → RAG 进阶(LlamaIndex结构化/多模态)


九、学习建议(更新)

  1. Function Calling 管线 + 中间件自定义(最值得敲代码)
  2. RAG 全流程跑通:PDF→清洗→切分→Embedding→Chroma 入库→检索问答
  3. 切分策略 A/B 测试:SentenceSplitter vs SemanticSplitter vs Hierarchical
  4. 中间件编排练习:SummarizationMiddleware + ModelCallLimitMiddleware + PIIMiddleware
  5. DeepAgents 综合项目:规划+文件系统+子代理
  6. 后续方向:MCP 协议(007)+ RAG 进阶 002/003