002.PDCA(戴明环)与 大模型推理框架ReAct
原作者:fengjutian
什么是 PDCA(戴明环)?
PDCA(戴明环)是一种用于 持续改进的管理方法,由质量管理大师 W. Edwards Deming 推广。
它通过一个不断循环的四步过程,让工作、产品或系统越来越好。
| 步骤 | 核心行动 | 本质 |
|---|---|---|
| Plan(计划) | 发现问题 → 分析原因 → 制定方案 | 先想清楚要做什么 |
| Do(执行) | 按计划实施 → 小规模试点 → 记录数据 | 将思路转化为行动 |
| Check(检查) | 对比结果与目标 → 找出偏差 | 验证效果好不好 |
| Act(处理/改进) | 成功标准化 → 失败调整方案 | 小步迭代,让系统变得更好 |
核心理念:通过循环反馈、迭代优化和小步快跑,让系统不断改进。
![[PDCA.excalidraw|300]]
大模型 ReAct(Reasoning + Acting)推理框架
大模型的 ReAct 框架,将推理与行动结合:
| 元素 | 作用 | 类比 PDCA |
|---|---|---|
| Thought(推理) | 分解复杂问题 → 规划下一步操作 | Plan |
| Action(行动) | 调用工具、执行操作 | Do |
| Observation(观察) | 获取工具返回结果 → 反馈到推理 | Check |
| 调整 Thought | 基于 Observation 修正下一步推理 | Act |
-
Reasoning(推理) :
- 模型在面对问题时,生成 思考步骤(Thoughts) 。
- 用于分解复杂任务、规划下一步操作、逻辑分析。
- 类似传统 Chain-of-Thought (CoT) ,但在 ReAct 中与行动结合。
-
Acting(行动) :
- 模型根据推理结果执行 操作(Actions) 。
- 行为可以是:
- 查询外部知识库(例如 Wikipedia、数据库)
- 调用 API 或工具
- 进行数学计算
- 发出进一步的提问
- 行动产生的 观察(Observations) 会反馈给模型,用于下一轮推理。
![[大模型ReAct.excalidraw|700]]
逻辑对齐:
- PDCA:用事实校验计划。
- ReAct:用搜索/代码运行结果校验推理。