6. 推理与思考
10 模块知识库第 6 篇——讲 agent 怎么在执行前先想清楚:ReAct / Plan-Execute / Reflection / System 2 / TIR 5 大推理模式,以及多步任务的拆解方法。
本文覆盖 8 种 reasoning 模式 + 4 维度定位:
- ReAct / Plan-Execute 边想边做 vs 先 plan 再执行,各自的失败模式
- Reflection / ToT 自我反思 + 树状思考,适合复杂多步任务
- Multi-agent reasoning 3 种拓扑:supervisor / peer / hierarchical
- 失败模式识别 3 个常见失败模式(infinite loop / context drift / overthink)
选型快查 (TL;DR)
| 场景 | 推荐模式 | 代表 agent |
|---|---|---|
| 单步工具调用 | ReAct | LangChain ReAct / Qwen-Agent |
| 多步 + 自反思 | Reflexion | Reflexion 论文 + Claude extended thinking |
| 重要 + 多步 + 不可逆 | Plan-Execute | Claude Code Plan mode / Agentforce Atlas |
| 多独立查询 + 想快 | ReWOO | ReWOO 论文 |
| 需要 explore 多种解 | Tree of Thought | ToT 论文 + Claude Deep Think |
| 复杂 DAG 工作流 | LLM Compiler | LLM Compiler 论文 + Coze 工作流 |
1. 这是什么 + 为什么重要
推理与思考回答的是 agent 最核心的一组问题:它怎么想?用什么推理模式?思考多深?
任何 agent 在每一轮对话中,都要在"显式控制流"(Plan → Execute → Verify)与"概率性 LLM 推理"(next-token prediction)之间做分配。推理模式决定了三件事:
- 能不能想清楚(架构):agent 是先把任务拆成计划再行动(Plan-Execute),还是边想边做边改(ReAct),还是开多个假设并行跑(Tree-of-Thought / Parallel Reasoning)?
- 会不会自我修正(Reflection):agent 错了之后,是直接交付,还是回头自检、改了再交?
- 能调多深(reasoning effort):用户能不能告诉它"这次给我想 30 秒别着急"?
为什么重要:同样的工具和上下文,放在 Plan-Execute agent 和 ReAct agent 里,成功率可以差 2-3 倍(Devin SWE-bench 实测 72% 通过 case 超过 10 分钟,Antigravity Deep Think 在 ARC-AGI-2 拿到 84.6%)。reasoning 模式直接决定 agent 能否处理 multi-step 复杂任务。
来源:Devin 官方 https://cognition.com/blog/swe-bench ✅;Anthropic 官方 https://docs.anthropic.com/en/docs/build-with-claude/extended-thinking ✅。
2. 子模块分解
2.1 ReAct(显式思考-行动循环)
是什么:ReAct(Reasoning + Acting)是 Yao et al. 2022 提出的范式 — agent 在每一步交替生成思考(Thought)→ 行动(Action)→ 观察(Observation) 三段,直到任务完成。ReAct 把"思考"显式作为 control flow 的一等公民,与 Chain-of-Thought(纯思考,不动外部世界)互补。
来源:Anthropic Claude Code 官方 https://www.anthropic.com/engineering/claude-code-best-practices ✅。
实现模式分类
| 分类 | 含义 | 代表实现 |
|---|---|---|
| 显式 ReAct | 开发者可读/可改 LLM 与 Tool 调用循环,每步 prompt 模板写死 "Thought/Action/Observation" | Qwen-Agent ReActChat(可重写 _call_llm / _call_tool) |
| 隐式 ReAct | ReAct 循环藏在框架/模型内部,开发者只调高层 API | Claude Code、ChatGPT Agent、Cursor Composer |
| Semi-explicit | 框架提供 hook 让你改某一步,但不暴露全循环 | AutoGPT(JSON 强制 thoughts + command 结构化输出) |
来源:Qwen-Agent 官方 https://qwenlm.github.io/Qwen-Agent/en/guide/core_moduls/agent/ ✅;AutoGPT GitHub https://github.com/Significant-Gravitas/AutoGPT ✅。
跨 agent 差异表(ReAct 视角)
| Agent | ReAct 实现 | 显式/隐式 | 关键差异 |
|---|---|---|---|
| Qwen-Agent | ReActChat 类 | 显式(可重写 _call_llm / _call_tool) | 唯一在生产框架里把 ReAct 当一等公民暴露给开发者的 |
| Claude Code | 内部 step-by-step | 隐式 | ReAct loop + extended thinking budget 可控;每步可见 tool call |
| ChatGPT Agent | reasoning_effort 控制 | 隐式 | Interleaved thinking(reasoning block 可在 tool call 前后) |
| Cursor Composer | RL 训练内部 loop | 隐式 | 在 sandboxed coding environments 训练,ReAct 能力从训练里涌现 |
| AutoGPT | 经典 ReAct 范式 | 显式 JSON | {'thoughts': ..., 'command': {...}} 强制结构化输出 |
| Devin | multi-step ReAct | 隐式 | 平均 10+ step;迭代 5-10 次不放弃(72% SWE-bench case >10 min) |
2.2 Plan-Execute(先规划再执行)
是什么:agent 收到任务后,先输出完整计划(可执行步骤列表),经用户/HITL/内部审核批准后,再按计划逐步执行。Plan-Execute 与 Plan mode 的差异在于:Plan-Execute 是 control flow 范式,Plan mode 是用户交互模式。
来源:Claude Code 官方 https://code.claude.com/docs/en/permission-modes ✅。
跨 agent 差异表
| Agent | Plan-Execute 实现 | Plan 可编辑 | 自动执行触发 |
|---|---|---|---|
| Claude Code | Plan mode(Shift+Tab / --permission-mode plan) | ✅ 用户可编辑 | 用户批准 EnterPlanMode 退出 |
| Trae Solo | PlanAgent 主智能体先输出 plan 文档 | ✅ | 用户批准 |
| Devin | Plan + approve/reject | ✅ | 用户批准 |
| Antigravity | Implementation Plan Artifact(Goal / Solution / Files / Verify) | ✅ 评论式(GitHub Alerts 语法) | 用户批准 / 三段式状态机门禁 |
| WorkBuddy | Plan 模式"先规划后全自动" | ⚠️ 计划展示 | "开始"按钮触发逐步执行 + 步骤打勾 |
| Manus | Plan Agent / Execute Agent / Verify Agent 三层 | ❌(Verify 对抗性) | 自动流转 |
| Qwen-Agent | 百炼可视化"智能体 / 工作流 / 编排" | ✅ 编排 | 编排触发 |
| Agentforce | Atlas Plan/Evaluate/Refine 三阶段循环 | ❌(内部 self-refine) | 自动 + 不满意则重规划 |
| Coze 3 | 工作流节点编排 | ✅ 节点编辑 | 工作流执行 |
| Copilot Studio | Generative AI Orchestration(chain-of-tools 15 个上限) | ✅ per-topic instructions | 编排调度 |
| Sierra | Goal-driven(目标 + guardrails) | ❌ | 自适应 |
| Accio Work | Task Layer Planner(不给步骤,只给目标) | ❌ | Planner 自拆解 |
2.3 Reflection / Self-critique(自检与自反思)
是什么:agent 在产出最终结果前(或产出后),对自己的中间步骤或最终输出做一次自我评估,发现错误就改、改完再交。Reflection 与 Plan-Execute 的差异在于:Plan-Execute 是事前规划,Reflection 是事后/事中自检。
来源:Anthropic Claude Code 官方 https://www.anthropic.com/engineering/claude-code-best-practices ✅。
跨 agent 差异表
| Agent | Reflection 实现 | 关键设计 |
|---|---|---|
| Claude Code | 4 层 verification gate | Stop hook + adversarial subagent 防 self-bias |
| Agentforce | Concierge Orchestrator 内部 Discover/Plan/Reflect/Act 四步 | Self-reflection 降低幻觉(33% accuracy 提升) |
| ChatGPT Agent | Self-Critique + Reflection via Trace grading | AgentKit 评分每 step(Correctness/Efficiency/Tool selection) |
| Devin | 3 层 verification(self → CI must pass → Devin Review) | Devin Review 独立 reviewer + Auto-Fix push commit |
| Antigravity | Self-validation(Artifact 证据)+ Self-improvement(KI 知识库写回) | "学习"作为一等公民,Agent Manager 可查看并复用 |
| Cursor Composer | 训练中学到的 verification 能力 | RL 阶段学会写 unit tests + 修 linter errors |
| AutoGPT | reflect_on_failure 失败反思函数 | 失败时 LLM 反思 + 改进方案重试 |
| Manus | Verify Agent 对抗性测试 | 专门找其他 AI 的问题 |
| Accio Work | Validator 验证层(每步结果校验) | 不合规 → 重试 / fallback |
2.4 Tree of Thought(多思考分支选最优)
是什么:agent 不只走一条思考路径,而是同时展开多棵思考树,每条路径走完后比较/打分,选最优路径继续。
跨 agent 差异表
| Agent | Tree of Thought 实现 | 备注 |
|---|---|---|
| Antigravity Deep Think | Parallel Reasoning(A/B/C/D 多个假设路径并发跑,跑完再比较取最优) | ARC-AGI-2 升级版 84.6% |
| Cursor Composer | 多模型并行 + 自动挑选最佳输出 | "having multiple models attempt the same problem and picking the best result significantly improves the final output" |
| Cursor Debug Mode | 多假设 → 插桩 → 复现 → 分析 → 修复 | 避免"猜测式 fix" |
| ChatGPT Agent | Multi-model ensemble(投票) | 多个 model 跑同一个问题,投票选答案 |
来源:Antigravity Deep Think 升级版 ⚠️;Cursor 官方 https://cursor.com/blog/2-0 ✅。
2.5 Multi-Agent topology(3 种典型 + 3 个失败模式)
是什么:多个 agent 协同工作的拓扑结构。最常见的三种:Manager-Worker、Cooperative Swarm、Pipeline。
2.6 System 2 reasoning(慢思考、双系统)
是什么:借鉴 Kahneman《思考,快与慢》的双系统理论 — System 1 是快、直觉、自动化的;System 2 是慢、刻意、需要 inference-time deliberation。Agent 应用 System 2 = 让模型在产出答案前多花时间思考,通过推理而非直觉得到答案。
Agentforce Atlas — 行业首创
Salesforce Agentforce Atlas 是行业首个明确以 Kahneman 双系统理论为基础的 enterprise agent 推理引擎。Salesforce 工程团队公开表示:"The Atlas Reasoning Engine is set to revolutionize enterprise workflows through advanced, deliberative, autonomous agents that utilize 'System 2' inference time reasoning"。
来源:Salesforce Engineering Blog https://engineering.salesforce.com/inside-the-brain-of-agentforce-revealing-the-atlas-reasoning-engine/ ✅。
Atlas 的具体实现:
- Atlas Plan/Evaluate/Refine 三阶段循环:识别意图 → 搜索数据 → 创建计划 → 评估有效性,不满意则重规划
- Ensemble RAG:多 RAG 模型集成,降低幻觉
- Self-reflection:每个 agent 反思后再交付
- Concierge Orchestrator:内部 Discover/Plan/Reflect/Act 四步
- 混合推理:LLM 概率思维 + Agent Script 业务规则确定性
性能验证(官方):早期试点在客服场景实现 2x 响应相关性 + 33% 端到端准确率提升 ✅;内部部署每周处理 180 万次对话,主动服务活动增长 40% ⚠️。
跨 agent 差异表(System 2 视角)
| Agent | System 2 reasoning 实现 |
|---|---|
| Agentforce Atlas | 行业首创(基于 Kahneman 双系统理论),Plan/Evaluate/Refine + Ensemble RAG + Self-reflection |
| Antigravity Deep Think | Parallel Reasoning + Forced Metacognition(TaskBoundary 工具强制自问"我现在在哪") |
| OpenAI o3 / o3-pro | Reasoning models + CoT monitoring 后台监控 reasoning chain |
| Claude extended thinking | thinking: {type: "enabled", budget_tokens: N} 控制推理 budget |
| Cursor Debug Mode | 多假设 → 插桩 → 复现 → 分析 → 修复 |
| ChatGPT Agent | reasoning_effort low/medium/high + Interleaved thinking |
2.7 Tool-Integrated Reasoning / TIR(推理过程可调工具)
是什么:传统 CoT 是"纯思考",TIR 让 agent 在推理过程中随时调外部工具(Python executor / calculator / search / database),把工具调用嵌入思考链。
2.8 Reasoning model(推理专用模型)
是什么:专门为推理任务训练/调优的 LLM,与通用 chat model 的区别是 — 它们在 inference time 会显式生成 thinking block(或 reasoning_content),把推理过程外化。
主流 reasoning model 一览
| 模型 | 厂商 | 关键特性 |
|---|---|---|
| o3 / o3-pro | OpenAI | 推理旗舰;o3-pro 加强版深度 reasoning |
| o4-mini | OpenAI | 轻量 + reasoning |
| GPT-5.5 / 5.4 / 5 | OpenAI | reasoning_effort 控制推理深度 |
| QwQ-32B | 阿里 | 推理模型,数学/逻辑/复杂分析 |
| Qwen3-Max-Thinking | 阿里 | AIME 25 和 HMMT 满分(国内首次) |
| DeepSeek R1 | DeepSeek | 推理模型,R1 适合复杂逻辑 |
| Claude extended thinking | Anthropic | API thinking: {type: "enabled", budget_tokens: N} |
| Gemini 3 Deep Think | ARC-AGI-2 45.1% / 升级版 84.6%,Codeforces Elo 3455 | |
| Gemini 3.5 Flash | Antigravity 2.0 默认,几乎在所有编程基准超过 3.1 Pro | |
| SWE-1.6 | Cognition | 优化 code 任务,multi-step reasoning + native tool use |
来源:OpenAI 官方 https://platform.openai.com/docs/models ✅;Anthropic 官方 https://docs.anthropic.com/en/docs/build-with-claude/extended-thinking ✅;Gemini 3 官方 https://blog.google/products/gemini/gemini-3/ ✅;Qwen-Agent 官方 https://github.com/QwenLM/Qwen-Agent ✅;Devin 官方 https://cognition.com/blog/swe-1-6-preview ✅。
reasoning_content 思维链字段
Qwen-Agent 2025-03-18 起支持 reasoning_content 字段,默认 Function Call template 适用于 Qwen2.5 系列和 QwQ-32B — 允许把 thinking 与 final answer 在输出层分开。
2.9 Reasoning effort(思考深度)
是什么:让用户/开发者显式控制 agent 思考的深度,在"快但浅"与"慢但深"之间选择。
跨 agent 差异表
| Agent | Reasoning effort 参数 | 档位数 |
|---|---|---|
| ChatGPT Agent | reasoning_effort: low / medium / high | 3 档(low 快速 / medium 平衡 70% 任务 / high 复杂 multi-step) |
| Claude Code | /effort: low / medium / high / xhigh / max(Sonnet 4.6+);API budget_tokens 控制 | 5 档 + token 级别精细控制 |
| Claude API | thinking: {type: "enabled", budget_tokens: N}(Opus 4.7/4.8 = 32000 tokens,Sonnet 4.6 = 64000 tokens,Haiku 4.5 不支持) | token-level |
| Antigravity Deep Think | 1-5 分钟深度思考 + Low Effort Mode | 2 档 + 时长可调 |
| ChatGPT Agent CoT monitoring | 后台用 LLM 监控 reasoning chain 找 loophole exploit | — |
来源:OpenAI 官方 https://platform.openai.com/docs/guides/reasoning ✅;Anthropic 官方 https://docs.anthropic.com/en/docs/build-with-claude/extended-thinking ✅;Anthropic Claude Code 官方 https://code.claude.com/docs/en/skills ✅。
最佳实践:日常任务 medium,复杂 multi-step high,Ultrathink magic word(prompt 中加 ultrathink)触发 max effort。
3. 横向对比总表(15 agent × 9 子模块)
| Agent | ReAct | Plan-Execute | Reflection | ToT | Multi-Agent | System 2 | TIR | Reasoning model | Effort |
|---|---|---|---|---|---|---|---|---|---|
| Claude Code | 隐式 | ✅ Plan mode | ✅ 4 层 gate | ❌ | ✅ Agent Teams | ✅ extended thinking | ✅ Bash | ✅ Sonnet/Opus 4.7+ | ✅ /effort 5 档 |
| ChatGPT Agent | 隐式 | ✅ | ✅ Self-Critique | ✅ Multi-model ensemble | ❌ | ✅ o3-pro | ✅ Interleaved | ✅ o3/o4/GPT-5 | ✅ 3 档 |
| Devin | 隐式 multi-step | ✅ approve/reject | ✅ 3 层 + Devin Review | ❌ | ✅ MultiDevin | ✅ SWE-1.6 | ✅ | ✅ SWE-1.6 + 多模型 | ❌ |
| WorkBuddy | 隐式 | ✅ Plan 模式 | ✅ 执行监控器 | ❌ | ✅ Multi-Agent 多窗口 | ❌ | ✅ | ✅ DeepSeek V4 Pro 推荐 | ❌ |
| Qwen-Agent | ✅ ReActChat 显式 | ✅ 百炼可视化 | ✅ LLM 反思 | ❌ | ✅ GroupChat | ❌ | ✅ TIR | ✅ QwQ-32B / Qwen3-Max-Thinking | ✅ |
| Antigravity | 隐式 | ✅ 三段式状态机 | ✅ Self-improvement | ✅ Parallel Reasoning | ✅ Mission Control | ✅ Deep Think | ✅ | ✅ Gemini 3.5 Flash | ✅ Low Effort Mode |
| Agentforce | 隐式 | ✅ Atlas 三阶段 | ✅ Self-reflection | ✅ Ensemble RAG | ✅ Cooperative Swarms | ✅ Atlas(行业首创) | ✅ | ✅ Einstein | ✅ |
| Sierra | 隐式 | ✅ Goal-driven | ✅ Supervisor Models | ✅ Constellation | ❌ | ✅ Conditional Activation | ❌ | ✅ | ❌ |
| Manus | 隐式 | ✅ 三层代理 | ✅ Verify Agent | ❌ | ✅ Wide Research | ❌ | ✅ | ✅ LLM multisig | ❌ |
| Cursor 2 | 隐式 | ✅ Composer | ✅ Composer Review | ✅ Debug Mode 多假设 | ✅ Composer sub-agent | ✅ Debug Mode | ✅ | ✅ Composer | ❌ |
| Coze 3 | 隐式 | ✅ 工作流编排 | ✅ 节点级条件判断 | ❌ | ✅ 项目空间分工 | ❌ | ✅ | ✅ DeepSeek R1/V3 | ❌ |
| Copilot Studio | 隐式 | ✅ Generative Orchestration | ✅ Custom Graders | ❌ | ✅ Connected agent | ❌ | ✅ | ✅ GPT-5/Claude/Mistral | ❌ |
| Trae Solo | 隐式 | ✅ PlanAgent | ✅ 子 Agent 失败重试 | ❌ | ✅ 多 Agent 协作 | ❌ | ✅ | ✅ 多模型 | ❌ |
| AutoGPT | ✅ 显式 JSON | ✅ | ✅ reflect_on_failure | ❌ | ✅ start_agent | ❌ | ✅ | ✅ O1/Claude thinking | ❌ |
| Accio Work | 隐式 | ✅ Planner | ✅ Validator | ❌ | ✅ 团队讨论 | ❌ | ✅ | ✅ 国产大模型 | ❌ |
4. 选型建议(场景 → 推理模式)
| 场景 | 推荐模式 | 推荐实现 |
|---|---|---|
| 数学/逻辑/代码 hard problem | System 2 + Reasoning model + high effort | Agentforce Atlas / o3-pro / Gemini 3 Deep Think / DeepSeek R1 / Claude extended thinking (high effort) |
| multi-step 软件工程任务 | Plan-Execute + Reflection + CI gate | Devin(SWE-1.6 + 3 层 verification)/ Claude Code(Plan mode + 4 层 verification gate) |
| 需要开发者控制 thinking 深度 | Reasoning effort 显式 + budget_tokens | Claude Code /effort + Anthropic API budget_tokens |
| 客服/企业业务规则 | System 2 + Ensemble RAG + Cooperative Swarm | Agentforce Atlas(行业首创 System 2 + 按 conversation $2 收费) |
| 需要边想边查(数学/视觉) | TIR + Reasoning model | Qwen2.5-Math TIR / Gemini 3 Agentic Vision / o3 code execution |
| 多 Agent 蜂群协作 | Manager-Worker / Cooperative Swarm | Claude Code Agent Teams / Agentforce Cooperative Swarms / WorkBuddy Multi-Agent |
| 从没见过 pattern 找规律 | Tree of Thought / Parallel Reasoning | Antigravity Deep Think(ARC-AGI-2 84.6%) |
| 想要开发者可改 ReAct 循环 | 显式 ReAct | Qwen-Agent ReActChat(唯一显式暴露) / AutoGPT JSON 结构化 |