AAAEC Resources返回官网
AAAEC Resources

6. 推理与思考

10 模块知识库第 6 篇——讲 agent 怎么在执行前先想清楚:ReAct / Plan-Execute / Reflection / System 2 / TIR 5 大推理模式,以及多步任务的拆解方法。


本文覆盖 8 种 reasoning 模式 + 4 维度定位:

  • ReAct / Plan-Execute 边想边做 vs 先 plan 再执行,各自的失败模式
  • Reflection / ToT 自我反思 + 树状思考,适合复杂多步任务
  • Multi-agent reasoning 3 种拓扑:supervisor / peer / hierarchical
  • 失败模式识别 3 个常见失败模式(infinite loop / context drift / overthink)

选型快查 (TL;DR)

场景推荐模式代表 agent
单步工具调用ReActLangChain ReAct / Qwen-Agent
多步 + 自反思ReflexionReflexion 论文 + Claude extended thinking
重要 + 多步 + 不可逆Plan-ExecuteClaude Code Plan mode / Agentforce Atlas
多独立查询 + 想快ReWOOReWOO 论文
需要 explore 多种解Tree of ThoughtToT 论文 + Claude Deep Think
复杂 DAG 工作流LLM CompilerLLM Compiler 论文 + Coze 工作流

1. 这是什么 + 为什么重要

推理与思考回答的是 agent 最核心的一组问题:它怎么想?用什么推理模式?思考多深?

任何 agent 在每一轮对话中,都要在"显式控制流"(Plan → Execute → Verify)与"概率性 LLM 推理"(next-token prediction)之间做分配。推理模式决定了三件事:

  1. 能不能想清楚(架构):agent 是先把任务拆成计划再行动(Plan-Execute),还是边想边做边改(ReAct),还是开多个假设并行跑(Tree-of-Thought / Parallel Reasoning)?
  2. 会不会自我修正(Reflection):agent 错了之后,是直接交付,还是回头自检、改了再交?
  3. 能调多深(reasoning effort):用户能不能告诉它"这次给我想 30 秒别着急"?

为什么重要:同样的工具和上下文,放在 Plan-Execute agent 和 ReAct agent 里,成功率可以差 2-3 倍(Devin SWE-bench 实测 72% 通过 case 超过 10 分钟,Antigravity Deep Think 在 ARC-AGI-2 拿到 84.6%)。reasoning 模式直接决定 agent 能否处理 multi-step 复杂任务。

来源:Devin 官方 https://cognition.com/blog/swe-bench ✅;Anthropic 官方 https://docs.anthropic.com/en/docs/build-with-claude/extended-thinking ✅。


2. 子模块分解

2.1 ReAct(显式思考-行动循环)

是什么:ReAct(Reasoning + Acting)是 Yao et al. 2022 提出的范式 — agent 在每一步交替生成思考(Thought)→ 行动(Action)→ 观察(Observation) 三段,直到任务完成。ReAct 把"思考"显式作为 control flow 的一等公民,与 Chain-of-Thought(纯思考,不动外部世界)互补。

来源:Anthropic Claude Code 官方 https://www.anthropic.com/engineering/claude-code-best-practices ✅。

实现模式分类

分类含义代表实现
显式 ReAct开发者可读/可改 LLM 与 Tool 调用循环,每步 prompt 模板写死 "Thought/Action/Observation"Qwen-Agent ReActChat(可重写 _call_llm / _call_tool)
隐式 ReActReAct 循环藏在框架/模型内部,开发者只调高层 APIClaude Code、ChatGPT Agent、Cursor Composer
Semi-explicit框架提供 hook 让你改某一步,但不暴露全循环AutoGPT(JSON 强制 thoughts + command 结构化输出)

来源:Qwen-Agent 官方 https://qwenlm.github.io/Qwen-Agent/en/guide/core_moduls/agent/ ✅;AutoGPT GitHub https://github.com/Significant-Gravitas/AutoGPT ✅。

跨 agent 差异表(ReAct 视角)

AgentReAct 实现显式/隐式关键差异
Qwen-AgentReActChat显式(可重写 _call_llm / _call_tool)唯一在生产框架里把 ReAct 当一等公民暴露给开发者的
Claude Code内部 step-by-step隐式ReAct loop + extended thinking budget 可控;每步可见 tool call
ChatGPT Agentreasoning_effort 控制隐式Interleaved thinking(reasoning block 可在 tool call 前后)
Cursor ComposerRL 训练内部 loop隐式在 sandboxed coding environments 训练,ReAct 能力从训练里涌现
AutoGPT经典 ReAct 范式显式 JSON{'thoughts': ..., 'command': {...}} 强制结构化输出
Devinmulti-step ReAct隐式平均 10+ step;迭代 5-10 次不放弃(72% SWE-bench case >10 min)

2.2 Plan-Execute(先规划再执行)

是什么:agent 收到任务后,先输出完整计划(可执行步骤列表),经用户/HITL/内部审核批准后,再按计划逐步执行。Plan-Execute 与 Plan mode 的差异在于:Plan-Execute 是 control flow 范式,Plan mode 是用户交互模式。

来源:Claude Code 官方 https://code.claude.com/docs/en/permission-modes ✅。

跨 agent 差异表

AgentPlan-Execute 实现Plan 可编辑自动执行触发
Claude CodePlan mode(Shift+Tab / --permission-mode plan)✅ 用户可编辑用户批准 EnterPlanMode 退出
Trae SoloPlanAgent 主智能体先输出 plan 文档用户批准
DevinPlan + approve/reject用户批准
AntigravityImplementation Plan Artifact(Goal / Solution / Files / Verify)✅ 评论式(GitHub Alerts 语法)用户批准 / 三段式状态机门禁
WorkBuddyPlan 模式"先规划后全自动"⚠️ 计划展示"开始"按钮触发逐步执行 + 步骤打勾
ManusPlan Agent / Execute Agent / Verify Agent 三层❌(Verify 对抗性)自动流转
Qwen-Agent百炼可视化"智能体 / 工作流 / 编排"✅ 编排编排触发
AgentforceAtlas Plan/Evaluate/Refine 三阶段循环❌(内部 self-refine)自动 + 不满意则重规划
Coze 3工作流节点编排✅ 节点编辑工作流执行
Copilot StudioGenerative AI Orchestration(chain-of-tools 15 个上限)✅ per-topic instructions编排调度
SierraGoal-driven(目标 + guardrails)自适应
Accio WorkTask Layer Planner(不给步骤,只给目标)Planner 自拆解

2.3 Reflection / Self-critique(自检与自反思)

是什么:agent 在产出最终结果前(或产出后),对自己的中间步骤或最终输出做一次自我评估,发现错误就改、改完再交。Reflection 与 Plan-Execute 的差异在于:Plan-Execute 是事前规划,Reflection 是事后/事中自检。

来源:Anthropic Claude Code 官方 https://www.anthropic.com/engineering/claude-code-best-practices ✅。

跨 agent 差异表

AgentReflection 实现关键设计
Claude Code4 层 verification gateStop hook + adversarial subagent 防 self-bias
AgentforceConcierge Orchestrator 内部 Discover/Plan/Reflect/Act 四步Self-reflection 降低幻觉(33% accuracy 提升)
ChatGPT AgentSelf-Critique + Reflection via Trace gradingAgentKit 评分每 step(Correctness/Efficiency/Tool selection)
Devin3 层 verification(self → CI must pass → Devin Review)Devin Review 独立 reviewer + Auto-Fix push commit
AntigravitySelf-validation(Artifact 证据)+ Self-improvement(KI 知识库写回)"学习"作为一等公民,Agent Manager 可查看并复用
Cursor Composer训练中学到的 verification 能力RL 阶段学会写 unit tests + 修 linter errors
AutoGPTreflect_on_failure 失败反思函数失败时 LLM 反思 + 改进方案重试
ManusVerify Agent 对抗性测试专门找其他 AI 的问题
Accio WorkValidator 验证层(每步结果校验)不合规 → 重试 / fallback

2.4 Tree of Thought(多思考分支选最优)

是什么:agent 不只走一条思考路径,而是同时展开多棵思考树,每条路径走完后比较/打分,选最优路径继续。

跨 agent 差异表

AgentTree of Thought 实现备注
Antigravity Deep ThinkParallel Reasoning(A/B/C/D 多个假设路径并发跑,跑完再比较取最优)ARC-AGI-2 升级版 84.6%
Cursor Composer多模型并行 + 自动挑选最佳输出"having multiple models attempt the same problem and picking the best result significantly improves the final output"
Cursor Debug Mode多假设 → 插桩 → 复现 → 分析 → 修复避免"猜测式 fix"
ChatGPT AgentMulti-model ensemble(投票)多个 model 跑同一个问题,投票选答案

来源:Antigravity Deep Think 升级版 ⚠️;Cursor 官方 https://cursor.com/blog/2-0 ✅。


2.5 Multi-Agent topology(3 种典型 + 3 个失败模式)

是什么:多个 agent 协同工作的拓扑结构。最常见的三种:Manager-Worker、Cooperative Swarm、Pipeline。


2.6 System 2 reasoning(慢思考、双系统)

是什么:借鉴 Kahneman《思考,快与慢》的双系统理论 — System 1 是快、直觉、自动化的;System 2 是慢、刻意、需要 inference-time deliberation。Agent 应用 System 2 = 让模型在产出答案前多花时间思考,通过推理而非直觉得到答案。

Agentforce Atlas — 行业首创

Salesforce Agentforce Atlas 是行业首个明确以 Kahneman 双系统理论为基础的 enterprise agent 推理引擎。Salesforce 工程团队公开表示:"The Atlas Reasoning Engine is set to revolutionize enterprise workflows through advanced, deliberative, autonomous agents that utilize 'System 2' inference time reasoning"。

来源:Salesforce Engineering Blog https://engineering.salesforce.com/inside-the-brain-of-agentforce-revealing-the-atlas-reasoning-engine/ ✅。

Atlas 的具体实现:

  • Atlas Plan/Evaluate/Refine 三阶段循环:识别意图 → 搜索数据 → 创建计划 → 评估有效性,不满意则重规划
  • Ensemble RAG:多 RAG 模型集成,降低幻觉
  • Self-reflection:每个 agent 反思后再交付
  • Concierge Orchestrator:内部 Discover/Plan/Reflect/Act 四步
  • 混合推理:LLM 概率思维 + Agent Script 业务规则确定性

性能验证(官方):早期试点在客服场景实现 2x 响应相关性 + 33% 端到端准确率提升 ✅;内部部署每周处理 180 万次对话,主动服务活动增长 40% ⚠️。

跨 agent 差异表(System 2 视角)

AgentSystem 2 reasoning 实现
Agentforce Atlas行业首创(基于 Kahneman 双系统理论),Plan/Evaluate/Refine + Ensemble RAG + Self-reflection
Antigravity Deep ThinkParallel Reasoning + Forced Metacognition(TaskBoundary 工具强制自问"我现在在哪")
OpenAI o3 / o3-proReasoning models + CoT monitoring 后台监控 reasoning chain
Claude extended thinkingthinking: {type: "enabled", budget_tokens: N} 控制推理 budget
Cursor Debug Mode多假设 → 插桩 → 复现 → 分析 → 修复
ChatGPT Agentreasoning_effort low/medium/high + Interleaved thinking

2.7 Tool-Integrated Reasoning / TIR(推理过程可调工具)

是什么:传统 CoT 是"纯思考",TIR 让 agent 在推理过程中随时调外部工具(Python executor / calculator / search / database),把工具调用嵌入思考链。


2.8 Reasoning model(推理专用模型)

是什么:专门为推理任务训练/调优的 LLM,与通用 chat model 的区别是 — 它们在 inference time 会显式生成 thinking block(或 reasoning_content),把推理过程外化。

主流 reasoning model 一览

模型厂商关键特性
o3 / o3-proOpenAI推理旗舰;o3-pro 加强版深度 reasoning
o4-miniOpenAI轻量 + reasoning
GPT-5.5 / 5.4 / 5OpenAIreasoning_effort 控制推理深度
QwQ-32B阿里推理模型,数学/逻辑/复杂分析
Qwen3-Max-Thinking阿里AIME 25 和 HMMT 满分(国内首次)
DeepSeek R1DeepSeek推理模型,R1 适合复杂逻辑
Claude extended thinkingAnthropicAPI thinking: {type: "enabled", budget_tokens: N}
Gemini 3 Deep ThinkGoogleARC-AGI-2 45.1% / 升级版 84.6%,Codeforces Elo 3455
Gemini 3.5 FlashGoogleAntigravity 2.0 默认,几乎在所有编程基准超过 3.1 Pro
SWE-1.6Cognition优化 code 任务,multi-step reasoning + native tool use

来源:OpenAI 官方 https://platform.openai.com/docs/models ✅;Anthropic 官方 https://docs.anthropic.com/en/docs/build-with-claude/extended-thinking ✅;Gemini 3 官方 https://blog.google/products/gemini/gemini-3/ ✅;Qwen-Agent 官方 https://github.com/QwenLM/Qwen-Agent ✅;Devin 官方 https://cognition.com/blog/swe-1-6-preview ✅。

reasoning_content 思维链字段

Qwen-Agent 2025-03-18 起支持 reasoning_content 字段,默认 Function Call template 适用于 Qwen2.5 系列和 QwQ-32B — 允许把 thinking 与 final answer 在输出层分开。


2.9 Reasoning effort(思考深度)

是什么:让用户/开发者显式控制 agent 思考的深度,在"快但浅"与"慢但深"之间选择。

跨 agent 差异表

AgentReasoning effort 参数档位数
ChatGPT Agentreasoning_effort: low / medium / high3 档(low 快速 / medium 平衡 70% 任务 / high 复杂 multi-step)
Claude Code/effort: low / medium / high / xhigh / max(Sonnet 4.6+);API budget_tokens 控制5 档 + token 级别精细控制
Claude APIthinking: {type: "enabled", budget_tokens: N}(Opus 4.7/4.8 = 32000 tokens,Sonnet 4.6 = 64000 tokens,Haiku 4.5 不支持)token-level
Antigravity Deep Think1-5 分钟深度思考 + Low Effort Mode2 档 + 时长可调
ChatGPT Agent CoT monitoring后台用 LLM 监控 reasoning chain 找 loophole exploit

来源:OpenAI 官方 https://platform.openai.com/docs/guides/reasoning ✅;Anthropic 官方 https://docs.anthropic.com/en/docs/build-with-claude/extended-thinking ✅;Anthropic Claude Code 官方 https://code.claude.com/docs/en/skills ✅。

最佳实践:日常任务 medium,复杂 multi-step high,Ultrathink magic word(prompt 中加 ultrathink)触发 max effort。


3. 横向对比总表(15 agent × 9 子模块)

AgentReActPlan-ExecuteReflectionToTMulti-AgentSystem 2TIRReasoning modelEffort
Claude Code隐式✅ Plan mode✅ 4 层 gate✅ Agent Teams✅ extended thinking✅ Bash✅ Sonnet/Opus 4.7+✅ /effort 5 档
ChatGPT Agent隐式✅ Self-Critique✅ Multi-model ensemble✅ o3-pro✅ Interleaved✅ o3/o4/GPT-5✅ 3 档
Devin隐式 multi-step✅ approve/reject✅ 3 层 + Devin Review✅ MultiDevin✅ SWE-1.6✅ SWE-1.6 + 多模型
WorkBuddy隐式✅ Plan 模式✅ 执行监控器✅ Multi-Agent 多窗口✅ DeepSeek V4 Pro 推荐
Qwen-Agent✅ ReActChat 显式✅ 百炼可视化✅ LLM 反思✅ GroupChat✅ TIR✅ QwQ-32B / Qwen3-Max-Thinking
Antigravity隐式✅ 三段式状态机✅ Self-improvement✅ Parallel Reasoning✅ Mission Control✅ Deep Think✅ Gemini 3.5 Flash✅ Low Effort Mode
Agentforce隐式✅ Atlas 三阶段✅ Self-reflection✅ Ensemble RAG✅ Cooperative Swarms✅ Atlas(行业首创)✅ Einstein
Sierra隐式✅ Goal-driven✅ Supervisor Models✅ Constellation✅ Conditional Activation
Manus隐式✅ 三层代理✅ Verify Agent✅ Wide Research✅ LLM multisig
Cursor 2隐式✅ Composer✅ Composer Review✅ Debug Mode 多假设✅ Composer sub-agent✅ Debug Mode✅ Composer
Coze 3隐式✅ 工作流编排✅ 节点级条件判断✅ 项目空间分工✅ DeepSeek R1/V3
Copilot Studio隐式✅ Generative Orchestration✅ Custom Graders✅ Connected agent✅ GPT-5/Claude/Mistral
Trae Solo隐式✅ PlanAgent✅ 子 Agent 失败重试✅ 多 Agent 协作✅ 多模型
AutoGPT✅ 显式 JSON✅ reflect_on_failure✅ start_agent✅ O1/Claude thinking
Accio Work隐式✅ Planner✅ Validator✅ 团队讨论✅ 国产大模型

4. 选型建议(场景 → 推理模式)

场景推荐模式推荐实现
数学/逻辑/代码 hard problemSystem 2 + Reasoning model + high effortAgentforce Atlas / o3-pro / Gemini 3 Deep Think / DeepSeek R1 / Claude extended thinking (high effort)
multi-step 软件工程任务Plan-Execute + Reflection + CI gateDevin(SWE-1.6 + 3 层 verification)/ Claude Code(Plan mode + 4 层 verification gate)
需要开发者控制 thinking 深度Reasoning effort 显式 + budget_tokensClaude Code /effort + Anthropic API budget_tokens
客服/企业业务规则System 2 + Ensemble RAG + Cooperative SwarmAgentforce Atlas(行业首创 System 2 + 按 conversation $2 收费)
需要边想边查(数学/视觉)TIR + Reasoning modelQwen2.5-Math TIR / Gemini 3 Agentic Vision / o3 code execution
多 Agent 蜂群协作Manager-Worker / Cooperative SwarmClaude Code Agent Teams / Agentforce Cooperative Swarms / WorkBuddy Multi-Agent
从没见过 pattern 找规律Tree of Thought / Parallel ReasoningAntigravity Deep Think(ARC-AGI-2 84.6%)
想要开发者可改 ReAct 循环显式 ReActQwen-Agent ReActChat(唯一显式暴露) / AutoGPT JSON 结构化

On this page