读 ReAct 论文有感:推理与行动的纠缠
ReAct(Yao et al., 2022)是 Agent 方向被引用最多的论文之一,几乎所有 Agent 框架都把它作为基础范式。我读完后最大的感受是:真正影响深远的想法,往往朴素到让人怀疑"这也能发论文?"。
论文核心:Reason + Act 交替
ReAct 的核心思想一句话能讲完:
让 LLM 在 Reasoning(思考)和 Acting(调用工具)之间交替进行,而不是只思考不行动,或只行动不思考。
它的 prompt 长这样:
Thought: 我需要先查一下南昌大学的排名
Action: search[南昌大学排名]
Observation: 南昌大学排名全国第 75 位(虚构数据)
Thought: 接下来查它的 AI 专业
Action: search[南昌大学人工智能专业]
Observation: ...这个 Thought → Action → Observation 循环,就是今天所有 ReAct-style Agent 的祖宗。
它真正解决的问题
为什么必须 Reason + Act 交替?论文做了对比实验:
- 只 Reason(纯 CoT):模型会"幻觉",自信地编造事实
- 只 Act(纯工具调用):模型不知道下一步该干啥,频繁调错工具
- ReAct:思考引导行动,行动的反馈修正思考,准确率最高
这说明一个深刻的事:LLM 的推理能力需要外部事实来锚定,否则就会飘。
对我的启发
读这篇论文让我意识到,Agent 不是"LLM + 一堆工具"那么简单,而是要设计一个让推理和反馈闭环的流程。后来我写自己的 Agent 时,会刻意在 prompt 里要求模型输出 Thought,哪怕只是为了让我 debug 时能看懂它在想什么。
朴素的思想 + 严谨的实验 = 经典论文。ReAct 教我的不只是技术,还有做研究的态度。
下一篇文章想聊聊当前大模型应用的现状,以及为什么我觉得 Agent 是下一个风口。