Skip to content

Agent 原理入门:从 LLM 到自主智能体

很多同学刚接触大模型时都会有一个困惑:LLM 已经会聊天、会写代码,为什么还要单独搞一个"Agent"?我自己学了一个月才慢慢想明白——LLM 是大脑,Agent 是手脚。光有大脑只会说,加上手脚才能"做事"。

什么是 Agent

一个最简化的 Agent 可以拆成三件套:

  • 感知(Perception):把用户的自然语言、外部环境信息变成模型可理解的输入
  • 决策(Reasoning):LLM 通过推理(CoT、ReAct)决定下一步该做什么
  • 行动(Action):调用工具(搜索、代码执行、API)真正改变外部状态

这三步会循环执行,直到任务完成。这就是经典的 Perception → Reasoning → Action 循环。

与普通 Chatbot 的本质区别

Chatbot 是"问一句答一句",Agent 是"给个目标,自己拆解、调用工具、循环修正"。最关键的差异有两点:

  1. 是否有记忆:Agent 需要短期记忆(当前任务上下文)和长期记忆(向量库召回)
  2. 是否有工具:Agent 必须能调用外部工具,否则永远只是"会说话的 LLM"

我的思考

入门时最容易陷入的坑是上来就啃 LangChain 源码,结果被一堆抽象绕晕。我的建议是先手写一个最小 Agent:用 while True 包住 LLM 调用,给它一个 calculator 工具,让它自己决定何时调用。跑通这个 demo,再去看框架源码会顺畅很多。

Agent 的灵魂不在框架,而在那个"循环 + 工具 + 推理"的范式本身。

下一篇我会记录用 LangChain 实现工具调用的踩坑过程,敬请期待。

最后更新于:

基于 VitePress 构建 · 勤于思,践于行 · RSS 订阅