Day01 | Agent究竟是什么?
一、 核心定义和四大组件
1. Agent 的本质公式
能够自主完成任务的系统就是 Agent,其核心逻辑可概括为:
大模型 (大脑)、工具 (双手) 与执行循环 (思考-行动-观察-再思考) 共同构成 Agent。
2. 缺一不可的四大核心组件
以下四个组件紧密协作,共同支撑 Agent 运作:
| 组件 | 角色 | 核心功能及细节 |
|---|---|---|
| 大模型 (LLM) | 大脑 | 推理中心:用户意图由它理解,当前状态由它分析,下一步动作也由它决定。判断该查什么、怎样解读结果等所有“思考”,均发生在这里。 |
| 工具 (Tools) | 双手 | 执行接口:搜索、数据库读写、API 调用等能力,让系统能够与外部世界交互。操作并非由大模型直接完成:它生成调用工具的指令,随后接收工具返回的结果。 |
| 记忆 (Memory) | 记事本 | 上下文管理:• 长期记忆:跨会话信息存入外部数据库,待需要时检索并注入。• 短期记忆:当前会话中的工具调用结果与对话历史被存入(Context Window),多步骤任务由此保持连贯。 |
| 执行循环 (Loop) | 节拍器 | 驱动引擎:普通大模型采用一次性问答(One-shot),Agent 则以“思考→行动→观察→再思考”为一轮,并不断进入下一轮;根本差异就在这里。 |
二、 Agent 的两类主流工作范式
两种范式:Plan and Execute 与 ReAct。
1. ReAct 模式(边想边做)
全称 Reasoning + Acting 的这一范式,目前应用最为主流。
工作流:
- Think(思考) :下一步采取什么动作,要依据当前上下文作出决定。
- Act(行动) :对工具发起调用。
- Observe(观察) :取得执行结果。
- Loop:回到思考阶段之前,先把结果并入上下文。
关键机制:
- 结果回流:为使大模型对历史有所“记忆”,Context Window 会接收每一步产生的结果。
- 动态决策:发现网络问题时转向网络工具,遇到慢查询时则检查日志;也就是说,路径会随发现而变化,并不固定。
适用场景:任务目标模糊、需要随机应变,且步骤较少(3步以内)。
局限性(长任务困境) :
- 迷路:大模型之所以容易遗忘最终目标,是因为步骤增加会使上下文变得过长。
- 绕路:由于缺少全局规划,执行过程可能像走迷宫一样反复走回头路。
- 成本高:Token 消耗会随着步骤线性增长,原因是全部历史都要在每轮循环中携带。
2. 先规划、后执行的 Plan and Execute 模式
这种模式是为解决 ReAct 的长任务难题而出现的。
核心逻辑:
- 第一阶段:Planner(规划) 。在调用工具之前,大模型先根据拿到的任务列出完整的子任务清单。
- 第二阶段:Executor(执行) 。简单调用或一个小的 ReAct 循环,都可以充当清单中的单个步骤;整个清单依次得到执行。
- 机制:Re-planning(重新规划) 。以原计划排查慢查询、结果发现锁等待为例,意外出现后,Planner 会接收 Executor 的反馈,并据此生成新的后续计划。
类比:
- ReAct = 到路口再决定转向,如同看着导航开车。
- Plan and Execute = 出发之前规划完整路线(转弯位置、预计到达时间均提前确定)。
适用场景:目标明确、需要全局把控,而且步骤多(5步以上)的复杂任务。
3. 范式对比及选型决策表
| 维度 | ReAct | Plan and Execute |
|---|---|---|
| 决策时机 | 实时决策(每走一步再看一步) | 事前决策(进行全局规划) |
| 全局视野 | 弱(只关注当前步骤) | 强(预先掌握全貌) |
| 灵活性 | 高(可随时调整路径) | 较低(调整依赖计划) |
| Token 消耗 | 步数越多,后期成本越高 | 消耗集中在规划阶段,执行阶段则较为可控 |
| 最佳实践 | 以 Plan and Execute 构建外层框架,再用 ReAct 执行内层子任务。 |
三、 Agent vs. Workflow(工作流)
初学者最容易混淆这一概念,而两者的核心差别在于控制权归属。
Workflow(工作流) :
- 控制者:开发者(代码) 。
- 逻辑:硬编码。先执行 A,再执行 B;如果 B 的结果为 X,则进入 C,否则进入 D。
- 特点:执行路径固定,成本较低且可预测性强。
- 适用:步骤清晰且重复性高的标准化流程。
Agent(智能体) :
- 控制者:大模型(实时推理) 。
- 逻辑:动态生成。模型获得目标后,自主决定执行路径。
- 特点:路径会动态变化,每次运行的结果可能不同。
- 适用:情况多变、需要自主判断的开放域任务。
架构建议:两者不是互斥关系。最稳健的生产架构通常是 “Workflow 做骨架,Agent 做血肉” 。即用 Workflow 控制主流程,只在需要复杂决策的环节插入 Agent。
四、 Agent 开发面临的四大挑战及应对
幻觉传导
- 问题:如果第一步推理产生幻觉(错误判断),之后的所有步骤都会建立在错误假设之上,最终使结论彻底偏离。
- 应对:验证工具返回的结果;对于删除数据、发通知等高风险操作,加入人工确认环节。
工具调用失败
- 问题:权限不足、网络超时或返回格式异常等情况,都可能使 Agent 卡死。
- 应对:工具需定义明确的错误返回格式;在 System Prompt 中预设“如果工具报错,应该如何处理”的逻辑。
成本与速度
- 问题:每轮循环都意味着一次 LLM 调用,步骤持续增加时,Token 消耗与延迟也会随之叠加。
- 应对:若 Workflow 足以解决,就不要改用 Agent;同时必须严格限制最大循环轮数。
循环风险
- 问题:查完 B 后又转回查 A,而查 A 又要求先查 B,系统便会陷入死循环。
- 应对:设置强制结束机制;要求模型每一步推理都自我审视:“现有信息是否足以得出结论?是否还有继续的必要?”
五、 用伪代码呈现 Agent 的极简逻辑
本质上,Agent 的核心骨架十分简单,它就是一个 While True 循环:
def run_agent(user_input):# 1. 初始化消息列表(包含System Prompt和用户输入)messages = [system_prompt, user_input]while True:# 2. 调用大模型,让它思考下一步response = llm.chat(messages)# 3. 判断是否为最终答案if response.is_final_answer:return response.content# 任务完成,退出循环# 4. 执行工具tool_result = execute_tool(response.tool_name, response.arguments)# 5. 将工具结果追加到消息列表(实现记忆/结果回流)messages.append({"role": "tool", "content": tool_result})# 6. 继续循环,让模型基于新结果再思考
总结:Agent 的核心在于利用大模型的推理能力,在“思考”与“行动”之间形成闭环,从而将 AI 从“聊天机器人”升级为“能够自主完成复杂任务的数字员工”。
-
07.29
MTG x Marvel 收藏家指挥官套牌的昂贵售价值得吗?
-
07.29
House of the Dragon:雷妮拉遭遇迄今最凶险兆,暗示“随之而来的腐朽”
-
07.29
Nova在VCT China 2026 Stage 2小组赛全胜收官,入围赛赛程正式确定
-
07.29
《Shang-Chi》主演刘思慕称,为续集愿意“爬过一英里的碎玻璃”
-
07.29
日本地区 GTA6 实体版将在发售 170 天后失效
-
07.29
在《永恒天空》中于毒云之上生存发展的六项实用技巧
-
- 杀戮尖塔2灵体卡牌推荐
- 07.29
-
- 失控进化空投位置在哪
- 07.29
-
-
- Day01 | Agent究竟是什么?
- 07.29
-
- MySQL慢查询激增,排查不要打乱节奏
- 07.29
-
- 四篇讲清一套 AI协作方法,我把它串成了一张图
- 07.29
-
-
下载
- |
-
-
下载
- 《行尸走肉第一章》免安装中文汉化硬盘版下载
- 单机|436 MB
- 一款以动作冒险为主题的游戏
-
-
下载
- 《街头霸王X铁拳》免安装中文汉化硬盘版下载
- 单机|111MB
- 一款非常好玩的格斗游戏
-
-
下载
- |
-
-
下载
- 《暗黑破坏神3》免安装繁体中文正式版下载
- 单机|7630 MB
- 一款以角色扮演为主题的游戏
-
-
下载
- 《马克思佩恩3》免安装硬盘版下载
- 单机|27033 MB
- 一款以第三人称射击为主题的游戏