首页
/
行业洞察
/
正文
INDUSTRY INSIGHT · 深度
《AI Agent原理与实战》2026版 第5课 Agent 系统解剖:核心组件总览
📅 2026/10/11 6:20:44
✍️ 爱科研究院
👁 阅读 3,247
本文收录于专栏《AI Agent原理与实战》2026版—— 专栏系统覆盖 AI Agent 的记忆、工具、插件与实战点击订阅可跟踪后续更新。本课定位前四课讲了Agent “是什么/为什么/何时用”本课回答Agent由什么组成。本课给出全课程的概念骨架Planning / Memory / Tool Use / Reflection 四大件以及综述界的 Brain-Body 口径。往后每一课都是这块骨架上一根骨头的展开——本课是你随时回来对照的全景图。阶段 1概念与基础 来源【微·3 引出 综述框架】关键字Agent架构、规划模块、记忆系统、工具使用、反思机制、Brain-Body框架、核心组件、系统总览本节目录5.1 四大件Planning / Memory / Tool Use / Reflection5.2 综述口径Brain-Body 框架5.3 组件间的依赖与信息流5.4 用四大件重读第 3 课四范式概念讲解5.1 四大件Planning / Memory / Tool Use / Reflection把一个 Agent 拆开社区与综述中最常见的归纳是四个能力件本课程称四大件——规划、记忆、工具使用、反思。它与主流综述的分解同构《The Rise and Potential of LLM Based Agents》arXiv:2309.07864的三段框架中Brain 内含知识与记忆、推理与规划等模块Tool Using 则归入 Action 段见 5.2反思是 Reflexion第 3 课之后被广泛接纳的第四种能力。微软课程第 3 课现行版本按 Space/Time/Core 三视角讲设计原则各能力件分散在其第 4-13 课逐一展开逐个定义每个组件后续都有整课展开① Planning规划——把目标拆成可执行子任务、排顺序、按中间结果调整。第 3 课的 Plan-and-Execute 是它的显式形态ReAct 的逐步 Thought 是隐式规划。深入见第 10 课。② Memory记忆——跨步骤、跨轮次、跨会话的信息保留与检索。注意它不等于上下文上下文是当前窗口里的 messages 数组第 2 课记忆是窗口外还能取回的东西外部存储检索。深入见第 14 课。③ Tool Use工具使用——模型对外部世界的行动能力查库、调 API、跑代码、开浏览器。协议层function calling/MCP解决怎么调设计层ACI解决怎么调得好。深入见第 7、8、18 课。④ Reflection反思——对自身输出的评估与修正结果对不对、任务完成没有、下一步要不要改。Reflexion第 3 课是代表它的局限自我评估 ≠ 正确在第 12 课专门讨论。一个重要的工程视角四大件不是四个模块是四种能力。同一段代码可以同时承担多种角色——第 6 课的最小 Agent 只有约 100 行但四件俱全规划系统提示词模型推理记忆messages 数组工具两个函数反思模型对观察的自评。组件的升级是把这些能力从隐式约定变成显式机制如把记忆从窗口内搬到向量库。5.2 综述口径Brain-Body 框架学术界更系统的分解来自 LLM Agent 综述。《The Rise and Potential of LLM Based Agents》arXiv:2309.07864《中国科学信息科学》2025把 Agent 分为三段Brain大脑LLM 本体——通用知识、语言推理、决策。四大件里除了 Tool Use 的执行部分都发生在 Brain。Perception感知把环境输入转成模型可处理的表示——工具返回值、文件内容、网页、图像都经感知通道进入上下文。Body/Action行动把模型决策变成环境变化——tool_calls 的实际执行器、代码沙箱、浏览器驱动。对应关系与信息流每轮循环完成一次感知→决策→行动闭环——这正是第 1 课传感器-决策-执行器的 LLM 版。工程上感知与行动都有独立的坑感知侧是信息过载一次工具返回 30k token 挤爆窗口第 13 课行动侧是副作用管理不可逆操作要闸门第 25 课。5.3 组件间的依赖与信息流四大件不是并列关系存在明确的信息流依赖依赖说明失效模式Planning 依赖 Memory规划要知道已经做了什么重复调同一工具、绕圈Tool Use 依赖 Planning先决定调什么再调乱调一通、幻觉参数Reflection 依赖 Tool Use 的观察自评需要环境 ground truth空想式反思自嗨Memory 写入依赖 Reflection该记什么是判断的结果垃圾进垃圾出最后一行值得展开不是所有经历都值得进长期记忆。第 14 课的记忆系统要配写入策略什么算可靠事实、什么只是过程噪声而这个判断本身是 Reflection 的职责——组件间是咬合的齿轮不是独立积木。5.4 用四大件重读第 3 课四范式把第 3 课的四范式按四大件标注一遍验证这套词汇表的覆盖力范式PlanningMemoryTool UseReflectionReAct隐式每步 Thought窗口内轨迹每步 Action轻量Thought 自评Plan-and-Execute显式先出全计划计划列表执行状态Executor 执行Replan 分支Reflexion隐式** episodic 反思文本**跨轮次任务内工具核心组件失败复盘ToT显式多分支树状态通常无外部工具生成-评估一体观察范式之间的差异就是哪个组件被强化的差异——Reflexion 强化 MemoryReflectionPlan-Execute 强化 PlanningToT 是 Planning 的搜索化。选范式选组件配比这个视角在第 9 课设计模式总论会再次出现。案例实战给 ReAct 轨迹做组件标注目标拿第 3 课已实测的珠峰问题轨迹工具searchcalculator2026-10-01 本机运行逐行标注组件归属把抽象四大件落到具体行为上。步骤一原始轨迹mini_agent.py 实测输出整理为标准 ReAct 记法[Q] 珠穆朗玛峰的高度是多少米换算成英尺呢1米3.28084英尺 [T1] 需要先查珠峰准确高度。 ← Planning(隐式) [A1] search({query: 珠穆朗玛峰高度}) ← Tool Use(决策) [O1] 珠穆朗玛峰海拔约 8848.86 米2020年测定… ← Perception(感知) [T2] 拿到米数现在换算英尺。 ← Planning Reflection(评估信息缺口) [A2] calculator({expr: 8848.86*3.28084}) ← Tool Use [O2] 29031.6938424 ← Perception [T3] 两项数据齐了8848.86 米 / 29031.69 英尺。 ← Reflection(完成判定) [F ] 最终回答8848.86 米 ≈ 29032 英尺。 ← 输出步骤二组件统计——一段 6 行轨迹里Planning 出现 2 次T1 拆解、T2 排序都是隐式没有独立 plannerTool Use 2 次A1/A2执行器在 Agent 代码里第 2 课原理Perception 2 次O1/O2观察直接进上下文Reflection 1 次T3 完成判定信息充分Memory全程只用窗口内轨迹messages 数组无外部记忆——最小实现的选择不是缺陷步骤三升级点标注——如果要把这个 mini Agent 升级为生产系统每个组件对应的升级方向组件当前100行内升级方向对应课Planning系统提示词内隐式显式任务清单动态勾选第 10 课Memorymessages 数组向量库/结构化档案检索第 14 课Tool Use2 个本地函数MCP 协议工具分级权限第 18/25 课Reflection模型自评外部校验器单元测试闭环第 12 课循环本体while max_iters框架编排检查点恢复第 16/17 课预期输出一张如上的组件标注表。这套轨迹→组件的读法是调试 Agent 的基本功——出问题时先定位是哪个组件失效是没规划好记忆丢了工具返回太脏还是自评失灵再对症修避免加 prompt 试试式的盲调。小结四大件Planning/Memory/Tool Use/Reflection是全课程的解剖词汇表它们是四种能力不是四个物理模块。综述口径 Brain-Perception-Action 描述信息闭环感知侧防过载、行动侧防副作用。组件间有依赖咬合规划靠记忆、反思靠观察、记忆写入靠反思单件强化可能被短板拖死。四大范式 四大件的不同配比选范式即选配比。轨迹组件标注是调试基本功先定位失效组件再动手修。交叉引用组件逐个展开——规划第 10 课、记忆第 14 课、工具第 7/8/18 课、反思第 12 课、上下文感知侧约束第 13 课四范式出处见第 3 课升级路线图右侧列即阶段 2-5 的课程地图。扩展阅读 网络提示github.com 需代理clone 可走 ghproxy 加速、push 优先 SSH学术站 arxiv.org 境内多可直连慢其余评测/规范站需代理。详见总纲附录《国内网络访问与国产适配指南》。LLM Agent 综述Brain 框架329 篇arXiv:2503.21460 https://arxiv.org/abs/2503.21460《The Rise and Potential of LLM Based Agents》brain/perception/action 三段式arXiv:2309.07864 https://arxiv.org/abs/2309.07864微软课程第 3 课现行版本Agentic Design PrinciplesSpace/Time/Core 三视角https://github.com/microsoft/ai-agents-for-beginners/tree/main/03-agentic-design-patternsAgent Memory 综述NUS、人大、复旦等 45 位作者102 页Forms-Functions-DynamicsarXiv:2512.13564 https://arxiv.org/abs/2512.13564我的专栏蛋白 / 抗体 / 多肽 / 核酸分子模拟 / 动力学 / 对接药物 / 设计 / 案例AI / Agent / 大模型开源蛋白结构预测分子模拟基础小分子药物设计案例AI Agent系列开源蛋白生成方法实践分子动力学模拟-Amber蛋白药物设计案例化学大模型开源多肽设计模型分子动力学模拟-Gromacs多肽药物设计案例《AI Agent原理与实战》开源多肽性质预测分子动力学模拟-OpenMM开源小分子生成设计CADD中的机器学习模型DNA/RNA药物设计結合自由能高效计算配置《MCP 入门实战》siRNA药物设计模型UCSF DOCK系列我胡师兄说药《AI入门实战2026》ASO药物设计模型rDock系列 LeDock系列 gnina系列《经典机器学习实战》
📌 标签:
工业官网
设计趋势
AI 建站
SEO
获取完整报告 →
RELATED ARTICLES
推荐阅读
2026/10/11 6:20:44
Python requests实现接口自动化测试:从入门到框架封装
2026/10/11 6:20:44
电子合同对外进度同步指南:给客户什么、留什么、怎么说
2026/10/11 6:15:44
AI视频生成异步任务管理:查询API与轮询策略实战
2026/10/11 7:15:49
STM32输出比较与输入捕获配置详解
2026/10/11 7:15:49
01序列间隔检查:一次遍历解决力扣1437边界问题
2026/10/11 7:15:49
代码智能体从零上手:实操配置与开发效率提升指南
2026/10/11 7:15:49
工程视角下的Transformer:训练策略、推理优化与全流程避坑指南
2026/10/11 7:15:49
Python实战:从零构建在线电影推荐系统,协同过滤与Flask接口全解析
2026/10/11 7:10:49
AI Agent 可观测性实践:用 OpenTelemetry 让决策路径可追踪
2026/10/11 0:00:10
流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南
2026/10/11 0:00:10
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别
2026/10/11 0:00:10
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容
2026/10/11 0:00:10
流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南
2026/10/11 0:00:10
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别
2026/10/11 0:00:10
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容
2026/10/10 3:41:56
我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频
2026/10/10 3:41:54
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证
2026/10/9 11:36:17
2026 大模型集体涨价:用 Python 做企业 Token 成本测算与选型避坑(附配置)