AI Agent 入门:从「会聊」到「会做事」
Agent 核心循环 · 主流框架对比 · 边界与成本控制
核心结论:Agent = 大模型 + 工具 + 记忆 + 循环。它把「说」变成「做」,但也把「一次调用」变成「可能几十次调用」——能力越强,越要管好边界与成本。
一、Agent 的核心循环
观察(Observ) → 规划(Plan) → 行动(Act) → 工具返回 → 反思(Reflect)
↑____________________________________│
循环直到任务完成
每一次循环模型都可能调用工具(查资料、跑代码、发请求),拿到结果后再决定下一步。能否「及时停手」取决于反思环节是否到位。
二、四大组成部件
| 部件 | 作用 | 常见实现 |
|---|---|---|
| 规划 | 拆解目标、决定下一步 | 提示词 / 规划模型 |
| 工具 | 连接外部能力 | 函数调用(见工具调用) |
| 记忆 | 短期上下文 + 长期知识 | 向量库 / 摘要 |
| 反思 | 评估结果、纠正偏差 | 自检提示 / 评测器 |
三、框架选型视角
- 通用编排框架:生态成熟、组件多,适合把多种模型/工具串起来做复杂流程。
- 专用运行框架:强调本地工具执行、CLI/无头模式与可调试性,适合工程化部署。
- 选型关键不是「谁最强」,而是你的场景偏「对话编排」还是「自主执行」,以及是否需要清晰的执行轨迹用于排错。
⚠ 上线前必想清:步数上限、哪些工具有「副作用」需人工确认、失败如何回滚、以及如何观测每一步的 token 成本。
四、常见问题
小模型能跑 Agent 吗?
规划环节可用小模型降本,但复杂任务仍需旗舰模型保证决策质量,推荐分层。
Agent 回答不稳定怎么办?
把任务拆得更细、加强反思与单元测试、对关键步骤固定提示,并记录执行轨迹做复盘。