Skip to content

概念卡片:AI Agent

一句话机制:Agent 是「会做事的大模型」——它把「理解任务、拆解步骤、调用工具、执行反馈、记住结果」五个能力组装成一个自动执行闭环,核心公式是 Agent = LLM(大脑)+ 工具调用 + 自动执行逻辑

五要素架构

模块职责常见实现
LLM理解任务、生成决策(「决定下一步做什么」)GPT / Claude / Gemini
Memory记忆:短期=当前任务上下文;长期=历史数据/结果向量库(FAISS)、Redis、本地库
Tools真正「做事」的能力层浏览器自动化(Playwright)、API、DB、文件、Shell
Planner把复杂任务拆成多步「竞品分析」→ 采集→抓取→分析→出报告
Executor调用工具、执行、返回结果框架内置循环

最小 Agent 的执行循环

用户输入任务 → LLM 分析 → 生成步骤 → 调用工具 → 返回结果 → 判断是否继续(循环)

典型落地场景(及各自关键约束)

场景Agent 做什么关键约束
跨境电商上架/价格监控/评论抓取/竞品分析账号隔离
社媒账号矩阵自动注册/定时发布/自动回复IP 环境必须隔离(代理网络分账号独立 IP)
数据采集自动识别页面结构、适配变化、自主修复页面变化导致规则失效
自动化网赚CPA/Affiliate 自动注册+引流合规风险高

不变量(必须成立的约束)

  • 「工具调用才是难点」:模型能力往往够,瓶颈在工具链稳定性(页面变化、API 限流、网络抖动)——这是 Agent 落地失败的第一原因。
  • Agent 不稳定是常态:复杂任务容易「卡住、误判、成本失控」,不是调一次就稳。
  • 网络环境影响巨大:自动注册/社媒/抓取类任务,IP 环境不稳定直接导致任务失败。

常见误解

  • 以为 Agent = 换个皮的 ChatGPT → ChatGPT 只「答话」,Agent 的差异在「自主调用工具执行任务」。
  • 以为难在模型 → 难在工具链和流程编排,模型只是其中一个环节。
  • 以为「AutoGPT 一挂就能全自动」→ 早期 AutoGPT 自主循环决策强但生产稳定性差,落地需人工在环(Human-in-the-loop)。

关联

  • 总览:AI大模型技术栈总览
  • 协议层(Agent 怎么连工具/连 Agent):概念卡片:MCP与Agent协议
  • 框架选型:[对比分析:AI Agent框架选型](./对比分析:AI Agent框架选型)
  • 源:B40-资源/语雀-Code-Summary/AITech/(AIAgent指南 / 初识OpenClaw / OpenClaw 系列)
最近更新