任务拆解
把模糊目标拆成可执行的步骤序列
过去两年,我们习惯把 LLM 当成一个"对话界面" —— 你问一句,它答一句。
Agent 把这件事彻底翻转:它接住一个目标,自己规划、调用工具、迭代验证,直到目标达成。
这是从"用 AI"到"部署 AI"的范式转换。
ChatGPT 发布,Prompt Engineering 时代起步
GPT-4 函数调用,Tool Use 萌芽;LangChain 走红
Claude 3.5 + MCP 协议,工具调用标准化
SWE-bench 突破 60%,代理化软件工程成立
Claude Code / Cursor / Devin 主流化,Agent 进入日常生产
把模糊目标拆成可执行的步骤序列
读文件、跑命令、查 API,与外部世界连接
跨会话记住事实、偏好、上下文
评估结果、识别错误、迭代修正
多个 sub-agent 并行,主 agent 编排
写代码、跑代码、读结果,形成完整闭环
读取文件、状态、用户消息
规划下一步,选工具或终止
执行 tool call,获得结果
直到目标达成或终止条件触发
推理大脑 · LLM 本体
决策引擎 · planner / memory / harness
执行手脚 · MCP / 文件 / Shell / API
Claude Code · Cursor · Devin · 自主写代码 / 改 bug / 跑测试 / 提 PR
Deep Research · Manus · 跨网页检索 / 数据清洗 / 报告生成
客服 Agent · 工单流转 · 合同审阅 · 法务 / HR 流程自动化
日程 / 邮件 / 文档 · 私域记忆 · Computer Use 接管屏幕
SWE-bench Verified 从 2023 年 4.8% 升到 2026 年 72%,模型终于能写完整模块,而不只是补全。
MCP 协议把 tool use 标准化,任何模型都能即插即用工具;一年内生态从 0 到 10k+ servers。
长上下文 + 缓存普及。Agent 跑一个完整任务的成本从美金级降到分级,经济模型成立。
交付目标而不是输入指令 —— 你定义"做什么",它决定"怎么做"。
Agent 能力 = 它能访问什么。MCP 之后,工具栈即护城河。
每周省下的几小时,半年后会变成无法追平的产能差。