智能体能力分层体系
(Agent 能力的五级进化体系:从思维 → 工具 → 策略 → 协作 → 自进化)
白皮书给出了一个非常重要的 Agent 能力分层体系,从 Level 0 → Level 4。这不是简单的“模型是否强”,而是整个系统结构在能力上的阶梯式跃迁。
注意: 每一层不是“选一种”,而是下一层会吸收上一层;每前进一步,都需要不仅更强的模型,更强的 Orchestration、Tooling、Memory 与 Governance 能力。
下面我按“架构深度 + 行为能力”逐级拆开。
Level 0 — Core Reasoning System(纯认知体,不连接真实世界)
白皮书对 Level 0 的描述非常明确:
这是单纯的「推理引擎」,没有工具、没有记忆、没有外部世界。
它只具备:
- 语言理解
- 逻辑推理
- 规划能力(理论上的)
- 基于训练数据的知识
但缺乏:
- 实时信息
- 执行能力
- 状态持续性
- 地域/系统连接
这个层级本质上还不是“Agent”,只能算“强推理模型”。
Level 0 的哲学本质:封闭世界假设(Closed-World Assumption)
模型认为世界 = 训练时见过的文本。 如果某件事发生在训练截止之后,它根本不知道。
典型“假 Agent”陷阱
很多人以为 prompt 写得复杂就等于 Agent,其实仍然是 Level 0。 比如:
- “请按以下步骤依次执行……”
- “你需要假装你在用 API 调用……”
- “你是一个全能助手,你可以做任何事……”
这些都只是“语言形容”,并不形成真正的 Agent 行为。
Level 1 — Connected Problem Solver(可访问世界、可执行动作)
这是「最基础,但已经算 Agent 的层级」。
文档定义:
能调用工具,能够查实时数据,能够完成单步骤任务。
核心能力的跃迁:
从“知道世界” → “接触世界”
Level 1 做的事是:
- 模型能说:“我需要查一下。”
- 然后真的查(调用 Search API / DB / RAG)
- 并把查到的数据用于生成答案
这是第一个“智能循环”,但它的循环是非常局部的:
reason → call tool → produce answer
这个层级本质是“单回合工具增强模型”
它能:
- 搜索
- 查询数据库
- 获取结构化数据
- 做一次性解析、合成
但不能:
- 做长链规划
- 跨多个步骤迭代
- 主动处理子任务
- 维护任务状态
这类系统通常仍然依赖「人类给出明确可执行指令」。
它只是增强版 ChatGPT,而不是任务执行系统。
Level 2 — Strategic Problem Solver(具备多步规划与上下文工程)
这是白皮书里非常关键的层级:
Level 2 能“构建一个计划”,并围绕这个计划进行上下文工程,然后逐步执行。
从系统视角:
这是第一层真正意义上的“Agent”
因为它具备:
- 多步骤推理(Chain-of-Thought, ReAct)
- 工具使用序列化(Tool chaining)
- 上下文工程(Context engineering)
- 状态管理(Stateful execution)
- 能根据中间结果调整计划(Dynamic replanning)
执行路径类似:
goal → plan → act1 → observe → adjust → act2 → observe → ... → finish
Level 2 的核心突破:上下文管理能力(Context Engineering)
文档特别强调:
Level 2 的关键是 Agent 能主动构建、修剪、组织上下文,使推理保持“聚焦”。
这是因为:
- 模型的 context window 有限
- 信息多了会压缩推理质量
- 信息少了会推错方向
- 工具调用结果格式各异,需要统一管理
这个层级是今天大多数“看似强”Agent 的上限
你看到的:
- 自动化客服
- 自动整合资料
- 自动生成报告
- 自动分析长文档
- 自动执行两三步的流程
大多数都停在 Level 2。
没有协作,没有自进化,没有委托能力。
Level 3 — Collaborative Multi-Agent System(多 Agent 协作体系)
这个层级跨度巨大,是从“单体 Agent”跳向“社会型智能系统”。
文档定义:
一个 Agent 能创建任务给另一个 Agent,形成分工合作的团队。
这相当于:
从“单个专家” → “一个小型组织”
它具备:
- Delegation:任务委派能力
- Specialization:多 Agent 按专业分工
- Coordination:协调不同 Agent 的任务顺序
- Aggregation:合并多个 Agent 输出
- Parallelism:多个 Agent 并发工作
- Long-running tasks:长周期执行(小时/天)
- Self-Consistency:互相审查、迭代
协作方式可以是:
- Manager → Worker
- Researcher → Writer → Critic
- Extractor → Analyzer → Executor
- Planner → Sub-planner → Executor
这和人类组织极其类似:
- PM 负责拆目标
- 工程师负责执行
- QA 负责审查
- Ops 负责运行
- 文档系统负责记录
Level 3 难点不在模型,而在“治理”
问题变成:
- 如何隔离 Agent 的权限?
- 如何防止无限循环委派?
- 如何调度?
- 如何监控?
- 如何避免冲突?
- 如何合并结果?
- 如何定义各 Agent 的职责边界?
这比“写一个强 prompt”难太多。
Level 3 的本质是:
一个 AI 多代理的操作系统(Agent OS)开始形成。
Level 4 — Self-Evolving System(自我扩展、自我进化的 Agent)
这是白皮书里最前沿的层级,也是最容易被误解的部分。
文档描述:
Level 4 的系统可以识别自己的能力缺口,并自动创建新工具或新 Agent 来弥补。
这意味着:
Agent 不再被明确编程,而是开始“自我扩充能力”。
表现包括:
1. Meta-Reasoning(元推理)
Agent 能判断:
- “我缺一个工具”
- “我缺一个子 Agent”
- “我该换策略”
- “我该重新设计任务结构”
2. Automatic Tool Creation(自动工具生成)
例如:
- 自动生成 Python 小脚本
- 自动生成 SQL
- 自动创建 Scraper
- 自动生成新的 API Wrapper
以弥补功能空白。
3. Automatic Agent Creation(自动构建子 Agent)
比如:
- “我需要一个负责情感分析的子 Agent”
- “我需要一个优化写作风格的 Critic Agent”
Agent 会调用某种「AgentFactory」或「Tooling Framework」来构建新的智能单位。
4. Self-Optimization(自我优化)
模型会根据历史轨迹:
- 总结模式
- 修正 prompt 格式
- 修正规划逻辑
- 修正工具使用策略
- 优化任务执行路径
形成“经验曲线”。
Level 4 的运行特征:
系统像“生态系统”一样变化,而不是像“程序”一样运行。
这一层是极少数组织在探索的(Google DeepMind / Anthropic / OpenAI 内部演示级系统)。
未来会在以下方向爆发:
- 科研自动化(AutoDiscover)
- 数学与算法自动探索(AlphaEvolve)
- 企业级自动化系统
- AI 自主运行的软件生态
Level 4 本质上是:
AI 系统开始具备“自我组织能力(Self-Organization)”。
深度总结(不带任何应用场景)
Level 的本质升级不是“能力强弱”,而是“系统结构”在升级
| Level | Agent 是什么? | 系统结构 |
|---|---|---|
| 0 | 大模型 | 单体推理模块 |
| 1 | 有工具的模型 | API + LLM |
| 2 | 有策略的 Agent | Orchestrator + Memory + Loop |
| 3 | 多 Agent 协作系统 | Delegation + SubAgents + Coordination |
| 4 | 自进化系统 | Meta-Agent + Tool/Agent Factory |
核心升级不是模型,而是:
- 状态
- 记忆
- 工具能力
- 角色体系
- 任务治理
- 系统拓扑结构
Level = 系统架构复杂度,决定了 Agent 的上限。
**准备继续 Part 5 吗?
Part 5 是最关键的一节:**
Core Agent Architecture(Model / Tools / Orchestration)
会完整拆解「每一层到底怎么写、怎么放、怎么抽象」。