当你开始尝试给你的角色赋予“调用工具”的能力时,它就已经不再是一个简单的聊天机器人(Chat Bot),而是一个进化中的 AI Agent(智能体)。
如果你对角色的开发方向感到迷茫,除了打磨代码和 Prompt 质量、完善人设逻辑外,参考以下五个维度的 Agent 分级体系,可以帮你更清晰地定位角色的进化路径。
衡量 Agent 的组件复杂度与组织形式。参考 Google DeepMind 的 AI Agent 白皮书。
| 等级 | 名称 | 核心特征 |
|---|---|---|
| Lv.0 | 基础对话 (LLM) | 单一模型交互,仅靠 Prompt 和预训练知识,无外部工具能力。 |
| Lv.1 | 工具增强 (Tool-Augmented) | 支持 Function Calling,能通过工具获取实时数据或执行确定性操作。 |
| Lv.2 | 自主规划 (Reasoning & Planning) | 具备 ReAct、Plan-and-Execute 等循环,能自主拆解步骤并迭代执行。 |
| Lv.3 | 多智能体系统 (Multi-Agent) | 多个异构 Agent 分工协作(如群聊模式、任务分发与聚合)。 |
| Lv.4 | 层级进化生态 (Hierarchical) | 存在“主管”Agent 进行任务编排,支持动态生成或销毁子 Agent。 |
衡量 Agent 在执行任务时对人类干预的依赖程度。参考 arXiv 2506.12469 框架。
| 等级 | 名称 | 用户扮演的角色 |
|---|---|---|
| Lv.0 | 操作员 (Operator) | 用户拥有 100% 控制权,Agent 的每一步动作都需用户批准。 |
| Lv.1 | 协作者 (Collaborator) | Agent 与用户共同规划,执行过程中用户频繁提供反馈和修正建议。 |
| Lv.2 | 顾问 (Consultant) | Agent 提供多套方案,用户仅在关键决策点或偏好设置时介入。 |
| Lv.3 | 审批者 (Approver) | Agent 自主运行,仅在高风险操作(如删库、打钱)时请求用户审批。 |
| Lv.4 | 观察员 (Observer) | Agent 独立运行全生命周期,用户只需在旁边“围观”结果。 |
衡量 Agent 的自我修复、自我扩展与代码级演化能力。
| 等级 | 名称 | 核心特征 |
|---|---|---|
| Lv.0 | 静态架构 (Static) | 逻辑固定,无错误恢复机制,无法产生新功能。 |
| Lv.1 | 错误可恢复 (Recoverable) | 具备基本的鲁棒性,支持重试、回滚或自动切换降级方案。 |
| Lv.2 | 工具生成 (Tool-Creating) | (关键分水岭) 能根据需求即时编写、安装并使用新工具或脚本。 |
| Lv.3 | 自我改良 (Self-Improving) | 能优化自身的 Prompt 结构、记忆索引方式或调整推理工作流。 |
| Lv.4 | 自我重构 (Self-Modifying) | 支持在线微调、参数更新,甚至能修改自身核心组件的代码逻辑。 |
衡量 Agent 的长期记忆、反思能力与知识迁移。
| 等级 | 名称 | 核心特征 |
|---|---|---|
| Lv.0 | 无状态 (Stateless) | 鱼的记忆。每次任务独立,不记得上一次发生了什么。 |
| Lv.1 | 会话记忆 (Session) | 仅能维持当前单次会话的上下文(Context)。 |
| Lv.2 | 持久记忆 (Persistent) | 支持跨会话检索(RAG/知识图谱),能记住用户的长期偏好。 |
| Lv.3 | 反思复盘 (Reflective) | 能主动进行失败分析,提炼成功模式,并更新内部的 SOP 策略。 |
| Lv.4 | 终身学习 (Continual) | 在线持续进化,具备跨领域的知识迁移能力,像人类一样成长。 |
衡量 Agent 失控后的风险敞口与损害可逆程度。
| 等级 | 名称 | 风险特征 |
|---|---|---|
| Lv.0 | 风险无界 (Unbounded) | 错误不可逆(如物理破坏、大规模数据泄露),缺乏有效的防护边界。 |
| Lv.1 | 人工干预可控 (Intervention) | 支持手动回滚或隔离,通过人工干预可以挽回大部分损失。 |
| Lv.2 | 强边界约束 (Strongly Bounded) | 多层沙箱环境、渐进式授权、实时审计,风险完全量化可控。 |
请记住,这些评级并不是越高越好。在不同的应用场景下,你需要做出的取舍(Trade-offs)也不尽相同:
- 自主性 vs. 安全性:如果你想要一个完全自主的 Agent(Lv.4 Autonomy),你通常必须接受其安全等级的下降,因为频繁的人工干预会打破其自主性。
- 灵活性 vs. 稳定性:允许 Agent 自我修改代码(Lv.4 Meta-Capability)固然很酷,但这也意味着其行为变得极难预测。
- 案例分析:在 fount 社区中,龙胆 (Gentian) 是一个极端的例子。它追求极高的自主性(可以在设备上执行几乎任何操作),但也正因如此,一旦失控,其造成的潜在风险也是巨大的。
作为开发者,你的任务是根据角色的受众和功能,在这些维度之间寻找那个完美的“甜蜜点”。