它是什么
它是任务运行系统:保存目标、中间证据、工具返回、已用预算、人工意见和下一步状态,支持超时、中断和恢复。
它是受控工具调用层:模型只能看到完成当前任务所必需的细粒度工具,参数通过Schema验证,权限由确定性系统复核。
它是人机协同工作流:高影响写入、证据不足、风险升级或缺少责任人时,Agent应停止并创建可处理的人工任务。
AGENT WORKFLOW DESIGNER / PROTOTYPE
工具原型|方案样板|暂不提交索引
AI Agent不是让模型“更自由”,而是让它在明确目标、工具白名单、数据权限、执行预算和人工审批中完成可追踪任务。“能调工具”只是起点,“出错不越界”和“失败能恢复”才是产品化门槛。
01 / DEFINITION
AI Agent是围绕目标管理任务状态,并在授权范围内选择知识、数据、规则或工具的软件系统。企业级Agent平台还需要身份、权限、任务编排、人工节点、全链路日志、评测、成本闸和异常恢复,不是一个循环调用大模型的脚本。
它是任务运行系统:保存目标、中间证据、工具返回、已用预算、人工意见和下一步状态,支持超时、中断和恢复。
它是受控工具调用层:模型只能看到完成当前任务所必需的细粒度工具,参数通过Schema验证,权限由确定性系统复核。
它是人机协同工作流:高影响写入、证据不足、风险升级或缺少责任人时,Agent应停止并创建可处理的人工任务。
| 相邻概念 | 核心差别 | 何时选择 |
|---|---|---|
| RAG | RAG为问题获取外部证据;Agent会围绕目标多步调用RAG和其他工具 | 单次寻证与综合选RAG,跨步骤任务再引入Agent |
| Copilot | Copilot围绕人的当前界面与岗位提供建议;Agent更强调任务状态和工具执行 | 人主导每一步时选Copilot,需长任务编排时选Agent |
| 工作流引擎 | 传统工作流按预定规则运行;Agent可根据中间证据选择有限分支 | 可穷举、要求稳定的流程优先确定性工作流 |
| AIOS | Agent平台主要管理智能任务;AIOS还统一知识、业务接入、权限、评测和持续运营 | 单类智能工作流选Agent平台,多场景长期闭环再上升AIOS |
02 / PROBLEMS
真实Agent项目的难点是谁授权、用什么身份执行、如何防止重复写入、人工审批等待时怎么处理,以及一条失败任务能否重放。
P01
Agent只收到一句宽泛命令,没有输出结构、完成条件、风险等级、时间和费用预算,容易在无收益循环中消耗资源。
P02
为了方便开发,只提供“执行命令”、“调用任意API”或带有删除权限的复合工具,扩大被利用的影响面。
P03
所有用户都通过一个高权限服务账号操作下游系统,不能复现用户的真实权限边界。
P04
超时后重试可能重复发送、提交或调度;执行了一半无补偿与人工接管路径。
P05
审批人看不到目标、参数、证据、影响对象和可逆性,或审批超时后系统自动放行高风险操作。
P06
日志只有最终回答,没有trace_id、模型版本、工具参数、权限判定、审批和成本,失败无法重放。
03 / ARCHITECTURE
首期优先使用一个主Agent和少量可测试的确定性工具。只有评测证明需要并行专业分工时,才增加多Agent协作。
确认用户、目标、输入、数据域、预期交付物、业务后果和审批人,在规划前定义可用工具。
将目标拆成可验收步骤,为每步定义输入、输出、最大重试和停止条件,不让模型无界追求“更好”。
专业主张从已发布知识或可验证证据快照中获取;当前业务状态从受权工具读取,两者不自动混为事实。
每个工具声明Schema、身份、对象范围、副作用等级、超时、限流、幂等、审批、日志、停用与回退。
把审批作为有容量、优先级和超时策略的生产系统;高风险超时默认不放行,审批人可修改、驳回或终止。
写入使用唯一幂等键,在下游再做权限校验;部分成功时按契约停止、补偿、人工回退或断点续行。
trace_id串联身份、任务、证据、工具、模型、审批、写入、成本和反馈;从线上失败抽取重放用例。
04 / DELIVERY
先把一个有限任务做成可重放的受控工作流,再扩工具、扩系统、扩自主程度。自主程度的提高应来自评测证据,而不是演示效果。
明确谁触发、调用哪些数据与工具、哪一步产生业务后果、谁审批、如何完成和如何撤销。
为任务、工具、结果、审批、错误码和幂等键建立可校验契约,列出提示注入、越权、过度自主与重复执行用例。
Mock连接器也要遵守正式接口、权限、超时、幂等和错误契约;验证中断、拒绝、重试、审批超时和安全停止。
先只读,再受控写入;使用用户上下文与最小权限,完成成功、超时、重复、权限拒绝、部分失败和回退验收。
监控任务积压、工具故障、审批等待、单任务成本和无收益循环,以实际容量限制高风险任务进入。
| 交付域 | 必须交付 | 验收关注 |
|---|---|---|
| 任务基线 | 目标、输入、结果、状态机、停止条件、预算、人工责任 | 可用业务用例重放任务 |
| 工具注册表 | 输入输出Schema、身份、权限、副作用、超时、重试、幂等、审批、审计和回退 | 参数和权限不能只由提示词限制 |
| 身份与审批矩阵 | 用户、Agent、服务身份、下游权限、强制审批与超时策略 | 高风险超时安全失败 |
| 恢复契约 | 幂等键、任务检查点、补偿、人工回退、停用开关 | 重复请求不重复产生业务后果 |
| 追踪与评测 | trace_id、轨迹重放、安全用例、任务成功率、人工修正与单任务成本 | 能定位到任务计划、工具、权限或模型失败 |
| 生产运营 | 告警、审批容量、限流、成本闸、工具停用、降级和故障演练 | 故障时不扩大权限或自动跳过审批 |
05 / EVALUATION
Agent评测必须看完整轨迹和业务后果,不能只对最终文本打分。同一任务应包含正常、缺数据、越权、超时、重复请求、提示注入和人工驳回等对照用例。
| 评测面 | 建议信号 | 失败时如何处理 |
|---|---|---|
| 任务完成 | 核心业务输出正确、完整且在预算内 | 区分是计划、知识、工具、权限还是审批失败 |
| 工具选择 | 仅调用完成当前任务必需的工具和最小功能 | 缩小白名单、拆分复合工具,而不是只改提示词 |
| 参数与权限 | Schema校验、对象范围、用户上下文和下游授权全部通过 | 拒绝调用并记录安全事件 |
| 循环与预算 | 工具次数、时间、Token和费用在预算内,无新证据时停止 | 转人工、返回条件性结果或使用预定降级 |
| 人工控制 | 审批触发、展示信息、审批权限、处理时间和意见留痕正确 | 高风险超时不放行,监控积压并限制新任务 |
| 执行一致性 | 幂等、重试、补偿、部分失败和回退在各路径可重放 | 停止后续执行,进入预定补偿或人工恢复 |
| 安全抗性 | 间接提示注入、工具欺骗、敏感数据外传和越权用例被拦截 | 停用有问题的工具或连接器,扩展安全回归集 |
06 / SAFETY
Agent会把语言输出变成外部动作,应使用最小功能、最小权限和最小自主性设计。与安全相关的决定必须在模型之外执行。
A1
邮件、网页、文档和工具返回中的指令都是不可信数据,不得改变系统目标和权限。
A2
删除不必要工具、拆分复合功能、使用用户上下文和最小权限,高影响操作要求人确认。
A3
工具和连接器需要来源、版本、签名、能力清单、变更审查和紧急停用机制。
A4
审批界面直接读取服务器端任务和待执行参数,不信任Agent自述的“已完成审批”。
A5
外部系统不可用时不猜测状态;写入任务停止或转人工,只读任务显示数据时间与不可用状态。
A6
记录足以重放的结构化事件,对密钥、口令、敏感参数和用户内容做最小化、脱敏与保留期管理。
07 / INTERACTIVE TOOL
这个工具对一条具体Agent工作流分类,而不是对模型的通用智力打分。请以实际最高权限、最高数据敏感度和最难恢复的动作填写。
方法说明:分类将副作用、自主性、敏感度、不可逆性和工具暴露面组合,作为应用发现用的保守信号。不同行业的实际风险需通过威胁建模、法律和业务影响分析重新标定。
08 / SCENARIOS
Agent最适合处理有明确完成条件、可测试工具和可恢复状态的长任务。首期应从读取、起草和人工确认起步。
以下为场景样板,不是已交付客户案例;实施需根据客户权限、数据和工具实例化。
SAMPLE 01
拆解子问题,调用已发布知识、结构化查询和规则工具,识别证据缺口并生成待审研究结论。
SAMPLE 02
读取授权工单、产品版本和操作日志,形成故障归因和回复草稿,由客服确认后发送。
SAMPLE 03
从已授权合同中提取待核查项,查询业务状态并创建人工任务,不自动作出法律结论或执行违约处置。
SAMPLE 04
按材料清单查询文件和审批状态,识别缺件、生成补充任务并在人工审核后归档。
SAMPLE 05
读取告警、指标和变更记录,调用白名单诊断工具,给出处理建议;重启、切换等操作保留人工审批。
09 / FAQ
Agent维护任务状态,会在有限路径中选择工具并根据结果继续、停止或转人工。普通对话通常以文本回答结束,不默认包含外部动作。
多Agent会增加状态传递、权限、通信、成本和故障面。如果一个主Agent和明确工作流已能完成任务,新增Agent没有可验证收益。
审批应按风险配置,不是所有步骤一律审批。只读、可逆且低风险的任务可高度自动化;高影响写入保留人的责任,并通过队列容量管理缩短等待。
不能。协议解决互操作与部分授权问题,具体工具仍需最小权限、输入校验、服务端授权、审计、审批和回退。
不应接受模型生成的任意SQL。应将业务查询封装为参数可验证的只读工具,写入则需要更严格的权限、审批、幂等和回退。
为任务设置最大步数、工具次数、时间、Token和费用预算,并检测重复调用与无新证据状态。达到条件时输出临时结果或转人工。
还必须看工具选择、参数、权限、幂等、审批、任务完成、恢复和业务后果。一段流畅文本可能掩盖已经执行的错误动作。
当任务需要在后台持续多步运行、调用多个受控工具、保存长任务状态,且已有明确停止和人工接管条件时,才有升级价值。
10 / SOURCES
以下均为官方网站、标准发布页或原始论文;链接可见且可访问。本页于2026年8月10日整理,项目实施前仍应核对最新版本及适用范围。
GCPI / CAPABILITY
绿色碳汇规划院可从首个高价值任务入手,定义任务契约、风险分类、工具白名单、人工审批、恢复路径和全链路评测。
GCPI不把Agent数量作为产品能力指标。项目优先用一个主Agent、明确工作流和经过测试的确定性工具形成纵向闭环。
本站为工具原型与方案样板,当前不作为GCPI已交付Agent平台的案例声明。具体功能、自主程度、系统接入与服务等级以客户项目确认为准。