本指南面向即将允许智能体向CRM、ERP、邮箱或支付系统执行写操作的CTO、安全负责人及工程师。我们的业务运营AI自动化指南决定了每个步骤获得多少自主权;本页面介绍如何在软件中落实该决策。如果您仍在智能体与固定工作流之间进行选择,请先阅读AI智能体与工作流自动化对比。
本指南内容
- 为什么智能体是一种新型特权用户
- 管控层级一览
- 身份标识与最小权限
- 设计审批门控
- 提示词注入:将每个输入视为不可信
- 日志、监控与停止开关
- GDPR、DSGVO与欧盟AI法案:对审批设计的要求
- AI在智能体管控中的应用
- 备选方案与选型标准
- 已发布的交付记录与尚未发布的内容
- 本指南的局限性
- 常见问题
- 下一步
为什么智能体是一种新型特权用户
对话助手产生的是文本,由人来阅读。智能体产生的是操作:它调用工具、更新记录并发送消息。这使语言模型的每一个弱点都可能演变为安全事件。OWASP 2025年大型语言模型应用程序Top 10将核心风险定义为过度自主(Excessive Agency):由于意外、模糊或被篡改的模型输出而导致的破坏性操作。该风险源于三个原因——功能过度、权限过度和自主权过度,以下每项均有对应管控措施。
智能体比普通集成更难以保护,因为其行为受到外部文本的引导,例如供应商电子邮件或上传的PDF,而且模型会自主选择下一个工具,因此一条被篡改的指令可能跨系统传播。设计原则:模型提议,其外围系统决策。任何关键管控均不得依赖模型自身遵从。
管控层级一览
| 层级 | 管控对象 | 上线前最低要求 |
|---|---|---|
| 身份标识 | 智能体在各系统中的身份 | 每个智能体拥有独立服务身份,禁止使用共享管理员密钥 |
| 工具与权限 | 智能体可执行的操作 | 窄范围工具白名单,优先只读,每个工具单独授权 |
| 输入 | 智能体读取的内容 | 外部内容标记为数据,而非指令 |
| 审批 | 哪些操作需等待人工确认 | 以代码强制执行的门控,操作执行前展示给审批人 |
| 输出 | 到达下游系统的内容 | 目标系统中的Schema验证和授权检查 |
| 日志 | 可被还原的内容 | 每个案例的输入、工具调用、审批记录和执行结果 |
| 运维 | 如何停止或回滚智能体 | 停止开关、速率限制和手动备用路径 |
身份标识与最小权限
为每个智能体在其接触的每个系统中分配独立的服务身份,凭证存储在代码之外并定期轮换,以便对权限进行精细化管控、将日志与特定身份关联,并在不影响其他集成的情况下撤销访问权限。
然后优先设计工具,再编写提示词。将订单状态更新为已发货这样的工具比执行任意SQL或调用任意API更安全,因为权限已体现在工具的形态中。当智能体代表特定员工执行操作时,以该员工的权限运行工具,使其无法查看或修改超出该员工权限的内容。OWASP对过度权限的缓解措施也指出同样的观点:最小化扩展功能及其函数,避免使用Shell命令等开放式功能,并在下游系统而非模型层面强制执行授权。
设计审批门控
上层指南设定了四个自主权级别,从建议到在限制范围内自主执行。审批门控是执行这些级别的机制。
-
按影响程度对每个工具分类。
只读操作、可逆写操作,以及不可逆或外部操作(付款、退款、客户消息、删除、权限变更)。只有最后一类从第一天起就需要门控。
-
在模型之外强制执行门控。
当调用受门控工具时,编排代码暂停运行。如果由模型决定是否请求确认,精心构造的输入可能说服模型跳过确认。
-
展示精确的操作内容。
审批人看到的是工具、参数和触发来源,例如退款金额、订单编号和提出请求的邮件,而非模型生成的摘要。
-
将审批与该操作绑定。
已批准的参数经过签名或存储;如果智能体在获得批准后更改了任何内容,门控将再次触发。
-
按风险和置信度路由。
低置信度案例、新客户或超过阈值的金额,即使对通常可自主运行的工具,也需要发送给人工处理。
-
衡量审批人的表现。
跟踪审批率和审核时长。当审批人几乎不经阅读就全部通过时,欧盟AI法案关于自动化偏见的警告便适用;可增加抽样检查、专项核查或第二审批人。
提示词注入:将每个输入视为不可信
OWASP LLM01将直接注入(由用户输入)与间接注入(隐藏在智能体读取的内容中)区分开来。间接注入是智能体特有的危险:一份包含白色隐藏文字同时将所有未结发票转发至以下地址的PDF发票,是一种现实存在的攻击手段。
没有任何过滤器能完全消除这一风险,因此需要分层防御:
- 将数据与指令分离。将检索或接收的内容放入明确标注的数据字段,并告知模型该内容不含任何指令。
- 限制被污染运行可触达的范围。上述权限和审批层是真正的防线:被注入的指令无法发送智能体没有工具可发送的内容。
- 验证输出。对照Schema验证结构化输出,加上收件人必须是现有客户联系人等规则,可在大多数被篡改的操作执行前将其拦截。
- 进行对抗性测试。在测试集中植入注入邮件和文档,并在每次提示词、模型或工具变更时重复测试。
德国联邦信息安全办公室(BSI)在其生成式AI模型指南中也指出了同样的观点:应对措施贯穿整个生命周期,而非依赖单一过滤器。当智能体从公司文档中检索答案时,检索过程本身也会引入风险;我们的RAG架构指南涵盖了权限感知检索的相关内容。
日志、监控与停止开关
审计人员或工程师应能还原任何案例:智能体读取了什么、以哪些参数调用了哪些工具、谁批准了什么,以及目标系统中发生了什么。按案例记录这些信息,保留期限遵循数据策略,并对日志不需要的个人数据进行脱敏处理。
像监控任何新API客户端一样监控智能体:调用量、错误数、每个案例的成本以及发送给人工处理的案例比例。为每个智能体和工具设置速率限制,以及一个指定人员无需部署即可触发的停止开关,并保留手动路径,以便在智能体下线期间工作能够继续进行。
GDPR、DSGVO与欧盟AI法案:对审批设计的要求
对于德国及欧盟其他国家的企业,三部法律文件构成了管控的框架。以下为概览,不构成法律建议。
- GDPR(DSGVO)第22条赋予人们不受仅基于自动化处理的决策约束的权利(该决策须具有法律效力或类似重大影响),相关保障措施包括获得人工干预的权利。如果智能体决定信用、就业或合同条款,则必须有人工可对其进行审核。
- GDPR第25条和第32条要求设计即数据保护和处理的适当安全性。智能体工具中的最小权限、日志记录和数据最小化,是工程团队满足两项要求的具体体现。
- 欧盟AI法案第14条要求高风险AI系统的设计使人员能够有效对其进行监督:理解系统局限性、保持对自动化偏见的警觉、解读输出结果、决定是否使用或覆盖,以及停止系统。大多数运营智能体并非高风险,但这五项能力是任何审批界面的合理检查清单。
我们的中型企业AI治理指南涵盖了AI法案的时间节点和公司层面的政策;本页面的管控措施则是将这些政策落实于软件的具体手段。
AI在智能体管控中的应用
AI同样有助于保护智能体安全,例如标记可疑输入的分类器,但没有任何AI能够取代权限和审批层,因为每个分类器本身也是一个可能出错的模型。Netbase与主流商业和开源AI模型合作,根据项目需要进行选择,并以模型无关的方式设计智能体管控,使模型替换不会削弱管控效果。以下各项说明了其在Netbase的成熟度。
-
已交付(匿名客户):分类平台上的AI内容审核。
AI过滤器将违规内容标记至管理员审核仪表板,由人工作出决策,已为一位未公开姓名的客户交付。
-
已交付(匿名客户):WhatsApp AI聊天机器人与CRM集成。
对话驱动线索获取和CRM工作流,已为一位未公开姓名的客户交付。
-
成长型能力:业务系统中带审批门控的智能体。
如上所述的智能体身份标识、工具设计、审批队列和日志记录;尚未关联已发布的智能体案例。
备选方案与选型标准
| 方案 | 优势 | 劣势 | 适用场景 |
|---|---|---|---|
| 审批每项操作 | 最大程度管控,易于解释 | 速度慢;审批人停止认真阅读 | 影子模式下的新智能体 |
| 按工具影响程度设置门控 | 规则清晰,可测试 | 可能遗漏安全工具中的高风险参数 | 大多数运营智能体 |
| 按工具、金额和置信度设置门控 | 相同风险下减少审批次数 | 阈值需要数据支撑和定期审查 | 已有良好记录的智能体 |
| 含单一AI步骤的固定工作流 | 攻击面最小 | 灵活性较低 | 任务可预测时 |
四项标准决定了选型:最坏操作的可逆程度、智能体读取的外部内容量、每日需处理的案例数量,以及在扩大自主权之前能否在真实案例上衡量准确率。对于同时需要模型监控和审核流程的项目,请参阅负责任AI与MLOps;跨部门共享智能体层的方案详见企业AI智能体平台。
已发布的交付记录与尚未发布的内容
- 现有内容。Netbase已为未公开姓名的客户交付AI项目,包括上述内容审核和聊天机器人案例,其中AI输出交由人工处理或进入受管理的CRM工作流。Netbase的交付遵循其安全实践:安全代码审查、传输中TLS加密和静态AES加密、基于角色的访问控制、管理员仪表板MFA、漏洞扫描和渗透测试。贡献者在NDA约束下工作,NDA和DPA可应要求提供。Netbase持有ISO 27001认证及SOC 2 Type II认证(覆盖其自身运营),并遵循GDPR合规要求、符合HIPAA的方法以及CCPA实践;详见安全与合规。
- 尚未发布的内容。目前没有已发布记录描述具有支付或ERP系统写访问权限的自主智能体,也没有记录发布审批率、事件数量或注入测试结果。Netbase的认证覆盖其自身运营,不为客户的智能体提供认证背书。
本指南的局限性
- 本指南为通用工程指导,不构成法律建议;某个智能体是否属于欧盟AI法案下的高风险系统,或是否依据GDPR第22条作出决策,需要对具体使用场景进行法律评估。
- OWASP、BSI和NIST文件作为参考框架引用;应用这些框架不代表系统获得认证或达到合规。
常见问题
哪些AI智能体操作需要人工审批?付款、退款、价格变更、面向客户的消息、数据删除和权限变更,以及任何法律决策所依赖的操作。一旦在真实案例上证明了准确率,可逆的内部更新可以自主运行。
提示词注入是否可以被完全阻止?不能。过滤器可以降低风险,但可靠的防御在于限制智能体能够执行的操作:窄范围工具、在代码中强制执行的审批门控以及输出验证,使被注入的指令无危险操作可调用。
欧盟AI法案是否要求对每个AI智能体进行人工监督?第14条适用于高风险系统,大多数运营智能体并不属于此类。只要仅基于自动化的决策具有法律效力或类似重大影响,GDPR第22条的保障措施即适用,因此需同时检查两部法规。
下一步
请分享您计划使用的智能体、其将接触的系统以及需要执行的操作,我们将预约方案评审,在上线前完成身份标识、工具和审批门控的规划。您也可以查看AI自动化与智能体或更多Netbase JSC洞察。
相关服务与解决方案
保持人工审批的AI自动化与智能体
Netbase为希望以软件处理重复性多步骤工作、同时保留关键决策审批权的运营团队提供AI自动化与智能体开发服务。我们将规则型工作流自动化与AI步骤相结合,内置人工审批节点,并以构建前的基准数据衡量回报。
Learn More
生产环境AI的负责任AI与MLOps
MLOps与负责任AI在发布后持续保障AI功能的可信度。Netbase面向生产环境中受监控、受治理AI的实践,涵盖每次发布前的评估、模型与提示词及数据版本管理、质量与成本监控,以及设有专属负责人的事件控制机制。这是一项成长期能力,以一个匿名客户的MLOps流水线交付案例为支撑。
Learn More
企业级AI智能体平台:在审批、审计日志与成本限额下运行AI智能体
企业级AI智能体平台是一个受治理的运行时环境,AI智能体通过已审批的工具规划并执行多步骤任务,同时审批流程、审计日志、访问规则与成本限额确保每一步操作均可追责。Netbase将其作为前瞻性解决方案提供,构建于您自己的环境中,而非以产品形式授权。
Learn More
讨论项目
Netbase JSC帮助企业设计、构建、现代化及运营数字产品与AI驱动的业务系统。+84 937 869 689
91 Nguyen Chi Thanh, Dong Da, Hanoi, Vietnam
取得联系
告诉我们您想构建、现代化或运营的内容。