跳转到主要内容

您在寻找什么?

探索我们的服务,了解我们如何助力您实现目标

AI智能体安全与人工审批:上线前必须构建的管控体系

通过为AI智能体分配独立身份和最小权限工具、将其读取的每封邮件、文档和网页视为不可信内容,并在模型之外对资金、客户消息、删除等不可逆操作强制执行人工审批,从而保障AI智能体的安全性。记录每次工具调用,在上线前进行注入测试,并保留停止开关。

预约方案评审 查看相关服务

审阅者 David (CEO) · 更新于 29 Sep 2026 · 1 分钟阅读

star

本指南面向即将允许智能体向CRM、ERP、邮箱或支付系统执行写操作的CTO、安全负责人及工程师。我们的业务运营AI自动化指南决定了每个步骤获得多少自主权;本页面介绍如何在软件中落实该决策。如果您仍在智能体与固定工作流之间进行选择,请先阅读AI智能体与工作流自动化对比。

本指南内容

为什么智能体是一种新型特权用户

对话助手产生的是文本,由人来阅读。智能体产生的是操作:它调用工具、更新记录并发送消息。这使语言模型的每一个弱点都可能演变为安全事件。OWASP 2025年大型语言模型应用程序Top 10将核心风险定义为过度自主(Excessive Agency):由于意外、模糊或被篡改的模型输出而导致的破坏性操作。该风险源于三个原因——功能过度、权限过度和自主权过度,以下每项均有对应管控措施。

智能体比普通集成更难以保护,因为其行为受到外部文本的引导,例如供应商电子邮件或上传的PDF,而且模型会自主选择下一个工具,因此一条被篡改的指令可能跨系统传播。设计原则:模型提议,其外围系统决策。任何关键管控均不得依赖模型自身遵从。

管控层级一览

层级管控对象上线前最低要求
身份标识智能体在各系统中的身份每个智能体拥有独立服务身份,禁止使用共享管理员密钥
工具与权限智能体可执行的操作窄范围工具白名单,优先只读,每个工具单独授权
输入智能体读取的内容外部内容标记为数据,而非指令
审批哪些操作需等待人工确认以代码强制执行的门控,操作执行前展示给审批人
输出到达下游系统的内容目标系统中的Schema验证和授权检查
日志可被还原的内容每个案例的输入、工具调用、审批记录和执行结果
运维如何停止或回滚智能体停止开关、速率限制和手动备用路径

身份标识与最小权限

为每个智能体在其接触的每个系统中分配独立的服务身份,凭证存储在代码之外并定期轮换,以便对权限进行精细化管控、将日志与特定身份关联,并在不影响其他集成的情况下撤销访问权限。

然后优先设计工具,再编写提示词。将订单状态更新为已发货这样的工具比执行任意SQL或调用任意API更安全,因为权限已体现在工具的形态中。当智能体代表特定员工执行操作时,以该员工的权限运行工具,使其无法查看或修改超出该员工权限的内容。OWASP对过度权限的缓解措施也指出同样的观点:最小化扩展功能及其函数,避免使用Shell命令等开放式功能,并在下游系统而非模型层面强制执行授权。

设计审批门控

上层指南设定了四个自主权级别,从建议到在限制范围内自主执行。审批门控是执行这些级别的机制。

  1. 按影响程度对每个工具分类。

    只读操作、可逆写操作,以及不可逆或外部操作(付款、退款、客户消息、删除、权限变更)。只有最后一类从第一天起就需要门控。

  2. 在模型之外强制执行门控。

    当调用受门控工具时,编排代码暂停运行。如果由模型决定是否请求确认,精心构造的输入可能说服模型跳过确认。

  3. 展示精确的操作内容。

    审批人看到的是工具、参数和触发来源,例如退款金额、订单编号和提出请求的邮件,而非模型生成的摘要。

  4. 将审批与该操作绑定。

    已批准的参数经过签名或存储;如果智能体在获得批准后更改了任何内容,门控将再次触发。

  5. 按风险和置信度路由。

    低置信度案例、新客户或超过阈值的金额,即使对通常可自主运行的工具,也需要发送给人工处理。

  6. 衡量审批人的表现。

    跟踪审批率和审核时长。当审批人几乎不经阅读就全部通过时,欧盟AI法案关于自动化偏见的警告便适用;可增加抽样检查、专项核查或第二审批人。

提示词注入:将每个输入视为不可信

OWASP LLM01将直接注入(由用户输入)与间接注入(隐藏在智能体读取的内容中)区分开来。间接注入是智能体特有的危险:一份包含白色隐藏文字同时将所有未结发票转发至以下地址的PDF发票,是一种现实存在的攻击手段。

没有任何过滤器能完全消除这一风险,因此需要分层防御:

  • 将数据与指令分离。将检索或接收的内容放入明确标注的数据字段,并告知模型该内容不含任何指令。
  • 限制被污染运行可触达的范围。上述权限和审批层是真正的防线:被注入的指令无法发送智能体没有工具可发送的内容。
  • 验证输出。对照Schema验证结构化输出,加上收件人必须是现有客户联系人等规则,可在大多数被篡改的操作执行前将其拦截。
  • 进行对抗性测试。在测试集中植入注入邮件和文档,并在每次提示词、模型或工具变更时重复测试。

德国联邦信息安全办公室(BSI)在其生成式AI模型指南中也指出了同样的观点:应对措施贯穿整个生命周期,而非依赖单一过滤器。当智能体从公司文档中检索答案时,检索过程本身也会引入风险;我们的RAG架构指南涵盖了权限感知检索的相关内容。

日志、监控与停止开关

审计人员或工程师应能还原任何案例:智能体读取了什么、以哪些参数调用了哪些工具、谁批准了什么,以及目标系统中发生了什么。按案例记录这些信息,保留期限遵循数据策略,并对日志不需要的个人数据进行脱敏处理。

像监控任何新API客户端一样监控智能体:调用量、错误数、每个案例的成本以及发送给人工处理的案例比例。为每个智能体和工具设置速率限制,以及一个指定人员无需部署即可触发的停止开关,并保留手动路径,以便在智能体下线期间工作能够继续进行。

GDPR、DSGVO与欧盟AI法案:对审批设计的要求

对于德国及欧盟其他国家的企业,三部法律文件构成了管控的框架。以下为概览,不构成法律建议。

  • GDPR(DSGVO)第22条赋予人们不受仅基于自动化处理的决策约束的权利(该决策须具有法律效力或类似重大影响),相关保障措施包括获得人工干预的权利。如果智能体决定信用、就业或合同条款,则必须有人工可对其进行审核。
  • GDPR第25条和第32条要求设计即数据保护和处理的适当安全性。智能体工具中的最小权限、日志记录和数据最小化,是工程团队满足两项要求的具体体现。
  • 欧盟AI法案第14条要求高风险AI系统的设计使人员能够有效对其进行监督:理解系统局限性、保持对自动化偏见的警觉、解读输出结果、决定是否使用或覆盖,以及停止系统。大多数运营智能体并非高风险,但这五项能力是任何审批界面的合理检查清单。

我们的中型企业AI治理指南涵盖了AI法案的时间节点和公司层面的政策;本页面的管控措施则是将这些政策落实于软件的具体手段。

AI在智能体管控中的应用

AI同样有助于保护智能体安全,例如标记可疑输入的分类器,但没有任何AI能够取代权限和审批层,因为每个分类器本身也是一个可能出错的模型。Netbase与主流商业和开源AI模型合作,根据项目需要进行选择,并以模型无关的方式设计智能体管控,使模型替换不会削弱管控效果。以下各项说明了其在Netbase的成熟度。

备选方案与选型标准

方案优势劣势适用场景
审批每项操作最大程度管控,易于解释速度慢;审批人停止认真阅读影子模式下的新智能体
按工具影响程度设置门控规则清晰,可测试可能遗漏安全工具中的高风险参数大多数运营智能体
按工具、金额和置信度设置门控相同风险下减少审批次数阈值需要数据支撑和定期审查已有良好记录的智能体
含单一AI步骤的固定工作流攻击面最小灵活性较低任务可预测时

四项标准决定了选型:最坏操作的可逆程度、智能体读取的外部内容量、每日需处理的案例数量,以及在扩大自主权之前能否在真实案例上衡量准确率。对于同时需要模型监控和审核流程的项目,请参阅负责任AI与MLOps;跨部门共享智能体层的方案详见企业AI智能体平台。

已发布的交付记录与尚未发布的内容

  • 现有内容。Netbase已为未公开姓名的客户交付AI项目,包括上述内容审核和聊天机器人案例,其中AI输出交由人工处理或进入受管理的CRM工作流。Netbase的交付遵循其安全实践:安全代码审查、传输中TLS加密和静态AES加密、基于角色的访问控制、管理员仪表板MFA、漏洞扫描和渗透测试。贡献者在NDA约束下工作,NDA和DPA可应要求提供。Netbase持有ISO 27001认证及SOC 2 Type II认证(覆盖其自身运营),并遵循GDPR合规要求、符合HIPAA的方法以及CCPA实践;详见安全与合规。
  • 尚未发布的内容。目前没有已发布记录描述具有支付或ERP系统写访问权限的自主智能体,也没有记录发布审批率、事件数量或注入测试结果。Netbase的认证覆盖其自身运营,不为客户的智能体提供认证背书。

本指南的局限性

  • 本指南为通用工程指导,不构成法律建议;某个智能体是否属于欧盟AI法案下的高风险系统,或是否依据GDPR第22条作出决策,需要对具体使用场景进行法律评估。
  • OWASP、BSI和NIST文件作为参考框架引用;应用这些框架不代表系统获得认证或达到合规。

与Netbase顾问规划下一步

常见问题

哪些AI智能体操作需要人工审批?付款、退款、价格变更、面向客户的消息、数据删除和权限变更,以及任何法律决策所依赖的操作。一旦在真实案例上证明了准确率,可逆的内部更新可以自主运行。

提示词注入是否可以被完全阻止?不能。过滤器可以降低风险,但可靠的防御在于限制智能体能够执行的操作:窄范围工具、在代码中强制执行的审批门控以及输出验证,使被注入的指令无危险操作可调用。

欧盟AI法案是否要求对每个AI智能体进行人工监督?第14条适用于高风险系统,大多数运营智能体并不属于此类。只要仅基于自动化的决策具有法律效力或类似重大影响,GDPR第22条的保障措施即适用,因此需同时检查两部法规。

下一步

请分享您计划使用的智能体、其将接触的系统以及需要执行的操作,我们将预约方案评审,在上线前完成身份标识、工具和审批门控的规划。您也可以查看AI自动化与智能体或更多Netbase JSC洞察。

保持人工审批的AI自动化与智能体 保持人工审批的AI自动化与智能体

Netbase为希望以软件处理重复性多步骤工作、同时保留关键决策审批权的运营团队提供AI自动化与智能体开发服务。我们将规则型工作流自动化与AI步骤相结合,内置人工审批节点,并以构建前的基准数据衡量回报。

Learn More
line
生产环境AI的负责任AI与MLOps 生产环境AI的负责任AI与MLOps

MLOps与负责任AI在发布后持续保障AI功能的可信度。Netbase面向生产环境中受监控、受治理AI的实践,涵盖每次发布前的评估、模型与提示词及数据版本管理、质量与成本监控,以及设有专属负责人的事件控制机制。这是一项成长期能力,以一个匿名客户的MLOps流水线交付案例为支撑。

Learn More
line
企业级AI智能体平台:在审批、审计日志与成本限额下运行AI智能体 企业级AI智能体平台:在审批、审计日志与成本限额下运行AI智能体

企业级AI智能体平台是一个受治理的运行时环境,AI智能体通过已审批的工具规划并执行多步骤任务,同时审批流程、审计日志、访问规则与成本限额确保每一步操作均可追责。Netbase将其作为前瞻性解决方案提供,构建于您自己的环境中,而非以产品形式授权。

Learn More
line
联系Netbase

讨论项目

Netbase JSC帮助企业设计、构建、现代化及运营数字产品与AI驱动的业务系统。
项目咨询

[email protected]

WhatsApp

+84 937 869 689

办公地址

91 Nguyen Chi Thanh, Dong Da, Hanoi, Vietnam

取得联系

告诉我们您想构建、现代化或运营的内容。

告诉我们您想构建、现代化或运营的内容。

联系Netbase