AI Agent安全2026:护栏、权限与人机协同清单
一个带发邮件工具的Agent,离给5000个客户发错邮件只差一条坏提示词。Agent安全是让自主性活下来的工程纪律。每张清单都该有什么?
💡 你将学到
一个带发邮件工具的Agent,离给5000个客户发错邮件只差一条坏提示词。Agent安全是让自主性活下来的工程纪律。每张清单都该有什么?
Agent手里的每个工具都是攻击者(或幻觉)能触发的能力。安全不是最后加的功能,而是Agent本身的权限设计。清单按层:第一层权限(任何部署前):最小权限(Agent只有任务需要的工具和作用域,邮件Agent不需要删除权限);读优先默认(先只读工具,写工具一个个加并说明理由);作用域凭据(专用服务账号按资源限额,别用你的个人API key);目的地白名单(发送动作只允许到批准的收件人/域名)。第二层护栏(运行时控制):人工批准门(不可逆或高影响动作——发送、删除、付款、部署——必须显式确认,标准是发前批准,一切不可撤销的都这样);预算和迭代上限(会话token预算和最大工具调用数,失控循环自己停);输出校验(模型输出先过schema再执行工具调用,畸形输出拒绝不执行);沙箱(碰外界的工具在隔离环境里以最少权限跑)。第三层检测(部署后):动作审计日志(每个工具调用记录输入输出和触发提示词,没记录就没法调查);异常告警(新目的地、异常批量、非常规时段如凌晨3点群发);对抗提示测试套件(安全指南的红队集,每次发布都跑)。人机协同设计模式:每个动作分类——自动(安全、可逆、低成本)、需批准(不可逆或高影响)、绝不允许(超出范围)。分类写进system prompt是偏好,在代码里强制才是法律。2026行业状态:OWASP把Agent特有风险加进了LLM指南,护栏框架(NeMo Guardrails、Llama Guard)提供可复用过滤器,共识很明确:自主性跑赢权限时Agent就会出事,最安全的Agent是权力无聊且有界的。
