AI Agent安全2026:护栏、权限与人机协同清单

📘 教程 2026-08-11 约 5 分钟阅读

一个带发邮件工具的Agent,离给5000个客户发错邮件只差一条坏提示词。Agent安全是让自主性活下来的工程纪律。每张清单都该有什么?

💡 你将学到

一个带发邮件工具的Agent,离给5000个客户发错邮件只差一条坏提示词。Agent安全是让自主性活下来的工程纪律。每张清单都该有什么?

Agent手里的每个工具都是攻击者(或幻觉)能触发的能力。安全不是最后加的功能,而是Agent本身的权限设计。清单按层:第一层权限(任何部署前):最小权限(Agent只有任务需要的工具和作用域,邮件Agent不需要删除权限);读优先默认(先只读工具,写工具一个个加并说明理由);作用域凭据(专用服务账号按资源限额,别用你的个人API key);目的地白名单(发送动作只允许到批准的收件人/域名)。第二层护栏(运行时控制):人工批准门(不可逆或高影响动作——发送、删除、付款、部署——必须显式确认,标准是发前批准,一切不可撤销的都这样);预算和迭代上限(会话token预算和最大工具调用数,失控循环自己停);输出校验(模型输出先过schema再执行工具调用,畸形输出拒绝不执行);沙箱(碰外界的工具在隔离环境里以最少权限跑)。第三层检测(部署后):动作审计日志(每个工具调用记录输入输出和触发提示词,没记录就没法调查);异常告警(新目的地、异常批量、非常规时段如凌晨3点群发);对抗提示测试套件(安全指南的红队集,每次发布都跑)。人机协同设计模式:每个动作分类——自动(安全、可逆、低成本)、需批准(不可逆或高影响)、绝不允许(超出范围)。分类写进system prompt是偏好,在代码里强制才是法律。2026行业状态:OWASP把Agent特有风险加进了LLM指南,护栏框架(NeMo Guardrails、Llama Guard)提供可复用过滤器,共识很明确:自主性跑赢权限时Agent就会出事,最安全的Agent是权力无聊且有界的。

相关文章
2026-08-08
Windows 11的隐藏Bug让C盘悄悄膨胀上百G,7月14日补丁才来
2026-08-05
标题:59.5GB给了核显!Intel新驱动把共享显存上限拉到93%
2026-08-01
微软免费开源了一个 Linux 操作系统,没错!是微软出品

💬 评论 (0)

暂无评论,来说两句吧~

登录后评论