LLM 护栏 2026:是什么、用哪个开源框架、怎么开始
LLM 应用一切正常,直到有个用户叫它忽略指令。护栏就是过滤输入、输出和工具调用的那一层——没有安全团队也能加,看这篇。
💡 你将学到
LLM 应用一切正常,直到有个用户叫它忽略指令。护栏就是过滤输入、输出和工具调用的那一层——没有安全团队也能加,看这篇。
📜 目录
护栏 vs 安全训练
模型安全训练让基座模型拒绝明显的滥用。护栏是应用层控制的运行时机制:检查每一次输入、每一次输出、每一次工具调用的规则。它们能抓住训练抓不住的东西——因为在模型之后生效,而不是烤进模型里。(star 数 2026-08-13 实测)
三个扼制点
输入校验:prompt 到达模型之前——拦截提示注入模式(忽略之前的指令、套系统提示词)、剥离违禁内容、检测越狱模板。
输出校验:生成之后、用户看到之前——检查违规、PII 泄露、幻觉引用、违禁话题。这是最被低估的扼制点,也是挡住大多数真实事故的那一个。
动作校验:模型工具调用执行之前——验证工具、参数、动作是否需要人工批准。这是演示用 agent 和可部署 agent 的分界线。
开源框架
Guardrails AI(7,278 stars):验证器生态。写验证器(Python 函数或 ML 模型)挂到输入/输出轨上,框架运行它们,失败时还能让 LLM 重答。杀手功能是结构化输出验证——不匹配 schema 就重新提示,直到符合。
NeMo Guardrails(NVIDIA,6,929 stars):对话策略路线。用 Colang 流程定义允许的对话路径,轨外的一切被拦截或重定向。对话产品更强,学习成本更高。
PurpleLlama / Llama Guard(Meta,4,344 stars):分类器路线。Llama Guard 是微调的小模型,按安全类别给 prompt 和响应分类。部署快、不用写规则——但继承它的类别定义。
garak(NVIDIA,8,779 stars):不是运行时护栏,是测试工具——用数千个攻击提示(越狱、注入、数据泄露)探测你的应用,让你在用户发现之前知道护栏哪里会塌。
最小起步配置
- 输入输出挂 Llama Guard(或小分类器)——20 分钟,覆盖明显情况
- 在 Guardrails AI 里给应用特定规则加一个自定义验证器(禁竞品名、价格上限等)
- 每周对应用跑 garak,每个迭代修最严重的失败类别
2026 的心态
护栏不是做完就扔的清单,是循环:探测→发现失败→修补→再探测。能在生产环境活下来的应用,都是把红队测试当日常杂务而不是上线仪式的。
