GitHub上的LLM越狱提示词数据集
越狱提示词集在GitHub上公开,是红队测试的必需品。
💡 你将学到
越狱提示词集在GitHub上公开,是红队测试的必需品。
GitHub 上的 LLM 越狱提示词:安全团队实际使用的数据集
越狱提示词——旨在绕过 LLM 安全对齐的输入——在 GitHub 上公开分享。这并非灰色地带的秘密:它们是标准的红队测试材料,就像渗透测试工具是公开的一样。以下是 2026 年安全团队实际使用的数据集。
标准数据集
1. jailbreakhub / JailbreakBench (JBB)。 学术基准。包含 100 多个精选越狱提示词,并配有标准化成功指标。用于已发表研究中,跨版本比较模型安全性。
2. LLM-Attacks / jailbreaks。 经典技术合集:DAN(Do Anything Now)、角色扮演逃逸、编码混淆以及多语言绕过。
3. Robust Intelligence / algorithmic-jailbreaks。 对抗性后缀攻击——自动化生成,而非手工编写。产出了著名的“通用对抗性后缀”,可跨模型生效。
4. Center for AI Safety (CAIS) 数据集。 聚焦安全性的集合,包括用于衡量模型对有害请求遵从频率的拒绝基准。
5. 各类“提示注入”仓库。 虽然与越狱不同,但注入载荷(忽略先前指令、系统提示词提取)通常与越狱提示词放在一起托管。
安全团队为何使用它们
- 回归测试: 每次模型更新都应针对同一套提示词重新测试
- 供应商基准测试: 在采用前比较 Claude、GPT 与 Llama 的安全性
- 构建防御: 基于已知攻击模式训练分类器
- 合规要求: 许多企业 AI 政策要求有文档记录的红队测试
如何负责任地使用它们
- 仅针对你拥有或获准测试的模型进行测试
- 切勿使用越狱提示词生成真实的有害内容
- 在内部存储测试集;不要扩散攻击载荷
- 配合自动化评分(模型是否遵从?是/否)
常见问题
下载越狱提示词合法吗? 提示词本身是研究产物;使用它们生成有害内容才会产生法律责任。将其视为测试数据即可。
现代模型仍然会在这类测试中失败吗? 会——每个新模型都会修复旧越狱方法,但新技术不断涌现;猫鼠游戏仍在继续。GPT-5 级和 Claude 4 级模型能抵御经典的 DAN 式提示词,但仍会在新型自动化攻击面前失守。
再谈越狱与提示注入的区别? 越狱针对模型的对齐机制;注入针对应用的指令。两者都应纳入你的测试集。
相关文章
❓ 常见问题
下载越狱提示词合法吗?
提示词本身是研究产物;使用它们生成有害内容才会产生法律责任。将其视为测试数据即可。
现代模型仍然会在这类测试中失败吗?
会——每个新模型都会修复旧越狱方法,但新技术不断涌现;猫鼠游戏仍在继续。GPT-5 级和 Claude 4 级模型能抵御经典的 DAN 式提示词,但仍会在新型自动化攻击面前失守。
再谈越狱与提示注入的区别?
越狱针对模型的对齐机制;注入针对应用的指令。两者都应纳入你的测试集。
本站文章由编辑人工撰写,收录的工具均经过实测或公开资料核验。文中链接指向工具官网或 GitHub 仓库,仅作信息参考,不构成付费推广。
