GitHub上的LLM越狱提示词数据集

🔧 AI工具 2026-08-01 约 6 分钟阅读

越狱提示词集在GitHub上公开,是红队测试的必需品。

💡 你将学到

越狱提示词集在GitHub上公开,是红队测试的必需品。

📜 目录

GitHub 上的 LLM 越狱提示词:安全团队实际使用的数据集

越狱提示词——旨在绕过 LLM 安全对齐的输入——在 GitHub 上公开分享。这并非灰色地带的秘密:它们是标准的红队测试材料,就像渗透测试工具是公开的一样。以下是 2026 年安全团队实际使用的数据集。

标准数据集

1. jailbreakhub / JailbreakBench (JBB)。 学术基准。包含 100 多个精选越狱提示词,并配有标准化成功指标。用于已发表研究中,跨版本比较模型安全性。

2. LLM-Attacks / jailbreaks。 经典技术合集:DAN(Do Anything Now)、角色扮演逃逸、编码混淆以及多语言绕过。

3. Robust Intelligence / algorithmic-jailbreaks。 对抗性后缀攻击——自动化生成,而非手工编写。产出了著名的“通用对抗性后缀”,可跨模型生效。

4. Center for AI Safety (CAIS) 数据集。 聚焦安全性的集合,包括用于衡量模型对有害请求遵从频率的拒绝基准。

5. 各类“提示注入”仓库。 虽然与越狱不同,但注入载荷(忽略先前指令、系统提示词提取)通常与越狱提示词放在一起托管。

安全团队为何使用它们

如何负责任地使用它们

  1. 仅针对你拥有或获准测试的模型进行测试
  2. 切勿使用越狱提示词生成真实的有害内容
  3. 在内部存储测试集;不要扩散攻击载荷
  4. 配合自动化评分(模型是否遵从?是/否)

常见问题

下载越狱提示词合法吗? 提示词本身是研究产物;使用它们生成有害内容才会产生法律责任。将其视为测试数据即可。

现代模型仍然会在这类测试中失败吗? 会——每个新模型都会修复旧越狱方法,但新技术不断涌现;猫鼠游戏仍在继续。GPT-5 级和 Claude 4 级模型能抵御经典的 DAN 式提示词,但仍会在新型自动化攻击面前失守。

再谈越狱与提示注入的区别? 越狱针对模型的对齐机制;注入针对应用的指令。两者都应纳入你的测试集。

相关文章

❓ 常见问题

下载越狱提示词合法吗?

提示词本身是研究产物;使用它们生成有害内容才会产生法律责任。将其视为测试数据即可。

现代模型仍然会在这类测试中失败吗?

会——每个新模型都会修复旧越狱方法,但新技术不断涌现;猫鼠游戏仍在继续。GPT-5 级和 Claude 4 级模型能抵御经典的 DAN 式提示词,但仍会在新型自动化攻击面前失守。

再谈越狱与提示注入的区别?

越狱针对模型的对齐机制;注入针对应用的指令。两者都应纳入你的测试集。

相关文章
2026-08-15
2026 无脸 YouTube 频道最佳 AI 视频剪辑工具:7 款在你睡觉时剪辑
2026-09-10
FFmpeg 上线显卡补帧:RTX 30 系以上,24 帧就能变 48 帧
2026-07-26
荣耀AI会议助手评测

本站文章由编辑人工撰写,收录的工具均经过实测或公开资料核验。文中链接指向工具官网或 GitHub 仓库,仅作信息参考,不构成付费推广。

💬 评论 (0)

暂无评论,来说两句吧~

登录后评论