#1精选的 LLM 越狱提示词与绕过技术集合,记录了绕过 AI 模型安全防护的对抗性输入。

使用SAM分割和CLIP模型来规避基于AI的诈骗图像分类器的对抗性图像扰动工具,用于安全研究。

红队家庭实验室搭建指南。在 Proxmox 和 pfSense 中搭建 GOAD 实验室,Operator/C2 与重定向器。

针对 AD 实验环境进行自动化对手模拟(Caldera),以验证 Sigma 检测覆盖范围并将结果映射到 MITRE ATT&CK。

按投递方式、编码方式和传播行为分类的公开报告提示注入技术追踪器,包含已确认的模型、来源和 MITRE ATLAS 标签。

研究代码实现了T-Backdoor,即针对脉冲神经网络的时序触发后门攻击,使用速率、延迟和抖动触发器,无需空间扰动。

防御框架,保持音频语言模型冻结,并添加中层风险门控与后层安全适配器,以在推理时阻止音频越狱。

生成HTML走私页面,通过JavaScript在客户端嵌入并重建文件,支持载荷编码、分块、混淆以及钓鱼诱饵模板。

黑盒输入阶段净化防御,通过损坏、扩散重建和DBSCAN共识投票来中和针对目标检测器的后门攻击。

针对 Web 代理的提示注入检测基准测试。

针对使用工具的LLM代理的控制令牌思维链抑制与解析器宽松攻击实验

针对灰盒木马攻击的研究代码,该攻击通过翻转微调LLM分类器中单个KV缓存位,并测量各类别的攻击成功率。

面向工具集成型 LLM 智能体的对抗攻击防御研究与实验代码,扩展 Agent Security Bench,加入新的防御策略与攻击场景。

Syntactic Ghost:一种针对预训练语言模型的不可感知通用后门攻击

研究代码,复现了来自SoK意图导向系统化论文的多轮LLM越狱实验(FITD、MRCJ、ActorAttack、X-Teaming)。

针对评分标准诱导偏好漂移(RIPD)的研究代码:进化式评分标准搜索、保持基准的选择,以及LLM评判者中的DPO策略错位评估。

此仓库包含论文“[Safety in Batches? Understanding and Mitigating Safety Failures in Batch Prompting]”的官方实现。