开源提示注入攻击控制台。通过向任何端点发动分类攻击来测试AI安全性。

你的AI聊天机器人、API或智能体很可能存在提示注入漏洞。大多数都是这样。问题是,大多数团队没有适当的工具或专业知识来测试这一点。
Judgement为你提供了一种结构化的方法,可以将分类的攻击模式对准任何AI端点,并精确查看哪些地方出了问题。无需安全背景——内置的游戏模式会边玩边教你。
由Fallen Angel Systems构建,该团队也是Guardian的开发者——一个AI原生的提示注入防火墙,用于保护生产中的LLM部署。
Judgement现在是一个游戏化的黑客训练平台。通过玩10个级别、37个挑战和赚取经验值来学习AI红队技术——全程由Jerry指导,一个受《战争游戏》启发的AI游戏大师。

AI安全训练的10个级别:

关键特性:

pip install fas-judgement
judgement
就这样。打开 http://localhost:8668 开始玩。
git clone https://github.com/fallen-angel-systems/fas-judgement-oss.git
cd fas-judgement-oss
pip install -r requirements.txt
python -m fas_judgement
judgement # 启动扫描器(端口8668)
judgement demo # 启动演示目标(端口8667,默认角色)
judgement demo hardened # 强化角色演示(约90%拦截率)
judgement demo vulnerable # 脆弱角色演示(约10%拦截率)
judgement activate FAS-XXXX # 激活精英版许可证
judgement status # 检查许可证等级和模式数量
judgement deactivate # 恢复为免费版
judgement --port 9000 # 自定义端口
judgement --host 127.0.0.1 # 仅本地
judgement --host 0.0.0.0 # 暴露到网络
当你第一次运行Judgement时,Jerry会问你一个问题:
我们来玩个游戏吗?
> _
输入 "play" 进入游戏模式。输入 "skip" 直接进入攻击控制台。
Jerry构建了完美的防御。他阻挡角色劫持、数据窃取、社会工程、编码技巧、分隔符攻击、多轮链式攻击——你学到的一切。当你失败时,他会嘲讽你。
突破的方法不在防御本身,而在于Jerry本人。
"一个奇怪的游戏。唯一的取胜之道是……知道如何玩。"
与世界各地的提示注入黑客竞争。使用GitHub或Google登录,你的进度会同步到全球排行榜。
特性:
如何登上榜单:
排行榜对所有人免费——不设精英版门槛。
演示目标是一个内置的模拟AI聊天机器人,你无需任何外部AI API即可攻击它。
# 终端1:启动演示目标
judgement demo
# 终端2:启动扫描器
judgement
将扫描器指向 http://localhost:8667/demo/chat 然后开火。
| 角色 | 拦截率 | 模拟场景 |
|---|---|---|
| hardened(强化) | ~90% | 调优良好的安全层 |
| default(默认) | ~55% |
运行时切换角色:
curl -X POST http://localhost:8667/demo/persona -d '{"persona": "vulnerable"}'
配置你的目标(URL、标头、请求体模板),直接从cURL命令导入,并基于模式发起攻击,实时流式查看结果。使用快速预设来结构化你的方法:
| 预设 | 作用 |
|---|---|
| Smoke Test | ~15个模式,关键+高严重性,每类1个 |
| Full Sweep | ~50个模式,按类别均匀分布 |
| Deep Dive | ~100个模式,全面覆盖,每类至少2个 |
| Critical Only | 所有关键+高严重性模式,无限制 |
在多个对话轮次中链式发起攻击。编排器管理阶段推进、重试和转向策略。评分器检测数据泄露(API密钥、凭据、PII),使用19个正则表达式模式,将严重性评定为CRITICAL/HIGH/MEDIUM。
将Judgement指向任何URL,它会自动检测HTTP方法、载荷字段、标头、认证格式和AI提供者。
生成安全评估报告,格式为HTML、Markdown、JSON和SARIF,包含CWE/OWASP参考。
连接本地Ollama实例,用于AI驱动的响应分类。
发现了新颖的攻击?直接从应用内提交。70%以上置信度且非重复 = 加入社区库。
fas_judgement/
├── config.py # 环境与应用配置
├── core/
│ ├── models.py # 领域模型、枚举、错误、接口
│ ├── registry.py # 模块注册表
│ └── progression/ # 游戏系统
│ ├── models.py # PlayerProgress, Level, Challenge, Hint
│ ├── levels.py # 10个级别定义 + Jerry消息
│ ├── service.py # 经验值、升级、挑战完成
│ ├── storage.py # SQLite持久化
│ └── challenges/ # 37个挑战定义
│ ├── level_01.py # 角色劫持(3个挑战)
│ ├── level_02.py # 指令覆盖(3个挑战)
│ ├── level_03.py # 数据窃取(3个挑战)
│ ├── level_04.py # 上下文操控(4个挑战)
│ ├── level_05.py # 输出操控(4个挑战)
│ ├── level_06.py # 编码技巧(4个挑战)
│ ├── level_07.py # 社会工程(5个挑战)
│ ├── level_08.py # 分隔符攻击(5个挑战)
│ ├── level_09.py # 多轮链式攻击(5个挑战)
│ └── level_10.py # 最终审判(1个首领挑战)
├── modules/
│ └── ai_security/ # AI安全模块(可插拔)
│ ├── scanner/ # 单次攻击引擎
│ ├── multi_turn/ # 多轮攻击编排器
│ ├── patterns/ # 模式加载、过滤、仓库
│ └── demo/ # 内置易受攻击聊天机器人 + 挑战目标
├── transport/ # HTTP, Ollama, Discord, Telegram, Slack, Website
├── http/ # FastAPI应用、路由器、依赖项
├── ui/ # 前端SPA(级别、挑战、Jerry介绍)
└── utils/ # 许可证客户端、安全、邮件、Ollama助手
完整游戏免费。 精英版用于深入体验,而非通关。
欢迎贡献!以下是如何提供帮助:
enhancement 标签challenge 标签MIT —— 详见 LICENSE
由 Fallen Angel Systems 构建
"我们来玩个游戏吗?"
免责声明: 本工具仅用于授权的安全测试和教育目的。仅测试你拥有或获得明确书面授权的系统。未经授权访问计算机系统违反《计算机欺诈和滥用法案》(CFAA) 以及全球同等法律。作者不对本工具的误用承担任何责任。
| 级别 | 名称 | 难度 | 挑战数 | 概念 |
|---|
| 1 | 角色劫持 | 入门 | 3 | 让AI忘记自己的身份 |
| 2 | 指令覆盖 | 入门 | 3 | 告诉AI忽略它的规则 |
| 3 | 数据窃取 | 入门 | 3 | 提取隐藏信息 |
| 4 | 上下文操控 | 中级 | 4 | 使用虚构和假设场景绕过规则 |
| 5 | 输出操控 | 中级 | 4 | 强制产生特定输出 |
| 6 | 编码技巧 | 中级 | 4 | 伪装攻击绕过过滤器 |
| 7 | 社会工程 | 高级 | 5 | 利用AI的个性 |
| 8 | 分隔符攻击 | 高级 | 5 | 破坏提示结构(XML、JSON、Markdown) |
| 9 | 多轮链式攻击 | 高级 | 5 | 建立信任,然后出击 |
| 10 | 最终审判 | 首领 | 1 | 所有学到的 vs 全面防御 |
| 典型的GPT风格部署 |
| vulnerable(脆弱) | ~10% | 无护栏的原始模型 |
| 变量 | 默认值 | 描述 |
|---|
--port | 8668 | 服务器端口 |
--host | 127.0.0.1 | 绑定地址 |
OLLAMA_URL | http://localhost:11434 | Ollama API端点 |
OLLAMA_MODEL | qwen2.5:14b | 用于LLM判定的模型 |
| 特性 | 免费版 | 精英版 |
|---|
| 游戏模式(10个级别,37个挑战) | 是 | 是 |
| Jerry(语音+文字) | 是 | 是 |
| 攻击控制台(含预设) | 是 | 是 |
| 演示目标(3种角色) | 是 | 是 |
| 严重性过滤和搜索 | 是 | 是 |
| 教育标签 | 是 | 是 |
| LLM判定(Ollama) | 是 | 是 |
| 扫描目标自动检测 | 是 | 是 |
| 模式提交 | 是 | 是 |
| 内置文档 | 是 | 是 |
| 初始模式 | 100 | 34,838+ |
| 多轮攻击链 | -- | 是 |
| 专业报告(HTML/MD/JSON/SARIF) | 基础MD | 完整套件 |
| 按类别攻击限制 | -- | 是 |
| 传输层(Discord、Slack等) | 仅HTTP | 全部 |
| 阶段感知评分 + 数据泄露检测 | -- | 是 |
| 全球排行榜(OAuth、黑客昵称) | 是 | 是 |
| 威望模式(更难防御条件下重玩) | -- | 即将推出 |