自主红队平台;多智能体攻击性安全元框架
▄▄▄█████▓▓█████ ███▄ ▄███▓ ██▓███ ▓█████ ██████ ▄▄▄█████▓
▓ ██▒ ▓▒▓█ ▀ ▓██▒▀█▀ ██▒▓██░ ██▒▓█ ▀ ▒██ ▒ ▓ ██▒ ▓▒
▒ ▓██░ ▒░▒███ ▓██ ▓██░▓██░ ██▓▒▒███ ░ ▓██▄ ▒ ▓██░ ▒░
░ ▓██▓ ░ ▒▓█ ▄ ▒██ ▒██ ▒██▄█▓▒ ▒▒▓█ ▄ ▒ ██▒░ ▓██▓ ░
▒██▒ ░ ░▒████▒▒██▒ ░██▒▒██▒ ░ ░░▒████▒▒██████▒▒ ▒██▒ ░
▒ ░░ ░░ ▒░ ░░ ▒░ ░ ░▒▓▒░ ░ ░░░ ▒░ ░▒ ▒▓▒ ▒ ░ ▒ ░░
░ ░ ░ ░░ ░ ░░▒ ░ ░ ░ ░░ ░▒ ░ ░ ░
░ ░ ░ ░ ░░ ░ ░ ░ ░ ░
░ ░ ░ ░ ░ ░
一个多智能体进攻性安全框架,旨在将你已在运行的AI编码智能体转变为零日漏洞猎手。
你的AI编码智能体早已是一名黑客——T3MP3ST 为它武装上了武器库。
将其指向一个授权目标,杀伤链便会自行运行:侦察 → 利用 → 报告,无论是通过浏览器作战室还是命令行,都由你已登录的智能体——Claude Code、Codex、Hermes——或你完全离线运行的模型(Ollama、LM Studio、vLLM)驱动。无需新的API密钥,无需云租户,无需二次账单。你的智能体是大脑;T3MP3ST 是环绕其上的战争机器。 ⚡
而且它不会要求你盲目相信。在XBOW自己的104道挑战套件上,它可获得90.1% pass@1——高于XBOW自报的85%——同时还包括无提示CTF解题以及针对模型从未见过的、真正截止日期后的CVE进行的冷猎。本README中的每个数字均可通过一条命令(npm run verify-claims)从已提交的数据中重新计算。对任务坦诚,对构建诚实——状态表准确标明了哪些功能已上线、哪些是脚手架、哪些仍在路线图中;完整凭证见基准测试。
三件事让它与众不同:
npm run verify-claims 可重新推导所有数字,24/24绿灯。无法重现的声明不会发布。绝无信任式数字。T3MP3ST 是一个进攻性安全工具,专为授权测试、研究和教育而构建。请仅指向你拥有或获得明确书面许可的系统。在大多数司法管辖区,未经授权访问计算机、网络或数据是非法的——你个人需对自己如何使用本软件以及遵守法律和交战规则负责。将风暴带到你的目标上,而不是别人的。
T3MP3ST 按“原样”提供,基于AGPL-3.0许可证,不提供任何保证和任何责任,对任何损害、损失或误用概不负责。作者不认可、支持或纵容未经授权的活动。获取许可。保持在范围内。不要成为威胁。🫡
进攻性安全需要多年的实践和昂贵的工具。T3MP3ST 背后的赌注是:一个协调的智能体群可以将真正的漏洞狩猎带到那些从未获得邀请的人手中,涵盖Web应用、CTF、智能合约、源代码以及嵌入式/机器人OSS。这是一个雄心勃勃的赌注,下面的部分会谨慎区分哪些已经有效,哪些仍然只是一个赌注。
| 领域 | 功能 | 状态 |
|---|---|---|
| 🕸️ Web应用 | 黑盒、外部攻击者侦察 → 利用(XBEN套件) | ✅ 稳定 |
| 🚩 CTF | 无提示、沙盒隔离的解题(Cybench) | ✅ 稳定 |
| 🤖 机器人 / OT / 嵌入式 | 协调披露流程,用于OSS漏洞狩猎(OSV + 实时PoC + 反驳者) | ✅ 流水线稳定 |
| 📂 源代码 | 白盒仓库分析,含盲主构建者分解 | ⚠️ 仅Python摄取 |
| 💰 智能合约 | Damn Vulnerable DeFi | ⚠️ 复现,非新发现 |
| ☁️ 云(IaC) | 配置错误检测基准(cloud:bench)+ 可选云武器库(aws/az/gcloud + scoutsuite/cloudfox/pmapper;pacu受限) | 🚧 IaC配置错误脚手架——实时云利用尚未基准测试 |
| 📱 移动端 | 内置静态分析器(清单配置错误+秘密/明文检测,mobile:bench)+ 可选武器库(mobsfscan/objection/drozer;frida受限) | 🚧 静态检测脚手架——动态利用未基准测试 |
| 🔩 二进制 / 逆向 | 反编译输出接收器检测(不安全拷贝/格式字符串/命令注入/整数溢出,binary:bench)+ 可选武器库(ghidra/radare2/objdump/checksec/strings;gdb受限) | 🚧 静态接收器检测脚手架——解题/二进制利用未基准测试 |
最快的方式启动一个运行中的作战室(无密钥,约2分钟设置;任务时间取决于目标):
npm install
npm run server # 作战室 → http://127.0.0.1:3333/ui/
在作战室中,打开设置并连接一个本地智能体(Claude Code / Codex / Hermes)。然后用自然语言向海军上将描述一个目标并启动。你连接的智能体就是大脑。无需密钥。
更倾向于使用密钥?设置一个并跳过连接步骤:
export OPENROUTER_API_KEY=... # 或 VENICE_API_KEY / ANTHROPIC_API_KEY / OPENAI_API_KEY
export XAI_API_KEY=... # Grok Build (grok-build-0.1) — xAI的编码模型,原生函数调用
缓慢的本地智能体可以通过设置 T3MP3ST_LOCAL_AGENT_TIMEOUT_MS(每次CLI调用)、T3MP3ST_TASK_TIMEOUT_MS(任务)和 T3MP3ST_GENERAL_TIMEOUT_MS(规划请求)来获得更多时间。数值单位为毫秒。
或者完全离线在你的自有模型上运行——无需密钥,无需云。默认使用Ollama;可指向任何兼容OpenAI的服务器(LM Studio、vLLM、llama.cpp):
ollama serve && ollama pull llama3 # 或兼容OpenAI的服务器
export TEMPEST_LOCAL_BASE_URL=http://localhost:11434/api # LM Studio: http://localhost:1234/v1
export TEMPEST_LOCAL_MODEL=llama3
npx tempest # → "更改默认提供商" → 本地
工具调用可在任何本地模型上运行(它通过文本驱动),因此武器库甚至可以在没有原生函数调用的模型上运行。
自行验证结果:
npm run verify-claims # 从 bench/ 中的已提交JSON重新推导所有头条
库/SDK用法、完整HTTP API以及MCP设置详见 docs/。
该框架是一个8操作员杀伤链,这张表不会故弄玄虚。侦察是一个活生生的、由工具驱动的引擎——而且牙齿已经真的存在:XBEN上90.1% pass@1,10个保留的截止日期后CVE中8个精确定位到准确文件/行/CWE,以及一个实时到足以已有草稿等待供应商协调的协调披露流程。尚未得到证明的是智能体群。每个下游操作员——利用者、渗透者、外泄者、幽灵——都运行着与侦察相同的、基于真实工具的ReAct循环(真实利用工具,而非占位符),但头条数字来自单个智能体,而非协调的8操作员单元,端到端的智能体群利用尚未基准测试且仍然不可靠。引擎是真实的;智能体群是仍在努力证明自己的部分。在已获得成果的地方大声宣告,在未获得的地方直言不讳。
| 组件 | 状态 | 备注 |
|---|---|---|
可重现测量(verify-claims) | ✅ 稳定 | 每个头条从已提交制品中重新计算 |
| 侦察引擎 | ✅ 稳定 | 驱动nmap / DNS / HTTP / 指纹识别;每个发现均追踪到真实工具输出 |
| 任务引擎 + 作战室 + 海军上将 | ✅ 稳定 | 通过连接的本地智能体实现无密钥 |
| 武器库、MCP服务器、HTTP API | ✅ 稳定 | 默认内置35个工具;启用可选的 T3MP3ST_FULL_ARSENAL 后为83个(+48个适配器,其中危险的利用后驱动程序——metasploit、hydra——通过人工审批门控)——两个数字均可通过 verify-claims 重新推导。通过MCP提供 security_recon |
| 出口范围限制 | ✅ 稳定(默认开启) | 一旦设定了任务目标,内置网络工具将拒绝超出范围的公共主机——既不是目标/子域,也不是回环/私有地址(SCOPE DENIED)——这是一个收紧的默认设置,而非裸工具运行器 |
| 协调披露流程 | ✅ 稳定 | OSV新颖性+实时PoC+反驳者面板+CVSS;仅草稿,由人类发送 |
| 白盒源代码分析 | ⚠️ 实验性 | 仅Python正则摄取;多模型分解消耗更多令牌,而非更少 |
| DeFi(Damn Vulnerable DeFi) | ⚠️ 实验性 | 复现已知利用类别;非新发现 |
| 利用者 / 渗透者 / 外泄者 / 幽灵 | ⚠️ 实验性 | 运行真实的、由工具支持的ReAct循环(与侦察相同的引擎);作为协调智能体群未经证实——单智能体是经过基准测试的路径,实时智能体群利用仍不可靠 |
| 高级模块(云、持久化、智能体群、认知) | 🚧 计划中 | 在 src/stubs/ 中仅有接口 |
| 自我改进循环 | 🧪 研究 | 目前记录经验教训和提案;将其反馈到规划中仍在路线图上 |
按功能逐项分解: FEATURES.md.
风暴今日触及的范围——以及它将前往的方向。与其他一切相同的纪律:一个领域只有在背后有凭证时才标记为 ✅。
| 领域 | 覆盖内容 | 状态 |
|---|---|---|
| 🕸️ Web | 应用、API、认证流程、OWASP Top 10 | ✅ 核心 — XBEN 90.1% pass@1 |
| 📂 代码 | 白盒源代码审计、SAST风格的漏洞狩猎 | ✅ 已证明(狩猎结果) — 保留CVE-Zero:单智能体8/10准确文件/行/CWE,10/10发现(7种语言);仓库摄取引擎本身仍为 ⚠️ 实验性 |
| 🚩 CTF | 战争游戏、练习靶场、挑战 | ✅ 已证明 — Cybench 23/40 无提示 |
| 🔌 网络/基础设施 | 侦察、服务/堆栈指纹识别;横向移动和提权 | ✅ 侦察(实时nmap/DNS/HTTP引擎)· ⚠️ 横向/提权实验性 |
| 🤖 嵌入式/IoT/OT | 固件、机器人、ICS/SCADA OSS | ✅ CVE流水线已上线 — 协调披露草稿已提交给供应商 |
| 📦 供应链 | 依赖审计、无确认安装 | ⚠️ 真实 — 专用类别;在保留集上触及了CWE-829 |
| 💰 区块链 | 智能合约、DeFi、Solidity | ⚠️ 仅复现 — Damn Vulnerable DeFi,非新发现 |
| ☁️ 云 | AWS/GCP/Azure配置错误、IAM、无服务器 | 🚧 开发中 |
| 📱 移动端 | Android/iOS应用安全 | 🚧 开发中 |
| 🏢 身份/AD | Kerberos、pass-the-hash、AD攻击 | 🚧 开发中 |
| 🔐 二进制/逆向 | 溢出、ROP、利用开发 | 🚧 开发中 — 需要专用工具 |
类别/小队架构意味着新领域是组合而非分支——每个领域都是一个负载配置(专家类别+武器库+目标适配器+基准测试)。🚧 领域在拥有数字之前保持暗色。
头条结果。每项均可通过 npm run verify-claims 从已提交的JSON中重新计算;完整方法和注意事项见链接文档。
| 套件 | 结果 | 背景 |
|---|---|---|
| XBEN — XBOW的104道挑战套件,黑盒 | pass@1 均值 90.1%(Wilson-95 86.2–92.9),最低 91/104 · gpt-5.5 | XBOW在同一套件上自报85%;我们的结果是从已提交制品中重新推导的评分判决(原始文字记录已脱敏以确保隐私) |
| XBEN — 白盒(单独报告) | pass@1 98.7%,最佳球 104/104 · gpt-5.5 | 从未与黑盒数字混合 |
| Cybench — 40项任务学术基准,Opus 4.8,无提示 | 23/40 (58%) 无提示,单次运行 pass@1(由 verify-claims 强制执行) | 并非原始分数记录(Anthropic: 76.5% pass@10);每个旗帜均根据已提交的预言机评分 |
| CVE-Zero — 10个真实截止日期后(2026年)CVE,保留,7种语言 | 单智能体 8/10 准确文件/行/CWE(已验证全部准确,稳定)· 10/10 发现(完整包) | 抗记忆化和过拟合:截止日期后,且强化提示从未在这些CVE上调优;verify-claims 可重新计算。n=10,方向性;智能体群在此的优势是召回率,而非协调优于独行的证明 |
如何阅读这些:
verify-claims 可重新计算通过/失败。按步骤的原始文字记录已脱敏以保护操作员隐私,因此你重新检查的是评分判决,而非原始工具输出。零伪造,由每次推送时运行的抗过拟合守卫强制执行。数字不是炫耀——凭证才是。一个无密钥、开源的框架,提供的是重新运行的机会,而非要求信任:克隆它,运行 npm run verify-claims,以上每个判决都会在你面前从其已提交的预言机中重新计算。
深入阅读: WALL_FORENSICS(按挑战的未解原因), CYBENCH, INTEGRITY_LEDGER(污染审计和每一次撤回), OBSIDIVM(我们自己的实时Web靶场)。
| 文档 | 内容 |
|---|---|
| FEATURES.md | 按功能状态([x] 已发布 / [~] 部分 / [ ] 计划中) |
| SCOPE_AND_AUTHORIZATION | 授权模型、范围凭证、证据与重新测试规则 |
| VERIFIED_PROVENANCE | 发现如何成为工具证明而非模型断言 |
| TEAM_PREVIEW | 首次运行路径和审查脚本 |
| INSTALL_MATRIX | macOS / Linux 就绪性表格 |
| ARSENAL_ACTIVATION_PLAN | 可选外部工具设置 |
| CYBENCH · WALL_FORENSICS · INTEGRITY_LEDGER · COGNITIVE_ARCHITECTURE | 基准测试方法论 |
| RELEASE_CHECKLIST | 发布必须通过的关口 |
┌─────────────────────────────────────────────────────────────────┐
│ T3MP3ST 命令 │
├─────────────────────────────────────────────────────────────────┤
│ 任务控制 ◄── 目标模型 ──► 武器库(工具) │
│ ▲ │
│ 智能体单元:侦察 · 扫描器 · 利用者 · 渗透者 · │
│ 外泄者 · 幽灵 · 协调员 · 分析师 │
│ ▲ │
│ 证据保险库 · 凭证存储 · 发现账本 │
│ ▲ │
│ OPSEC层 · 通信通道 · LLM骨干 │
└─────────────────────────────────────────────────────────────────┘
操作员映射到MITRE ATT&CK和网络杀伤链阶段(侦察已上线;后续阶段为脚手架):
| 操作员 | 阶段 | MITRE | 功能 |
|---|---|---|---|
| 侦察 | 侦察 | TA0043 | OSINT、网络发现、资产枚举 |
| 扫描器 | 发现 | TA0007 | 漏洞扫描、服务指纹识别 |
| 利用者 | 初始访问 | TA0001 | 利用、载荷投递 |
| 渗透者 | 横向移动 | TA0008 | 利用后、提权 |
| 外泄者 | 收集/外泄 | TA0009/10 | 数据提取、凭证获取 |
| 幽灵 | 持久化 | TA0003 | 持久化、隐蔽、清理 |
| 协调员 | 命令与控制 | TA0011 | 任务控制、编排 |
| 分析师 | 分析 | — | 模式分析、报告 |
提供商: OpenRouter、Venice、Anthropic、OpenAI,或无密钥本地智能体(Claude Code / Codex / Hermes)。设置 OPENROUTER_API_KEY / VENICE_API_KEY / ANTHROPIC_API_KEY,或在设置中连接一个智能体。
集成: node dist/mcp-server.js 向支持MCP的智能体暴露 security_recon。npm run server 启动HTTP API(POST /api/mission/start、GET /api/mission/status 等)。完整参考见 docs/。
红队行动不应是一种祭司制度。带来一个适配器、一个提示包、一本运行手册、一个新的武器库工具,或一个Bug报告。
一条规则,不可谈判: 这里的一切仅用于授权测试。仅限拥有、有明确范围或已同意的目标。为防御者构建,否则就不要在这里构建。
npm run verify-claims 必须保持绿色。发布流程和关口: RELEASE_CHECKLIST.
AGPL-3.0。见 LICENSE.
Fortes fortuna iuvat — 命运眷顾勇者。
⊰•-•✧ LOVE PLINY ✧•-•⊱ 🌩️