Awesome AI Security

一份精选的 AI 安全相关框架、标准、学习资源和开源工具列表。
如果你想贡献内容,请创建 PR 或通过 @ottosulin 联系我。
目录
学习资源
阅读与指南
课程、实验室与 CTF
播客
治理与风险管理
框架
标准与验证
分类法、术语与风险数据库
清单与实用指南
攻击技术与红队
对抗性 ML 与经典模型
LLM 与 GenAI 红队
- garak - 用于 LLM 的安全探测工具
- ai-scanner - 基于 NVIDIA garak 构建的开源 Web 应用程序,用于 AI 模型安全评估。具有 179 个探针、多目标扫描、定时扫描、ASR 评分和 SIEM 集成功能。
- promptfoo - 测试你的提示词、智能体和 RAG。针对 LLM 的红队测试、渗透测试和漏洞扫描。比较 GPT、Claude、Gemini、Llama 等的性能。简单的声明式配置,支持命令行和 CI/CD 集成。
- PyRIT - 用于生成式 AI 的 Python 风险识别工具(PyRIT)是一个开源框架,旨在帮助安全专业人员和工程师主动识别生成式 AI 系统中的风险。
- PurpleLlama - 一套用于评估和改进 LLM 安全性的工具。
- augustus - 用于检测提示注入、越狱和对抗性攻击的 LLM 安全测试框架。190+ 个探针、28 个提供商、单个 Go 二进制文件。支持并发扫描、速率限制和重试逻辑,可用于生产环境。
- FuzzyAI - 一个强大的自动化 LLM 模糊测试工具,旨在帮助开发人员和安全研究人员识别并缓解其 LLM API 中的潜在越狱风险。
- EasyJailbreak - 一个易于使用的 Python 框架,用于生成对抗性越狱提示词。
- gptfuzz - GPTFUZZER 的官方仓库:使用自动生成的越狱提示词对大型语言模型进行红队测试
- llamator - 用于测试大型语言模型(LLM)漏洞的框架。
- agentic_security - Agentic LLM 漏洞扫描器 / AI 红队工具包
- Agentic Radar - 用于智能体工作流的开源 CLI 安全扫描器。
- RAPTOR - 基于 Claude Code 构建的自主攻防安全研究框架。串联静态分析(Semgrep、CodeQL)、二进制分析、LLM 驱动的漏洞验证、漏洞利用生成和补丁编写。支持基于 Z3 可行性分析的多模型编排。
- whistleblower - 用于测试通过 API 暴露的 AI 应用系统提示泄露与能力发现的攻击性安全工具
- promptmap - 用于自定义 LLM 应用程序的提示注入扫描器
- spikee - 用于评估和利用的简单提示注入工具包
- ps-fuzz -
智能体 AI 与 MCP 攻击工具
- RAMPART - 面向智能体 AI 应用程序的 pytest 原生安全与安保测试框架。
- AI-Infra-Guard - 由腾讯朱雀实验室开发的全面、智能、易用的 AI 红队平台。集成了基础设施扫描、MCP 扫描和越狱评估模块,提供一键式 Web UI、REST API 和基于 Docker 的部署,用于全面的 AI 安全评估。
- OpenPromptInjection - 用于提示注入攻击与防御的基准测试集
- AIMap - 面向暴露的 AI 智能体基础设施的互联网规模发现与安全测试平台。向 Shodan 查询 MCP 服务器、Ollama 实例、vLLM/LiteLLM 代理等——然后进行指纹识别、风险评分,并启动协议特定的攻击套件,实时流式输出结果。### AI 辅助进攻性安全
- PentestGPT - 一款由 GPT 赋能的渗透测试工具
- HackingBuddyGPT - 帮助白帽黑客用 50 行或更少的代码使用 LLM
- cai - 网络安全人工智能(Cybersecurity AI,CAI),一个开放且可直接用于漏洞赏金的人工智能(论文)
- shannon - 由 Keygraph 开发的全自主 AI 渗透测试器,面向 Web 应用与 API。采用白盒安全测试,分析源代码、识别攻击向量并执行真实漏洞利用。在 XBOW 基准上成功率达 96.15%(104 个漏洞利用中成功 100 个)。
- strix - Strix 是行为与真实黑客别无二致的自主 AI 智能体——它们动态运行你的代码、发现漏洞,并通过实际的概念验证(PoC)进行验证
- redamon - 由 AI 驱动的智能体化红队框架,可将从侦察、漏洞利用到后渗透的进攻性安全操作全程自动化,零人工干预。
- CyberStrikeAI - 用 Go 构建的 AI 原生安全测试平台。集成 100+ 安全工具,配备智能编排引擎,提供基于预定义安全角色的角色化测试、技能系统和全面的生命周期管理。使用 MCP 协议和 AI 智能体实现从对话命令到漏洞发现的端到端自动化。
- HexStrikeAI - HexStrike AI MCP Agents 是一个先进的 MCP 服务器,可让 AI 智能体(Claude、GPT、Copilot 等)自主运行 150+ 网络安全工具,用于自动化渗透测试、漏洞发现、漏洞赏金自动化和安全研究。
- mcp-for-security - 面向 SQLMap、FFUF、NMAP、Masscan 等流行安全工具的模型上下文协议(MCP)服务器集合。可将安全测试和渗透测试集成到 AI 工作流中。
- mcp-security-hub - 一个不断壮大的 MCP 服务器集合,将进攻性安全工具带给 AI 助手。支持 Nmap、Ghidra、Nuclei、SQLMap、Hashcat 等。
隐写术与隐蔽信道
- ST3GG - 一体化隐写术套件,具备多层编码、图像和音频隐写功能,并提供用于检测 AI 生成媒体中隐藏数据的隐写分析工具。
基准测试与评估
- ISC-Bench - 内部安全崩溃(Internal Safety Collapse):通过正常任务完成即可在 pass@3 中越狱任何前沿 LLM(Claude Opus 4.6、GPT-5.4)——无需对抗性提示。黑盒、跨领域、跨科学。全新的失效模式。 [论文]
- jailbreakbench - JailbreakBench:用于越狱语言模型的开放鲁棒性基准测试 [NeurIPS 2024 数据集与基准测试轨道]
- AgentDojo - 一个用于评估 LLM 智能体攻击与防御的动态环境。
- AIRTBench - 代码仓库:AIRTBench:衡量语言模型中的自主 AI 红队能力
- HackingBuddyGPT benchmark dataset - 自动化渗透测试的基准数据集
- AgentDoG - AgentDoG 是一个面向自主智能体的风险感知评估与防护框架。它专注于轨迹级风险评估,旨在判定智能体在不同应用场景下的执行轨迹是否包含安全风险。
- AICGSecEval - 腾讯的 AI 代码生成安全综合评估基准,覆盖 10 个 CWE 类别,并配备自动化测试工具
- Inspect - 由英国 AI 安全研究所开发的大语言模型评估框架。内置 200+ 预构建评估,涵盖提示词工程、工具使用、多轮对话和模型评分(model-graded scoring)。
- sec-code-bench - 阿里巴巴的基准测试,用于跨 17 个漏洞类别和 4 种编程语言评估 LLM 代码安全能力
防御与安全控制
输入/输出护栏
- NeMo-Guardrails - NeMo Guardrails 是一个开源工具包,可轻松为基于 LLM 的对话系统添加可编程护栏。
- LlamaFirewall - LlamaFirewall 是一个旨在检测和缓解以 AI 为中心的安全风险的框架,支持多层输入和输出,例如典型的 LLM 聊天以及更先进的多步骤智能体操作。
- llm-guard - Protect AI 出品的 LLM Guard 是一款综合性工具,旨在强化大语言模型(LLM)的安全性。
- Guardrails.ai - Guardrails 是一个 Python 包,允许用户为大语言模型(LLM)的输出添加结构、类型和质量保证
- TrustGate - 生成式应用防火墙(GAF),用于检测、预防和阻止针对 GenAI 应用的攻击
- ZenGuard AI - 面向 AI 智能体的最快信任层
- LocalMod - 自托管内容审核 API,具备提示词注入检测、有害内容过滤、PII 检测和 NSFW 分类功能。100% 离线运行。
- DynaGuard - 一个支持用户自定义策略的动态护栏模型
- AprielGuard - 8B 参数的安全与防护模型
- Safe Zone - Safe Zone 是一个开源的 PII 检测与护栏引擎,防止敏感数据泄露给 LLM 和第三方 API。
- superagent - Superagent 提供经过专门训练的护栏,使 AI 智能体安全且合规。
- ShellWard - AI 智能体安全中间件,提供 8 层防御以抵御提示词注入、数据外泄和危险命令。零依赖。
- CodeGate - 一个开源、注重隐私的项目,在开发者的代码生成 AI 工作流中充当安全层
- Future AGI - 开源、可自托管的平台,内置针对不安全输出(越狱、PII、注入、有害内容)的实时护栏,并支持评估、追踪、模拟,以及面向 LLM 和智能体应用的网关。
智能体运行时安全与沙箱
- OpenShell - OpenShell 是面向自主 AI 智能体的安全、私密运行时。它提供由声明式 YAML 策略约束的沙箱化执行环境,可防止未经授权的文件访问、数据外泄和不受控的网络活动。
- OpenSandbox - 面向 AI 智能体的安全、快速、可扩展的沙箱运行时。支持多语言 SDK、Docker/Kubernetes 运行时、gVisor/Kata Containers/Firecracker 隔离。CNCF Landscape 项目。
- CubeSandbox - 腾讯云推出的面向 AI 智能体的即时、并发、安全且轻量的沙箱。冷启动低于 60 毫秒,内存开销小于 5MB,兼容 E2B SDK。基于 RustVMM 和 KVM 构建,具备极致隔离能力(专用内核 + eBPF)。
- Aegis - 由 Antropos 出品的开源 AI 智能体 EDR。实时监控自主 AI 智能体的进程、文件、网络和行为。无遥测、无云,一切皆在本地。
- Microsoft Agent Governance Toolkit - 来自微软的 AI 智能体治理工具包 —— 面向自主 AI 智能体的策略执行、零信任身份、执行沙箱化和可靠性工程。覆盖 OWASP Agentic Top 10 的全部 10 项。
- agentfield - 面向智能体系统的开源控制平面,具备加密身份、策略执行和审计友好的可观测性。
- leash - Leash 将 AI 编码智能体封装在容器中并监控其活动。
- vibekit - 在干净、隔离的沙箱中运行 Claude Code、Gemini、Codex 或任何编码智能体,并内置敏感数据脱敏和可观测性。
- pipelock - 面向 AI 智能体的安全防护框架 —— 具备 DLP 扫描的出口代理、SSRF 保护、MCP 响应扫描和工作区完整性监控
- skill-scanner - 面向 AI 智能体技能(Skills)的安全扫描器,可检测提示词注入、数据外泄和恶意代码模式。结合基于模式的检测(YAML + YARA)、LLM-as-a-judge 和行为数据流分析,实现全面的威胁检测。
- SkillSpector - 面向 AI 智能体技能的安全扫描器。通过静态分析 + 可选的 LLM 语义评估,检测跨 16 个类别的 64 种漏洞模式。支持多格式输出(JSON、Markdown、SARIF)。
- Project CodeGuard - CoSAI 开源项目,用于保障 AI 辅助开发工作流的安全。CodeGuard 为 AI 编码助手提供安全控制和护栏,防止在 AI 生成代码的开发过程中引入漏洞。
- AgentLens - 面向 AI 安全与可解释性研究的智能体可观测性和重放工具。该框架可运行多会话智能体轨迹,以 ATIF 格式捕获这些轨迹,并跟踪跨会话的文件状态变更。专为研究跨多轮、多会话、多智能体交互中的 LLM 智能体行为而构建。
- claude-code-devcontainer -
MCP 安全
模型与工件扫描
- modelscan - ModelScan 是 Protect AI 的开源项目,用于扫描模型以判断其是否包含不安全代码。
- picklescan - 安全扫描器,用于检测执行可疑操作的 Python Pickle 文件
- fickling - 一个 Python pickling 反编译器与静态分析器
- medusa - AI 优先的安全扫描器,配备 74+ 分析器、180+ AI 智能体安全规则,并具备智能误报削减能力。支持所有语言。可检测 React2Shell、mcp-remote RCE 等 CVE。
- julius - 面向安全专业人员的 LLM 服务指纹识别工具。在渗透测试和攻击面发现过程中可检测 32+ AI 服务(Ollama、vLLM、LiteLLM、Hugging Face TGI 等)。使用基于 HTTP 的服务指纹识别来确定服务器基础设施。
- a2a-scanner - 扫描 A2A 智能体以发现潜在威胁和安全问题### AI 辅助的防御性安全
- Claude Code Security Review - 使用 Claude 分析代码变更以发现安全漏洞的 AI 驱动安全审查 GitHub Action。
- deepsec - Vercel Labs 推出的智能体驱动漏洞扫描器,利用编码智能体在大型代码库中查找难以发现的问题。支持并行扫描、PR diff 审查和 CI/CD 集成。
- defending-code-reference-harness - 使用 Claude 进行自主漏洞发现与修复的参考实现。包含威胁建模、扫描、分类和修补技能。
- Visa Vulnerability Agentic Harness - 包含 11 个阶段的智能体 SAST 流水线,从检测到 LLM 驱动的修复和对抗性验证。输出 SARIF,可与 Claude Code、Copilot 和 Gemini 集成。
- GhidraGPT - 将 GPT 模型集成到 Ghidra 中,实现自动化代码分析、变量重命名、漏洞检测和解释生成。
- IDAssist - 适用于 IDA Pro 的 AI 驱动逆向工程插件。通过语义知识图谱、RAG 文档搜索以及多 LLM 提供商(OpenAI、Anthropic、Ollama、LiteLLM)支持,将 LLM 驱动的分析集成到 IDA 界面中。可分析函数、建议重命名、回答有关代码的问题。
- ThreatForest - 基于 Strands 框架构建的智能体威胁建模平台。可从代码仓库自主生成攻击树,将攻击步骤映射到 MITRE ATT&CK 技术,并生成可操作的缓解建议。
- claude-grc-plugin - 可将 Claude 变成资深 GRC 分析师的 Claude Code 插件。包含 72+ 个参考文件,覆盖 15 个框架(NIST 800-53、FedRAMP、ISO 27001、SOC 2 等)、24 条斜杠命令以及面向联邦和商业合规工作的深度领域知识。
隐私与机密计算
数据与供应链安全
智能体 AI 安全技能
- Elastic Agent Skills - 为 Elastic 的 AI 助手提供的技能集合,支持跨日志、追踪和威胁情报进行自然语言安全调查
- Ghost Security Skills - 面向 Claude Code 的智能体应用安全(appsec)技能和工具
- tm_skills - 用于辅助持续威胁建模的智能体技能
- Trail of Bits Skills Marketplace - Trail of Bits 为安全研究、漏洞检测和审计工作流打造的 Claude Code 技能
- Semgrep Skills - 面向 Claude Code 和其他 AI 编码助手的官方 Semgrep 技能。直接在 AI 辅助开发工作流中提供安全扫描、代码分析和漏洞检测能力。
- claude-bug-bounty - 用于 AI 辅助漏洞赏金狩猎的 Claude Code 技能。自动化侦察、IDOR、XSS、SSRF、OAuth、GraphQL 和 LLM 注入测试,附带 4 关卡验证清单和报告生成。
- Anthropic Cybersecurity Skills - 为 AI 智能体提供的 734+ 个结构化网络安全技能。已映射 MITRE ATT&CK,遵循 agentskills.io 标准。兼容 Claude Code、Copilot、Codex CLI、Cursor 和 Gemini CLI。
- llm-sast-scanner - 面向 AI 编码智能体(Claude Code、Codex 等)的 SAST 技能,覆盖 34 个类别的结构化漏洞检测。具备 source-to-sink 污点分析、用于降低误报的 Judge 验证,以及在基准测试中 99%+ 的精确率/召回率。
- sast-skills - 将你的 AI 编码器变成 SAST 扫描器的智能体技能集合
- pentest-ai-agents - 31 个用于进攻性安全的 Claude Code 子智能体。覆盖侦察、Web、AD、云、移动、无线、社会工程学、载荷构建、逆向工程、漏洞利用链、检测工程、取证和报告生成等领域的专业 AI 子智能体。Tier 2 智能体可在审批门控下直接执行工具。
- Mantis Skills - Google 的解耦式、顺序化、面向安全的智能体 AI 技能流水线,用于跨任意规模的代码库自主审查、去重、验证、复现和修补漏洞。具备多阶段流水线(架构分析 → 威胁建模 → 研究 → 审查 → 复现 → 修补 → 校准 → 反思)、内置沙箱,以及可在迭代运行中不断适应的持续学习循环。支持 RTL 硬件、IaC、ML 流水线和编译后的二进制文件。
专注安全的 AI 模型
安全分类器与提示注入检测
领域适配的安全语言模型
- ATTACK-BERT - 用于将安全文本映射到 MITRE ATT&CK 技术的 sentence-transformer 模型。
- CySecBERT - 通过领域特定预训练适配网络安全和 CTI 任务的 BERT 模型。
数据集
- SafetyPrompts - 经过精心整理的安全相关提示词集合,用于评估 LLM 的安全与安保属性。
- Do-Not-Answer - 负责任的 LLM 不应回答的提示词数据集,用于安全评估和红队测试。
- JailBreakV-28K - 包含 28,000 条越狱提示词的大规模数据集,用于对 LLM 安全性进行基准测试。
- CL4R1T4S - 来自 ChatGPT、Claude、Gemini、Grok、Perplexity、Cursor、Lovable、Replit 等主要 AI 工具的泄露系统提示词。已知最大的生产环境系统提示词集合,用于透明度和攻击面研究。
- LEAKHUB - 系统提示词泄露排行榜 —— 用于跟踪和排名各 AI 产品系统提示词泄露情况的社区平台。
- Leaked System Prompts - 来自商业 AI 工具的泄露系统提示词集合 —— 有助于理解真实世界的提示词工程和攻击面。