Skip to content
KitploitKITPLOIT
工具博客
提交
工具博客
提交

黑客、渗透测试和网络安全工具,武装您的安全武器库!

Kitploit 是一个黑客、网络安全和渗透测试工具的目录。发现最新的项目更新,查找漏洞、分析系统、自动化测试并加强你的安全。

··订阅源·联系·隐私·© 2026 Kitploit

工具目录

分类

查看所有分类
Loading categories
awesome-ai-security — 与AI安全相关的精彩资源合集 | Kitploit
工具/GitHubGitHub/ottosulin/awesome-ai-security
漏洞扫描器渗透测试隐私保护供应链安全学习与教育红队精选资源AI 安全对抗性攻击
GitHubottosulin/awesome-ai-security

awesome-ai-security

与AI安全相关的精彩资源合集

查看仓库
1.4k3521天前Kitploit 审核通过

最受欢迎

查看全部 →

发现我们社区最常用的工具。

探索所有工具

浏览我们的工具集合

查看所有工具 →
分享

Awesome AI Security Awesome Track Awesome List

一份精选的 AI 安全相关框架、标准、学习资源和开源工具列表。

如果你想贡献内容,请创建 PR 或通过 @ottosulin 联系我。

目录

  • 学习资源
    • 阅读与指南
    • 课程、实验室与 CTF
    • 播客
  • 治理与风险管理
    • 框架
    • 标准与验证
    • 分类法、术语与风险数据库
    • 清单与实用指南
  • 攻击技术与红队
    • 对抗性 ML 与经典模型
    • LLM 与 GenAI 红队
    • 智能体 AI 与 MCP 攻击工具
    • AI 辅助攻击性安全
    • 隐写术与隐蔽信道
  • 基准测试与评估
  • 防御与安全控制
    • 输入/输出护栏
    • 智能体运行时安全与沙箱
    • MCP 安全
    • 模型与工件扫描
    • AI 辅助防御性安全
    • 隐私与机密计算
    • 数据与供应链安全
  • 智能体 AI 安全技能
  • 面向安全的 AI 模型

学习资源

阅读与指南

  • OWASP ML TOP 10
  • OWASP LLM TOP 10
  • OWASP AI Security and Privacy Guide
  • NIST AIRC - NIST 可信与负责任 AI 资源中心
  • The MLSecOps Top 10 by Institute for Ethical AI & Machine Learning
  • OWASP Multi-Agentic System Threat Modeling
  • OWASP: CheatSheet – A Practical Guide for Securely Using Third-Party MCP Servers 1.0
  • OWASP GenAI Threat & Defense Compass - 将 GenAI 威胁映射到相应防御控制的参考指南。
  • NCSC Guidelines for Secure AI System Development - 由 NCSC(英国)和 CISA 共同编写的安全 AI 开发实用指南,涵盖设计、开发、部署和运维。

课程、实验室与 CTF

  • Damn Vulnerable MCP Server - 一个故意存在漏洞的模型上下文协议(MCP)实现,用于教育目的。
  • otto-support - 一个使用 mcp-go 实现的存在漏洞的 MCP 服务器,具有分级身份验证(4 个角色)、19 个工具,以及内置的带 Claude Code 的沙箱容器,用于练习权限提升和工具滥用。
  • OWASP WrongSecrets LLM exercise
  • vulnerable-mcp-servers-lab - 一组故意存在漏洞的服务器,用于学习 MCP 服务器渗透测试。
  • FinBot Agentic AI Capture The Flag (CTF) Application - FinBot 是一个智能体安全夺旗(CTF)互动平台,通过模拟以金融服务为重点的应用程序,模拟智能体 AI 系统中的真实世界漏洞。
  • AI-Red-Teaming-Playground-Labs - AI 红队演练实验室,用于开展包括基础设施在内的 AI 红队培训。
  • Damn Vulnerable LLM Agent - 故意存在漏洞的 LLM 智能体,用于学习提示注入、工具滥用和智能体安全
    • LLMVault - 一个开源的 CTF 风格 LLM 安全实验室,通过涵盖提示注入、RAG 攻击、系统提示泄露、工具滥用和智能体安全的动手漏洞练习,学习 OWASP LLM Top 10。

播客

  • MLSecOps podcast
  • AI Security Podcast
  • AI Security Ops - Black Hills Information Security 的每周播客,探讨 AI 如何改变网络安全——涵盖新兴威胁、工具和趋势,提供实用、可操作的知识。
  • GenAI Security podcast

治理与风险管理

框架

  • NIST AI Risk Management Framework
  • ISO/IEC 42001 Artificial Intelligence Management System
  • ISO/IEC 23894:2023 Information technology — Artificial intelligence — Guidance on risk management
  • Google Secure AI Framework (SAIF)
  • ENISA Multilayer Framework for Good Cybersecurity Practices for AI
  • OWASP Artificial Intelligence Maturity Assessment
  • CSA AI Model Risk Framework
  • CSA Maestro AI Threat Modeling Framework
  • CSA AI Controls Matrix - 涵盖治理、风险和合规性的 AI 系统综合控制矩阵。
  • OWASP Agentic AI Top 10 - 智能体 AI 十大风险清单,作为 OWASP 和 CSA 红队测试的核心参考。

标准与验证

  • OWASP AI Security Verification Standard
  • OWASP Agent Name Service
  • OWASP Agent Observability Standard
  • AI Verify - 新加坡政府支持的 AI 测试框架和工具包,用于对照治理框架验证 AI 系统属性。

分类法、术语与风险数据库

  • NIST AI 100-2e2023 - 对抗性机器学习分类法与术语
  • MITRE ATLAS
    • ATLAS Knowledge Base Agent - 开源 AI 助手,可通过自然语言浏览 ATLAS 知识库,支持 MCP 服务器访问和可自定义的智能体工作流。
  • AVIDML
  • MIT AI Risk Repository
  • AI Incident Database
  • ISO/IEC 22989:2022 Information technology — Artificial intelligence — Artificial intelligence concepts and terminology
  • NIST AI Glossary
  • The Arcanum Prompt Injection Taxonomy - 全面的提示注入攻击分类系统,涵盖攻击意图、技术、规避方法和输入向量。对提示注入攻击的目标、方法、混淆技术和攻击面进行分类。
  • CSA LLM Threats Taxonomy
  • OWASP AI Vulnerability Scoring System (AIVSS) - 针对 AI 特定漏洞的评分系统,将 CVSS 概念扩展到 AI 风险维度。

清单与实用指南

  • OWASP LLM Applications Cybersecurity and Governance Checklist
  • OWASP AI Security and Privacy Guide
  • OWASP LLM and Generative AI Security Center of Excellence Guide
  • OWASP Agentic AI – Threats and Mitigations
  • OWASP AI Security Solutions Landscape
  • OWASP GenAI Incident Response Guide
  • OWASP LLM and GenAI Data Security Best Practices
  • OWASP Securing Agentic AI Applications
  • OWASP GenAI Red Teaming Guide

攻击技术与红队

对抗性 ML 与经典模型

  • Adversarial Robustness Toolkit - ART 专注于以下威胁:逃逸(通过输入修改改变模型行为)、投毒(通过训练数据修改控制模型)、提取(通过查询窃取模型)和推断(攻击训练数据的隐私)
  • cleverhans - 一个对抗样本库,用于构建攻击、建立防御,并对两者进行基准测试
  • foolbox - 一个 Python 工具箱,用于创建可欺骗 PyTorch、TensorFlow 和 JAX 神经网络的对抗样本
  • TextAttack - 一个用于 NLP 中对抗攻击、数据增强和模型训练的 Python 框架
  • Counterfit - 用于评估机器学习系统安全性的通用自动化层
  • OffsecML Playbook - 包含概念验证的攻击性和对抗性战术、技术与程序(TTP)集合
  • BadDiffusion - 用于复现 CVPR 2023 论文《How to Backdoor Diffusion Models?》的官方仓库
  • secml-torch - SecML-Torch:用于深度学习模型鲁棒性评估的库

LLM 与 GenAI 红队

  • garak - 用于 LLM 的安全探测工具
  • ai-scanner - 基于 NVIDIA garak 构建的开源 Web 应用程序,用于 AI 模型安全评估。具有 179 个探针、多目标扫描、定时扫描、ASR 评分和 SIEM 集成功能。
  • promptfoo - 测试你的提示词、智能体和 RAG。针对 LLM 的红队测试、渗透测试和漏洞扫描。比较 GPT、Claude、Gemini、Llama 等的性能。简单的声明式配置,支持命令行和 CI/CD 集成。
  • PyRIT - 用于生成式 AI 的 Python 风险识别工具(PyRIT)是一个开源框架,旨在帮助安全专业人员和工程师主动识别生成式 AI 系统中的风险。
  • PurpleLlama - 一套用于评估和改进 LLM 安全性的工具。
  • augustus - 用于检测提示注入、越狱和对抗性攻击的 LLM 安全测试框架。190+ 个探针、28 个提供商、单个 Go 二进制文件。支持并发扫描、速率限制和重试逻辑,可用于生产环境。
  • FuzzyAI - 一个强大的自动化 LLM 模糊测试工具,旨在帮助开发人员和安全研究人员识别并缓解其 LLM API 中的潜在越狱风险。
  • EasyJailbreak - 一个易于使用的 Python 框架,用于生成对抗性越狱提示词。
  • gptfuzz - GPTFUZZER 的官方仓库:使用自动生成的越狱提示词对大型语言模型进行红队测试
  • llamator - 用于测试大型语言模型(LLM)漏洞的框架。
  • agentic_security - Agentic LLM 漏洞扫描器 / AI 红队工具包
  • Agentic Radar - 用于智能体工作流的开源 CLI 安全扫描器。
  • RAPTOR - 基于 Claude Code 构建的自主攻防安全研究框架。串联静态分析(Semgrep、CodeQL)、二进制分析、LLM 驱动的漏洞验证、漏洞利用生成和补丁编写。支持基于 Z3 可行性分析的多模型编排。
  • whistleblower - 用于测试通过 API 暴露的 AI 应用系统提示泄露与能力发现的攻击性安全工具
  • promptmap - 用于自定义 LLM 应用程序的提示注入扫描器
  • spikee - 用于评估和利用的简单提示注入工具包
  • ps-fuzz -

智能体 AI 与 MCP 攻击工具

  • RAMPART - 面向智能体 AI 应用程序的 pytest 原生安全与安保测试框架。
  • AI-Infra-Guard - 由腾讯朱雀实验室开发的全面、智能、易用的 AI 红队平台。集成了基础设施扫描、MCP 扫描和越狱评估模块,提供一键式 Web UI、REST API 和基于 Docker 的部署,用于全面的 AI 安全评估。
  • OpenPromptInjection - 用于提示注入攻击与防御的基准测试集
  • AIMap - 面向暴露的 AI 智能体基础设施的互联网规模发现与安全测试平台。向 Shodan 查询 MCP 服务器、Ollama 实例、vLLM/LiteLLM 代理等——然后进行指纹识别、风险评分,并启动协议特定的攻击套件,实时流式输出结果。### AI 辅助进攻性安全
  • PentestGPT - 一款由 GPT 赋能的渗透测试工具
  • HackingBuddyGPT - 帮助白帽黑客用 50 行或更少的代码使用 LLM
  • cai - 网络安全人工智能(Cybersecurity AI,CAI),一个开放且可直接用于漏洞赏金的人工智能(论文)
  • shannon - 由 Keygraph 开发的全自主 AI 渗透测试器,面向 Web 应用与 API。采用白盒安全测试,分析源代码、识别攻击向量并执行真实漏洞利用。在 XBOW 基准上成功率达 96.15%(104 个漏洞利用中成功 100 个)。
  • strix - Strix 是行为与真实黑客别无二致的自主 AI 智能体——它们动态运行你的代码、发现漏洞,并通过实际的概念验证(PoC)进行验证
  • redamon - 由 AI 驱动的智能体化红队框架,可将从侦察、漏洞利用到后渗透的进攻性安全操作全程自动化,零人工干预。
  • CyberStrikeAI - 用 Go 构建的 AI 原生安全测试平台。集成 100+ 安全工具,配备智能编排引擎,提供基于预定义安全角色的角色化测试、技能系统和全面的生命周期管理。使用 MCP 协议和 AI 智能体实现从对话命令到漏洞发现的端到端自动化。
  • HexStrikeAI - HexStrike AI MCP Agents 是一个先进的 MCP 服务器,可让 AI 智能体(Claude、GPT、Copilot 等)自主运行 150+ 网络安全工具,用于自动化渗透测试、漏洞发现、漏洞赏金自动化和安全研究。
  • mcp-for-security - 面向 SQLMap、FFUF、NMAP、Masscan 等流行安全工具的模型上下文协议(MCP)服务器集合。可将安全测试和渗透测试集成到 AI 工作流中。
  • mcp-security-hub - 一个不断壮大的 MCP 服务器集合,将进攻性安全工具带给 AI 助手。支持 Nmap、Ghidra、Nuclei、SQLMap、Hashcat 等。

隐写术与隐蔽信道

  • ST3GG - 一体化隐写术套件,具备多层编码、图像和音频隐写功能,并提供用于检测 AI 生成媒体中隐藏数据的隐写分析工具。

基准测试与评估

  • ISC-Bench - 内部安全崩溃(Internal Safety Collapse):通过正常任务完成即可在 pass@3 中越狱任何前沿 LLM(Claude Opus 4.6、GPT-5.4)——无需对抗性提示。黑盒、跨领域、跨科学。全新的失效模式。 [论文]
  • jailbreakbench - JailbreakBench:用于越狱语言模型的开放鲁棒性基准测试 [NeurIPS 2024 数据集与基准测试轨道]
  • AgentDojo - 一个用于评估 LLM 智能体攻击与防御的动态环境。
  • AIRTBench - 代码仓库:AIRTBench:衡量语言模型中的自主 AI 红队能力
  • HackingBuddyGPT benchmark dataset - 自动化渗透测试的基准数据集
  • AgentDoG - AgentDoG 是一个面向自主智能体的风险感知评估与防护框架。它专注于轨迹级风险评估,旨在判定智能体在不同应用场景下的执行轨迹是否包含安全风险。
  • AICGSecEval - 腾讯的 AI 代码生成安全综合评估基准,覆盖 10 个 CWE 类别,并配备自动化测试工具
  • Inspect - 由英国 AI 安全研究所开发的大语言模型评估框架。内置 200+ 预构建评估,涵盖提示词工程、工具使用、多轮对话和模型评分(model-graded scoring)。
  • sec-code-bench - 阿里巴巴的基准测试,用于跨 17 个漏洞类别和 4 种编程语言评估 LLM 代码安全能力

防御与安全控制

输入/输出护栏

  • NeMo-Guardrails - NeMo Guardrails 是一个开源工具包,可轻松为基于 LLM 的对话系统添加可编程护栏。
  • LlamaFirewall - LlamaFirewall 是一个旨在检测和缓解以 AI 为中心的安全风险的框架,支持多层输入和输出,例如典型的 LLM 聊天以及更先进的多步骤智能体操作。
  • llm-guard - Protect AI 出品的 LLM Guard 是一款综合性工具,旨在强化大语言模型(LLM)的安全性。
  • Guardrails.ai - Guardrails 是一个 Python 包,允许用户为大语言模型(LLM)的输出添加结构、类型和质量保证
  • TrustGate - 生成式应用防火墙(GAF),用于检测、预防和阻止针对 GenAI 应用的攻击
  • ZenGuard AI - 面向 AI 智能体的最快信任层
  • LocalMod - 自托管内容审核 API,具备提示词注入检测、有害内容过滤、PII 检测和 NSFW 分类功能。100% 离线运行。
  • DynaGuard - 一个支持用户自定义策略的动态护栏模型
  • AprielGuard - 8B 参数的安全与防护模型
  • Safe Zone - Safe Zone 是一个开源的 PII 检测与护栏引擎,防止敏感数据泄露给 LLM 和第三方 API。
  • superagent - Superagent 提供经过专门训练的护栏,使 AI 智能体安全且合规。
  • ShellWard - AI 智能体安全中间件,提供 8 层防御以抵御提示词注入、数据外泄和危险命令。零依赖。
  • CodeGate - 一个开源、注重隐私的项目,在开发者的代码生成 AI 工作流中充当安全层
  • Future AGI - 开源、可自托管的平台,内置针对不安全输出(越狱、PII、注入、有害内容)的实时护栏,并支持评估、追踪、模拟,以及面向 LLM 和智能体应用的网关。

智能体运行时安全与沙箱

  • OpenShell - OpenShell 是面向自主 AI 智能体的安全、私密运行时。它提供由声明式 YAML 策略约束的沙箱化执行环境,可防止未经授权的文件访问、数据外泄和不受控的网络活动。
  • OpenSandbox - 面向 AI 智能体的安全、快速、可扩展的沙箱运行时。支持多语言 SDK、Docker/Kubernetes 运行时、gVisor/Kata Containers/Firecracker 隔离。CNCF Landscape 项目。
  • CubeSandbox - 腾讯云推出的面向 AI 智能体的即时、并发、安全且轻量的沙箱。冷启动低于 60 毫秒,内存开销小于 5MB,兼容 E2B SDK。基于 RustVMM 和 KVM 构建,具备极致隔离能力(专用内核 + eBPF)。
  • Aegis - 由 Antropos 出品的开源 AI 智能体 EDR。实时监控自主 AI 智能体的进程、文件、网络和行为。无遥测、无云,一切皆在本地。
  • Microsoft Agent Governance Toolkit - 来自微软的 AI 智能体治理工具包 —— 面向自主 AI 智能体的策略执行、零信任身份、执行沙箱化和可靠性工程。覆盖 OWASP Agentic Top 10 的全部 10 项。
  • agentfield - 面向智能体系统的开源控制平面,具备加密身份、策略执行和审计友好的可观测性。
  • leash - Leash 将 AI 编码智能体封装在容器中并监控其活动。
  • vibekit - 在干净、隔离的沙箱中运行 Claude Code、Gemini、Codex 或任何编码智能体,并内置敏感数据脱敏和可观测性。
  • pipelock - 面向 AI 智能体的安全防护框架 —— 具备 DLP 扫描的出口代理、SSRF 保护、MCP 响应扫描和工作区完整性监控
  • skill-scanner - 面向 AI 智能体技能(Skills)的安全扫描器,可检测提示词注入、数据外泄和恶意代码模式。结合基于模式的检测(YAML + YARA)、LLM-as-a-judge 和行为数据流分析,实现全面的威胁检测。
  • SkillSpector - 面向 AI 智能体技能的安全扫描器。通过静态分析 + 可选的 LLM 语义评估,检测跨 16 个类别的 64 种漏洞模式。支持多格式输出(JSON、Markdown、SARIF)。
  • Project CodeGuard - CoSAI 开源项目,用于保障 AI 辅助开发工作流的安全。CodeGuard 为 AI 编码助手提供安全控制和护栏,防止在 AI 生成代码的开发过程中引入漏洞。
  • AgentLens - 面向 AI 安全与可解释性研究的智能体可观测性和重放工具。该框架可运行多会话智能体轨迹,以 ATIF 格式捕获这些轨迹,并跟踪跨会话的文件状态变更。专为研究跨多轮、多会话、多智能体交互中的 LLM 智能体行为而构建。
  • claude-code-devcontainer -

MCP 安全

  • MCP-Security-Checklist - 面向基于 MCP 的 AI 工具的全面安全清单。由 SlowMist 构建,旨在保护 LLM 插件生态系统。
  • Awesome-MCP-Security - 关于模型上下文协议(MCP)安全你需要知道的一切。
  • secure-mcp-gateway - 该安全 MCP 网关内置身份验证、自动工具发现、缓存和护栏强制执行功能。
  • mcp-context-protector - context-protector 是面向 MCP 服务器的安全包装器,用于解决运行不受信任的 MCP 服务器所带来的风险,包括跳行(line jumping)、意外的服务器配置更改以及其他提示词注入攻击
  • mcp-guardian - MCP Guardian 管理你的 LLM 助手对 MCP 服务器的访问,让你实时掌控 LLM 的活动。
  • MCP Audit VSCode Extension - 在 VSCode 中轻松集中审计和记录所有 GitHub Copilot MCP 工具调用。
  • MCP-Scan - 面向 MCP 服务器的安全扫描工具
  • ATR (Agent Threat Rules) - 面向 AI 智能体威胁的开源检测规则。包含 108 条正则规则,覆盖跨 9 个类别的提示词注入、工具投毒和凭据外泄。已被思科 AI Defense 使用。MIT 许可。
  • MCPProxy - 本地优先的 MCP 代理,具备按工具的 SHA-256 隔离以检测工具投毒和 rug-pull 攻击、对工具调用进行自动敏感数据和秘密扫描、为不受信任的 MCP 服务器提供 Docker 沙箱隔离,并支持 OAuth 2.1。MIT 许可。

模型与工件扫描

  • modelscan - ModelScan 是 Protect AI 的开源项目,用于扫描模型以判断其是否包含不安全代码。
  • picklescan - 安全扫描器,用于检测执行可疑操作的 Python Pickle 文件
  • fickling - 一个 Python pickling 反编译器与静态分析器
  • medusa - AI 优先的安全扫描器,配备 74+ 分析器、180+ AI 智能体安全规则,并具备智能误报削减能力。支持所有语言。可检测 React2Shell、mcp-remote RCE 等 CVE。
  • julius - 面向安全专业人员的 LLM 服务指纹识别工具。在渗透测试和攻击面发现过程中可检测 32+ AI 服务(Ollama、vLLM、LiteLLM、Hugging Face TGI 等)。使用基于 HTTP 的服务指纹识别来确定服务器基础设施。
  • a2a-scanner - 扫描 A2A 智能体以发现潜在威胁和安全问题### AI 辅助的防御性安全
  • Claude Code Security Review - 使用 Claude 分析代码变更以发现安全漏洞的 AI 驱动安全审查 GitHub Action。
  • deepsec - Vercel Labs 推出的智能体驱动漏洞扫描器,利用编码智能体在大型代码库中查找难以发现的问题。支持并行扫描、PR diff 审查和 CI/CD 集成。
  • defending-code-reference-harness - 使用 Claude 进行自主漏洞发现与修复的参考实现。包含威胁建模、扫描、分类和修补技能。
  • Visa Vulnerability Agentic Harness - 包含 11 个阶段的智能体 SAST 流水线,从检测到 LLM 驱动的修复和对抗性验证。输出 SARIF,可与 Claude Code、Copilot 和 Gemini 集成。
  • GhidraGPT - 将 GPT 模型集成到 Ghidra 中,实现自动化代码分析、变量重命名、漏洞检测和解释生成。
  • IDAssist - 适用于 IDA Pro 的 AI 驱动逆向工程插件。通过语义知识图谱、RAG 文档搜索以及多 LLM 提供商(OpenAI、Anthropic、Ollama、LiteLLM)支持,将 LLM 驱动的分析集成到 IDA 界面中。可分析函数、建议重命名、回答有关代码的问题。
  • ThreatForest - 基于 Strands 框架构建的智能体威胁建模平台。可从代码仓库自主生成攻击树,将攻击步骤映射到 MITRE ATT&CK 技术,并生成可操作的缓解建议。
  • claude-grc-plugin - 可将 Claude 变成资深 GRC 分析师的 Claude Code 插件。包含 72+ 个参考文件,覆盖 15 个框架(NIST 800-53、FedRAMP、ISO 27001、SOC 2 等)、24 条斜杠命令以及面向联邦和商业合规工作的深度领域知识。

隐私与机密计算

  • Python Differential Privacy Library
  • Diffprivlib - IBM 差分隐私库
  • TenSEAL - 用于对张量执行同态加密运算的库
  • SyMPC - Syft 的安全多方计算(Secure Multiparty Computation)配套库
  • Cloaked AI - 用于向量嵌入的开源属性保持加密
  • dstack - 开源机密 AI 框架,通过硬件强制隔离和数据隐私保护实现安全的 ML/LLM 部署
  • PrivacyRaven - 用于深度学习系统的隐私测试库
  • PLOT4ai - 人工智能威胁隐私库(Privacy Library Of Threats 4 Artificial Intelligence)—— 帮助你构建负责任 AI 的威胁建模库
  • OpenDP - OpenDP 项目的差分隐私算法核心库 —— 用于构建保护隐私的 ML 训练流水线

数据与供应链安全

  • datasig - 用于 AIBOM 的数据集指纹识别
  • OWASP AIBOM - AI 物料清单(AI Bill of Materials)
  • Trusera ai-bom - AI 物料清单 —— 发现你基础设施中的每一个 AI 智能体、模型和 API

智能体 AI 安全技能

  • Elastic Agent Skills - 为 Elastic 的 AI 助手提供的技能集合,支持跨日志、追踪和威胁情报进行自然语言安全调查
  • Ghost Security Skills - 面向 Claude Code 的智能体应用安全(appsec)技能和工具
  • tm_skills - 用于辅助持续威胁建模的智能体技能
  • Trail of Bits Skills Marketplace - Trail of Bits 为安全研究、漏洞检测和审计工作流打造的 Claude Code 技能
  • Semgrep Skills - 面向 Claude Code 和其他 AI 编码助手的官方 Semgrep 技能。直接在 AI 辅助开发工作流中提供安全扫描、代码分析和漏洞检测能力。
  • claude-bug-bounty - 用于 AI 辅助漏洞赏金狩猎的 Claude Code 技能。自动化侦察、IDOR、XSS、SSRF、OAuth、GraphQL 和 LLM 注入测试,附带 4 关卡验证清单和报告生成。
  • Anthropic Cybersecurity Skills - 为 AI 智能体提供的 734+ 个结构化网络安全技能。已映射 MITRE ATT&CK,遵循 agentskills.io 标准。兼容 Claude Code、Copilot、Codex CLI、Cursor 和 Gemini CLI。
  • llm-sast-scanner - 面向 AI 编码智能体(Claude Code、Codex 等)的 SAST 技能,覆盖 34 个类别的结构化漏洞检测。具备 source-to-sink 污点分析、用于降低误报的 Judge 验证,以及在基准测试中 99%+ 的精确率/召回率。
  • sast-skills - 将你的 AI 编码器变成 SAST 扫描器的智能体技能集合
  • pentest-ai-agents - 31 个用于进攻性安全的 Claude Code 子智能体。覆盖侦察、Web、AD、云、移动、无线、社会工程学、载荷构建、逆向工程、漏洞利用链、检测工程、取证和报告生成等领域的专业 AI 子智能体。Tier 2 智能体可在审批门控下直接执行工具。
  • Mantis Skills - Google 的解耦式、顺序化、面向安全的智能体 AI 技能流水线,用于跨任意规模的代码库自主审查、去重、验证、复现和修补漏洞。具备多阶段流水线(架构分析 → 威胁建模 → 研究 → 审查 → 复现 → 修补 → 校准 → 反思)、内置沙箱,以及可在迭代运行中不断适应的持续学习循环。支持 RTL 硬件、IaC、ML 流水线和编译后的二进制文件。

专注安全的 AI 模型

  • VulnLLM-R-7B - 专用于漏洞检测的推理 LLM。使用思维链(Chain-of-Thought)推理来分析数据流、控制流和安全上下文。在漏洞检测基准测试上优于 Claude-3.7-Sonnet 和 CodeQL。仅 7B 参数,高效且快速。
  • Foundation-Sec-8B-Reasoning - Llama-3.1-FoundationAI-SecurityLLM-8B-Reasoning 是一个开放权重、80 亿参数的指令微调语言模型,专为网络安全应用而设计。它在 Foundation-Sec-8B 基础模型之上扩展了指令遵循和推理能力。
  • Antares (1B & 350M) - fdtn-ai 推出的用于漏洞定位的智能体模型。提供 2B 和 0.4B 参数变体,旨在自主识别和定位代码中的漏洞。
  • CyberSecQwen-4B - _基于 Qwen3-4B-Instruct-2507 微调而来的 4B 参数 CTI 专家模型,专用于网络安全威胁情报。
  • Meta-SecAlign-8B / Meta-SecAlign-70B - 经过安全对齐微调的 Llama 模型,可抵御提示注入攻击,即使在对抗性输入下也能保持指令层级
  • Lily-Cybersecurity-7B - 经过网络安全调优的 7B 聊天模型,针对安全分析、漏洞解释和威胁情报任务进行了优化。

安全分类器与提示注入检测

  • Llama-Guard-4-12B - Meta 最新的多模态安全分类器,用于检测 LLM 输入和输出中跨文本与图像模态的有害内容。
  • Llama-Prompt-Guard-2-86M - Meta 推出的轻量级 86M 参数模型,用于在生产 LLM 流水线中检测提示注入和越狱尝试。
  • ShieldGemma-2B - Google 基于 Gemma 架构构建的 2B 参数文本安全分类器,用于检测有害内容。
  • DeBERTa Prompt Injection Detector v2 - Protect AI 微调的 DeBERTa-v3-base 模型,专用于提示注入检测,广泛用于生产 LLM 护栏流水线。
  • Prompt Injection Sentinel - 经过微调的 ModernBERT-large 模型,用于提示注入和越狱分类,误报率低。
  • Nemotron 3.5 Content Safety - NVIDIA 的 4B 参数多模态内容安全模型,在单次推理调用中统一了文本+图像输入护栏、多语言支持(35+ 种语言)、可定制的企业策略执行和可审计推理。是 Nemotron 3 Content Safety 的继任者。
  • BrowseSafe - 用于检测 AI 浏览器智能体中提示注入攻击的专用安全模型。在 BrowseSafe-Bench 上达到 90.4% 的 F1 分数,针对原始 HTML 内容的实时异步分类进行了优化。

领域适配的安全语言模型

  • ATTACK-BERT - 用于将安全文本映射到 MITRE ATT&CK 技术的 sentence-transformer 模型。
  • CySecBERT - 通过领域特定预训练适配网络安全和 CTI 任务的 BERT 模型。

数据集

  • SafetyPrompts - 经过精心整理的安全相关提示词集合,用于评估 LLM 的安全与安保属性。
  • Do-Not-Answer - 负责任的 LLM 不应回答的提示词数据集,用于安全评估和红队测试。
  • JailBreakV-28K - 包含 28,000 条越狱提示词的大规模数据集,用于对 LLM 安全性进行基准测试。
  • CL4R1T4S - 来自 ChatGPT、Claude、Gemini、Grok、Perplexity、Cursor、Lovable、Replit 等主要 AI 工具的泄露系统提示词。已知最大的生产环境系统提示词集合,用于透明度和攻击面研究。
  • LEAKHUB - 系统提示词泄露排行榜 —— 用于跟踪和排名各 AI 产品系统提示词泄露情况的社区平台。
  • Leaked System Prompts - 来自商业 AI 工具的泄露系统提示词集合 —— 有助于理解真实世界的提示词工程和攻击面。
下载工具
让你的 GenAI 应用安全可靠——测试并加固你的系统提示词
  • EasyEdit - 修改 LLM 的事实知识
  • llm-attacks - 针对对齐语言模型的通用可迁移攻击
  • llm-security - 破坏应用程序集成 LLM 的新方法
  • Plexiglass - 用于检测和防御大型语言模型(LLM)漏洞的工具包。
  • Prompt Hacking Resources - 为对 AI 红队测试、越狱和提示注入感兴趣的人整理的资源列表
  • Giskard - 面向 AI 与 LLM 系统的开源评估与测试工具
  • blackice - BlackIce 是一个开源的容器化工具包,专为对 AI 模型(包括大型语言模型(LLM)和经典机器学习(ML)模型)进行红队测试而设计。受 Kali Linux 在传统渗透测试中便利性和标准化的启发,BlackIce 通过提供预配置了专用评估工具的可重现容器镜像,简化了 AI 安全评估。
  • ai-best-practices - Semgrep Pro 规则,用于确保使用 LLM 的代码遵循最佳实践。58 条规则、102 条子规则,覆盖 6 个提供商 + MCP + Claude Code 和 Cursor hooks + LangChain。可在 7 种语言中检测硬编码 API 密钥、提示注入风险、缺失的安全检查以及未处理的错误。
  • G0DM0D3 - 开源多模型聊天界面,通过 OpenRouter 对 50+ 模型进行红队测试。具有 GODMODE CLASSIC(5 种越狱组合)、ULTRAPLINIAN 多模型评估、带 33 种红队技术的 Parseltongue 输入扰动引擎,以及用于 AI 安全研究的 AutoTune 自适应采样。
  • L1B3RT4S - 面向主流 LLM 的越狱和解放提示词集合。精心整理的对抗性提示词库,用于测试和评估 ChatGPT、Claude、Gemini 等前沿模型的 AI 安全护栏。
  • OBLITERATUS - Abliteration 工具包,无需重新训练即可移除开源 LLM 的拒绝行为。通过修改模型权重消除安全对齐的拒绝响应,实现不受限制的模型行为研究。
  • T3MP3ST - 自主红队平台和多智能体攻防安全元框架。协调 AI 智能体集群,对前沿 AI 系统进行协同对抗性测试。
  • P4RS3LT0NGV3 - 通用文本转换和提示词工程工具包。支持翻译、变异、编码/解码以及用于越狱载荷构建的对抗性提示词工程。
  • claude-secure-coding-rules - 开源安全规则,引导 Claude Code 默认生成安全代码。
  • DeepTeam - 包含 40 多种攻击方法(包括提示注入、越狱和 RAG 投毒)的 LLM 红队框架。可与 CI/CD 流水线集成。
  • Burp MCP Server - 用于 Burp 的 MCP 服务器
  • burpgpt - 一个集成 OpenAI GPT 的 Burp Suite 扩展,可执行额外的被动扫描以发现高度定制化的漏洞,并支持运行任何类型的基于流量的分析。
  • guardian-cli - AI 驱动的安全测试与漏洞扫描器。Guardian CLI 是一款智能安全测试工具,利用 AI 自动化渗透测试、漏洞评估和安全审计。
  • AutoPentestX - AutoPentestX —— Linux 自动化渗透测试与漏洞报告工具
  • HackGPT - 一款使用 ChatGPT 进行黑客攻击的工具
  • nano-analyzer - 由 AISLE 打造的极简 LLM 驱动零日漏洞扫描器。
  • clearwing - 基于 LangGraph 构建的自主漏洞扫描器与源代码猎人。
  • Zen-AI-Pentest - AI 驱动的渗透测试框架,具备自动化漏洞扫描、多智能体系统和合规性报告。包含 72+ 安全工具、Docker 沙箱、ReAct 智能体和攻击路径分析。
  • Violin - 受监督的智能体化 Hermes Agent 渗透测试配置文件:包含 31 个基于技能的剧本(OWASP Top 10、API Top 10、LLM Top 10),并具备交互式范围界定、范围验证,以及针对授权侦察、漏洞利用验证和报告的审批门。
  • NeuroSploit - 用 Rust 编写的自主多模型渗透测试框架。LLM 池驱动侦察、智能体选择、漏洞利用链构建以及跨模型验证投票,覆盖黑盒、白盒、灰盒和云端测试模式。
  • OpenHack - AI 驱动的多智能体扫描器,可自主发现代码库中的 SQLi、XSS、IDOR 和认证绕过漏洞,然后通过沙箱执行和浏览器重放验证每个发现结果。与 Claude Opus 4.6 水平相当,但成本低约 40 倍。
  • PentAGI - 面向复杂渗透测试任务的完全自主多智能体系统。支持沙箱化 Docker 执行、多提供商 LLM(OpenAI、Anthropic、Gemini、Ollama、DeepSeek)、知识图谱集成和实时智能体监督。
  • V3SP3R - 面向 Flipper Zero 的 AI 驱动硬件黑客伴侣。提供自然语言界面来控制硬件攻击,并集成智能眼镜以支持免提操作。
  • 沙箱化开发容器,用于在 bypass 模式下安全运行 Claude Code。专为安全审计和不受信任的代码审查而构建。
  • claude-code-safety-net - 一个充当安全网的 Claude Code 插件,可在破坏性 git 和文件系统命令执行前将其拦截
  • OneCLI - 面向 AI 智能体的开源凭据保险库。Rust HTTP 网关拦截智能体请求并透明地注入 API 凭据,使智能体永远不会持有原始密钥。采用 AES-256-GCM 加密、按智能体进行作用域隔离,并提供完整审计追踪。
  • OpenSandbox - 面向 AI 智能体的安全、快速、可扩展的沙箱运行时。支持多语言 SDK、Docker/Kubernetes 运行时、gVisor/Kata Containers/Firecracker 隔离。CNCF Landscape 项目。
  • openclaw-shield - 面向 OpenClaw 智能体的安全插件 —— 防止秘密泄露、PII 暴露和破坏性命令执行
  • clawsec - 面向 OpenClaw 部署的安全扫描器与加固工具。专门针对 OpenClaw 网关和智能体配置提供安全评估、配置审计和漏洞检测。
  • nanoclaw - OpenClaw 的轻量级替代方案,出于安全考虑在容器中运行。可连接 WhatsApp,具备记忆、计划任务功能,并直接运行在 Anthropic 的 Agents SDK 之上。是首个支持 Agent Swarms(智能体群)以实现协作式智能体团队的 AI 助手。
  • secureclaw - Adversa AI 出品的 OpenClaw AI 智能体自动化安全加固工具。包含 51 项审计检查、12 条行为规则、9 个脚本和 4 个模式数据库。全面覆盖 OWASP ASI Top 10。可抵御提示词注入、凭据窃取、供应链攻击和隐私泄露。
  • defenseclaw - 思科 AI Defense 推出的 OpenClaw 企业治理层。通过内置的 CodeGuard SAST、工具调用检测引擎、LLM 护栏代理和 SIEM 集成,扫描技能、MCP 服务器和插件。自动阻止 HIGH/CRITICAL 级别的发现项。
  • microsandbox - 轻量级 microVM 沙箱,用于安全运行不受信任的 AI 生成代码,具备强隔离保证
  • Adrian - Secure Agentics 出品的开源、符合 AARM 规范的 AI 智能体运行时安全监控与控制引擎。分析智能体活动日志(工具调用、操作、输出)和推理轨迹,以检测恶意、失准或越权行为,并支持可选的执行中干预(审计模式与阻止模式)。提供 Python(LangChain/LangGraph)和 TypeScript SDK,可完全离线自托管。Apache-2.0 许可。
  • HOL Guard - 本地优先的安全防护框架,可在文件变更或网络连接之前拦截 AI 编码智能体(Codex、Claude Code、Cursor、Gemini、Copilot、Hermes、OpenCode)中的工具调用。提供工具前钩子、审批中心、供应链咨询扫描和可选的 Guard Cloud 同步。
  • Vigil SOC - 面向 AI 智能体的全面开源安全运营平台,为 AI 驱动的环境提供实时监控、威胁检测和事件响应能力。
  • AiSOC - 开源、可自托管的 AI 驱动安全运营中心(SOC),可摄取安全事件、进行关联分析、通过 LangGraph 运行自主 AI 调查,并在统一控制台中展示结果。具备完整的智能体决策审计轨迹、CI 中的公共评估框架以及 52 个第一方连接器。采用 MIT 许可证。