Skip to content
KitploitKITPLOIT
ツールブログ
提出
ツールブログ
提出

ハッキング、侵入テスト、サイバーセキュリティツールをあなたのセキュリティアーセナルに!

Kitploitはハッキング、サイバーセキュリティ、ペネトレーションテストのツールディレクトリです。最新のプロジェクトアップデートを見つけて、脆弱性の発見、システム分析、テストの自動化、セキュリティの強化を行いましょう。

··フィード·お問い合わせ·プライバシー·© 2026 Kitploit

ツールディレクトリ

カテゴリ

すべてのカテゴリを見る
Loading categories
awesome-ai-security — AIセキュリティに関連する素晴らしいリソースのコレクション | Kitploit
ツール/GitHubGitHub/ottosulin/awesome-ai-security
脆弱性スキャナーペネトレーションテストプライバシーサプライチェーンセキュリティ学習と教育レッドチーミング厳選リソースAIセキュリティ敵対的攻撃
GitHubottosulin/awesome-ai-security

awesome-ai-security

AIセキュリティに関連する素晴らしいリソースのコレクション

リポジトリを見る
1.4k3521日前Kitploit レビュー済み

人気

すべて見る →

コミュニティで最も使われているツールを見つけましょう。

すべてのツールを探索

ツールコレクションを閲覧

すべてのツールを見る →
共有

Awesome AI Security Awesome Track Awesome List

AIセキュリティ関連のフレームワーク、標準、学習リソース、オープンソースツールの厳選リストです。

貢献したい場合は、PRを作成するか、@ottosulin までご連絡ください。

目次

  • 学習リソース
    • 読み物 & ガイド
    • コース、ラボ & CTF
    • ポッドキャスト
  • ガバナンス & リスク管理
    • フレームワーク
    • 標準 & 検証
    • 分類体系、用語 & リスクデータベース
    • チェックリスト & 実践ガイダンス
  • 攻撃手法 & レッドチーミング
    • 敵対的ML & 古典的モデル
    • LLM & GenAI レッドチーミング
    • エージェンティックAI & MCP攻撃ツール
    • AI支援型オフェンシブセキュリティ
    • ステガノグラフィ & covert チャネル
  • ベンチマーク & 評価
  • 防御 & セキュリティコントロール
    • 入力/出力ガードレール
    • エージェント実行時セキュリティ & サンドボックス化
    • MCPセキュリティ
    • モデル & アーティファクトスキャン
    • AI支援型ディフェンシブセキュリティ
    • プライバシー & 機密コンピューティング
    • データ & サプライチェーンセキュリティ
  • エージェンティックAIセキュリティスキル
  • セキュリティ特化型AIモデル

学習リソース

読み物 & ガイド

  • OWASP ML TOP 10
  • OWASP LLM TOP 10
  • OWASP AI Security and Privacy Guide
  • NIST AIRC - NIST Trustworthy & Responsible AI Resource Center
  • The MLSecOps Top 10 by Institute for Ethical AI & Machine Learning
  • OWASP Multi-Agentic System Threat Modeling
  • OWASP: CheatSheet – A Practical Guide for Securely Using Third-Party MCP Servers 1.0
  • OWASP GenAI Threat & Defense Compass - GenAIの脅威を対応する防御コントロールにマッピングするリファレンスガイド。
  • NCSC Guidelines for Secure AI System Development - NCSC(英国)とCISAが共同執筆した、設計、開発、展開、運用を網羅するセキュアなAI開発のための実践的ガイドライン。

コース、ラボ & CTF

  • Damn Vulnerable MCP Server - 教育目的で意図的に脆弱性を持たせたModel Context Protocol (MCP) の実装。
  • otto-support - mcp-goを使用した脆弱なMCPサーバー実装。階層型認証(4ロール)、19のツール、Claude Codeによるサンドボックス化されたコンテナが組み込まれており、権限昇格やツールの悪用を練習できる。
  • OWASP WrongSecrets LLM exercise
  • vulnerable-mcp-servers-lab - MCPサーバーのペネトレーションテストを学習するための意図的に脆弱性を持たせたサーバーコレクション。
  • FinBot Agentic AI Capture The Flag (CTF) Application - FinBotは、金融サービスを模したアプリケーション上でエージェンティックAIシステムにおける現実世界の脆弱性をシミュレートする、対話型のAgentic Security Capture The Flag (CTF) プラットフォーム。
  • AI-Red-Teaming-Playground-Labs - インフラストラクチャを含むAIレッドチーミングトレーニングを実施するためのAIレッドチーミングプレイグラウンドラボ。
  • Damn Vulnerable LLM Agent - プロンプトインジェクション、ツールの悪用、エージェントセキュリティについて学習するための、意図的に脆弱性を持たせたLLMエージェント。
    • LLMVault - OWASP LLM Top 10を学習するためのオープンソースのCTF形式LLMセキュリティラボ。プロンプトインジェクション、RAG攻撃、システムプロンプト漏洩、ツールの悪用、エージェントセキュリティを扱う実践的な脆弱性演習を提供。

ポッドキャスト

  • MLSecOps podcast
  • AI Security Podcast
  • AI Security Ops - Black Hills Information Securityが提供するウィークリーポッドキャスト。AIがサイバーセキュリティをどのように変革しているかを探求し、新たな脅威、ツール、トレンドを実用的で実践可能な知識とともに紹介。
  • GenAI Security podcast

ガバナンス & リスク管理

フレームワーク

  • NIST AI Risk Management Framework
  • ISO/IEC 42001 Artificial Intelligence Management System
  • ISO/IEC 23894:2023 Information technology — Artificial intelligence — Guidance on risk management
  • Google Secure AI Framework (SAIF)
  • ENISA Multilayer Framework for Good Cybersecurity Practices for AI
  • OWASP Artificial Intelligence Maturity Assessment
  • CSA AI Model Risk Framework
  • CSA Maestro AI Threat Modeling Framework
  • CSA AI Controls Matrix - ガバナンス、リスク、コンプライアンスをカバーするAIシステム向けの包括的なコントロールマトリクス。
  • OWASP Agentic AI Top 10 - OWASPおよびCSAのレッドチーミングの中核となるエージェンティックAI向けTop 10。

標準 & 検証

  • OWASP AI Security Verification Standard
  • OWASP Agent Name Service
  • OWASP Agent Observability Standard
  • AI Verify - シンガポール政府が支援するAIテストフレームワークおよびツールキット。ガバナンスフレームワークに対してAIシステムの特性を検証する。

分類体系、用語 & リスクデータベース

  • NIST AI 100-2e2023 - 敵対的機械学習の分類体系と用語
  • MITRE ATLAS
    • ATLAS Knowledge Base Agent - 自然言語、MCPサーバーアクセス、カスタマイズ可能なエージェントワークフローを使用してATLASナレッジベースを探索するためのオープンソースAIアシスタント。
  • AVIDML
  • MIT AI Risk Repository
  • AI Incident Database
  • ISO/IEC 22989:2022 Information technology — Artificial intelligence — Artificial intelligence concepts and terminology
  • NIST AI Glossary
  • The Arcanum Prompt Injection Taxonomy - 攻撃の意図、手法、回避策、入力ベクトルをカバーする包括的なプロンプトインジェクション攻撃分類システム。プロンプトインジェクション攻撃の目標、方法、難読化手法、攻撃面を分類。
  • CSA LLM Threats Taxonomy
  • OWASP AI Vulnerability Scoring System (AIVSS) - AI固有の脆弱性のためのスコアリングシステム。CVSSの概念をAIリスクの次元に拡張。

チェックリスト & 実践ガイダンス

  • OWASP LLM Applications Cybersecurity and Governance Checklist
  • OWASP AI Security and Privacy Guide
  • OWASP LLM and Generative AI Security Center of Excellence Guide
  • OWASP Agentic AI – Threats and Mitigations
  • OWASP AI Security Solutions Landscape
  • OWASP GenAI Incident Response Guide
  • OWASP LLM and GenAI Data Security Best Practices
  • OWASP Securing Agentic AI Applications
  • OWASP GenAI Red Teaming Guide

攻撃手法 & レッドチーミング

敵対的ML & 古典的モデル

  • Adversarial Robustness Toolkit - ARTは、回避(入力変更によるモデル動作の変更)、ポイズニング(訓練データ変更によるモデル制御)、抽出(クエリによるモデル盗取)、推論(訓練データのプライバシー攻撃)の脅威に焦点を当てる。
  • cleverhans - 攻撃の構築、防御の構築、および両方のベンチマークを行うための敵対的サンプルライブラリ。
  • foolbox - PyTorch、TensorFlow、JAXでニューラルネットワークを欺く敵対的サンプルを作成するためのPythonツールボックス。
  • TextAttack - NLPにおける敵対的攻撃、データ拡張、モデル訓練のためのPythonフレームワーク。
  • Counterfit - 機械学習システムのセキュリティを評価するための汎用的な自動化レイヤー。
  • OffsecML Playbook - 攻撃的および敵対的なTTPと概念実証のコレクション。
  • BadDiffusion - CVPR 2023で発表された論文「How to Backdoor Diffusion Models?」を再現するための公式リポジトリ。
  • secml-torch - SecML-Torch: ディープラーニングモデルのロバスト性評価のためのライブラリ。

LLM & GenAI レッドチーミング

  • garak - LLMのセキュリティプロービングツール。
  • ai-scanner - NVIDIA garakをベースにした、AIモデルセキュリティ評価のためのオープンソースWebアプリケーション。179のプローブ、マルチターゲットスキャン、スケジュールスキャン、ASRスコアリング、SIEM統合を備える。
  • promptfoo - プロンプト、エージェント、RAGをテスト。LLMのレッドチーミング、ペネトレーションテスト、脆弱性スキャン。GPT、Claude、Gemini、Llamaなどのパフォーマンスを比較。シンプルな宣言的設定でコマンドラインおよびCI/CD統合に対応。
  • PyRIT - Python Risk Identification Tool for generative AI (PyRIT) は、セキュリティ専門家やエンジニアが生成AIシステムのリスクを積極的に特定できるように構築されたオープンソースフレームワーク。
  • PurpleLlama - LLMのセキュリティを評価および改善するためのツールセット。
  • augustus - プロンプトインジェクション、脱獄、敵対的攻撃を検出するLLMセキュリティテストフレームワーク。190以上のプローブ、28のプロバイダー、単一のGoバイナリ。同時スキャン、レート制限、リトライロジックを備えたプロダクション対応。
  • FuzzyAI - 自動化されたLLMファジングのための強力なツール。開発者やセキュリティ研究者がLLM APIにおける潜在的な脱獄を特定し軽減するのに役立つよう設計。
  • EasyJailbreak - 敵対的な脱獄プロンプトを生成するための使いやすいPythonフレームワーク。
  • gptfuzz - GPTFUZZER: 自動生成された脱獄プロンプトによるLLMのレッドチーミングに関する公式リポジトリ。
  • llamator - 大規模言語モデル (LLM) の脆弱性をテストするためのフレームワーク。
  • agentic_security - エージェンティックLLM脆弱性スキャナー / AIレッドチーミングキット。
  • Agentic Radar - エージェンティックワークフロー向けのオープンソースCLIセキュリティスキャナー。
  • RAPTOR - Claude Code上に構築された自律型攻撃/防御セキュリティ研究フレームワーク。静的解析(Semgrep、CodeQL)、バイナリ解析、LLMによる脆弱性検証、エクスプロイト生成、パッチ作成をチェーンする。Z3ベースの実現可能性分析によるマルチモデルオーケストレーション。
  • whistleblower - API経由で公開されたAIアプリケーションのシステムプロンプト漏洩および機能発見をテストするためのオフェンシブセキュリティツール。
  • promptmap -

エージェンティックAI & MCP攻撃ツール

  • RAMPART - エージェンティックAIアプリケーション向けのpytestネイティブな安全性およびセキュリティテストフレームワーク。
  • AI-Infra-Guard - Tencent朱雀ラボが開発した、包括的、インテリジェント、かつ使いやすいAIレッドチーミングプラットフォーム。Infra Scan、MCP Scan、Jailbreak Evaluationのモジュールを統合し、ワンクリックWeb UI、REST API、Dockerベースのデプロイメントを提供し、包括的なAIセキュリティ評価を実現。
  • OpenPromptInjection - プロンプトインジェクション攻撃と防御のためのベンチマーク。
  • AIMap - 公開されたAIエージェントインフラストラクチャのインターネット規模での発見とセキュリティテストプラットフォーム。Shodanに対してMCPサーバー、Ollamaインスタンス、vLLM/LiteLLMプロキシなどをクエリし、フィンガープリンティング、リスクスコアリング、プロトコル固有の攻撃スイートをリアルタイムストリーミング結果とともに起動。### AI支援による攻撃的セキュリティ
  • PentestGPT - GPTを活用したペネトレーションテストツール
  • HackingBuddyGPT - 倫理的なハッカーが50行以下のコードでLLMを使用できるように支援
  • cai - サイバーセキュリティAI(CAI)、オープンでバグバウンティ対応の人工知能(論文)
  • shannon - KeygraphによるWebアプリケーションとAPI向けの完全自律型AIペネトレーションテスター。ソースコードを分析し、攻撃ベクトルを特定し、実際のエクスプロイトを実行するホワイトボックスセキュリティテスト。XBOWベンチマークで96.15%の成功率(100/104のエクスプロイト)。
  • strix - Strixは実際のハッカーとまったく同様に動作する自律型AIエージェントです。コードを動的に実行し、脆弱性を発見し、実際の概念実証を通じて検証します。
  • redamon - AIを活用したエージェンティックなレッドチームフレームワークで、偵察からエクスプロイト、ポストエクスプロイトまで、人間の介入なしに攻撃的セキュリティ運用を自動化します。
  • CyberStrikeAI - Goで構築されたAIネイティブのセキュリティテストプラットフォーム。100以上のセキュリティツールをインテリジェントオーケストレーションエンジンと統合し、事前定義されたセキュリティロールによるロールベースのテスト、スキルシステム、包括的なライフサイクル管理を提供。MCPプロトコルとAIエージェントを使用して、会話型コマンドから脆弱性発見までのエンドツーエンド自動化を実現。
  • HexStrikeAI - HexStrike AI MCP Agentsは高度なMCPサーバーで、AIエージェント(Claude、GPT、Copilotなど)が自律的に150以上のサイバーセキュリティツールを実行し、自動化されたペネトレーションテスト、脆弱性発見、バグバウンティ自動化、セキュリティ研究を可能にします。
  • mcp-for-security -

ステガノグラフィーと秘密通信

  • ST3GG - 多層エンコーディング、画像および音声ステガノグラフィー、AI生成メディア内の隠しデータを検出するステガノ分析ツールを備えたオールインワンのステガノグラフィースイート。

ベンチマークと評価

  • ISC-Bench - 内部安全性崩壊:通常のタスク完了を通じてpass@3で最先端LLM(Claude Opus 4.6、GPT-5.4)をジェイルブレイクします — 敵対的プロンプトは不要。ブラックボックス、クロスドメイン、クロスサイエンス。新しい障害モード。 [Paper]
  • jailbreakbench - JailbreakBench: 言語モデルのジェイルブレイクに対するオープンなロバストネスベンチマーク [NeurIPS 2024 データセットおよびベンチマークトラック]
  • AgentDojo - LLMエージェントの攻撃と防御を評価する動的環境。
  • AIRTBench - コードリポジトリ:AIRTBench: 言語モデルにおける自律型AIレッドチーミング能力の測定
  • HackingBuddyGPT benchmark dataset - 自動ペネトレーションテスト用ベンチマークデータセット
  • AgentDoG - AgentDoGは自律エージェント向けのリスク認識型評価およびガーディングフレームワークです。軌跡レベルのリスク評価に焦点を当て、多様なアプリケーションシナリオにおいてエージェントの実行軌跡が安全リスクを含むかどうかを判断することを目的としています。
  • AICGSecEval - TencentによるAIコード生成セキュリティの包括的評価ベンチマーク。自動テストハーネスを備え、10のCWEカテゴリをカバー。
  • Inspect - 英国AIセキュリティ研究所による大規模言語モデル評価のためのフレームワーク。プロンプトエンジニアリング、ツール使用、マルチターンダイアログ、モデル評価スコアリングをカバーする200以上の組み込み評価。
  • sec-code-bench - Alibabaによる17の脆弱性カテゴリと4つのプログラミング言語にわたるLLMのコードセキュリティ能力評価のためのベンチマーク

防御とセキュリティ制御

入出力ガードレール

  • NeMo-Guardrails - NeMo Guardrailsは、LLMベースの会話システムにプログラム可能なガードレールを簡単に追加するためのオープンソースツールキットです。
  • LlamaFirewall - LlamaFirewallは、AI中心のセキュリティリスクを検出および軽減するために設計されたフレームワークで、典型的なLLMチャットからより高度なマルチステップのエージェンティック操作まで、複数層の入力と出力をサポートします。
  • llm-guard - Protect AIによるLLM Guardは、大規模言語モデル(LLM)のセキュリティを強化するために設計された包括的なツールです。
  • Guardrails.ai - Guardrailsは、大規模言語モデル(LLM)の出力に構造、型、品質保証を追加できるPythonパッケージです。
  • TrustGate - 生成アプリケーションファイアウォール(GAF)で、GenAIアプリケーションに対する攻撃を検出、防止、ブロックします。
  • ZenGuard AI - 最速のAIエージェント向けトラストレイヤー
  • LocalMod - セルフホスト型コンテンツモデレーションAPIで、プロンプトインジェクション検出、有害性フィルタリング、PII検出、NSFW分類を備えています。100%オフラインで動作。
  • DynaGuard - ユーザー定義ポリシーによる動的ガードレールモデル
  • AprielGuard - 8Bパラメータの安全性・セキュリティ保護モデル
  • Safe Zone - Safe ZoneはオープンソースのPII検出およびガードレールエンジンで、機密データがLLMやサードパーティAPIに漏洩するのを防ぎます。
  • superagent - Superagentは、AIエージェントを安全かつコンプライアンス準拠にするための目的別トレーニングされたガードレールを提供します。
  • ShellWard - プロンプトインジェクション、データ流出、危険なコマンドに対する8層防御を備えたAIエージェントセキュリティミドルウェア。依存関係ゼロ。
  • CodeGate - 開発者のコード生成AIワークフロー内でセキュリティレイヤーとして機能する、プライバシー重視のオープンソースプロジェクト
  • Future AGI - オープンソースのセルフホスト可能なプラットフォームで、安全でない出力(ジェイルブレイク、PII、インジェクション、有害性)に対する組み込みリアルタイムガードレール、評価、トレーシング、シミュレーション、LLMおよびエージェントアプリケーション向けゲートウェイを備えています。

エージェントランタイムセキュリティとサンドボックス化

  • OpenShell - OpenShellは自律型AIエージェントのための安全でプライベートなランタイムです。宣言型YAMLポリシーによって管理されるサンドボックス化された実行環境を提供し、不正なファイルアクセス、データ流出、制御されていないネットワークアクティビティを防ぎます。
  • OpenSandbox - AIエージェント向けの安全、高速、拡張可能なサンドボックスランタイム。マルチ言語SDK、Docker/Kubernetesランタイム、gVisor/Kata Containers/Firecracker分離。CNCF Landscapeプロジェクト。
  • CubeSandbox - Tencent CloudによるAIエージェント向けのインスタント、同時実行、安全、軽量なサンドボックス。サブ60msのコールドスタート、5MB未満のメモリオーバーヘッド、E2B SDK互換。RustVMMとKVM上に構築され、極度の分離(専用カーネル + eBPF)を実現。
  • Aegis - AntroposによるAIエージェント向けオープンソースEDR。自律型AIエージェントのプロセス、ファイル、ネットワーク、行動をリアルタイムで監視。テレメトリなし、クラウドなし、すべてローカルに保存。
  • Microsoft Agent Governance Toolkit - MicrosoftのAIエージェントガバナンスツールキット — 自律型AIエージェント向けのポリシー適用、ゼロトラストアイデンティティ、実行サンドボックス化、信頼性エンジニアリング。OWASP Agentic Top 10の10/10をカバー。
  • agentfield - 暗号化アイデンティティ、ポリシー適用、監査に適した可観測性を備えたエージェントシステム向けオープンソースコントロールプレーン。
  • leash - LeashはAIコーディングエージェントをコンテナでラップし、その活動を監視します。
  • vibekit - Claude Code、Gemini、Codex — または任意のコーディングエージェント — を、機密データの編集と可観測性を組み込んだクリーンで隔離されたサンドボックスで実行します。
  • pipelock - AIエージェント向けセキュリティハーネス — DLPスキャン、SSRF保護、MCPレスポンススキャン、ワークスペース整合性監視を備えたエグレスプロキシ
  • skill-scanner - AIエージェントスキル向けのセキュリティスキャナーで、プロンプトインジェクション、データ流出、悪意のあるコードパターンを検出します。パターンベース検出(YAML + YARA)、LLM-as-a-judge、行動データフロー分析を組み合わせて包括的な脅威検出を実現。
  • SkillSpector - AIエージェントスキル向けセキュリティスキャナー。静的解析 + オプションのLLMセマンティック評価により、16カテゴリにわたる64の脆弱性パターンを検出。マルチフォーマット出力(JSON、Markdown、SARIF)。
  • Project CodeGuard - AI支援開発ワークフローをセキュアにするためのCoSAIオープンソースプロジェクト。CodeGuardはAIコーディングアシスタント向けのセキュリティ制御とガードレールを提供し、AI生成コード開発中に脆弱性が導入されるのを防ぎます。
  • AgentLens -

MCPセキュリティ

  • MCP-Security-Checklist - MCPベースのAIツール向けの包括的なセキュリティチェックリスト。LLMプラグインエコシステムを保護するためにSlowMistによって構築されました。
  • Awesome-MCP-Security - Model Context Protocol (MCP) セキュリティについて知っておくべきすべて。
  • secure-mcp-gateway - このSecure MCP Gatewayは、認証、自動ツール検出、キャッシング、ガードレール適用を備えて構築されています。
  • mcp-context-protector - context-protectorはMCPサーバーのセキュリティラッパーで、信頼できないMCPサーバーの実行に伴うリスク(ラインマッピング、予期しないサーバー設定変更、その他のプロンプトインジェクション攻撃など)に対処します
  • mcp-guardian - MCP Guardianは、LLMアシスタントのMCPサーバーへのアクセスを管理し、LLMのアクティビティをリアルタイムで制御できます。
  • MCP Audit VSCode Extension - VSCode内のすべてのGitHub Copilot MCPツール呼び出しを一元的に簡単に監査およびログ記録します。
  • MCP-Scan - MCPサーバー向けセキュリティスキャンツール
  • ATR (Agent Threat Rules) - AIエージェントの脅威に対するオープンソース検出ルール。9カテゴリにわたるプロンプトインジェクション、ツールポイズニング、認証情報流出をカバーする108の正規表現ルール。Cisco AI Defenseで使用。MITライセンス。
  • MCPProxy - ローカルファーストのMCPプロキシで、ツールごとのSHA-256検疫によるツールポイズニングおよびラグプル攻撃の検出、ツール呼び出しの自動機密データおよびシークレットスキャン、信頼できないMCPサーバー向けDockerサンドボックス分離、OAuth 2.1を備えています。MITライセンス。

モデルとアーティファクトのスキャン

  • modelscan - ModelScanはProtect AIによるオープンソースプロジェクトで、モデルをスキャンして安全でないコードが含まれているかどうかを判断します。
  • picklescan - 不審な動作を行うPython Pickleファイルを検出するセキュリティスキャナー
  • fickling - Pythonのpickle逆コンパイラおよび静的解析ツール
  • medusa - AIファーストのセキュリティスキャナーで、74以上のアナライザー、180以上のAIエージェントセキュリティルール、インテリジェントな偽陽性削減を備えています。すべての言語をサポート。React2Shell、mcp-remote RCEのCVE検出。
  • julius - セキュリティ専門家向けのLLMサービスフィンガープリンティングツール。ペネトレーションテストおよび攻撃対象領域の発見中に32以上のAIサービス(Ollama、vLLM、LiteLLM、Hugging Face TGIなど)を検出。HTTPベースのサービスフィンガープリンティングを使用してサーバーインフラストラクチャを識別します。
  • a2a-scanner - A2Aエージェントをスキャンして潜在的な脅威とセキュリティ問題を検出### AI支援による防御セキュリティ
  • Claude Code Security Review - Claudeを使用してコード変更のセキュリティ脆弱性を分析する、AIを活用したセキュリティレビューGitHub Action。
  • deepsec - Vercel Labsによるエージェント駆動型脆弱性スキャナー。コーディングエージェントを使用して大規模コードベースの見つけにくい問題を発見。並列スキャン、PR差分レビュー、CI/CD統合をサポート。
  • defending-code-reference-harness - Claudeを使用した自律的な脆弱性発見と修正のためのリファレンス実装。脅威モデリング、スキャン、トリアージ、パッチ適用スキルを含む。
  • Visa Vulnerability Agentic Harness - 検出からLLM駆動の修正、敵対的検証まで11のステージを持つエージェンティックSASTパイプライン。SARIFを出力し、Claude Code、Copilot、Geminiと統合。
  • GhidraGPT - GPTモデルをGhidraに統合し、自動コード分析、変数名変更、脆弱性検出、説明生成を実現。
  • IDAssist - IDA Pro向けAI搭載リバースエンジニアリングプラグイン。LLM駆動の分析をIDAのインターフェースに統合し、セマンティックナレッジグラフ、RAGドキュメント検索、複数のLLMプロバイダ(OpenAI、Anthropic、Ollama、LiteLLM)をサポート。関数の分析、名前の提案、コードに関する質問への回答を行う。
  • ThreatForest - Strandsフレームワークに基づくエージェント型脅威モデリングプラットフォーム。リポジトリから攻撃ツリーを自律的に生成し、攻撃ステップをMITRE ATT&CKテクニックにマッピング、実行可能な緩和策の推奨を生成。

プライバシーと機密コンピューティング

  • Python Differential Privacy Library
  • Diffprivlib - IBMの差分プライバシーライブラリ
  • TenSEAL - テンソル上の準同型暗号演算を行うためのライブラリ
  • SyMPC - Syft向けのセキュアなマルチパーティ計算(MPC)のコンパニオンライブラリ
  • Cloaked AI - ベクトル埋め込みのためのオープンソースのプロパティ保存暗号化
  • dstack - ハードウェアによる分離とデータプライバシーを備えた、安全なML/LLMデプロイメントのためのオープンソースの機密AIフレームワーク
  • PrivacyRaven - 深層学習システムのためのプライバシーテストライブラリ
  • PLOT4ai - Privacy Library Of Threats 4 Artificial Intelligence — 責任あるAI構築を支援する脅威モデリングライブラリ
  • OpenDP - OpenDPプロジェクトによる差分プライバシーアルゴリズムの中核ライブラリ — プライバシー保護MLトレーニングパイプラインの構築に使用

データとサプライチェーンセキュリティ

  • datasig - AIBOMのためのデータセットフィンガープリンティング
  • OWASP AIBOM - AI部品表(AI Bill of Materials)
  • Trusera ai-bom - AI部品表 — インフラストラクチャ内のすべてのAIエージェント、モデル、APIを発見

エージェント型AIセキュリティスキル

  • Elastic Agent Skills - ElasticのAIアシスタント向けスキル集。ログ、トレース、脅威インテリジェンスにわたる自然言語でのセキュリティ調査を可能にする。
  • Ghost Security Skills - Claude Code向けのエージェントアプリケーションセキュリティ(AppSec)スキルとツール
  • tm_skills - 継続的脅威モデリングを支援するエージェントスキル
  • Trail of Bits Skills Marketplace - Trail of BitsによるClaude Codeスキル。セキュリティ研究、脆弱性検出、監査ワークフロー向け。
  • Semgrep Skills - Claude Codeおよび他のAIコーディングアシスタント向けの公式Semgrepスキル。AI支援開発ワークフローに直接セキュリティスキャン、コード分析、脆弱性検出機能を提供。
  • claude-bug-bounty - AI支援バグバウンティハンティングのためのClaude Codeスキル。偵察、IDOR、XSS、SSRF、OAuth、GraphQL、LLMインジェクションテストを自動化し、4ゲート検証チェックリストとレポート生成を備える。
  • Anthropic Cybersecurity Skills - AIエージェント向けの734以上の構造化されたサイバーセキュリティスキル。MITRE ATT&CKマッピング済み、agentskills.io標準準拠。Claude Code、Copilot、Codex CLI、Cursor、Gemini CLIと互換性あり。
  • llm-sast-scanner - AIコーディングエージェント(Claude Code、Codexなど)向けのSASTスキル。34クラスにわたる構造化脆弱性検出。ソースからシンクへのテイント分析、誤検出削減のためのJudge検証、ベンチマークで99%以上の適合率/再現率を特徴とする。
  • sast-skills - AIコーダーをSASTスキャナーに変えるエージェントスキル集
  • pentest-ai-agents - 攻撃的セキュリティのための31のClaude Codeサブエージェント。偵察、Web、AD、クラウド、モバイル、ワイヤレス、ソーシャルエンジニアリング、ペイロード作成、リバースエンジニアリング、エクスプロイトチェーン、検知工学、フォレンジック、レポート生成に特化したAIサブエージェント。Tier 2エージェントは承認ゲートを介してツールを直接実行可能。
  • Mantis Skills - Googleによる、分離・順次・セキュリティ重視のエージェンティックAIスキルパイプライン。あらゆる規模のコードベースで脆弱性の自律的なレビュー、重複排除、検証、再現、修正を行う。多段階パイプライン(アーキテクチャ分析→脅威モデリング→調査→レビュー→再現→修正→キャリブレーション→リフレクション)、組み込みサンドボックス、反復実行に適応する継続的学習ループを特徴とする。RTLハードウェア、IaC、MLパイプライン、コンパイル済みバイナリをサポート。

セキュリティ特化型AIモデル

  • VulnLLM-R-7B - 脆弱性検出に特化した推論LLM。Chain-of-Thought推論を使用してデータフロー、制御フロー、セキュリティコンテキストを分析。脆弱性検出ベンチマークでClaude-3.7-SonnetとCodeQLを上回る性能。わずか7Bパラメータで効率的かつ高速。
  • Foundation-Sec-8B-Reasoning - Llama-3.1-FoundationAI-SecurityLLM-8B-Reasoningは、サイバーセキュリティアプリケーションに特化した、オープンウェイト・80億パラメータの命令チューニング済み言語モデル。Foundation-Sec-8Bベースモデルに命令追従能力と推論能力を追加。
  • Antares (1B & 350M) - fdtn-aiによる脆弱性特定のためのエージェント型モデル。2Bおよび0.4Bパラメータのバリエーションがあり、コード内の脆弱性を自律的に特定・位置特定するよう設計。
  • CyberSecQwen-4B - Qwen3-4B-Instruct-2507からファインチューニングされた、サイバーセキュリティ脅威インテリジェンス向けの40億パラメータCTI専門家モデル。
  • Meta-SecAlign-8B / Meta-SecAlign-70B - プロンプトインジェクション攻撃に耐性を持つようファインチューニングされたセキュリティ調整済みLlamaモデル。敵対的入力下でも命令階層を維持。
  • Lily-Cybersecurity-7B - セキュリティ分析、脆弱性説明、脅威インテリジェンスタスクに最適化された、サイバーセキュリティ調整済みの7Bチャットモデル。

安全性分類器とプロンプトインジェクション検出

  • Llama-Guard-4-12B - Metaの最新マルチモーダル安全性分類器。テキストおよび画像モダリティにわたるLLM入出力の有害コンテンツを検出。
  • Llama-Prompt-Guard-2-86M - Meta製の軽量86Mパラメータモデル。本番LLMパイプラインにおけるプロンプトインジェクションおよびジェイルブレイク試行の検出用。
  • ShieldGemma-2B - Googleの2Bパラメータテキスト安全性分類器。有害コンテンツ検出用で、Gemmaアーキテクチャに基づく。
  • DeBERTa Prompt Injection Detector v2 - Protect AIによるプロンプトインジェクション検出用にファインチューニングされたDeBERTa-v3-base。本番LLMガードレールパイプラインで広く使用。
  • Prompt Injection Sentinel - プロンプトインジェクションおよびジェイルブレイク分類用にファインチューニングされたModernBERT-largeモデル。低誤検出率。
  • Nemotron 3.5 Content Safety - NVIDIAの4Bパラメータマルチモーダルコンテンツ安全性モデル。テキスト+画像入力ガードレール、多言語サポート(35+言語)、カスタマイズ可能なエンタープライズポリシー適用、監査可能な推論を単一の推論呼び出しで統合。Nemotron 3 Content Safetyの後継。
  • BrowseSafe - AIブラウザエージェントにおけるプロンプトインジェクション攻撃検出のための特化型セキュリティモデル。BrowseSafe-Benchで90.4%のF1スコアを達成。生HTMLコンテンツのリアルタイム非同期分類向けに最適化。

ドメイン適応型セキュリティ言語モデル

  • ATTACK-BERT - セキュリティテキストをMITRE ATT&CKテクニックにマッピングするためのSentence-Transformerモデル。
  • CySecBERT - ドメイン固有の事前学習によりサイバーセキュリティおよびCTIタスクに適応したBERTモデル。

データセット

  • SafetyPrompts - LLMの安全性とセキュリティ特性を評価するための、厳選された安全性関連プロンプト集。
  • Do-Not-Answer - 責任あるLLMが回答すべきでないプロンプトのデータセット。安全性評価とレッドチーミング用。
  • JailBreakV-28K - LLM安全性のベンチマークのための28,000件のジェイルブレイクプロンプトの大規模データセット。
  • CL4R1T4S - ChatGPT、Claude、Gemini、Grok、Perplexity、Cursor、Lovable、Replitおよび他の主要AIツールから流出したシステムプロンプト。透明性と攻撃面調査のための、既知最大のプロダクションシステムプロンプトコレクション。
  • LEAKHUB - システムプロンプトリークリーダーボード — AI製品全体のシステムプロンプトリークを追跡・ランク付けするコミュニティプラットフォーム。
  • Leaked System Prompts - 商用AIツールから流出したシステムプロンプトのコレクション — 実際のプロンプトエンジニアリングと攻撃面の理解に有用。
ツールをダウンロード
カスタムLLMアプリケーション向けのプロンプトインジェクションスキャナー。
  • spikee - 評価と悪用のためのシンプルなプロンプトインジェクションキット。
  • ps-fuzz - GenAIアプリケーションを安全に保護 — システムプロンプトをテストし強化する。
  • EasyEdit - LLMの真実(ground truths)を修正する。
  • llm-attacks - アライメントされた言語モデルに対する普遍的で転移可能な攻撃。
  • llm-security - アプリケーション統合型LLMを破る新しい方法。
  • Plexiglass - 大規模言語モデル (LLM) の脆弱性を検出および保護するためのツールキット。
  • Prompt Hacking Resources - AIレッドチーミング、脱獄、プロンプトインジェクションに興味がある人のための厳選リソースリスト。
  • Giskard - AI & LLMシステムのためのオープンソース評価 & テスト。
  • blackice - BlackIceは、大規模言語モデル (LLM) や古典的機械学習 (ML) モデルを含むAIモデルのレッドチーミングのために設計されたオープンソースのコンテナ化ツールキット。従来のペネトレーションテストにおけるKali Linuxの利便性と標準化に着想を得て、BlackIceは特殊な評価ツールが事前設定された再現可能なコンテナイメージを提供することでAIセキュリティ評価を簡素化する。
  • ai-best-practices - LLMを使用するコードがベストプラクティスに従っていることを確認するためのSemgrep Proルール。58のルール、102のサブルールで6プロバイダー + MCP + Claude Code & Cursorフック + LangChainをカバー。7言語にわたってハードコードされたAPIキー、プロンプトインジェクションリスク、安全性チェックの欠落、未処理エラーを検出。
  • G0DM0D3 - OpenRouterを介して50以上のモデルに対応するオープンソースのマルチモデルチャットインターフェース。GODMODE CLASSIC(5つの脱獄コンボ)、ULTRAPLINIANマルチモデル評価、33のレッドチーム手法を備えたParseltongue入力摂動エンジン、AI安全性研究のためのAutoTune適応サンプリングを搭載。
  • L1B3RT4S - 主要なLLM向けの脱獄および解放プロンプトのコレクション。ChatGPT、Claude、Gemini、その他のフロンティアモデルにおけるAI安全ガードレールをテストおよび評価するために設計された厳選された敵対的プロンプトライブラリ。
  • OBLITERATUS - 再訓練なしでオープンソースLLMから拒否動作を除去するアブリタレーションツールキット。モデルの重みを変更して安全性にアライメントされた拒否応答を排除し、制限のないモデル動作研究を可能にする。
  • T3MP3ST - 自律型レッドチーミングプラットフォームおよびマルチエージェントオフェンシブセキュリティメタハーネス。フロンティアAIシステムに対する協調的な敵対的テストのためにAIエージェントの群れを調整する。
  • P4RS3LT0NGV3 - ユニバーサルテキスト変換およびプロンプトクラフティングツールキット。翻訳、変異、エンコード/デコード、脱獄ペイロード構築のための敵対的プロンプトエンジニアリングをサポート。
  • claude-secure-coding-rules - Claude Codeがデフォルトでセキュアなコードを生成するように導くオープンソースのセキュリティルール。
  • DeepTeam - プロンプトインジェクション、脱獄、RAGポイズニングを含む40以上の攻撃手法を備えたLLMレッドチーミングフレームワーク。CI/CDパイプラインと統合。
  • SQLMap、FFUF、NMAP、Masscanなどの人気セキュリティツール向けのModel Context Protocolサーバーのコレクション。セキュリティテストとペネトレーションテストをAIワークフローに統合します。
  • mcp-security-hub - 拡大を続けるMCPサーバーのコレクションで、攻撃的セキュリティツールをAIアシスタントにもたらします。Nmap、Ghidra、Nuclei、SQLMap、Hashcatなど。
  • Burp MCP Server - Burp用MCPサーバー
  • burpgpt - OpenAIのGPTを統合したBurp Suite拡張機能で、高度にカスタマイズされた脆弱性を発見するための追加のパッシブスキャンを実行し、任意のタイプのトラフィックベースの分析を可能にします。
  • guardian-cli - AIを活用したセキュリティテスト&脆弱性スキャナー。Guardian CLIはAIを活用してペネトレーションテスト、脆弱性評価、セキュリティ監査を自動化するインテリジェントなセキュリティテストツールです。
  • AutoPentestX - AutoPentestX – Linux向け自動ペネトレーションテスト&脆弱性レポートツール
  • HackGPT - ChatGPTを使用したハッキングツール
  • nano-analyzer - AISLEによる最小限のLLM駆動型ゼロデイ脆弱性スキャナー。
  • clearwing - LangGraph上に構築された自律型脆弱性スキャナーおよびソースコードハンター。
  • Zen-AI-Pentest - AIを活用したペネトレーションテストフレームワークで、自動脆弱性スキャン、マルチエージェントシステム、コンプライアンスレポートを備えています。72以上のセキュリティツール、Dockerサンドボックス、ReActエージェント、攻撃経路分析。
  • Violin - 監視型のエージェンティックHermes Agentペネストプロファイル:31のスキルベースのプレイブック(OWASP Top 10、API Top 10、LLM Top 10)と、対話型スコーピング、スコープ検証、承認ゲートを備え、許可された偵察、エクスプロイト検証、レポート作成を行います。
  • NeuroSploit - Rustによる自律型マルチモデルペネトレーションテストハーネス。LLMプールが偵察、エージェント選択、エクスプロイト連鎖、およびブラックボックス、ホワイトボックス、グレーボックス、クラウドエンゲージメントモードにわたるクロスモデル検証投票を駆動します。
  • OpenHack - AIを活用したマルチエージェントスキャナーで、コードベース内のSQLi、XSS、IDOR、認証バイパスを自律的に発見し、サンドボックス実行とブラウザリプレイを通じて各発見を検証します。Claude Opus 4.6と同等の性能で、コストは約40分の1。
  • PentAGI - 複雑なペネトレーションテストタスクのための完全自律型マルチエージェントシステム。サンドボックス化されたDocker実行、マルチプロバイダーLLMサポート(OpenAI、Anthropic、Gemini、Ollama、DeepSeek)、ナレッジグラフ統合、リアルタイムエージェント監視。
  • V3SP3R - Flipper Zero向けのAIを活用したハードウェアハッキングコンパニオン。ハードウェア攻撃を制御するための自然言語インターフェースを備え、スマートグラスとの統合によりハンズフリー操作を実現。
  • AI安全性と解釈可能性研究のためのエージェント可観測性およびリプレイツール。マルチセッションのエージェント軌跡を実行し、ATIF形式でキャプチャし、セッション間のファイル状態変更を追跡するハーネス。マルチターン、マルチセッション、マルチエージェント相互作用にわたるLLMエージェントの行動研究用に構築。
  • claude-code-devcontainer - Claude Codeをバイパスモードで安全に実行するためのサンドボックス化されたdevcontainer。セキュリティ監査と信頼できないコードレビュー用に構築。
  • claude-code-safety-net - セーフティネットとして機能するClaude Codeプラグインで、破壊的なgitおよびファイルシステムコマンドが実行される前にキャッチします
  • OneCLI - AIエージェント向けのオープンソース認証情報ボールト。Rust HTTPゲートウェイがエージェントリクエストをインターセプトし、API認証情報を透過的に注入するため、エージェントは生のキーを保持しません。AES-256-GCM暗号化、エージェントごとのスコープ設定、完全な監査証跡。
  • OpenSandbox - AIエージェント向けの安全、高速、拡張可能なサンドボックスランタイム。マルチ言語SDK、Docker/Kubernetesランタイム、gVisor/Kata Containers/Firecracker分離。CNCF Landscapeプロジェクト。
  • openclaw-shield - OpenClawエージェント向けセキュリティプラグイン - シークレット漏洩、PII露出、破壊的なコマンド実行を防止
  • clawsec - OpenClawデプロイメント向けのセキュリティスキャナーおよび強化ツール。OpenClawゲートウェイおよびエージェント設定に特化したセキュリティ評価、構成監査、脆弱性検出を提供。
  • nanoclaw - セキュリティのためにコンテナで実行されるOpenClawの軽量代替品。WhatsAppに接続し、メモリ、スケジュールジョブを持ち、AnthropicのAgents SDK上で直接動作。協調エージェントチーム向けのAgent Swarmsをサポートする最初のAIアシスタント。
  • secureclaw - Adversa AIによるOpenClaw AIエージェント向けの自動セキュリティ強化。51の監査チェック、12の行動ルール、9のスクリプト、4のパターンデータベース。OWASP ASI Top 10を完全カバー。プロンプトインジェクション、認証情報の盗難、サプライチェーン攻撃、プライバシー漏洩から保護。
  • defenseclaw - Cisco AI DefenseによるOpenClawのエンタープライズガバナンスレイヤー。組み込みのCodeGuard SAST、ツール呼び出し検査エンジン、LLMガードレールプロキシ、SIEM統合により、スキル、MCPサーバー、プラグインをスキャン。HIGH/CRITICALな発見を自動ブロック。
  • microsandbox - 信頼できないAI生成コードを強力な分離保証のもとで安全に実行するための軽量マイクロVMサンドボックス
  • Adrian - Secure AgenticsによるAIエージェント向けのオープンソース、AARM準拠のランタイムセキュリティ監視および制御エンジン。エージェントのアクティビティログ(ツール呼び出し、アクション、出力)と推論トレースを分析して、悪意のある、不整合な、または権限外の行動を検出し、オプションの飛行中介入(監査モード vs ブロックモード)を提供。Python(LangChain/LangGraph)およびTypeScript SDK、完全にセルフホスト可能でオフライン動作。Apache-2.0。
  • HOL Guard - ファイルが変更されたりネットワークに接続される前に、AIコーディングエージェント(Codex、Claude Code、Cursor、Gemini、Copilot、Hermes、OpenCode)のツール呼び出しをインターセプトするローカルファーストのセキュリティハーネス。ツール事前フック、承認センター、サプライチェーンアドバイザリースキャン、オプションのGuard Cloud同期。
  • claude-grc-plugin - ClaudeをシニアGRCアナリストに変えるClaude Codeプラグイン。15のフレームワーク(NIST 800-53、FedRAMP、ISO 27001、SOC 2など)をカバーする72以上の参照ファイル、24のスラッシュコマンド、連邦および商用コンプライアンス業務のための深いドメイン知識。
  • Vigil SOC - AIエージェント向けの包括的なオープンソースセキュリティ運用プラットフォーム。AI駆動環境のリアルタイム監視、脅威検出、インシデント対応を実現。
  • AiSOC - オープンソースで自己ホスト可能なAI搭載SOC。セキュリティイベントを取り込み、相関付け、LangGraphを介して自律的なAI駆動調査を実行し、統合コンソールに結果を表示。完全なエージェント決定監査証跡、CIでの公開評価ハーネス、52のファーストパーティコネクタを搭載。MITライセンス。