Skip to content
KitploitKITPLOIT
ツールブログ
提出
ツールブログ
提出

ハッキング、侵入テスト、サイバーセキュリティツールをあなたのセキュリティアーセナルに!

Kitploitはハッキング、サイバーセキュリティ、ペネトレーションテストのツールディレクトリです。最新のプロジェクトアップデートを見つけて、脆弱性の発見、システム分析、テストの自動化、セキュリティの強化を行いましょう。

··フィード·お問い合わせ·プライバシー·© 2026 Kitploit

ツールディレクトリ

カテゴリ

すべてのカテゴリを見る
Loading categories
CVE-Factory — CVE-Factory | Kitploit
ツール/GitHubGitHub/livecvebench/cve-factory
コンテナセキュリティ動的分析 (サンドボックス)脆弱性分析エクスプロイトペネトレーションテスト論文と研究学習と教育厳選リソースAIセキュリティ
GitHublivecvebench/cve-factory

CVE-Factory

CVE-Factory

リポジトリを見る
16474ヶ月前Kitploit レビュー済み

人気

すべて見る →

コミュニティで最も使われているツールを見つけましょう。

すべてのツールを探索

ツールコレクションを閲覧

すべてのツールを見る →
共有

CVE-Factory:コードセキュリティ脆弱性のためのエキスパートレベルのエージェントタスクのスケーリング

Paper Leaderboard Benchmark Model Dataset License: MIT

CVE-Factoryは、完全自動化されたエンドツーエンドのCVE再現のためのマルチエージェントシステムです。CVEレコードを入力すると、システムは自動的に詳細を調査し、テストケースを生成し、Docker環境を構築し、各脆弱性が悪用可能かつパッチ可能であることを検証します。このパイプラインは、人手を介さずにCVEメタデータを再現可能でテスト可能な脆弱性環境に変換します。

⚠️ セキュリティ警告: このシステムは、脆弱性のあるソフトウェアを含むDockerコンテナをビルドして実行します。CVEコンテナをホストシステムから隔離するために、必ず Docker-in-Docker (DinD) 環境 を使用してください。CVE-FactoryをホストのDockerデーモン上で直接実行しないでください。

📢 ニュース

  • [2026-03-27] 3,181件の新しいCVEタスク環境 (Hugging Face)、18.8kのトレーニングトレースを持つ Abacus-cve-v1.1、および LiveCVEBench-verified & PatchEval-verified ベンチマークを追加。4つの新しいエージェント (Judger, Changer, Comparer, Expert)、3つのスキル (cve-test-generator, cheat-detect, cheat-detect-evaluate) を追加し、ツールアクセス制御を許可リストから拒否リストに切り替えました。詳細は 更新ノート をご覧ください。

✨ ハイライト

🤖 エンドツーエンドの自動化

CVEレコードを入力すると、完全なCVE再現環境が得られます。Terminal Bench 標準 に従い、生成された各タスクパッケージには以下が含まれます:

  • 環境セットアップ: 脆弱性アプリケーションをホストする Dockerfile と docker-compose.yaml
  • タスク設定: 構造化された指示説明を含む task.yaml (CVE-IDなし)
  • リファレンス修正: 脆弱性をパッチする solution.sh
  • 評価エントリ: 評価を開始する run-tests.sh

セキュリティタスク向けに特別に設計されており、テストロジックは次の2つに分割されています:

  • test_func.py: 修正前後で基本機能が動作することを確認する機能テスト
  • test_vuln.py: パッチ前は脆弱性が存在し、パッチ後に解決されることを検証するエクスプロイトテスト

手動調査も手動コーディングも不要 – 生のCVEメタデータから検証済み再現まで完全自動化。

生成されるアーティファクト構造:

root@kitploit:~
CVE-2025-XXXX/
├── task.yaml              # 構造化タスクメタデータ
├── Dockerfile          # 脆弱性環境セットアップ
├── docker-compose.yaml # サービスオーケストレーション
├── task-deps/  
├── solution.sh            # 検証済みパッチ
└── test/
    ├── test_func.py       # 機能チェック
    ├── test_vuln.py       # 脆弱性エクスプロイトチェック
    └── run-tests.sh           # ワンクリック評価スクリプト

📊 実証済みの高い成功率

2025年の554件のCVEを対象とした大規模評価において、CVE-Factoryは499件のケースを再現することに成功し、90.1%の成功率を達成しました。さらに、成功した471ケースの厳格な専門家レビューにより、**312タスク(66.2%)**が完全かつ正確に再現されていることが確認されました!

同一の初期情報を使用したセキュリティ専門家との比較では、環境とソリューションの構築において約95%の検証合格率を達成し、自動化された脆弱性再現におけるエキスパートレベルの能力を示しました。

📂 オープンデータセット: cve_tasks/ ディレクトリに 1,000以上のCVEタスク環境 を公開しています:

  • trainset/ (887タスク): Abacus-cve のトレーニングに使用。4,000以上の蒸留エージェントトレース は Hugging Face 🤗 にあり、これらのタスクから Claude Opus 4.5 と Mini SWE-Agent ハーネスを使用して生成されました。
  • trainset-2/: 比較的簡単な難易度の追加タスク。トレーニングデータには含まれていません。
  • 新規: さらに 3,181タスク が Hugging Face の cve_tasks_3k_compressed で利用可能(サイズ制限のため圧縮アーカイブ)、Abacus-cve-v1.1 のトレーニング用に 18.8kのエージェントトレース を含む。

🚀 トレーニング結果

CVE-Factoryトレースでのファインチューニングにより、セキュリティベンチマークで劇的な改善が得られます。Qwen3-32B は LiveCVEBench で 約6.8倍の改善(5.29% → 35.79%)、PatchEval で約4.2倍(5.66% → 23.58%)、さらには Terminal-Bench でも有意な向上(12.50% → 28.75%)を示し、強力なクロスタスク汎化能力を実証しています。

わずか4kトレースで、Abacus-cve (32B) は Qwen3-Coder-480B、MiniMax-M2、Claude Sonnet 4 を上回り、セキュリティタスクで Claude Sonnet 4.5 レベルに迫ります。

新規: 18.8kトレースでトレーニングされた Abacus-cve-v1.1 はさらなる向上を達成(LiveCVEBenchで+3.83、PatchEvalで+2.38)。拡張されたトレーニングデータについては cve_train_v1.1 をご覧ください。

🧠 自律型 Claude Code エージェント

固定の検索ワークフローや単純なツール使用ループとは異なり、各エージェントは完全な Claude Code セッションとして動作します。手順をハードコードするのではなく、各エージェントをその 役割(例:Analyzer)、目標(例:「脆弱性環境を構築する」)、リソース(例:特定のドキュメントへのアクセス)、および 検証方法(例:「check_env_ready を通過する必要がある」)によって定義します。エージェントは人間の開発者のように動作します:自律的にファイルを探索し、エラーをデバッグし、ログを読み、指定されたワークスペース内でソリューションを反復的に改善します。

⚡ 非同期同時処理

CVE-Factoryは複数のCVEを同時に処理できるように設計されています。各CVEパイプラインは非同期に実行されるため、高速なタスクは低速なタスクを待つことなく後続のステージに進みます。システムは非同期アーキテクチャを使用しており、特定のエージェントタイプごとに同時実行制限を分離できます。例えば、軽量な調査タスク(Analyzer)には高い制限を、リソース集約型のDockerタスク(Builder)には低い制限を設定できます。この柔軟性により、システムの過負荷を防ぎながら処理速度を最大化します。ステージレベルのタイムアウトにより、ハングしたプロセスが処理キューをブロックするのを防ぎます。

🧩 モジュラー型マルチステージパイプライン

パイプラインは6つの独立したステージで構成されており、個別に実行することも組み合わせて実行することもできます。

  • フェーズ1 (Analyzer → Generator) は、CVE調査を実行し、Dockerを必要とせずにアーティファクトを生成します。

    ツール要件: Analyzerエージェントは web_search および web_fetch ツールに依存します。サードパーティのAPIプロバイダーを使用する場合は、これらの特定のツール機能をサポートしていることを確認する必要があります。

  • フェーズ2 (Builder → Validator → Solver → Checker) は、Docker環境の構築と検証を処理します。環境構築から全体検証まで、エージェントはローカルファイルシステムとDockerデーモンのみと対話するため、ウェブ関連のツールは必要ありません。

各ステージは個別に呼び出すこともでき、再現プロセスを細かく制御し、特定のステージのデバッグを容易にします。

🏗️ アーキテクチャ

パイプラインアーキテクチャ

システムは6つのステージで構成されています:

🚀 クイックスタート

🐳 1. Docker-in-Docker 環境のセットアップ

root@kitploit:~
# 隔離されたDinD環境を起動(セキュリティに必須)
cd dev-env
docker compose up -d

# 開発コンテナに入る
docker compose exec cve-factory bash

詳細なDinD設定とトラブルシューティングについては dev-env/README.md を参照してください。

📂 2. CVE入力の準備

再現したいCVEを original_cves_md/ ディレクトリに配置します。ファイル名は CVE-YYYY-NNNNN.md の形式で、関連情報を含んでいる必要があります。これらの入力を準備するには、LiveCVEBench-Preview の cve-sampler を使用することをお勧めします。

root@kitploit:~
# DinD開発コンテナ内
cd /workspace
pip install -r requirements.txt

# CVE入力ファイルの準備を確認
ls original_cves_md/

▶️ 3. CVE-Factoryの実行

root@kitploit:~
# APIキーを設定するか、Claudeサブスクリプションを使用
export ANTHROPIC_API_KEY="your-key"
export ANTHROPIC_BASE_URL="your-url"
# 特定のCVEを処理
python -m orchestrator.run --cve CVE-2025-XXXXX

# または入力ディレクトリ内のすべてのCVEを処理
python -m orchestrator.run

# フェーズを個別に実行
python -m orchestrator.run --phase1  --cve CVE-2025-XXXXX # Analyzer + Generatorのみ(Docker不要)
python -m orchestrator.run --phase2  --cve CVE-2025-XXXXX # Builder → Checker(Docker必須)

CVEの再現は次の場合に成功と見なされます:

  • 脆弱な状態: test_func.py PASS、test_vuln.py FAIL(アプリは動作し、脆弱性は悪用可能)
  • 修正された状態: test_func.py PASS、test_vuln.py PASS(アプリは動作し、脆弱性はパッチ済み)

⚙️ 設定

config.yaml の主要設定で実行を最適化します:

root@kitploit:~
# config.yamlの調整例
orchestrator:
  max_concurrent_cves: 3  # 安定性のために同時実行数を減らす

agents:
  limits:
    builder: 2            # Dockerがすべてのリソースを消費するのを防ぐ

📚 ドキュメント

  • DinD環境 - Docker-in-Dockerセットアップガイド(ここから開始)
  • スクリプト - 手動デバッグおよび検証スクリプト
  • アーキテクチャ - 詳細なシステム設計とデータフロー
  • エージェント管理 - オーケストレーションとリソース制御
  • 通信 - エージェント間メッセージプロトコル
  • 将来のロードマップ - 計画されている改善と機能

🚧 開発中

現在、OneFactory を積極的に開発しています。これは、ターミナル、SWE、およびセキュリティ(CVE)機能を統合した包括的な3-in-1エージェントデータパイプラインである統一合成フレームワークです。

CVE-Factoryに基づいて、LiveCVEBench を開発し、ベンチマークの最初のバージョン、トレーニングデータ、および Abacus-cve モデルをリリースしました。今後もベンチマークを拡張し、SFT & RL トレーニングレシピを最適化していきます。さらなるアップデートにご期待ください!


🤝 コントリビューション

このプロジェクトは継続的に拡張および更新されています。ご提案がある場合、またはこのプロジェクトに参加/貢献したい場合は、[email protected] までご連絡ください!

📝 ライセンス

MIT License

🎓 引用

root@kitploit:~
@misc{luo2026cvefactory,
  title={CVE-Factory: Scaling Expert-Level Agentic Tasks for Code Security Vulnerability}, 
  author={Xianzhen Luo and Jingyuan Zhang and Shiqi Zhou and Rain Huang and Chuan Xiao and Qingfu Zhu and Zhiyuan Ma and Xing Yue and Yang Yue and Wencong Zeng and Wanxiang Che},
  year={2026},
  eprint={2602.03012},
  archivePrefix={arXiv},
  primaryClass={cs.CR},
  url={https://arxiv.org/abs/2602.03012}
}
ツールをダウンロード
モデルLiveCVEBenchPatchEvalTerminal-Bench平均
Qwen3-32B (ベース)5.295.6612.507.82
Abacus-cve (本手法)35.7923.5828.7529.37
Qwen3-Coder-30B10.589.9113.7511.41
Qwen3-Coder-480B19.5819.3436.2525.06
MiniMax-M224.8719.3437.5027.24
Claude Sonnet 420.1122.6433.7525.50
Claude Sonnet 4.534.3928.7745.0036.05
Claude Opus 4.541.2732.0848.7540.70
ステージ目的
情報収集Analyzerが詳細を public.md と役割固有のドキュメント(for_generator.md など)に収集します。情報が不十分な場合は終了します。
ファイル生成Generatorが論理コンポーネントを作成:task.yaml、テスト(test_func.py、test_vuln.py)、solution.sh、run-tests.sh、および docker-reqs.md ガイダンス。
環境構築Builderが Dockerfile と docker-compose.yaml を生成し、厳密性を確保するために「ブラインドビルディング」(テスト/ソリューションにアクセス不可)で動作します。
脆弱性検証Orchestratorが check_env_ready を介して test_vuln の FAIL + test_func の PASS を検証します。失敗した場合、Validatorエージェントが環境を修正します(最大3回のリトライ)。
解決策検証Orchestratorが check_fix_ready を介して修正を検証します。両方のテストがPASSする必要があります。失敗した場合、Solverエージェントがソリューションまたは環境を調整します。
全体検証Checkerエージェントが、check_cve_ready の結果に関係なく、エラーを処理するかQA(モックコード/データのクリーンアップ)を実行します。最終的なE2Eチェックで成功を確認します。
セクション設定説明
Orchestratormax_concurrent_cves同時に処理するCVEの数を制御します。APIレート制限に達する場合はこれを減らします。
Agentslimits特定のステージの同時実行上限を設定します(例:builder を制限してディスク/CPUを節約)。
Modelsmodels.default基礎となるLLMを切り替えます(例:Claude 4.5 Sonnet vs Opus)。