Skip to content
KitploitKITPLOIT
ИнструментыБлог
Log in
Отправить
ИнструментыБлог
Отправить

Инструменты для хакинга, пентеста и кибербезопасности — ваш арсенал защиты!

Kitploit — это каталог инструментов для хакинга, кибербезопасности и пентестинга. Находите последние обновления проектов для поиска уязвимостей, анализа систем, автоматизации тестирования и усиления вашей безопасности.

ЛентыКонтактыКонфиденциальность© 2026 Kitploit

Каталог инструментов

Категории

Все категории
Loading categories
CVE-Factory — CVE-Factory | Kitploit
Инструменты/GitHubGitHub/livecvebench/cve-factory
Безопасность контейнеровДинамический анализ (песочница)Анализ уязвимостейЭксплуатацияТестирование на ПроникновениеСтатьи и ИсследованияОбучение и ОбразованиеПодобранные РесурсыБезопасность ИИ
GitHublivecvebench/cve-factory

CVE-Factory

CVE-Factory

1647196 месяцев назадПроверено Kitploit

Популярное

Смотреть все →

Откройте для себя самые используемые инструменты нашего сообщества.

Изучить все инструменты

Просмотрите нашу коллекцию инструментов

Смотреть все инструменты →
Поделиться
Репозиторий

CVE-Factory: Масштабирование агентных задач экспертного уровня для уязвимостей безопасности кода

Paper Leaderboard Benchmark Model Dataset License: MIT

CVE-Factory — это мультиагентная система для полностью автоматизированного сквозного воспроизведения CVE. На основе записей о CVE система автоматически исследует детали, генерирует тест-кейсы, создаёт Docker-окружения и проверяет, что каждая уязвимость может быть как эксплуатирована, так и устранена. Конвейер преобразует метаданные CVE в воспроизводимые и тестируемые окружения с уязвимостями без ручного вмешательства.

⚠️ Предупреждение о безопасности: эта система собирает и запускает Docker-контейнеры, содержащие уязвимое программное обеспечение. Вы ОБЯЗАНЫ использовать окружение Docker-in-Docker (DinD) для изоляции CVE-контейнеров от вашей хост-системы. Никогда не запускайте CVE-Factory напрямую на демоне Docker вашего хоста.

📢 Новости

  • [2026-03-27] Добавлено 3 181 новое CVE-окружение для задач (Hugging Face), Abacus-cve-v1.1 с 18,8 тыс. обучающих трейсов, а также бенчмарки LiveCVEBench-verified и PatchEval-verified. Добавлены 4 новых агента (Judger, Changer, Comparer, Expert), 3 навыка (cve-test-generator, cheat-detect, cheat-detect-evaluate), а управление доступом к инструментам переключено с allowlist на denylist. Подробности — в Примечаниях к обновлению.

✨ Ключевые возможности

🤖 Сквозная автоматизация

Введите записи CVE — получите полное окружение для воспроизведения CVE. Следуя стандарту Terminal Bench, каждый созданный пакет задач включает:

  • Настройка окружения: Dockerfile и docker-compose.yaml с уязвимым приложением
  • Конфигурация задачи: task.yaml со структурированными описаниями инструкций (без CVE-идентификаторов)
  • Эталонное исправление: solution.sh для устранения уязвимости
  • Точка входа оценки: run-tests.sh для запуска оценки

Специально разработанная для задач безопасности, наша логика тестирования разделена на:

  • test_func.py: функциональные тесты, проверяющие, что базовые функции работают как до, так и после исправления
  • test_vuln.py: эксплойт-тесты, подтверждающие наличие уязвимости до исправления и её устранение после

Никакого ручного исследования, никакого ручного кодирования — полная автоматизация от необработанных метаданных CVE до проверенного воспроизведения.

Структура создаваемых артефактов:

CVE-2025-XXXX/
├── task.yaml              # Structured Task Metadata
├── Dockerfile          # Vulnerable Environment Setup
├── docker-compose.yaml # Service Orchestration   
├── task-deps/  
├── solution.sh            # Verified Patch
└── test/
    ├── test_func.py       # Functionality Check
    ├── test_vuln.py       # Vulnerability Exploit Check
    └── run-tests.sh           # One-click Evaluation Script 

📊 Подтверждённый высокий показатель успеха

В ходе масштабной оценки 554 CVE за 2025 год CVE-Factory успешно воспроизвёл 499 случаев, достигнув 90,1% успеха. Кроме того, строгая экспертная проверка 471 успешного случая подтвердила, что 312 задач (66,2%) были воспроизведены полностью и точно!

При сравнении с экспертами по безопасности, использовавшими идентичную исходную информацию, наша система достигла ~95% доли прохождения проверки при создании окружений и решений — что демонстрирует возможности экспертного уровня в автоматизированном воспроизведении уязвимостей.

📂 Открытый набор данных: Мы публикуем более 1 000 CVE-окружений для задач в каталоге cve_tasks/:

  • trainset/ (887 задач): используется для обучения Abacus-cve. Более 4 000 дистиллированных трейсов агентов на Hugging Face 🤗 сгенерированы на основе этих задач с помощью Claude Opus 4.5 и каркаса Mini SWE-Agent.
  • trainset-2/: дополнительные задачи относительно более простой сложности. Не включены в обучающие данные.
  • НОВОЕ: ещё 3 181 задача доступна в cve_tasks_3k_compressed на Hugging Face (сжатый архив из-за ограничений размера), с 18,8 тыс. трейсов агентов для обучения Abacus-cve-v1.1.

🚀 Результаты обучения

Дообучение на трейсах CVE-Factory даёт значительные улучшения на бенчмарках в области безопасности. Qwen3-32B достигает ~6,8× улучшения на LiveCVEBench (5,29% → 35,79%), ~4,2× на PatchEval (5,66% → 23,58%) и даже показывает существенный прирост на Terminal-Bench (12,50% → 28,75%) — что демонстрирует сильное обобщение между задачами.

МодельLiveCVEBenchPatchEvalTerminal-BenchСредн.
Qwen3-32B (базовая)5,295,6612,507,82
Abacus-cve (наша)35,7923,5828,7529,37
Qwen3-Coder-30B10,589,9113,7511,41
Qwen3-Coder-480B19,5819,3436,2525,06
MiniMax-M224,8719,3437,5027,24
Claude Sonnet 420,1122,6433,7525,50
Claude Sonnet 4.534,3928,7745,0036,05
Claude Opus 4.541,2732,0848,7540,70

Всего лишь с 4 тыс. трейсов Abacus-cve (32B) превосходит Qwen3-Coder-480B, MiniMax-M2 и Claude Sonnet 4, приближаясь к уровню Claude Sonnet 4.5 на задачах безопасности.

НОВОЕ: модель Abacus-cve-v1.1, обученная на 18,8 тыс. трейсов, даёт дополнительный прирост (+3,83 на LiveCVEBench, +2,38 на PatchEval). Расширенные обучающие данные см. в cve_train_v1.1.

🧠 Автономные агенты Claude Code

В отличие от жёстких поисковых конвейеров или простых циклов использования инструментов, каждый агент работает как полноценная сессия Claude Code. Мы не прописываем шаги жёстко; вместо этого мы определяем каждого агента через его Роль (например, Analyzer), Цель (например, «Создать уязвимое окружение»), Ресурсы (например, доступ к определённым документам) и Метод проверки (например, «Должен пройти check_env_ready»). Агенты действуют как разработчики-люди: они автономно исследуют файлы, отлаживают ошибки, читают логи и итеративно дорабатывают решения в пределах своего выделенного рабочего пространства.

⚡ Асинхронная параллельная обработка

Скачать инструмент