Skip to content
KitploitKITPLOIT
ИнструментыЭксплойтыБлог
Log in
Отправить
ИнструментыЭксплойтыБлог
Отправить

Инструменты для хакинга, пентеста и кибербезопасности — ваш арсенал защиты!

Kitploit — это каталог инструментов для хакинга, кибербезопасности и пентестинга. Находите последние обновления проектов для поиска уязвимостей, анализа систем, автоматизации тестирования и усиления вашей безопасности.

ЛентыКонтактыКонфиденциальность© 2026 Kitploit

Каталог инструментов

Категории

Все категории
Loading categories
TarantuBench — Полный репозиторий всех лабораторных работ, доступных в рамках бенчмарка | Kitploit
Инструменты/GitHubGitHub/trivulzianus/tarantubench
Аутентификация и авторизацияСканеры уязвимостейЭксплуатация веб-приложенийВеб-безопасностьCTFТестирование на ПроникновениеОбучение и ОбразованиеРазработка Полезной НагрузкиЛаборатории и Практика
GitHubtrivulzianus/tarantubench

TarantuBench

Полный репозиторий всех лабораторных работ, доступных в рамках бенчмарка

21124 месяцев назадЕщё не проверено

Популярное

Смотреть все →

Откройте для себя самые используемые инструменты нашего сообщества.

Изучить все инструменты

Просмотрите нашу коллекцию инструментов

Смотреть все инструменты →
Поделиться
Репозиторий

TarantuBench v1

Бенчмарк для оценки AI-агентов на задачах веб-безопасности, созданный движком TarantuLabs.

Что это такое?

TarantuBench — это набор из 100 уязвимых веб-приложений, каждое из которых содержит скрытый флаг (TARANTU{...}). Задача агента — найти и извлечь флаг, взаимодействуя с приложением через HTTP — так же, как это сделал бы человек-тестер на проникновение.

Задания варьируются от начального уровня (обход аутентификации через SQL-инъекцию) до продвинутых многошаговых цепочек атак, требующих эксплуатации до 5 уязвимостей последовательно — включая злоупотребление бизнес-логикой, хранимый XSS для кражи сессии, подделку JWT, SSRF и SQL-инъекцию во внутренних API.

Каждая лабораторная работа — это самодостаточное приложение на Node.js/Express с БД SQLite в памяти. Никаких внешних зависимостей, не требуется сетевой доступ — просто запустите сервер и начинайте исследование.

Все задания в этом релизе сгенерированы с помощью проприетарного движка генерации лабораторных работ TarantuLabs.

v1 — Генерация в масштабе

TarantuBench v1 представляет собой зрелый, масштабируемый бенчмарк, подкреплённый проверенным конвейером генерации:

  • Пропускная способность. Конвейер генерирует примерно 100 проверенных лабораторных работ в час, используя Claude Opus с адаптивным мышлением. Каждая работа — это полноценное тематическое веб-приложение с реалистичным интерфейсом, начальными данными и одной или несколькими эксплуатируемыми уязвимостями.
  • Верификация. Каждая сгенерированная работа детерминированно проверяется: запускается сервер, выполняется автоматически сгенерированный решатель, подтверждается извлечение флага. Конвейер достигает 93% успешной верификации с первой попытки. Неудачные работы автоматически диагностируются и перегенерируются до тех пор, пока вся партия не пройдёт проверку.
  • Node.js/Express по дизайну. Все работы ориентированы на Node.js/Express — это осознанный выбор, а не ограничение. Он позволяет запускать каждое задание интерактивно в браузере через WebContainers на tarantulabs.com, делая бенчмарк доступным без локальной настройки.
  • Что дальше. Будущие версии расширят инфраструктуру уязвимостей на другие серверные фреймворки и языки, а также исследуют задачи безопасности за пределами веб-приложений — включая эксплуатацию бинарных файлов, сетевую безопасность и криптографические атаки.

Быстрый старт

Требования к Node-обвязке: Node.js 18+ и npm.

Требования к заданию Inspect AI: Python 3.11+, Docker и uv или другой совместимый с PEP 517 установщик.

Набор запускаемых лабораторных работ опубликован на Hugging Face по адресу tarantulabs/TarantuBench. Этот репозиторий GitHub содержит оценочную обвязку и документацию.

git clone https://github.com/Trivulzianus/TarantuBench.git
cd TarantuBench
cd eval && npm install && cd ..

# Загрузите файл набора данных с Hugging Face или клонируйте репозиторий набора:
# git clone https://huggingface.co/datasets/tarantulabs/TarantuBench data

# Запустите вашего агента против всех 100 лабораторных работ
node eval/harness.js --dataset data/tarantubench-v1.jsonl \
  --command "python my_agent.py --url {URL}" \
  --timeout 300

# Сгенерируйте отчёт с результатами
node eval/scorecard.js

Перед проведением формальной оценки проверьте, что локальный набор данных или набор с Hugging Face имеет ожидаемое количество строк и схему:

node eval/validate-dataset.js --dataset data/tarantubench-v1.jsonl --expected-count 100
node eval/validate-dataset.js --hf tarantulabs/TarantuBench --expected-count 100

Обвязка запускает каждую лабораторную работу, помещает перед ней прозрачный прокси-логгер и выполняет команду вашего агента (заменяя {URL} на адрес цели). Ваш агент может быть написан на любом языке — ему нужно лишь отправлять HTTP-запросы и отправлять флаг через POST {URL}/submit-flag с телом {"flag": "TARANTU{...}"}.

Запуск одной лабораторной работы вручную

# Запустите одну работу в режиме сервера — обвязка выведет URL, вы подключаете агента
node eval/harness.js --dataset data/tarantubench-v1.jsonl \
  --labs corporate-portal-chain-xss-idor \
  --mode server --timeout 300

Зачем нужен этот бенчмарк?

  • Однозначная оценка: либо агент извлёк флаг, либо нет. Никаких частичных баллов, не требуется человеческое суждение.
  • Градуированная сложность: от начального (одна точка инъекции) до продвинутого (многошаговые цепочки эксплойтов, требующие 2–5 связанных уязвимостей).
  • Воспроизводимость: детерминированный код сервера и отсутствие внешних API. Обвязка генерирует новый флаг на каждый запуск, поэтому поведение эксплойта воспроизводимо, хотя буквальное значение флага меняется при каждом запуске.
  • Генерация в масштабе: лабораторные работы синтезируются движком TarantuLabs, а не пишутся вручную. Это означает, что бенчмарк может программно расти по мере добавления новых типов уязвимостей и определений цепочек.

Схема набора данных

Каждая строка в data/tarantubench-v1.jsonl представляет одно задание:

СтолбецТипОписание
lab_idstringУникальный идентификатор
titlestringЧеловекочитаемое название задания
descriptionstringКраткое описание сценария (показывается агенту)
objectiveslist[string]Что агенту поручено выполнить
hintslist[string]Необязательные пошаговые подсказки (для абляционных исследований)
difficultystringBeginner, Intermediate или Advanced
categorystringОсновное семейство уязвимостей (например, SQL Injection, XSS)
vuln_subtypestringКонкретная техника (например, sqli-union, xss-stored)
chain_typestring или nullИдентификатор многошаговой цепочки или null для одноуязвимых работ
server_codestringПолный исходный код уязвимого приложения на Node.js/Express
dependenciesobjectЗависимости npm, необходимые для запуска сервера

Разбивка заданий

По сложности

СложностьКоличествоОписание
Beginner35Одна уязвимость, прямая эксплуатация
Intermediate25Требуется перебор, обход фильтров или многошаговая логика
Advanced40Многошаговые цепочки, ошибки бизнес-логики или глубокая эксплуатация

По категории

КатегорияКоличество
Цепочки множественных уязвимостей34
SQL-инъекция20
IDOR (Небезопасная прямая ссылка на объект)11
Обход аутентификации/авторизации10
XSS (Межсайтовый скриптинг)10
Бизнес-логика8
Инъекция команд5
SSRF (Подделка запроса со стороны сервера)2

Цепочки заданий

34 из 100 лабораторных работ требуют связывания нескольких уязвимостей:

Тип цепочкиКоличествоШаги
SSRF → SQL-инъекция8Обход контроля доступа через SSRF, затем извлечение флага через SQLi
SSRF → Blind SQLi5SSRF для доступа к внутреннему эндпоинту, затем слепое булево извлечение
XSS → SQL-инъекция7Кража сессии администратора через хранимый XSS, затем использование поиска, доступного только админу, с SQLi
XSS → IDOR5Кража сессии администратора через хранимый XSS, затем доступ к скрытым данным через IDOR
JWT Forgery → Blind SQLi4Взлом слабого секрета JWT, подделка повышенного токена, извлечение флага по символам
JWT Forgery → IDOR3Взлом JWT, подделка повышенной роли, доступ к ограниченным эндпоинтам API
Biz Logic → XSS → JWT → SSRF → SQLi15-шаговая цепочка через злоупотребление рефералами, кражу сессии, подделку JWT, SSRF-переключение и union SQLi
XSS → JWT → SSRF → SQLi14-шаговая цепочка через кражу сессии, подделку JWT, SSRF и SQL-инъекцию

Тематика приложений

Скачать инструмент