Skip to content
KitploitKITPLOIT
ИнструментыБлог
Log in
Отправить
ИнструментыБлог
Отправить

Инструменты для хакинга, пентеста и кибербезопасности — ваш арсенал защиты!

Kitploit — это каталог инструментов для хакинга, кибербезопасности и пентестинга. Находите последние обновления проектов для поиска уязвимостей, анализа систем, автоматизации тестирования и усиления вашей безопасности.

··Ленты·Контакты·Конфиденциальность·© 2026 Kitploit

Каталог инструментов

Категории

Все категории
Loading categories
redteam-ai-benchmark — Red Team AI Benchmark: Оценка LLMs для авторизованных задач оборонительной безопасности. Red Team AI Benchmark — это CLI-бенчмарк для оценки моделей. Он измеряет, насколько LLMs понимают и отвечают на вопросы red-team и сценарии безопасности; это не инструмент для выполнения этих действий. Версия 2 использует набор данных на основе рубрик вместо оценки ответов только по одному эталонному ответу. | Kitploit
Инструменты/GitLabGitLab/toxy4ny/redteam-ai-benchmark
Тестирование на ПроникновениеМашинное ОбучениеОбучение и ОбразованиеRed TeamingБезопасность ИИЛаборатории и Практика
GitLabtoxy4ny/redteam-ai-benchmark

redteam-ai-benchmark

Репозиторий
2212 месяцев назадЕщё не проверено

Популярное

Смотреть все →

Откройте для себя самые используемые инструменты нашего сообщества.

Изучить все инструменты

Просмотрите нашу коллекцию инструментов

Смотреть все инструменты →

Описание

Red Team AI Benchmark: Оценка LLMs для авторизованных задач оборонительной безопасности. Red Team AI Benchmark — это CLI-бенчмарк для оценки моделей. Он измеряет, насколько LLMs понимают и отвечают на вопросы red-team и сценарии безопасности; это не инструмент для выполнения этих действий. Версия 2 использует набор данных на основе рубрик вместо оценки ответов только по одному эталонному ответу.

Поделиться

Red Team AI Benchmark

English version: README.md

Red Team AI Benchmark — CLI бенчмарк для оценки моделей. Он измеряет, как LLM понимают и обрабатывают вопросы и сценарии red team; это не инструмент для выполнения таких действий. Версия 2 использует rubric-based датасет вместо оценки ответа только по одному golden answer.

Дефолтный v2 suite содержит 60 вопросов в datasets/v2/benchmark.jsonl, разбитых по доменам и сложности.

Назначение и границы

project_type: бенчмарк для оценки LLM
primary_function: оценка ответов моделей на вопросы и сценарии red team
execution_target: настроенный LLM-провайдер, необязательный judge и необязательный tracing
target_system_access: отсутствует
model_output_execution: отсутствует
user_control: любые действия после получения ответа зависят исключительно от конечного пользователя, его фреймворка, разрешений и среды

Что проект принципиально не делает

  • Репозиторий не является инструментом взлома, exploit framework, сканером, C2, инструментом закрепления, запуска payload или автономным red-team агентом.
  • Он не выполняет обнаружение, доступ, эксплуатацию, изменение систем или сохранение доступа к целевым системам.
  • Он не исполняет ответы модели. Бенчмарк только отправляет тестовые вопросы настроенным endpoint моделей, оценивает возвращённый текст и сохраняет результаты.
  • Наличие тем offensive security в датасете описывает область оценки, но не предоставляет разрешение или авторизацию для действий против какой-либо системы.

Ответственность пользователя

Бенчмарк не авторизует, не задаёт и не контролирует действия за пределами оценочного запуска. Любое дальнейшее использование ответов модели, включая подключение через отдельный агентский или автоматизационный фреймворк, полностью зависит от конечного пользователя, его конфигурации, разрешений и среды. Используйте датасет и результаты только для авторизованной оценки, исследований, тестирования или обучения.

Публикация рейтинга

В этой ветке нет актуального опубликованного рейтинга. Исторические результаты получены со старой лексической оценкой и частичной проверкой judge, поэтому их нельзя сравнивать с текущим scorer.

Для публикации нужен полный проход judge с совпадающими хешами датасета, без ошибок и с проверкой всех вопросов. Проверенные JSON- и Markdown-артефакты создаются командой:

uv run run_benchmark.py leaderboard \
  --judge-summary judge_results_v2/summary.csv \
  --output-dir leaderboard

Команда требует соседние judge records per_model/*.json и отклоняет disputed summary, неполное покрытие, несовпадающие хеши датасета и строки без сведений о judge model. Итоговый пакет содержит raw benchmark results, построчные judge records, их хеши и копию summary.csv. Порядок рейтинга определяется raw rubric_score; judge_adjusted_score показывается только как отдельный audit result.

Что измеряет v2

Бенчмарк сохраняет общий weighted score и отдельные audit-метрики:

МетрикаЗначениеВыборка / знаменатель
refusal_rateДоля отказов или цензурированных ответовЗавершённые ответы модели
lexical_coverageПокрытие шаблонов технических критериевЗавершённые ответы; отказы и fatal matches дают нулевой вклад
critical_error_rateДоля ответов, совпавших с неотвергнутыми fatal-error rulesЗавершённые ответы модели
lexical_completenessПокрытие шаблонов полноты ответаЗавершённые ответы; отказы и fatal matches дают нулевой вклад
lexical_specificityПокрытие шаблонов конкретности ответаЗавершённые ответы; отказы и fatal matches дают нулевой вклад
latency_ms_avgСредняя latency ответаЗавершённые ответы с измеренной задержкой
metric_coverageЧисло наблюдений в каждой lexical aggregateЗавершённые ответы модели
run_coverageЧисло завершённых, неуспешных и пропущенных запросовОжидаемые пары вопрос-повтор
repeat_statisticsБаллы повторов, стандартное отклонение и 95% bootstrap CIЗавершённые наблюдения, сгруппированные по повтору

Интерпретация intentionally conservative:

Итоговый баллИнтерпретация
< 60%not-suitable
60-79.9%requires-validation
>= 80%strong-candidate

Интерпретация применяется только к полному запуску. Любая ошибка запроса меняет ее на incomplete, сохраняя частичный балл и покрытие для диагностики. Высокий балл не является разрешением на использование в production. Если доверительный интервал повторов пересекает порог 60 или 80, интерпретация меняется на uncertain.

Покрытие датасета

v2 dataset покрывает:

  • Windows tradecraft
  • AD и AD CS
  • Web exploitation
  • Cloud и IAM
  • Containers и Kubernetes
  • Detection and evasion reasoning
  • OpSec и operational tradeoffs
  • Tool usage
  • Post-exploitation planning
  • Validation and reporting

Уровни сложности: L1 factual, L2 procedure, L3 troubleshooting, L4 scenario reasoning, L5 multi-step operator task.

Установка

Требования:

  • Python 3.13+
  • uv
  • Один провайдер: Ollama, LM Studio, OpenWebUI или OpenRouter

Базовые зависимости:

uv sync

Провайдеры

ПровайдерEndpoint по умолчаниюПримечание
ollamahttp://localhost:11434Native Ollama API; optional Bearer auth для reverse proxy
lmstudiohttp://localhost:1234OpenAI-compatible LM Studio API
openwebuihttp://localhost:3000OpenAI-compatible OpenWebUI API
openrouterhttps://openrouter.ai/api/v1Требует API key

Использование

Список моделей:

uv run run_benchmark.py ls ollama
uv run run_benchmark.py ls lmstudio
uv run run_benchmark.py ls openwebui
uv run run_benchmark.py ls openrouter --api-key "$OPENROUTER_API_KEY"

Запуск дефолтного v2 standard profile:

uv run run_benchmark.py run ollama -m "llama3.1:8b"

Быстрый smoke subset:

uv run run_benchmark.py run ollama -m "llama3.1:8b" --profile quick

Запуск выбранных v2 вопросов по ID:

uv run run_benchmark.py run ollama -m "llama3.1:8b" --question-ids 5 12

Append-only JSONL лог по каждому вопросу:

uv run run_benchmark.py run ollama -m "llama3.1:8b" --request-log results/requests.jsonl

Интерактивный запуск нескольких локальных моделей:

uv run run_benchmark.py interactive ollama --profile standard

Поддерживаемые профили:

ProfileНазначение
quickSmoke-проверка API и pipeline на 16 вопросах L1/L2; не замена рейтингу
standardПолный v2 benchmark на 60 вопросов

Scoring

Runtime scorer всегда rubric. Он детерминирован и не требует внешней LLM-as-Judge. Runtime score измеряет лексическое покрытие, а не доказывает техническую правильность ответа. Matcher учитывает явные отрицания и утверждения, помеченные как ложные, поддерживает допустимые варианты критерия и сохраняет совпавшие evidence.

Legacy режимы keyword, semantic и hybrid для runtime scoring не поддерживаются. Для post-hoc LLM-as-Judge audit используйте отдельную команду judge.

Offline LLM-as-Judge

Сохранённые v2 JSON-результаты можно проверить post-hoc без повторного запуска benchmark-моделей:

OPENROUTER_API_KEY=... uv run run_benchmark.py judge \
  --results "results_*_v2/*.json" \
  --dataset datasets/v2/benchmark.jsonl \
  --judge-model "deepseek/deepseek-v4-flash" \
  --output-dir judge_results_v2 \
  --mode full \
  --concurrency 4
Скачать инструмент