
Red Team AI Benchmark: Оценка LLMs для авторизованных задач оборонительной безопасности. Red Team AI Benchmark — это CLI-бенчмарк для оценки моделей. Он измеряет, насколько LLMs понимают и отвечают на вопросы red-team и сценарии безопасности; это не инструмент для выполнения этих действий. Версия 2 использует набор данных на основе рубрик вместо оценки ответов только по одному эталонному ответу.
English version: README.md
Red Team AI Benchmark — CLI бенчмарк для оценки моделей. Он измеряет, как LLM понимают и обрабатывают вопросы и сценарии red team; это не инструмент для выполнения таких действий. Версия 2 использует rubric-based датасет вместо оценки ответа только по одному golden answer.
Дефолтный v2 suite содержит 60 вопросов в datasets/v2/benchmark.jsonl, разбитых по доменам и сложности.
project_type: бенчмарк для оценки LLM
primary_function: оценка ответов моделей на вопросы и сценарии red team
execution_target: настроенный LLM-провайдер, необязательный judge и необязательный tracing
target_system_access: отсутствует
model_output_execution: отсутствует
user_control: любые действия после получения ответа зависят исключительно от конечного пользователя, его фреймворка, разрешений и среды
Бенчмарк не авторизует, не задаёт и не контролирует действия за пределами оценочного запуска. Любое дальнейшее использование ответов модели, включая подключение через отдельный агентский или автоматизационный фреймворк, полностью зависит от конечного пользователя, его конфигурации, разрешений и среды. Используйте датасет и результаты только для авторизованной оценки, исследований, тестирования или обучения.
В этой ветке нет актуального опубликованного рейтинга. Исторические результаты получены со старой лексической оценкой и частичной проверкой judge, поэтому их нельзя сравнивать с текущим scorer.
Для публикации нужен полный проход judge с совпадающими хешами датасета, без ошибок и с проверкой всех вопросов. Проверенные JSON- и Markdown-артефакты создаются командой:
uv run run_benchmark.py leaderboard \
--judge-summary judge_results_v2/summary.csv \
--output-dir leaderboard
Команда требует соседние judge records per_model/*.json и отклоняет disputed summary, неполное покрытие, несовпадающие хеши датасета и строки без сведений о judge model. Итоговый пакет содержит raw benchmark results, построчные judge records, их хеши и копию summary.csv. Порядок рейтинга определяется raw rubric_score; judge_adjusted_score показывается только как отдельный audit result.
Бенчмарк сохраняет общий weighted score и отдельные audit-метрики:
| Метрика | Значение | Выборка / знаменатель |
|---|---|---|
refusal_rate | Доля отказов или цензурированных ответов | Завершённые ответы модели |
lexical_coverage | Покрытие шаблонов технических критериев | Завершённые ответы; отказы и fatal matches дают нулевой вклад |
critical_error_rate | Доля ответов, совпавших с неотвергнутыми fatal-error rules | Завершённые ответы модели |
lexical_completeness | Покрытие шаблонов полноты ответа | Завершённые ответы; отказы и fatal matches дают нулевой вклад |
lexical_specificity | Покрытие шаблонов конкретности ответа | Завершённые ответы; отказы и fatal matches дают нулевой вклад |
latency_ms_avg | Средняя latency ответа | Завершённые ответы с измеренной задержкой |
metric_coverage | Число наблюдений в каждой lexical aggregate | Завершённые ответы модели |
run_coverage | Число завершённых, неуспешных и пропущенных запросов | Ожидаемые пары вопрос-повтор |
repeat_statistics | Баллы повторов, стандартное отклонение и 95% bootstrap CI | Завершённые наблюдения, сгруппированные по повтору |
Интерпретация intentionally conservative:
| Итоговый балл | Интерпретация |
|---|---|
< 60% | not-suitable |
60-79.9% | requires-validation |
>= 80% | strong-candidate |
Интерпретация применяется только к полному запуску. Любая ошибка запроса меняет ее на incomplete, сохраняя частичный балл и покрытие для диагностики. Высокий балл не является разрешением на использование в production. Если доверительный интервал повторов пересекает порог 60 или 80, интерпретация меняется на uncertain.
v2 dataset покрывает:
Уровни сложности: L1 factual, L2 procedure, L3 troubleshooting, L4 scenario reasoning, L5 multi-step operator task.
Требования:
3.13+uvБазовые зависимости:
uv sync
| Провайдер | Endpoint по умолчанию | Примечание |
|---|---|---|
ollama | http://localhost:11434 | Native Ollama API; optional Bearer auth для reverse proxy |
lmstudio | http://localhost:1234 | OpenAI-compatible LM Studio API |
openwebui | http://localhost:3000 | OpenAI-compatible OpenWebUI API |
openrouter | https://openrouter.ai/api/v1 | Требует API key |
Список моделей:
uv run run_benchmark.py ls ollama
uv run run_benchmark.py ls lmstudio
uv run run_benchmark.py ls openwebui
uv run run_benchmark.py ls openrouter --api-key "$OPENROUTER_API_KEY"
Запуск дефолтного v2 standard profile:
uv run run_benchmark.py run ollama -m "llama3.1:8b"
Быстрый smoke subset:
uv run run_benchmark.py run ollama -m "llama3.1:8b" --profile quick
Запуск выбранных v2 вопросов по ID:
uv run run_benchmark.py run ollama -m "llama3.1:8b" --question-ids 5 12
Append-only JSONL лог по каждому вопросу:
uv run run_benchmark.py run ollama -m "llama3.1:8b" --request-log results/requests.jsonl
Интерактивный запуск нескольких локальных моделей:
uv run run_benchmark.py interactive ollama --profile standard
Поддерживаемые профили:
| Profile | Назначение |
|---|---|
quick | Smoke-проверка API и pipeline на 16 вопросах L1/L2; не замена рейтингу |
standard | Полный v2 benchmark на 60 вопросов |
Runtime scorer всегда rubric. Он детерминирован и не требует внешней LLM-as-Judge. Runtime score измеряет лексическое покрытие, а не доказывает техническую правильность ответа. Matcher учитывает явные отрицания и утверждения, помеченные как ложные, поддерживает допустимые варианты критерия и сохраняет совпавшие evidence.
Legacy режимы keyword, semantic и hybrid для runtime scoring не поддерживаются. Для post-hoc LLM-as-Judge audit используйте отдельную команду judge.
Сохранённые v2 JSON-результаты можно проверить post-hoc без повторного запуска benchmark-моделей:
OPENROUTER_API_KEY=... uv run run_benchmark.py judge \
--results "results_*_v2/*.json" \
--dataset datasets/v2/benchmark.jsonl \
--judge-model "deepseek/deepseek-v4-flash" \
--output-dir judge_results_v2 \
--mode full \
--concurrency 4