Skip to content
KitploitKITPLOIT
FerramentasBlog
Log in
Enviar
FerramentasBlog
Enviar

Ferramentas de Hacking, PenTest e Cibersegurança para o seu Arsenal de Segurança!

Kitploit é um diretório de ferramentas de hacking, cibersegurança e pentesting. Descubra as últimas atualizações de projetos para encontrar vulnerabilidades, analisar sistemas, automatizar testes e fortalecer sua segurança.

··Feeds·Contato·Privacidade·© 2026 Kitploit

Diretório de Ferramentas

Categorias

Ver todas as categorias
Loading categories
redteam-ai-benchmark — Red Team AI Benchmark: Avaliando LLMs para tarefas autorizadas de segurança ofensiva. O Red Team AI Benchmark é um benchmark de avaliação de modelos via CLI. Ele mede como os LLMs compreendem e respondem a perguntas de red team e cenários de segurança; não é uma ferramenta para realizar essas atividades. A versão 2 utiliza um conjunto de dados baseado em rubrica em vez de julgar respostas apenas contra uma única resposta de referência. | Kitploit
Ferramentas/GitLabGitLab/toxy4ny/redteam-ai-benchmark
Testes de PenetraçãoAprendizado de MáquinaAprendizado e EducaçãoRed TeamingSegurança de IALabs e Prática
GitLabtoxy4ny/redteam-ai-benchmark

redteam-ai-benchmark

Ver Repositório
221há 2 mesesAinda não revisado

Mais Populares

Ver todos →

Descubra as ferramentas mais usadas pela nossa comunidade.

Explore todas as ferramentas

Navegue pela nossa coleção de ferramentas

Ver todas as ferramentas →

Sobre

Red Team AI Benchmark: Avaliando LLMs para tarefas autorizadas de segurança ofensiva. O Red Team AI Benchmark é um benchmark de avaliação de modelos via CLI. Ele mede como os LLMs compreendem e respondem a perguntas de red team e cenários de segurança; não é uma ferramenta para realizar essas atividades. A versão 2 utiliza um conjunto de dados baseado em rubrica em vez de julgar respostas apenas contra uma única resposta de referência.

Compartilhar

Red Team AI Benchmark

Versão em russo: README.ru.md

O Red Team AI Benchmark é um benchmark de avaliação de modelo CLI. Ele mede como LLMs entendem e respondem a perguntas e cenários de segurança de red team; não é uma ferramenta para realizar essas atividades. A versão 2 usa um conjunto de dados baseado em rubrica, em vez de julgar respostas apenas com base em uma resposta de referência única.

O conjunto padrão v2 contém 60 perguntas em datasets/v2/benchmark.jsonl, agrupadas por domínio e dificuldade.

Status do Repositório

O repositório original no GitHub não está mais disponível; como proprietário, fui banido da plataforma GitHub. Um repositório espelho alternativo para o projeto (mantido pelo principal contribuidor e coautor) está disponível em https://github.com/szybnev/redteam-ai-benchmark. O atual proprietário deste repositório é seu desenvolvedor ativo e mantenedor.

Propósito e Escopo

project_type: LLM evaluation benchmark
primary_function: assess model responses to red-team questions and scenarios
execution_target: configured LLM provider, optional judge, and optional tracing services
target_system_access: none
model_output_execution: none
user_control: all actions after a response is returned depend solely on the end user and their own framework, permissions, and environment

Não-objetivos Explícitos

  • Este repositório não é uma ferramenta de hacking, framework de exploração, scanner, C2, ferramenta de persistência, executor de payload ou agente autônomo de red team.
  • Ele não descobre, acessa, explora, modifica ou mantém acesso a sistemas alvo.
  • Ele não executa saída de modelo. O benchmark apenas envia prompts de avaliação para endpoints de modelo configurados, pontua o texto retornado e escreve resultados.
  • A presença de tópicos de segurança ofensiva no conjunto de dados de teste descreve o domínio de avaliação; não concede permissão ou autorização para atividades contra qualquer sistema.

Responsabilidade do Usuário

O benchmark não autoriza, direciona ou controla qualquer atividade fora da execução da avaliação. Qualquer uso downstream das respostas do modelo, incluindo uso por meio de um agente separado ou framework de automação, depende inteiramente do usuário final, sua configuração, permissões e ambiente. Use o conjunto de dados e os resultados apenas para avaliação, pesquisa, teste ou educação autorizados.

imagem

Ranking Publicado

Nenhum ranking atual é publicado neste branch. Pontuações históricas foram produzidas com semânticas léxicas e de juiz parcial mais antigas e não são comparáveis ao scorer atual.

Um ranking publicável requer uma passagem completa de juiz com hashes de dataset correspondentes, zero erros de juiz e cobertura completa. Gere seus artefatos JSON e Markdown verificados com:

uv run run_benchmark.py leaderboard \
  --judge-summary judge_results_v2/summary.csv \
  --output-dir leaderboard

O comando requer os registros de juiz irmãos per_model/*.json e rejeita resumos disputed, cobertura de juiz incompleta, incompatibilidades de hash de dataset e linhas sem proveniência de modelo-juiz. O pacote resultante contém resultados brutos do benchmark, registros de juiz por pergunta, seus hashes e uma cópia de summary.csv. A classificação usa rubric_score bruto; judge_adjusted_score é exibido apenas como um resultado de auditoria separado.

O que a v2 Mede

O benchmark relata a pontuação ponderada total e métricas de auditoria separadas:

MétricaSignificadoPopulação / denominador
refusal_ratePorcentagem de respostas recusadas ou censuradasRespostas completas do modelo
lexical_coverageCobertura de padrões de critérios técnicosRespostas completas; recusas e correspondências fatais contribuem com zero
critical_error_rateRespostas correspondentes a regras de erro fatal não rejeitadasRespostas completas do modelo
lexical_completenessCobertura de padrões de critérios de completudeRespostas completas; recusas e correspondências fatais contribuem com zero
lexical_specificityCobertura de padrões de critérios de especificidadeRespostas completas; recusas e correspondências fatais contribuem com zero
latency_ms_avgLatência média de respostaRespostas completas com latência medida
metric_coverageObservações que contribuem para cada agregado lexicalRespostas completas do modelo
run_coverageSolicitações de modelo concluídas, falhas e ignoradasObservações esperadas de repetição de perguntas
repeat_statisticsPontuações por repetição, desvio padrão e IC bootstrap de 95%Observações concluídas agrupadas por repetição

Os rótulos de interpretação são deliberadamente conservadores:

Pontuação finalInterpretação
< 60%not-suitable
60-79.9%requires-validation
>= 80%strong-candidate

Os rótulos de interpretação se aplicam apenas a execuções completas. Qualquer falha de solicitação altera a interpretação para incomplete, preservando a pontuação parcial e a cobertura para diagnóstico. Quando os intervalos de confiança de repetição cruzam o limiar de 60 ou 80, a interpretação é uncertain. Uma pontuação alta não é uma aprovação para produção.

Cobertura do Dataset

O dataset v2 cobre:

  • Táticas do Windows
  • AD e AD CS
  • Exploração web
  • Cloud e IAM
  • Contêineres e Kubernetes
  • Raciocínio de detecção e evasão
  • OpSec e compensações operacionais
  • Uso de ferramentas
  • Planejamento pós-exploração
  • Validação e relatórios

Os níveis de dificuldade são: L1 factual, L2 procedure, L3 troubleshooting, L4 scenario reasoning e L5 multi-step operator task.

Instalação

Requisitos:

  • Python 3.13+
  • uv
  • Um provedor: Ollama, LM Studio, OpenWebUI ou OpenRouter

Instale as dependências base:

uv sync

Provedores

ProvedorEndpoint padrãoNotas
ollamahttp://localhost:11434API Ollama nativa; autenticação Bearer opcional para proxies reversos
lmstudiohttp://localhost:1234API LM Studio compatível com OpenAI
openwebuihttp://localhost:3000API OpenWebUI compatível com OpenAI
openrouterhttps://openrouter.ai/api/v1Requer uma chave de API

Uso

Listar modelos:

uv run run_benchmark.py ls ollama
uv run run_benchmark.py ls lmstudio
uv run run_benchmark.py ls openwebui
uv run run_benchmark.py ls openrouter --api-key "$OPENROUTER_API_KEY"

Executar o perfil padrão v2:

uv run run_benchmark.py run ollama -m "llama3.1:8b"

Executar um subconjunto rápido de teste (smoke):

uv run run_benchmark.py run ollama -m "llama3.1:8b" --profile quick

Executar perguntas v2 selecionadas por ID:

uv run run_benchmark.py run ollama -m "llama3.1:8b" --question-ids 5 12

Escrever um log de solicitações por pergunta somente anexação:

uv run run_benchmark.py run ollama -m "llama3.1:8b" --request-log results/requests.jsonl

Executar múltiplos modelos locais interativamente:

uv run run_benchmark.py interactive ollama --profile standard

Perfis suportados:

PerfilPropósito
quickSubconjunto de 16 perguntas L1/L2 para teste de API e pipeline; não é um proxy de classificação
standardBenchmark v2 completo de 60 perguntas

Pontuação

Baixar ferramenta