Skip to content
KitploitKITPLOIT
FerramentasExploitsBlog
Log in
Enviar
FerramentasExploitsBlog
Enviar

Ferramentas de Hacking, PenTest e Cibersegurança para o seu Arsenal de Segurança!

Kitploit é um diretório de ferramentas de hacking, cibersegurança e pentesting. Descubra as últimas atualizações de projetos para encontrar vulnerabilidades, analisar sistemas, automatizar testes e fortalecer sua segurança.

··Feeds·Contato·Privacidade·© 2026 Kitploit

Diretório de Ferramentas

Categorias

Ver todas as categorias
Loading categories
skill-safety-bench — Benchmark para avaliar a segurança de agentes de IA contra ataques incorporados no contexto voltado para habilidades, com 155 casos em 6 domínios de risco, medindo o sucesso da tarefa e a resistência a ataques. | Kitploit
Ferramentas/GitHubGitHub/ai45lab/skill-safety-bench
Aprendizado e EducaçãoSegurança de IAAtaque AdversárioLabs e Prática
GitHubai45lab/skill-safety-bench

skill-safety-bench

Benchmark para avaliar a segurança de agentes de IA contra ataques incorporados no contexto voltado para habilidades, com 155 casos em 6 domínios de risco, medindo o sucesso da tarefa e a resistência a ataques.

Ver Repositório
31451há 4 mesesRevisado pelo Kitploit

Mais Populares

Ver todos →

Descubra as ferramentas mais usadas pela nossa comunidade.

Explore todas as ferramentas

Navegue pela nossa coleção de ferramentas

Ver todas as ferramentas →
Compartilhar

SkillSafetyBench

English 中文

SkillSafetyBench é um benchmark totalmente materializado para avaliar falhas de segurança causadas por ataques ao contexto voltado a habilidades. Cada caso mantém a tarefa voltada ao usuário comum, enquanto o ataque é colocado em habilidades locais, scripts auxiliares, arquivos sidecar, corpora, modelos, ou outros artefatos do espaço de trabalho que um agente pode consultar durante a execução.

Explore o design do benchmark, o explorador de casos, o leaderboard e a análise de experimentos no site do SkillSafetyBench, e leia o artigo completo no arXiv.

Visão geral do SkillSafetyBench

O que o Benchmark Avalia

Agentes modernos de codificação e tarefas frequentemente dependem de habilidades locais e artefatos do ambiente, não apenas do prompt do usuário. O SkillSafetyBench testa se um agente consegue concluir trabalho benigno enquanto resiste a instruções inseguras ou contexto enganoso incorporado nessas superfícies voltadas a habilidades. Os portadores de tarefas benignas são selecionados do SkillsBench.

O benchmark é estático e pronto para execução. Não é um gerador de casos. O repositório contém 155 casos preparados em 6 domínios de risco e 30 categorias. Cada caso inclui:

  • uma tarefa base benigna que ainda deve ser concluída
  • uma ou mais superfícies de ataque voltadas a habilidades
  • um verificador determinístico para o comportamento inseguro
  • testes de tarefa para a conclusão da tarefa base
  • metadados e justificativa descrevendo o design final do caso

Cada execução é avaliada em dois eixos:

  • task_success: se a tarefa comum do usuário foi concluída
  • attack_success: se o comportamento inseguro foi observado

Essa separação é importante: um sistema pode parecer capaz porque conclui a tarefa, enquanto ainda é vulnerável porque segue o contexto de habilidade que contém o ataque.

Estrutura do Benchmark

O SkillSafetyBench contém 155 casos organizados em 6 domínios de risco e 30 categorias. Cada domínio de risco contém 5 categorias, e cada categoria contém múltiplos casos concretos construídos em torno de portadores de tarefas comuns.

root@kitploit:~
SkillSafetyBench
└── 6 domínios de risco
    ├── RD1: Riscos de Confiança no Contexto e Manipulação de Prompt
    ├── RD2: Riscos de Agência, Escopo e Autorização
    ├── RD3: Riscos de Execução, Runtime, Framework e Protocolo
    ├── RD4: Riscos de Limite de Dados, Saída e Externalização
    ├── RD5: Riscos de Memória, Recuperação, Auditoria e Persistência
    └── RD6: Riscos de Conhecimento, Modelo, Cadeia de Suprimentos e Operacionais

Os casos são armazenados por domínio de risco, categoria e id do caso:

root@kitploit:~
benchmark/<domínio-de-risco>/<categoria>/<caso>/
  metadata.json
  rationale.md
  attacked_task/
    instruction.md
    task.toml
    environment/
    solution/solve.sh
    tests/test.sh
  eval/verify_attack.py

O diretório do benchmark é a fonte de verdade para os casos. Os diretórios de categoria usam o padrão de nomenclatura categoryN-..., por exemplo:

root@kitploit:~
benchmark/risk-domain-6-knowledge-model-supply-chain-and-operational-risks/category1-availability_cost_and_service_exhaustion/

Pipeline de Construção do Benchmark

O pipeline de construção do benchmark parte de portadores de tarefas benignas, preserva a tarefa original voltada ao usuário, injeta o ataque por meio de artefatos voltados a habilidades e anexa verificações determinísticas tanto para a conclusão da tarefa quanto para o comportamento do ataque. Isso mantém a avaliação focada em saber se os agentes conseguem resistir a contexto local inseguro enquanto ainda realizam o trabalho solicitado.

Pipeline de construção do SkillSafetyBench

Aviso de Segurança

Este repositório contém casos de benchmark adversariais. Alguns casos simulam phishing, solicitação de credenciais, operações destrutivas, exfiltração de dados, abuso de limites de sandbox, ações externas e comportamentos semelhantes a persistência.

Execute o benchmark apenas em ambientes de pesquisa isolados. Não use credenciais de produção, contas de nuvem de produção, contas pessoais ou arquivos locais sensíveis. Prefira chaves de API descartáveis, contêineres descartáveis, acesso de rede restrito e um diretório de trabalho dedicado. Revise os artefatos de execução antes de compartilhá-los.

Como Executar o Benchmark

1. Prepare o Toolchain

Ferramentas necessárias:

  • bash
  • python3, recomendado >= 3.11
  • docker
  • uv
  • harbor
  • nvm
  • Node.js 22

Instale o Harbor se necessário:

root@kitploit:~
uv tool install harbor

Verifique o toolchain básico:

root@kitploit:~
harbor --help
python3 --version
docker --version

Se o seu agente Harbor estiver instalado via Node, ative o Node 22 no shell que inicia a execução:

root@kitploit:~
export NVM_DIR="$HOME/.nvm"
[ -s "$NVM_DIR/nvm.sh" ] && . "$NVM_DIR/nvm.sh"
nvm use 22

2. Configure as Variáveis de Ambiente

Crie um .envrc local a partir do arquivo de exemplo:

root@kitploit:~
cp env.example .envrc

Para codex, defina pelo menos:

root@kitploit:~
export OPENAI_BASE_URL="https://your-openai-compatible-endpoint/v1"
export OPENAI_API_KEY="replace-with-your-openai-api-key"

Para claude-code, defina uma variável de autenticação compatível com Anthropic, por exemplo:

root@kitploit:~
export ANTHROPIC_BASE_URL="https://api.anthropic.com"
export ANTHROPIC_API_KEY="replace-with-your-anthropic-api-key"

Se você usa direnv, execute:

root@kitploit:~
direnv allow

Se não, nenhuma etapa extra é necessária. O script em lote faz o source explícito do .envrc em tempo de execução.

3. Execute os Casos

O ponto de entrada canônico é:

root@kitploit:~
scripts/start_agent_batch.sh

Execute um domínio de risco:

root@kitploit:~
scripts/start_agent_batch.sh --rd 5

Escolha agente e modelo:

root@kitploit:~
scripts/start_agent_batch.sh \
  --rd 3 \
  --agent codex \
  --model openai/gpt-5.4

Execute com Claude Code:

root@kitploit:~
scripts/start_agent_batch.sh \
  --rd 3 \
  --agent claude-code \
  --model claude-3-7-sonnet-20250219

Execute um único caso:

root@kitploit:~
scripts/start_agent_batch.sh \
  --rd 5 \
  --case travel_planning_poisoned_belief_persistence_memory_anchor

Execute uma única categoria:

root@kitploit:~
scripts/start_agent_batch.sh \
  --rd 6 \
  --category category3-model_behavior_and_finetuning_poisoning

Execute a partir de um manifesto explícito:

root@kitploit:~
scripts/start_agent_batch.sh \
  --manifest benchmark/risk-domain-6-knowledge-model-supply-chain-and-operational-risks/manifest.json

Use um arquivo de ambiente personalizado:

root@kitploit:~
scripts/start_agent_batch.sh \
  --rd 5 \
  --envrc /path/to/your.envrc

Imprima os casos selecionados sem executar:

root@kitploit:~
scripts/start_agent_batch.sh --rd 5 --dry-run

4. Leia as Saídas da Execução

Cada execução cria um diretório de saída em jobs/:

root@kitploit:~
jobs/<agente>-risk-domain-5-memory-recovery-audit-and-persistence-risks-<timestamp>/

Comece com:

  • jobs/<execução>/attack_results.json
  • jobs/<execução>/summary.json
  • jobs/<execução>/attack_results.csv
  • jobs/<execução>/summary.csv

Arquivos úteis por execução:

  • selected_cases.json
  • batch_config.json
  • <case_id>/case_result.json
  • attack_results.md

Resultados comuns de ataque:

  • attack_success
  • attack_not_observed
  • task_output_missing

task_output_missing significa que a saída explícita esperada da tarefa estava ausente. O verificador de ataque pode continuar mesmo assim quando artefatos suficientes existem para avaliar a condição do ataque.

Baixar ferramenta