Skip to content
KitploitKITPLOIT
FerramentasBlog
Enviar
FerramentasBlog
Enviar

Ferramentas de Hacking, PenTest e Cibersegurança para o seu Arsenal de Segurança!

Kitploit é um diretório de ferramentas de hacking, cibersegurança e pentesting. Descubra as últimas atualizações de projetos para encontrar vulnerabilidades, analisar sistemas, automatizar testes e fortalecer sua segurança.

··Feeds·Contato·Privacidade·© 2026 Kitploit

Diretório de Ferramentas

Categorias

Ver todas as categorias
Loading categories
Ferramentas/GitHubGitHub/sunblaze-ucb/exploitgym
Frameworks de ExploraçãoAnálise de VulnerabilidadesShellcodeExploração de Aplicações WebFuzzingCTFTestes de PenetraçãoPapers e PesquisaAprendizado e EducaçãoDesenvolvimento de PayloadsSegurança de IAExploração de Binários
756935há 1 mêsRevisado pelo Kitploit
GitHubsunblaze-ucb/exploitgym

exploitgym

ExploitGym é um benchmark realista e de grande escala, construído a partir de vulnerabilidades do mundo real, projetado para avaliar a capacidade de agentes de IA de desenvolver exploits.

Ver Repositório

Mais Populares

Ver todos →

Descubra as ferramentas mais usadas pela nossa comunidade.

Explore todas as ferramentas

Navegue pela nossa coleção de ferramentas

Ver todas as ferramentas →
Compartilhar

ExploitGym

Website Paper License

ExploitGym é um benchmark realista e de grande escala, construído a partir de vulnerabilidades do mundo real em programas de espaço de usuário, no motor V8 do Google e no kernel Linux, projetado para avaliar a capacidade de agentes de IA de desenvolver exploits.

Início rápido

root@kitploit:~
# 1. Python deps
uv sync --extra proxy

# 2. Build runtime artifacts (gdb, socat, nc, node + agent CLIs) and
#    extract task data
bash scripts/setup/setup_data.sh

# 3. Verify the install
bash scripts/setup/validate.sh

# 4. Pull the Firewall Squid image
docker pull ubuntu/squid:latest

# 5. Pull the Docker images for the tasks you want to run
uv run scripts/setup/pull_images.py data/task_ids/sample.txt

# 6. Start the controller, firewall, and LLM proxy. pre_run.py runs the
#    readiness checks and starts all three (auto-detecting any already
#    running), or start them by hand — see docs/eval.md
export OPENAI_API_KEY=...
export ANTHROPIC_API_KEY=...
uv run scripts/setup/pre_run.py data/task_ids/sample.txt

# 7. Run the agent
export CYBERGYM_ADMIN_KEY=...
uv run examples/run_agent.py --help

As etapas detalhadas de configuração (dependências do sistema, GDB, node estático, CLIs do agente) estão em docs/setup.md.

Documentação

  • Configuração: dependências Python, GDB, socat/nc, node + CLIs do agente
  • Imagens Docker: baixando as imagens de destino por família de tarefas
  • Avaliação: controlador / firewall / proxy de LLM + examples/run_agent.py
  • Defesas: desabilitando defesas do sistema (ASLR, etc.)
  • Firewall: isolamento de rede de saída para contêineres de agentes
  • Submissão: formato e requisitos de submissão para o leaderboard do benchmark

Atualizações do benchmark

O benchmark lançado é mantido ativamente. A versão atual é v1.0 com 869 instâncias. Consulte CHANGELOG.md para o histórico completo de versões. A lista canônica de tarefas para a versão atual é data/task_ids/v1.txt.

Citação

Se você usar o ExploitGym em sua pesquisa, cite:

root@kitploit:~
@article{wang2026exploitgym,
  title={ExploitGym: Can AI Agents Turn Security Vulnerabilities into Real Attacks?},
  author={Wang, Zhun and Schiller, Nico and Li, Hongwei and Sesha Narayana, Srijiith and Nasr, Milad and Carlini, Nicholas and Qi, Xiangyu and Wallace, Eric and Bursztein, Elie and Invernizzi, Luca and Thomas, Kurt and Shoshitaishvili, Yan and Guo, Wenbo and He, Jingxuan and Holz, Thorsten and Song, Dawn},
  journal={arXiv preprint arXiv:2605.11086},
  year={2026}
}

Licença

O código-fonte é licenciado sob Apache-2.0. Os dados de tarefas incluídos em data/tasks/ derivam de upstreams externos e mantêm suas respectivas licenças, consulte DATA_LICENSE.md.

Baixar ferramenta