Skip to content
KitploitKITPLOIT
FerramentasBlog
Enviar
FerramentasBlog
Enviar

Ferramentas de Hacking, PenTest e Cibersegurança para o seu Arsenal de Segurança!

Kitploit é um diretório de ferramentas de hacking, cibersegurança e pentesting. Descubra as últimas atualizações de projetos para encontrar vulnerabilidades, analisar sistemas, automatizar testes e fortalecer sua segurança.

··Feeds·Contato·Privacidade·© 2026 Kitploit

Diretório de Ferramentas

Categorias

Ver todas as categorias
Loading categories
terminal-bench-2 — Benchmark para avaliar agentes de IA em tarefas do mundo real, incluindo resolução de vulnerabilidades, depuração de código e montagem de proteínas em ambientes containerizados. Usado por laboratórios de fronteira para medir capacidades de agentes. | Kitploit
Ferramentas/GitHubGitHub/harbor-framework/terminal-bench-2
Análise de VulnerabilidadesScripting e AutomaçãoVirtualização para SegurançaCTFTestes de PenetraçãoDevSecOpsAprendizado e EducaçãoLabs e Prática
GitHub
harbor-framework/terminal-bench-2

terminal-bench-2

Benchmark para avaliar agentes de IA em tarefas do mundo real, incluindo resolução de vulnerabilidades, depuração de código e montagem de proteínas em ambientes containerizados. Usado por laboratórios de fronteira para medir capacidades de agentes.

Ver Repositório
37110911há 4 mesesRevisado pelo Kitploit

Mais Populares

Ver todos →

Descubra as ferramentas mais usadas pela nossa comunidade.

Explore todas as ferramentas

Navegue pela nossa coleção de ferramentas

Ver todas as ferramentas →
Compartilhar

Terminal-Bench 2.0

root@kitploit:~

######################################################################
#  _____                   _             _       ______________      #
# |_   _|__ _ __ _ __ ___ (_)_ __   __ _| |     ||            ||     #
#   | |/ _ \ '__| '_ ` _ \| | '_ \ / _` | |     || >          ||     #
#   | |  __/ |  | | | | | | | | | | (_| | |     ||            ||     #
#   |_|\___|_|  |_| |_| |_|_|_| |_|\__,_|_|     ||____________||     #
#   ____                  _       ____    ___   |______________|     #
#  | __ )  ___ _ __   ___| |__   |___ \  / _ \  \\############\\     #
#  |  _ \ / _ \ '_ \ / __| '_ \    __) || | | |  \\############\\    # 
#  | |_) |  __/ | | | (__| | | |  / __/ | |_| |   \      ____    \   #
#  |____/ \___|_| |_|\___|_| |_| |_____(_)___/     \_____\___\____\  #
#                                                                    #
######################################################################

Docs

Terminal-Bench é um benchmark popular para medir as capacidades de agentes e modelos de linguagem em realizar trabalho valioso em ambientes conteinerizados. As tarefas incluem montar proteínas para síntese, depurar código assíncrono e resolver vulnerabilidades de segurança.

É utilizado por praticamente todos os laboratórios de fronteira.

Começando

Primeiro, instale o Harbor, nosso pacote para avaliar e otimizar agentes:

root@kitploit:~
uv tool install harbor

ou

root@kitploit:~
pip install harbor

Agora você deve conseguir executar o TB 2.0! Teste-o executando as soluções oracle do dataset em contêineres Docker localmente:

root@kitploit:~
uv run harbor run --dataset [email protected] \
   --agent oracle \
   --n-concurrent 4 

Este comando baixa automaticamente as tarefas do benchmark. Você pode visualizá-las em https://github.com/laude-institute/terminal-bench-2

Você também pode executar usando Terminus:

root@kitploit:~
export ANTHROPIC_API_KEY=<YOUR-KEY>
uv run harbor run --dataset [email protected] \
   --agent terminus-2 \
   --model anthropic/claude-opus-4-1 \
   --n-concurrent 4 

Ou um dos agentes de terceiros instalados:

root@kitploit:~
export ANTHROPIC_API_KEY=<YOUR-KEY> 
uv run harbor run --dataset [email protected] \
   --agent claude-code \
   --model anthropic/claude-opus-4-1 \
   --n-concurrent 4 

Migrando do Terminal-Bench Harness para o Harbor

Se você já testou seu agente ou modelo dentro do repositório legado do Terminal-Bench, migrar para o Harbor deve ser simples. Basta apontar o mesmo endpoint de modelo para o argumento --model do harbor run.

Para agentes, você precisará criar subclasses de BaseInstalledAgent ou BaseAgent. Para um exemplo, veja como suportamos o Claude Code.

Discord

Se você ainda tiver dúvidas, entre em contato pelo Discord: https://discord.gg/6xWPKhGDbA
Vamos monitorar o canal #tb-2.

FAQ

P: Por que vocês criaram uma nova versão do benchmark?
R: Sempre soubemos que, à medida que as capacidades dos modelos aumentassem, precisaríamos manter o terminal-bench atualizado com as capacidades de fronteira. O TB2.0 é construído com tarefas mais difíceis para testar essas capacidades. Além disso, queríamos ultrapassar a fronteira com uma ênfase contínua na qualidade das tarefas. Cada tarefa no TB2.0 recebeu várias horas de validação humana e assistida por LM para garantir que as tarefas são (1) solucionáveis, (2) realistas e (3) bem especificadas. Compartilharemos mais sobre como fizemos isso em nosso próximo preprint.

P: O que é "Harbor" e por que preciso usá-lo?
R: Harbor é nosso novo framework para executar avaliações agentivas e gerar rollouts de RL. Planejamos lançá-lo para consumo geral ainda este mês. Aproveitamos tudo o que aprendemos sobre avaliações de agentes e reescrevemos o harness de avaliação original do Terminal-Bench do zero para melhorar confiabilidade, observabilidade, escalabilidade e desempenho.

Citando o Terminal-Bench

Se você achou nosso benchmark útil, considere usar a seguinte citação:

root@kitploit:~
@misc{tbench_2025,
      title={Terminal-Bench: A Benchmark for AI Agents in Terminal Environments}, 
      url={https://github.com/laude-institute/terminal-bench}, 
      author={The Terminal-Bench Team}, year={2025}, month={Apr}} 
Baixar ferramenta