Skip to content
KitploitKITPLOIT
HerramientasBlog
Enviar
HerramientasBlog
Enviar

¡Herramientas de Hacking, PenTest y Ciberseguridad para tu Arsenal de Seguridad!

Kitploit es un directorio de herramientas de hacking, ciberseguridad y pentesting. Descubre las últimas actualizaciones de proyectos para encontrar vulnerabilidades, analizar sistemas, automatizar pruebas y fortalecer tu seguridad.

··Feeds·Contacto·Privacidad·© 2026 Kitploit

Directorio de Herramientas

Categorías

Ver todas las categorías
Loading categories
terminal-bench-2 — Benchmark para evaluar agentes de IA en tareas del mundo real, incluyendo resolución de vulnerabilidades, depuración de código y ensamblaje de proteínas en entornos contenerizados. Utilizado por laboratorios de vanguardia para medir las capacidades de los agentes. | Kitploit
Herramientas/GitHubGitHub/harbor-framework/terminal-bench-2
Análisis de VulnerabilidadesScripting y AutomatizaciónVirtualización de SeguridadCTFPruebas de PenetraciónDevSecOpsAprendizaje y EducaciónLabs y Práctica
GitHub
harbor-framework/terminal-bench-2

terminal-bench-2

Benchmark para evaluar agentes de IA en tareas del mundo real, incluyendo resolución de vulnerabilidades, depuración de código y ensamblaje de proteínas en entornos contenerizados. Utilizado por laboratorios de vanguardia para medir las capacidades de los agentes.

Ver Repositorio
37110911hace 4 mesesRevisado por Kitploit

Más Populares

Ver todos →

Descubre las herramientas más usadas por nuestra comunidad.

Explora todas las herramientas

Explora nuestra colección de herramientas

Ver todas las herramientas →
Compartir

Terminal-Bench 2.0

root@kitploit:~

######################################################################
#  _____                   _             _       ______________      #
# |_   _|__ _ __ _ __ ___ (_)_ __   __ _| |     ||            ||     #
#   | |/ _ \ '__| '_ ` _ \| | '_ \ / _` | |     || >          ||     #
#   | |  __/ |  | | | | | | | | | | (_| | |     ||            ||     #
#   |_|\___|_|  |_| |_| |_|_|_| |_|\__,_|_|     ||____________||     #
#   ____                  _       ____    ___   |______________|     #
#  | __ )  ___ _ __   ___| |__   |___ \  / _ \  \\############\\     #
#  |  _ \ / _ \ '_ \ / __| '_ \    __) || | | |  \\############\\    # 
#  | |_) |  __/ | | | (__| | | |  / __/ | |_| |   \      ____    \   #
#  |____/ \___|_| |_|\___|_| |_| |_____(_)___/     \_____\___\____\  #
#                                                                    #
######################################################################

Docs

Terminal-Bench es un benchmark popular para medir las capacidades de agentes y modelos de lenguaje para realizar trabajo valioso en entornos contenerizados. Las tareas incluyen ensamblar proteínas para síntesis, depurar código asíncrono y resolver vulnerabilidades de seguridad.

Es utilizado por prácticamente todos los laboratorios de frontera.

Primeros pasos

Primero, instala Harbor, nuestro paquete para evaluar y optimizar agentes:

root@kitploit:~
uv tool install harbor

o

root@kitploit:~
pip install harbor

Ahora deberías poder ejecutar TB 2.0. Pruébalo ejecutando las soluciones oracle del conjunto de datos en contenedores docker localmente:

root@kitploit:~
uv run harbor run --dataset [email protected] \
   --agent oracle \
   --n-concurrent 4 

Este comando descarga automáticamente las tareas del benchmark. Puedes verlas en https://github.com/laude-institute/terminal-bench-2

También puedes ejecutar usando Terminus:

root@kitploit:~
export ANTHROPIC_API_KEY=<YOUR-KEY>
uv run harbor run --dataset [email protected] \
   --agent terminus-2 \
   --model anthropic/claude-opus-4-1 \
   --n-concurrent 4 

O uno de los agentes de terceros instalados:

root@kitploit:~
export ANTHROPIC_API_KEY=<YOUR-KEY> 
uv run harbor run --dataset [email protected] \
   --agent claude-code \
   --model anthropic/claude-opus-4-1 \
   --n-concurrent 4 

Migración desde el Terminal-Bench Harness a Harbor

Si probaste anteriormente tu agente o modelo dentro del repositorio legacy de Terminal-Bench, migrar a Harbor debería ser sencillo. Simplemente apunta el mismo endpoint del modelo al argumento --model de harbor run.

Para agentes, necesitarás subclasificar BaseInstalledAgent o BaseAgent. Para un ejemplo, consulta cómo soportamos Claude Code.

Discord

Si tienes alguna pregunta pendiente, comunícate en Discord: https://discord.gg/6xWPKhGDbA
Estaremos monitoreando el canal #tb-2.

FAQ

P: ¿Por qué hicieron una nueva versión del benchmark?
R: Siempre supimos que a medida que aumentaran las capacidades de los modelos, necesitaríamos mantener terminal-bench actualizado con las capacidades de frontera. TB2.0 está construido con tareas más difíciles para probar estas capacidades. Además, queríamos empujar la frontera con un énfasis continuo en la calidad de las tareas. Cada tarea en TB2.0 ha recibido varias horas de validación humana y asistida por LM para asegurar que las tareas son (1) resolubles, (2) realistas y (3) bien especificadas. Compartiremos más detalles sobre cómo hicimos esto en nuestro próximo preprint.

P: ¿Qué es “Harbor” y por qué tengo que usarlo?
R: Harbor es nuestro nuevo framework para ejecutar evaluaciones agenticas y generar rollouts de RL. Planeamos lanzarlo para consumo general a finales de este mes. Tomamos todo lo que aprendimos sobre evaluaciones de agentes y reescribimos el harness de evaluación original de Terminal-Bench desde cero para mejorar la fiabilidad, observabilidad, escalabilidad y rendimiento.

Citando Terminal-Bench

Si encontraste útil nuestro benchmark, considera usar la siguiente cita:

root@kitploit:~
@misc{tbench_2025,
      title={Terminal-Bench: A Benchmark for AI Agents in Terminal Environments}, 
      url={https://github.com/laude-institute/terminal-bench}, 
      author={The Terminal-Bench Team}, year={2025}, month={Apr}} 
Descargar herramienta