Skip to content
KitploitKITPLOIT
OutilsBlog
Soumettre
OutilsBlog
Soumettre

Outils de Hacking, PenTest et Cybersécurité pour votre Arsenal de Sécurité !

Kitploit est un répertoire d'outils de hacking, de cybersécurité et de pentesting. Découvrez les dernières mises à jour des projets pour trouver des vulnérabilités, analyser des systèmes, automatiser les tests et renforcer votre sécurité.

··Flux·Contact·Confidentialité·© 2026 Kitploit

Répertoire d'outils

Catégories

Voir toutes les catégories
Loading categories
terminal-bench-2 — Benchmark pour évaluer les agents IA sur des tâches réelles incluant la résolution de vulnérabilités, le débogage de code et l'assemblage de protéines dans des environnements conteneurisés. Utilisé par les laboratoires de pointe pour mesurer les capacités des agents. | Kitploit
Outils/GitHubGitHub/harbor-framework/terminal-bench-2
Analyse des VulnérabilitésScripting et AutomatisationVirtualisation de SécuritéCTFTests d'IntrusionDevSecOpsApprentissage et ÉducationLabs et Pratique

Populaires

Voir tout →

Découvrez les outils les plus utilisés par notre communauté.

Explorer tous les outils

Parcourez notre collection d'outils

Voir tous les outils →
Partager
GitHub
harbor-framework/terminal-bench-2

terminal-bench-2

Benchmark pour évaluer les agents IA sur des tâches réelles incluant la résolution de vulnérabilités, le débogage de code et l'assemblage de protéines dans des environnements conteneurisés. Utilisé par les laboratoires de pointe pour mesurer les capacités des agents.

Voir le dépôt
371109il y a 3 moisVérifié par Kitploit

Terminal-Bench 2.0

root@kitploit:~

######################################################################
#  _____                   _             _       ______________      #
# |_   _|__ _ __ _ __ ___ (_)_ __   __ _| |     ||            ||     #
#   | |/ _ \ '__| '_ ` _ \| | '_ \ / _` | |     || >          ||     #
#   | |  __/ |  | | | | | | | | | | (_| | |     ||            ||     #
#   |_|\___|_|  |_| |_| |_|_|_| |_|\__,_|_|     ||____________||     #
#   ____                  _       ____    ___   |______________|     #
#  | __ )  ___ _ __   ___| |__   |___ \  / _ \  \\############\\     #
#  |  _ \ / _ \ '_ \ / __| '_ \    __) || | | |  \\############\\    # 
#  | |_) |  __/ | | | (__| | | |  / __/ | |_| |   \      ____    \   #
#  |____/ \___|_| |_|\___|_| |_| |_____(_)___/     \_____\___\____\  #
#                                                                    #
######################################################################

Documentation

Terminal-Bench est un benchmark populaire pour mesurer les capacités des agents et des modèles de langage à effectuer des tâches utiles dans des environnements conteneurisés. Les tâches incluent l'assemblage de protéines pour la synthèse, le débogage de code asynchrone et la résolution de vulnérabilités de sécurité.

Il est utilisé par pratiquement tous les laboratoires de pointe.

Prise en main

Tout d'abord, installez Harbor, notre package pour évaluer et optimiser les agents :

root@kitploit:~
uv tool install harbor

ou

root@kitploit:~
pip install harbor

Vous devriez maintenant pouvoir exécuter TB 2.0 ! Testez-le en exécutant les solutions oracle du dataset dans des conteneurs Docker localement :

root@kitploit:~
uv run harbor run --dataset [email protected] \
   --agent oracle \
   --n-concurrent 4 

Cette commande télécharge automatiquement les tâches du benchmark. Vous pouvez les consulter à l'adresse https://github.com/laude-institute/terminal-bench-2

Vous pouvez également l'exécuter avec Terminus :

root@kitploit:~
export ANTHROPIC_API_KEY=<YOUR-KEY>
uv run harbor run --dataset [email protected] \
   --agent terminus-2 \
   --model anthropic/claude-opus-4-1 \
   --n-concurrent 4 

Ou avec l'un des agents tiers installés :

root@kitploit:~
export ANTHROPIC_API_KEY=<YOUR-KEY> 
uv run harbor run --dataset [email protected] \
   --agent claude-code \
   --model anthropic/claude-opus-4-1 \
   --n-concurrent 4 

Migration de l'ancien Terminal-Bench Harness vers Harbor

Si vous avez déjà testé votre agent ou modèle dans l'ancien dépôt Terminal-Bench, la migration vers Harbor devrait être simple. Pointez simplement le même point de terminaison de modèle vers l'argument --model de harbor run.

Pour les agents, vous devrez sous-classer BaseInstalledAgent ou BaseAgent. Pour un exemple, voir comment nous supportons Claude Code.

Discord

Si vous avez d'autres questions, n'hésitez pas à nous contacter sur Discord : https://discord.gg/6xWPKhGDbA
Nous surveillerons le canal #tb-2.

FAQ

Q : Pourquoi avez-vous créé une nouvelle version du benchmark ?
R : Nous avons toujours su qu'à mesure que les capacités des modèles augmenteraient, nous devrions maintenir terminal-bench à jour avec les capacités de pointe. TB2.0 est construit avec des tâches plus difficiles pour tester ces capacités. De plus, nous voulions repousser les limites en continuant de mettre l'accent sur la qualité des tâches. Chaque tâche de TB2.0 a reçu plusieurs heures de validation humaine et assistée par LLM afin de garantir que les tâches soient (1) résolubles, (2) réalistes et (3) bien spécifiées. Nous partagerons plus de détails sur la façon dont nous avons procédé dans notre prochain preprint.

Q : Qu'est-ce que « Harbor » et pourquoi dois-je l'utiliser ?
R : Harbor est notre nouveau framework pour exécuter des évaluations agentiques et générer des rollouts RL. Nous prévoyons de le publier pour une utilisation générale plus tard ce mois-ci. Nous avons pris tout ce que nous avons appris sur les évaluations d'agents et réécrit le Harness d'évaluation original de Terminal-Bench à partir de zéro pour une meilleure fiabilité, observabilité, évolutivité et performances.

Citation de Terminal-Bench

Si notre benchmark vous a été utile, veuillez envisager d'utiliser la citation suivante :

root@kitploit:~
@misc{tbench_2025,
      title={Terminal-Bench: A Benchmark for AI Agents in Terminal Environments}, 
      url={https://github.com/laude-institute/terminal-bench}, 
      author={The Terminal-Bench Team}, year={2025}, month={Apr}} 
Télécharger l’outil