Skip to content
KitploitKITPLOIT
ToolsBlog
Einreichen
ToolsBlog
Einreichen

Hacking-, PenTest- und Cybersicherheits-Tools für Ihr Sicherheitsarsenal!

Kitploit ist ein Verzeichnis von Hacking-, Cybersicherheits- und Pentesting-Tools. Entdecken Sie die neuesten Projekt-Updates, um Schwachstellen zu finden, Systeme zu analysieren, Tests zu automatisieren und Ihre Sicherheit zu stärken.

··Feeds·Kontakt·Datenschutz·© 2026 Kitploit

Tool-Verzeichnis

Kategorien

Alle Kategorien anzeigen
Loading categories
terminal-bench-2 — Benchmark zur Bewertung von KI-Agenten bei realen Aufgaben, einschließlich Schwachstellenbehebung, Code-Debugging und Protein-Assemblierung in containerisierten Umgebungen. Wird von führenden Laboren zur Messung der Agentenfähigkeiten verwendet. | Kitploit
Tools/GitHubGitHub/harbor-framework/terminal-bench-2
SchwachstellenanalyseScripting & AutomatisierungSicherheitsvirtualisierungCTFPenetrationstestsDevSecOpsLernen & BildungLabs & Praxis
GitHub
harbor-framework/terminal-bench-2

terminal-bench-2

Benchmark zur Bewertung von KI-Agenten bei realen Aufgaben, einschließlich Schwachstellenbehebung, Code-Debugging und Protein-Assemblierung in containerisierten Umgebungen. Wird von führenden Laboren zur Messung der Agentenfähigkeiten verwendet.

Repository anzeigen
37110913vor 4 MonatenVon Kitploit geprüft

Beliebteste

Alle anzeigen →

Entdecken Sie die meistgenutzten Tools unserer Community.

Alle Tools erkunden

Durchsuchen Sie unsere Tool-Sammlung

Alle Tools anzeigen →
Teilen

Terminal-Bench 2.0

root@kitploit:~

######################################################################
#  _____                   _             _       ______________      #
# |_   _|__ _ __ _ __ ___ (_)_ __   __ _| |     ||            ||     #
#   | |/ _ \ '__| '_ ` _ \| | '_ \ / _` | |     || >          ||     #
#   | |  __/ |  | | | | | | | | | | (_| | |     ||            ||     #
#   |_|\___|_|  |_| |_| |_|_|_| |_|\__,_|_|     ||____________||     #
#   ____                  _       ____    ___   |______________|     #
#  | __ )  ___ _ __   ___| |__   |___ \  / _ \  \\############\\     #
#  |  _ \ / _ \ '_ \ / __| '_ \    __) || | | |  \\############\\    # 
#  | |_) |  __/ | | | (__| | | |  / __/ | |_| |   \      ____    \   #
#  |____/ \___|_| |_|\___|_| |_| |_____(_)___/     \_____\___\____\  #
#                                                                    #
######################################################################

Docs

Terminal-Bench ist ein beliebter Benchmark zur Messung der Fähigkeiten von Agenten und Sprachmodellen, wertvolle Arbeiten in containerisierten Umgebungen durchzuführen. Zu den Aufgaben gehören das Zusammenbauen von Proteinen für die Synthese, das Debuggen von asynchronem Code und das Beheben von Sicherheitslücken.

Er wird von praktisch allen führenden Forschungslabors verwendet.

Erste Schritte

Installieren Sie zunächst Harbor, unser Paket zur Bewertung und Optimierung von Agenten:

root@kitploit:~
uv tool install harbor

oder

root@kitploit:~
pip install harbor

Sie sollten nun TB 2.0 ausführen können! Testen Sie es, indem Sie die Oracle-Lösungen des Datensatzes lokal in Docker-Containern ausführen:

root@kitploit:~
uv run harbor run --dataset [email protected] \
   --agent oracle \
   --n-concurrent 4 

Dieser Befehl lädt automatisch die Aufgaben für den Benchmark herunter. Sie können sie unter https://github.com/laude-institute/terminal-bench-2 einsehen.

Sie können es auch mit Terminus ausführen:

root@kitploit:~
export ANTHROPIC_API_KEY=<YOUR-KEY>
uv run harbor run --dataset [email protected] \
   --agent terminus-2 \
   --model anthropic/claude-opus-4-1 \
   --n-concurrent 4 

Oder mit einem der installierten Drittanbieter-Agenten:

root@kitploit:~
export ANTHROPIC_API_KEY=<YOUR-KEY> 
uv run harbor run --dataset [email protected] \
   --agent claude-code \
   --model anthropic/claude-opus-4-1 \
   --n-concurrent 4 

Migration von der Terminal-Bench-Harness zu Harbor

Wenn Sie Ihren Agenten oder Ihr Modell zuvor im alten Terminal-Bench-Repository getestet haben, ist die Migration zu Harbor unkompliziert. Geben Sie einfach denselben Modell-Endpunkt als Argument --model für harbor run an.

Für Agenten müssen Sie eine Unterklasse von BaseInstalledAgent oder BaseAgent erstellen. Ein Beispiel finden Sie unter wie wir Claude Code unterstützen.

Discord

Wenn Sie noch Fragen haben, wenden Sie sich bitte an Discord: https://discord.gg/6xWPKhGDbA
Wir werden den Kanal #tb-2 überwachen.

FAQ

F: Warum haben Sie eine neue Version des Benchmarks erstellt?
A: Wir wussten immer, dass wir mit zunehmenden Modellfähigkeiten den Terminal-Bench an die Grenzen der Leistungsfähigkeit anpassen müssen. TB2.0 wurde mit schwierigeren Aufgaben entwickelt, um diese Fähigkeiten zu testen. Außerdem wollten wir die Grenzen mit einem anhaltenden Fokus auf Aufgabenqualität verschieben. Jede Aufgabe in TB2.0 hat mehrere Stunden menschliche und LM-gestützte Validierung erhalten, um sicherzustellen, dass die Aufgaben (1) lösbar, (2) realistisch und (3) gut spezifiziert sind. Wir werden in unserem kommenden Preprint mehr darüber teilen, wie wir dies umgesetzt haben.

F: Was ist „Harbor“ und warum muss ich es verwenden?
A: Harbor ist unser neues Framework zur Durchführung von agentischen Evaluierungen und zur Generierung von RL-Rollouts. Wir planen, es später in diesem Monat für die Allgemeinheit freizugeben. Wir haben alles, was wir über Agenten-Evaluierungen gelernt haben, genommen und die ursprüngliche Terminal-Bench-Evaluierungs-Harness von Grund auf neu geschrieben, um eine verbesserte Zuverlässigkeit, Beobachtbarkeit, Skalierbarkeit und Leistung zu erreichen.

Zitieren von Terminal-Bench

Wenn Sie unseren Benchmark nützlich fanden, verwenden Sie bitte das folgende Zitat:

root@kitploit:~
@misc{tbench_2025,
      title={Terminal-Bench: A Benchmark for AI Agents in Terminal Environments}, 
      url={https://github.com/laude-institute/terminal-bench}, 
      author={The Terminal-Bench Team}, year={2025}, month={Apr}} 
Tool herunterladen