Benchmark zur Bewertung von KI-Agenten bei realen Aufgaben, einschließlich Schwachstellenbehebung, Code-Debugging und Protein-Assemblierung in containerisierten Umgebungen. Wird von führenden Laboren zur Messung der Agentenfähigkeiten verwendet.
######################################################################
# _____ _ _ ______________ #
# |_ _|__ _ __ _ __ ___ (_)_ __ __ _| | || || #
# | |/ _ \ '__| '_ ` _ \| | '_ \ / _` | | || > || #
# | | __/ | | | | | | | | | | | (_| | | || || #
# |_|\___|_| |_| |_| |_|_|_| |_|\__,_|_| ||____________|| #
# ____ _ ____ ___ |______________| #
# | __ ) ___ _ __ ___| |__ |___ \ / _ \ \\############\\ #
# | _ \ / _ \ '_ \ / __| '_ \ __) || | | | \\############\\ #
# | |_) | __/ | | | (__| | | | / __/ | |_| | \ ____ \ #
# |____/ \___|_| |_|\___|_| |_| |_____(_)___/ \_____\___\____\ #
# #
######################################################################
Terminal-Bench ist ein beliebter Benchmark zur Messung der Fähigkeiten von Agenten und Sprachmodellen, wertvolle Arbeiten in containerisierten Umgebungen durchzuführen. Zu den Aufgaben gehören das Zusammenbauen von Proteinen für die Synthese, das Debuggen von asynchronem Code und das Beheben von Sicherheitslücken.
Er wird von praktisch allen führenden Forschungslabors verwendet.
Installieren Sie zunächst Harbor, unser Paket zur Bewertung und Optimierung von Agenten:
uv tool install harbor
oder
pip install harbor
Sie sollten nun TB 2.0 ausführen können! Testen Sie es, indem Sie die Oracle-Lösungen des Datensatzes lokal in Docker-Containern ausführen:
uv run harbor run --dataset [email protected] \
--agent oracle \
--n-concurrent 4
Dieser Befehl lädt automatisch die Aufgaben für den Benchmark herunter. Sie können sie unter https://github.com/laude-institute/terminal-bench-2 einsehen.
Sie können es auch mit Terminus ausführen:
export ANTHROPIC_API_KEY=<YOUR-KEY>
uv run harbor run --dataset [email protected] \
--agent terminus-2 \
--model anthropic/claude-opus-4-1 \
--n-concurrent 4
Oder mit einem der installierten Drittanbieter-Agenten:
export ANTHROPIC_API_KEY=<YOUR-KEY>
uv run harbor run --dataset [email protected] \
--agent claude-code \
--model anthropic/claude-opus-4-1 \
--n-concurrent 4
Wenn Sie Ihren Agenten oder Ihr Modell zuvor im alten Terminal-Bench-Repository getestet haben, ist die Migration zu Harbor unkompliziert. Geben Sie einfach denselben Modell-Endpunkt als Argument --model für harbor run an.
Für Agenten müssen Sie eine Unterklasse von BaseInstalledAgent oder BaseAgent erstellen. Ein Beispiel finden Sie unter wie wir Claude Code unterstützen.
Wenn Sie noch Fragen haben, wenden Sie sich bitte an Discord: https://discord.gg/6xWPKhGDbA
Wir werden den Kanal #tb-2 überwachen.
F: Warum haben Sie eine neue Version des Benchmarks erstellt?
A: Wir wussten immer, dass wir mit zunehmenden Modellfähigkeiten den Terminal-Bench an die Grenzen der Leistungsfähigkeit anpassen müssen. TB2.0 wurde mit schwierigeren Aufgaben entwickelt, um diese Fähigkeiten zu testen. Außerdem wollten wir die Grenzen mit einem anhaltenden Fokus auf Aufgabenqualität verschieben. Jede Aufgabe in TB2.0 hat mehrere Stunden menschliche und LM-gestützte Validierung erhalten, um sicherzustellen, dass die Aufgaben (1) lösbar, (2) realistisch und (3) gut spezifiziert sind. Wir werden in unserem kommenden Preprint mehr darüber teilen, wie wir dies umgesetzt haben.
F: Was ist „Harbor“ und warum muss ich es verwenden?
A: Harbor ist unser neues Framework zur Durchführung von agentischen Evaluierungen und zur Generierung von RL-Rollouts. Wir planen, es später in diesem Monat für die Allgemeinheit freizugeben. Wir haben alles, was wir über Agenten-Evaluierungen gelernt haben, genommen und die ursprüngliche Terminal-Bench-Evaluierungs-Harness von Grund auf neu geschrieben, um eine verbesserte Zuverlässigkeit, Beobachtbarkeit, Skalierbarkeit und Leistung zu erreichen.
Wenn Sie unseren Benchmark nützlich fanden, verwenden Sie bitte das folgende Zitat:
@misc{tbench_2025,
title={Terminal-Bench: A Benchmark for AI Agents in Terminal Environments},
url={https://github.com/laude-institute/terminal-bench},
author={The Terminal-Bench Team}, year={2025}, month={Apr}}