######################################################################
# _____ _ _ ______________ #
# |_ _|__ _ __ _ __ ___ (_)_ __ __ _| | || || #
# | |/ _ \ '__| '_ ` _ \| | '_ \ / _` | | || > || #
# | | __/ | | | | | | | | | | | (_| | | || || #
# |_|\___|_| |_| |_| |_|_|_| |_|\__,_|_| ||____________|| #
# ____ _ ____ ___ |______________| #
# | __ ) ___ _ __ ___| |__ |___ \ / _ \ \\############\\ #
# | _ \ / _ \ '_ \ / __| '_ \ __) || | | | \\############\\ #
# | |_) | __/ | | | (__| | | | / __/ | |_| | \ ____ \ #
# |____/ \___|_| |_|\___|_| |_| |_____(_)___/ \_____\___\____\ #
# #
######################################################################
Terminal-Bench 是一个流行的基准测试,用于衡量智能体和语言模型在容器化环境中执行有价值工作的能力。任务包括组装蛋白质用于合成、调试异步代码以及解决安全漏洞。
几乎所有前沿实验室都在使用它。
首先,安装 Harbor,这是我们用于评估和优化智能体的软件包:
uv tool install harbor
或
pip install harbor
现在你应该能够运行 TB 2.0!通过在本地 Docker 容器中运行数据集 oracle 解决方案来测试:
uv run harbor run --dataset [email protected] \
--agent oracle \
--n-concurrent 4
该命令会自动下载基准测试的任务。你可以在 https://github.com/laude-institute/terminal-bench-2 查看它们。
你也可以使用 Terminus 运行:
export ANTHROPIC_API_KEY=<YOUR-KEY>
uv run harbor run --dataset [email protected] \
--agent terminus-2 \
--model anthropic/claude-opus-4-1 \
--n-concurrent 4
或者使用已安装的第三方智能体:
export ANTHROPIC_API_KEY=<YOUR-KEY>
uv run harbor run --dataset [email protected] \
--agent claude-code \
--model anthropic/claude-opus-4-1 \
--n-concurrent 4
如果你之前已经在旧版 Terminal-Bench 仓库中测试过你的智能体或模型,那么迁移到 Harbor 应该很简单。只需将相同的模型端点指向 harbor run 的 --model 参数即可。
对于智能体,你需要继承 BaseInstalledAgent 或 BaseAgent。关于如何实现,请参考我们如何支持 Claude Code。
如果还有任何疑问,请通过 Discord 联系我们:https://discord.gg/6xWPKhGDbA
我们将在 #tb-2 频道中进行监控。
问:为什么你们要制作一个新版本的基准测试?
答: 我们一直知道,随着模型能力的提升,我们需要让 terminal-bench 跟上前沿能力的步伐。TB2.0 构建了更困难的任务来测试这些能力。此外,我们希望继续强调任务质量,推动前沿发展。TB2.0 中的每个任务都经过了数小时的人工和语言模型辅助验证,以确保任务(1)可解决,(2)真实,(3)具备良好的规范性。我们将在即将发布的预印本中分享更多关于如何做到这一点的细节。
问:“Harbor”是什么?为什么我必须使用它?
答: Harbor 是我们新的框架,用于运行智能体评估和生成强化学习(RL)的 rollout。我们计划在本月晚些时候将其发布供一般使用。我们将在智能体评估中学到的一切应用到重新编写原始 Terminal-Bench 评估工具中,从头开始构建,以提高可靠性、可观察性、可扩展性和性能。
如果你发现我们的基准测试有用,请考虑使用以下引用:
@misc{tbench_2025,
title={Terminal-Bench: A Benchmark for AI Agents in Terminal Environments},
url={https://github.com/laude-institute/terminal-bench},
author={The Terminal-Bench Team}, year={2025}, month={Apr}}