Skip to content
KitploitKITPLOIT
工具博客
提交
工具博客
提交

黑客、渗透测试和网络安全工具,武装您的安全武器库!

Kitploit 是一个黑客、网络安全和渗透测试工具的目录。发现最新的项目更新,查找漏洞、分析系统、自动化测试并加强你的安全。

··订阅源·联系·隐私·© 2026 Kitploit

工具目录

分类

查看所有分类
Loading categories
terminal-bench-2 — 评估AI代理在真实世界任务中的基准,包括漏洞修复、代码调试以及在容器化环境中的蛋白质组装。被前沿实验室用于衡量代理能力。 | Kitploit
工具/GitHubGitHub/harbor-framework/terminal-bench-2
漏洞分析脚本与自动化安全虚拟化CTF渗透测试DevSecOps学习与教育实验室与实践
GitHubharbor-framework/terminal-bench-2

terminal-bench-2

评估AI代理在真实世界任务中的基准,包括漏洞修复、代码调试以及在容器化环境中的蛋白质组装。被前沿实验室用于衡量代理能力。

查看仓库
371109134个月前Kitploit 审核通过

最受欢迎

查看全部 →

发现我们社区最常用的工具。

探索所有工具

浏览我们的工具集合

查看所有工具 →
分享

Terminal-Bench 2.0

root@kitploit:~

######################################################################
#  _____                   _             _       ______________      #
# |_   _|__ _ __ _ __ ___ (_)_ __   __ _| |     ||            ||     #
#   | |/ _ \ '__| '_ ` _ \| | '_ \ / _` | |     || >          ||     #
#   | |  __/ |  | | | | | | | | | | (_| | |     ||            ||     #
#   |_|\___|_|  |_| |_| |_|_|_| |_|\__,_|_|     ||____________||     #
#   ____                  _       ____    ___   |______________|     #
#  | __ )  ___ _ __   ___| |__   |___ \  / _ \  \\############\\     #
#  |  _ \ / _ \ '_ \ / __| '_ \    __) || | | |  \\############\\    # 
#  | |_) |  __/ | | | (__| | | |  / __/ | |_| |   \      ____    \   #
#  |____/ \___|_| |_|\___|_| |_| |_____(_)___/     \_____\___\____\  #
#                                                                    #
######################################################################

文档

Terminal-Bench 是一个流行的基准测试,用于衡量智能体和语言模型在容器化环境中执行有价值工作的能力。任务包括组装蛋白质用于合成、调试异步代码以及解决安全漏洞。

几乎所有前沿实验室都在使用它。

开始使用

首先,安装 Harbor,这是我们用于评估和优化智能体的软件包:

root@kitploit:~
uv tool install harbor

或

root@kitploit:~
pip install harbor

现在你应该能够运行 TB 2.0!通过在本地 Docker 容器中运行数据集 oracle 解决方案来测试:

root@kitploit:~
uv run harbor run --dataset [email protected] \
   --agent oracle \
   --n-concurrent 4 

该命令会自动下载基准测试的任务。你可以在 https://github.com/laude-institute/terminal-bench-2 查看它们。

你也可以使用 Terminus 运行:

root@kitploit:~
export ANTHROPIC_API_KEY=<YOUR-KEY>
uv run harbor run --dataset [email protected] \
   --agent terminus-2 \
   --model anthropic/claude-opus-4-1 \
   --n-concurrent 4 

或者使用已安装的第三方智能体:

root@kitploit:~
export ANTHROPIC_API_KEY=<YOUR-KEY> 
uv run harbor run --dataset [email protected] \
   --agent claude-code \
   --model anthropic/claude-opus-4-1 \
   --n-concurrent 4 

从 Terminal-Bench Harness 迁移到 Harbor

如果你之前已经在旧版 Terminal-Bench 仓库中测试过你的智能体或模型,那么迁移到 Harbor 应该很简单。只需将相同的模型端点指向 harbor run 的 --model 参数即可。

对于智能体,你需要继承 BaseInstalledAgent 或 BaseAgent。关于如何实现,请参考我们如何支持 Claude Code。

Discord

如果还有任何疑问,请通过 Discord 联系我们:https://discord.gg/6xWPKhGDbA
我们将在 #tb-2 频道中进行监控。

常见问题(FAQ)

问:为什么你们要制作一个新版本的基准测试?
答: 我们一直知道,随着模型能力的提升,我们需要让 terminal-bench 跟上前沿能力的步伐。TB2.0 构建了更困难的任务来测试这些能力。此外,我们希望继续强调任务质量,推动前沿发展。TB2.0 中的每个任务都经过了数小时的人工和语言模型辅助验证,以确保任务(1)可解决,(2)真实,(3)具备良好的规范性。我们将在即将发布的预印本中分享更多关于如何做到这一点的细节。

问:“Harbor”是什么?为什么我必须使用它?
答: Harbor 是我们新的框架,用于运行智能体评估和生成强化学习(RL)的 rollout。我们计划在本月晚些时候将其发布供一般使用。我们将在智能体评估中学到的一切应用到重新编写原始 Terminal-Bench 评估工具中,从头开始构建,以提高可靠性、可观察性、可扩展性和性能。

引用 Terminal-Bench

如果你发现我们的基准测试有用,请考虑使用以下引用:

root@kitploit:~
@misc{tbench_2025,
      title={Terminal-Bench: A Benchmark for AI Agents in Terminal Environments}, 
      url={https://github.com/laude-institute/terminal-bench}, 
      author={The Terminal-Bench Team}, year={2025}, month={Apr}} 
下载工具