Skip to content
KitploitKITPLOIT
ツールブログ
提出
ツールブログ
提出

ハッキング、侵入テスト、サイバーセキュリティツールをあなたのセキュリティアーセナルに!

Kitploitはハッキング、サイバーセキュリティ、ペネトレーションテストのツールディレクトリです。最新のプロジェクトアップデートを見つけて、脆弱性の発見、システム分析、テストの自動化、セキュリティの強化を行いましょう。

··フィード·お問い合わせ·プライバシー·© 2026 Kitploit

ツールディレクトリ

カテゴリ

すべてのカテゴリを見る
Loading categories
terminal-bench-2 — コンテナ化された環境における脆弱性解決、コードデバッグ、タンパク質アセンブリなどの現実世界のタスクでAIエージェントを評価するためのベンチマーク。最先端の研究所がエージェントの能力を測定するために使用しています。 | Kitploit
ツール/GitHubGitHub/harbor-framework/terminal-bench-2
脆弱性分析スクリプトと自動化セキュリティ仮想化CTFペネトレーションテストDevSecOps学習と教育ラボと実践
GitHubharbor-framework/terminal-bench-2

terminal-bench-2

コンテナ化された環境における脆弱性解決、コードデバッグ、タンパク質アセンブリなどの現実世界のタスクでAIエージェントを評価するためのベンチマーク。最先端の研究所がエージェントの能力を測定するために使用しています。

リポジトリを見る
3711093ヶ月前Kitploit レビュー済み

人気

すべて見る →

コミュニティで最も使われているツールを見つけましょう。

すべてのツールを探索

ツールコレクションを閲覧

すべてのツールを見る →
共有

Terminal-Bench 2.0

root@kitploit:~

######################################################################
#  _____                   _             _       ______________      #
# |_   _|__ _ __ _ __ ___ (_)_ __   __ _| |     ||            ||     #
#   | |/ _ \ '__| '_ ` _ \| | '_ \ / _` | |     || >          ||     #
#   | |  __/ |  | | | | | | | | | | (_| | |     ||            ||     #
#   |_|\___|_|  |_| |_| |_|_|_| |_|\__,_|_|     ||____________||     #
#   ____                  _       ____    ___   |______________|     #
#  | __ )  ___ _ __   ___| |__   |___ \  / _ \  \\############\\     #
#  |  _ \ / _ \ '_ \ / __| '_ \    __) || | | |  \\############\\    # 
#  | |_) |  __/ | | | (__| | | |  / __/ | |_| |   \      ____    \   #
#  |____/ \___|_| |_|\___|_| |_| |_____(_)___/     \_____\___\____\  #
#                                                                    #
######################################################################

Docs

Terminal-Bench は、エージェントや言語モデルがコンテナ化環境で価値ある作業を実行する能力を測定するための、広く利用されているベンチマークです。タスクには、合成用タンパク質の組み立て、非同期コードのデバッグ、セキュリティ脆弱性の解決などが含まれます。

事実上すべての最先端研究所で使用されています。

はじめに

まず、エージェントの評価と最適化のためのパッケージである Harbor をインストールします。

root@kitploit:~
uv tool install harbor

または

root@kitploit:~
pip install harbor

これで TB 2.0 が実行できるようになりました! データセットのオラクルソリューションをローカルの Docker コンテナで実行してテストしてみましょう。

root@kitploit:~
uv run harbor run --dataset [email protected] \
   --agent oracle \
   --n-concurrent 4 

このコマンドは、ベンチマークのタスクを自動的にダウンロードします。タスクは https://github.com/laude-institute/terminal-bench-2 で確認できます。

Terminus を使用して実行することもできます。

root@kitploit:~
export ANTHROPIC_API_KEY=<YOUR-KEY>
uv run harbor run --dataset [email protected] \
   --agent terminus-2 \
   --model anthropic/claude-opus-4-1 \
   --n-concurrent 4 

または、インストール済みのサードパーティエージェントを使用します。

root@kitploit:~
export ANTHROPIC_API_KEY=<YOUR-KEY> 
uv run harbor run --dataset [email protected] \
   --agent claude-code \
   --model anthropic/claude-opus-4-1 \
   --n-concurrent 4 

Terminal-Bench Harness から Harbor への移行

以前にレガシーな Terminal-Bench リポジトリ内でエージェントやモデルをテストしていた場合、Harbor への移行は簡単です。同じモデルエンドポイントを harbor run の --model 引数に指定するだけです。

エージェントの場合は、BaseInstalledAgent または BaseAgent をサブクラス化する必要があります。例については、Claude Code のサポート方法 を参照してください。

Discord

ご不明な点がございましたら、Discord までお問い合わせください: https://discord.gg/6xWPKhGDbA
#tb-2 チャンネルを監視しています。

FAQ

Q: なぜベンチマークの新しいバージョンを作成したのですか?
A: モデルの能力が向上するにつれて、terminal-bench を最先端の能力に合わせて更新し続ける必要があると常に認識していました。TB2.0 は、これらの能力をテストするためのより難しいタスクで構築されています。さらに、タスクの品質に引き続き重点を置きながら、フロンティアを押し進めたいと考えました。TB2.0 の各タスクは、タスクが (1) 解決可能、(2) 現実的、(3) 適切に指定されていることを確認するために、数時間にわたる人間および LM 支援による検証を受けています。これがどのように行われたかについては、近日公開予定のプレプリントで詳しく説明します。

Q: 「Harbor」とは何ですか?なぜ使用する必要があるのですか?
A: Harbor は、エージェント評価を実行し、RL ロールアウトを生成するための新しいフレームワークです。今月中に一般公開する予定です。エージェント評価について学んだすべてのことを活かして、オリジナルの Terminal-Bench 評価ハーネスを信頼性、観測可能性、スケーラビリティ、パフォーマンスの向上のためにゼロから書き直しました。

Terminal-Bench の引用

本ベンチマークが有用でしたら、以下の引用を検討してください。

root@kitploit:~
@misc{tbench_2025,
      title={Terminal-Bench: A Benchmark for AI Agents in Terminal Environments}, 
      url={https://github.com/laude-institute/terminal-bench}, 
      author={The Terminal-Bench Team}, year={2025}, month={Apr}} 
ツールをダウンロード