Skip to content
KitploitKITPLOIT
도구익스플로잇블로그
Log in
제출
도구익스플로잇블로그
제출

해킹, 침투 테스트 및 사이버 보안 도구를 당신의 보안 무기고에!

Kitploit은 해킹, 사이버 보안 및 침투 테스트 도구 디렉토리입니다. 최신 프로젝트 업데이트를 발견하여 취약점을 찾고, 시스템을 분석하고, 테스트를 자동화하고, 보안을 강화하세요.

··피드·문의·개인정보·© 2026 Kitploit

도구 디렉토리

카테고리

모든 카테고리 보기
Loading categories
terminal-bench-2 — 취약점 해결, 코드 디버깅, 컨테이너 환경에서의 단백질 조립 등 실제 작업에서 AI 에이전트를 평가하기 위한 벤치마크입니다. 프론티어 연구소에서 에이전트 능력을 측정하는 데 사용됩니다. | Kitploit
도구/GitHubGitHub/harbor-framework/terminal-bench-2
Vulnerability AnalysisScripting & AutomationSecurity VirtualizationCTFPenetration TestingDevSecOpsLearning & EducationLabs & Practice
GitHubharbor-framework/terminal-bench-2

terminal-bench-2

취약점 해결, 코드 디버깅, 컨테이너 환경에서의 단백질 조립 등 실제 작업에서 AI 에이전트를 평가하기 위한 벤치마크입니다. 프론티어 연구소에서 에이전트 능력을 측정하는 데 사용됩니다.

저장소 보기
371109195개월 전Kitploit 검토 완료

인기

모두 보기 →

커뮤니티에서 가장 많이 사용되는 도구를 찾아보세요.

모든 도구 탐색

도구 컬렉션을 둘러보세요

모든 도구 보기 →
공유

Terminal-Bench 2.0


######################################################################
#  _____                   _             _       ______________      #
# |_   _|__ _ __ _ __ ___ (_)_ __   __ _| |     ||            ||     #
#   | |/ _ \ '__| '_ ` _ \| | '_ \ / _` | |     || >          ||     #
#   | |  __/ |  | | | | | | | | | | (_| | |     ||            ||     #
#   |_|\___|_|  |_| |_| |_|_|_| |_|\__,_|_|     ||____________||     #
#   ____                  _       ____    ___   |______________|     #
#  | __ )  ___ _ __   ___| |__   |___ \  / _ \  \\############\\     #
#  |  _ \ / _ \ '_ \ / __| '_ \    __) || | | |  \\############\\    # 
#  | |_) |  __/ | | | (__| | | |  / __/ | |_| |   \      ____    \   #
#  |____/ \___|_| |_|\___|_| |_| |_____(_)___/     \_____\___\____\  #
#                                                                    #
######################################################################

Docs

Terminal-Bench는 컨테이너화된 환경에서 유용한 작업을 수행하기 위한 에이전트와 언어 모델의 성능을 측정하는 인기 있는 벤치마크입니다. 작업에는 합성용 단백질 조립, 비동기 코드 디버깅, 보안 취약점 해결 등이 포함됩니다.

실질적으로 모든 프런티어 연구소에서 사용됩니다.

시작하기

먼저, 에이전트를 평가하고 최적화하기 위한 패키지인 Harbor를 설치하세요:

uv tool install harbor

또는

pip install harbor

이제 TB 2.0을 실행할 수 있습니다! 로컬 도커 컨테이너에서 데이터셋 오라클 솔루션을 실행하여 테스트해보세요:

uv run harbor run --dataset [email protected] \
   --agent oracle \
   --n-concurrent 4 

이 명령어는 벤치마크 작업을 자동으로 다운로드합니다. 작업은 https://github.com/laude-institute/terminal-bench-2에서 확인할 수 있습니다.

Terminus를 사용하여 실행할 수도 있습니다:

export ANTHROPIC_API_KEY=<YOUR-KEY>
uv run harbor run --dataset [email protected] \
   --agent terminus-2 \
   --model anthropic/claude-opus-4-1 \
   --n-concurrent 4 

또는 설치된 타사 에이전트 중 하나를 사용하여 실행할 수 있습니다:

export ANTHROPIC_API_KEY=<YOUR-KEY> 
uv run harbor run --dataset [email protected] \
   --agent claude-code \
   --model anthropic/claude-opus-4-1 \
   --n-concurrent 4 

Terminal-Bench Harness에서 Harbor로 마이그레이션하기

이전에 레거시 Terminal-Bench 저장소 내에서 에이전트나 모델을 테스트했다면 Harbor로 마이그레이션하는 것은 간단합니다. 동일한 모델 엔드포인트를 harbor run의 --model 인수에 지정하기만 하면 됩니다.

에이전트의 경우 BaseInstalledAgent 또는 BaseAgent를 서브클래싱해야 합니다. 예시는 Claude Code 지원 방법을 참조하세요.

Discord

추가 질문이 있으시면 Discord에서 연락주세요: https://discord.gg/6xWPKhGDbA
#tb-2 채널을 모니터링하고 있습니다.

자주 묻는 질문 (FAQ)

질문: 왜 벤치마크의 새 버전을 만드셨나요?
답변: 우리는 모델의 성능이 향상됨에 따라 terminal-bench를 최첨단 성능에 맞게 업데이트해야 한다는 것을 항상 알고 있었습니다. TB2.0은 이러한 성능을 테스트하기 위해 더 어려운 작업으로 구성되었습니다. 또한, 작업 품질에 지속적인 중점을 두면서 프런티어를 더욱 발전시키고자 했습니다. TB2.0의 각 작업은 작업이 (1) 해결 가능하고, (2) 현실적이며, (3) 잘 명시되어 있는지 확인하기 위해 몇 시간의 사람 및 LM 기반 검증을 거쳤습니다. 이를 어떻게 수행했는지에 대한 자세한 내용은 곧 출시될 프리프린트에서 공유하겠습니다.

질문: "Harbor"란 무엇이며, 왜 사용해야 하나요?
답변: Harbor는 에이전틱 평가를 실행하고 RL 롤아웃을 생성하기 위한 새로운 프레임워크입니다. 이번 달 말에 일반 공개할 계획입니다. 우리는 에이전트 평가에 대해 배운 모든 것을 바탕으로 원래 Terminal-Bench 평가 도구를 처음부터 다시 작성하여 신뢰성, 관찰 가능성, 확장성 및 성능을 향상시켰습니다.

Terminal-Bench 인용하기

벤치마크가 유용했다면, 다음 인용을 사용해 주시기 바랍니다:

@misc{tbench_2025,
      title={Terminal-Bench: A Benchmark for AI Agents in Terminal Environments}, 
      url={https://github.com/laude-institute/terminal-bench}, 
      author={The Terminal-Bench Team}, year={2025}, month={Apr}} 
도구 다운로드