
취약점 해결, 코드 디버깅, 컨테이너 환경에서의 단백질 조립 등 실제 작업에서 AI 에이전트를 평가하기 위한 벤치마크입니다. 프론티어 연구소에서 에이전트 능력을 측정하는 데 사용됩니다.
######################################################################
# _____ _ _ ______________ #
# |_ _|__ _ __ _ __ ___ (_)_ __ __ _| | || || #
# | |/ _ \ '__| '_ ` _ \| | '_ \ / _` | | || > || #
# | | __/ | | | | | | | | | | | (_| | | || || #
# |_|\___|_| |_| |_| |_|_|_| |_|\__,_|_| ||____________|| #
# ____ _ ____ ___ |______________| #
# | __ ) ___ _ __ ___| |__ |___ \ / _ \ \\############\\ #
# | _ \ / _ \ '_ \ / __| '_ \ __) || | | | \\############\\ #
# | |_) | __/ | | | (__| | | | / __/ | |_| | \ ____ \ #
# |____/ \___|_| |_|\___|_| |_| |_____(_)___/ \_____\___\____\ #
# #
######################################################################
Terminal-Bench는 컨테이너화된 환경에서 유용한 작업을 수행하기 위한 에이전트와 언어 모델의 성능을 측정하는 인기 있는 벤치마크입니다. 작업에는 합성용 단백질 조립, 비동기 코드 디버깅, 보안 취약점 해결 등이 포함됩니다.
실질적으로 모든 프런티어 연구소에서 사용됩니다.
먼저, 에이전트를 평가하고 최적화하기 위한 패키지인 Harbor를 설치하세요:
uv tool install harbor
또는
pip install harbor
이제 TB 2.0을 실행할 수 있습니다! 로컬 도커 컨테이너에서 데이터셋 오라클 솔루션을 실행하여 테스트해보세요:
uv run harbor run --dataset [email protected] \
--agent oracle \
--n-concurrent 4
이 명령어는 벤치마크 작업을 자동으로 다운로드합니다. 작업은 https://github.com/laude-institute/terminal-bench-2에서 확인할 수 있습니다.
Terminus를 사용하여 실행할 수도 있습니다:
export ANTHROPIC_API_KEY=<YOUR-KEY>
uv run harbor run --dataset [email protected] \
--agent terminus-2 \
--model anthropic/claude-opus-4-1 \
--n-concurrent 4
또는 설치된 타사 에이전트 중 하나를 사용하여 실행할 수 있습니다:
export ANTHROPIC_API_KEY=<YOUR-KEY>
uv run harbor run --dataset [email protected] \
--agent claude-code \
--model anthropic/claude-opus-4-1 \
--n-concurrent 4
이전에 레거시 Terminal-Bench 저장소 내에서 에이전트나 모델을 테스트했다면 Harbor로 마이그레이션하는 것은 간단합니다. 동일한 모델 엔드포인트를 harbor run의 --model 인수에 지정하기만 하면 됩니다.
에이전트의 경우 BaseInstalledAgent 또는 BaseAgent를 서브클래싱해야 합니다. 예시는 Claude Code 지원 방법을 참조하세요.
추가 질문이 있으시면 Discord에서 연락주세요: https://discord.gg/6xWPKhGDbA
#tb-2 채널을 모니터링하고 있습니다.
질문: 왜 벤치마크의 새 버전을 만드셨나요?
답변: 우리는 모델의 성능이 향상됨에 따라 terminal-bench를 최첨단 성능에 맞게 업데이트해야 한다는 것을 항상 알고 있었습니다. TB2.0은 이러한 성능을 테스트하기 위해 더 어려운 작업으로 구성되었습니다. 또한, 작업 품질에 지속적인 중점을 두면서 프런티어를 더욱 발전시키고자 했습니다. TB2.0의 각 작업은 작업이 (1) 해결 가능하고, (2) 현실적이며, (3) 잘 명시되어 있는지 확인하기 위해 몇 시간의 사람 및 LM 기반 검증을 거쳤습니다. 이를 어떻게 수행했는지에 대한 자세한 내용은 곧 출시될 프리프린트에서 공유하겠습니다.
질문: "Harbor"란 무엇이며, 왜 사용해야 하나요?
답변: Harbor는 에이전틱 평가를 실행하고 RL 롤아웃을 생성하기 위한 새로운 프레임워크입니다. 이번 달 말에 일반 공개할 계획입니다. 우리는 에이전트 평가에 대해 배운 모든 것을 바탕으로 원래 Terminal-Bench 평가 도구를 처음부터 다시 작성하여 신뢰성, 관찰 가능성, 확장성 및 성능을 향상시켰습니다.
벤치마크가 유용했다면, 다음 인용을 사용해 주시기 바랍니다:
@misc{tbench_2025,
title={Terminal-Bench: A Benchmark for AI Agents in Terminal Environments},
url={https://github.com/laude-institute/terminal-bench},
author={The Terminal-Bench Team}, year={2025}, month={Apr}}