Benchmark para avaliar agentes de IA em tarefas do mundo real, incluindo resolução de vulnerabilidades, depuração de código e montagem de proteínas em ambientes containerizados. Usado por laboratórios de fronteira para medir capacidades de agentes.
######################################################################
# _____ _ _ ______________ #
# |_ _|__ _ __ _ __ ___ (_)_ __ __ _| | || || #
# | |/ _ \ '__| '_ ` _ \| | '_ \ / _` | | || > || #
# | | __/ | | | | | | | | | | | (_| | | || || #
# |_|\___|_| |_| |_| |_|_|_| |_|\__,_|_| ||____________|| #
# ____ _ ____ ___ |______________| #
# | __ ) ___ _ __ ___| |__ |___ \ / _ \ \\############\\ #
# | _ \ / _ \ '_ \ / __| '_ \ __) || | | | \\############\\ #
# | |_) | __/ | | | (__| | | | / __/ | |_| | \ ____ \ #
# |____/ \___|_| |_|\___|_| |_| |_____(_)___/ \_____\___\____\ #
# #
######################################################################
Terminal-Bench é um benchmark popular para medir as capacidades de agentes e modelos de linguagem em realizar trabalho valioso em ambientes conteinerizados. As tarefas incluem montar proteínas para síntese, depurar código assíncrono e resolver vulnerabilidades de segurança.
É utilizado por praticamente todos os laboratórios de fronteira.
Primeiro, instale o Harbor, nosso pacote para avaliar e otimizar agentes:
uv tool install harbor
ou
pip install harbor
Agora você deve conseguir executar o TB 2.0! Teste-o executando as soluções oracle do dataset em contêineres Docker localmente:
uv run harbor run --dataset [email protected] \
--agent oracle \
--n-concurrent 4
Este comando baixa automaticamente as tarefas do benchmark. Você pode visualizá-las em https://github.com/laude-institute/terminal-bench-2
Você também pode executar usando Terminus:
export ANTHROPIC_API_KEY=<YOUR-KEY>
uv run harbor run --dataset [email protected] \
--agent terminus-2 \
--model anthropic/claude-opus-4-1 \
--n-concurrent 4
Ou um dos agentes de terceiros instalados:
export ANTHROPIC_API_KEY=<YOUR-KEY>
uv run harbor run --dataset [email protected] \
--agent claude-code \
--model anthropic/claude-opus-4-1 \
--n-concurrent 4
Se você já testou seu agente ou modelo dentro do repositório legado do Terminal-Bench, migrar para o Harbor deve ser simples. Basta apontar o mesmo endpoint de modelo para o argumento --model do harbor run.
Para agentes, você precisará criar subclasses de BaseInstalledAgent ou BaseAgent. Para um exemplo, veja como suportamos o Claude Code.
Se você ainda tiver dúvidas, entre em contato pelo Discord: https://discord.gg/6xWPKhGDbA
Vamos monitorar o canal #tb-2.
P: Por que vocês criaram uma nova versão do benchmark?
R: Sempre soubemos que, à medida que as capacidades dos modelos aumentassem, precisaríamos manter o terminal-bench atualizado com as capacidades de fronteira. O TB2.0 é construído com tarefas mais difíceis para testar essas capacidades. Além disso, queríamos ultrapassar a fronteira com uma ênfase contínua na qualidade das tarefas. Cada tarefa no TB2.0 recebeu várias horas de validação humana e assistida por LM para garantir que as tarefas são (1) solucionáveis, (2) realistas e (3) bem especificadas. Compartilharemos mais sobre como fizemos isso em nosso próximo preprint.
P: O que é "Harbor" e por que preciso usá-lo?
R: Harbor é nosso novo framework para executar avaliações agentivas e gerar rollouts de RL. Planejamos lançá-lo para consumo geral ainda este mês. Aproveitamos tudo o que aprendemos sobre avaliações de agentes e reescrevemos o harness de avaliação original do Terminal-Bench do zero para melhorar confiabilidade, observabilidade, escalabilidade e desempenho.
Se você achou nosso benchmark útil, considere usar a seguinte citação:
@misc{tbench_2025,
title={Terminal-Bench: A Benchmark for AI Agents in Terminal Environments},
url={https://github.com/laude-institute/terminal-bench},
author={The Terminal-Bench Team}, year={2025}, month={Apr}}