Бенчмарк для оценки ИИ-агентов на реальных задачах, включая устранение уязвимостей, отладку кода и сборку белков в контейнеризированных средах. Используется ведущими лабораториями для измерения возможностей агентов.
######################################################################
# _____ _ _ ______________ #
# |_ _|__ _ __ _ __ ___ (_)_ __ __ _| | || || #
# | |/ _ \ '__| '_ ` _ \| | '_ \ / _` | | || > || #
# | | __/ | | | | | | | | | | | (_| | | || || #
# |_|\___|_| |_|_| |_| |_|_| |_|\__,_|_| ||____________|| #
# ____ _ ____ ___ |______________| #
# | __ ) ___ _ __ ___| |__ |___ \ / _ \ \\############\\ #
# | _ \ / _ \ '_ \ / __| '_ \ __) || | | | \\############\\ #
# | |_) | __/ | | | (__| | | | / __/ | |_| | \ ____ \ #
# |____/ \___|_| |_|\___|_| |_| |_____(_)___/ \_____\___\____\ #
# #
######################################################################
Terminal-Bench — это популярный бенчмарк для измерения способностей агентов и языковых моделей выполнять полезную работу в контейнеризированных средах. Задачи включают сборку белков для синтеза, отладку асинхронного кода и устранение уязвимостей в безопасности.
Этот бенчмарк используется практически всеми ведущими лабораториями.
Сначала установите Harbor — наш пакет для оценки и оптимизации агентов:
uv tool install harbor
или
pip install harbor
Теперь вы должны быть в состоянии запустить TB 2.0! Проверьте это, выполнив эталонные решения набора данных в Docker-контейнерах локально:
uv run harbor run --dataset [email protected] \
--agent oracle \
--n-concurrent 4
Эта команда автоматически загружает задачи для бенчмарка. Вы можете просмотреть их по адресу https://github.com/laude-institute/terminal-bench-2
Также вы можете запустить с помощью Terminus:
export ANTHROPIC_API_KEY=<YOUR-KEY>
uv run harbor run --dataset [email protected] \
--agent terminus-2 \
--model anthropic/claude-opus-4-1 \
--n-concurrent 4
Или используя одного из установленных сторонних агентов:
export ANTHROPIC_API_KEY=<YOUR-KEY>
uv run harbor run --dataset [email protected] \
--agent claude-code \
--model anthropic/claude-opus-4-1 \
--n-concurrent 4
Если вы ранее тестировали своего агента или модель внутри старого репозитория Terminal-Bench, то миграция в Harbor должна быть простой. Просто укажите ту же конечную точку модели в аргументе --model команды harbor run.
Для агентов вам нужно создать подкласс BaseInstalledAgent или BaseAgent. Пример вы можете посмотреть, как мы поддерживаем Claude Code.
Если у вас остались вопросы, обращайтесь в Discord: https://discord.gg/6xWPKhGDbA
Мы будем следить за каналом #tb-2.
В: Почему вы сделали новую версию бенчмарка?
О: Мы всегда знали, что по мере роста возможностей моделей нам нужно будет обновлять terminal-bench в соответствии с передовыми возможностями. TB2.0 построен на более сложных задачах для проверки этих возможностей. Кроме того, мы хотели продвинуть границы возможного, уделяя особое внимание качеству задач. Каждая задача в TB2.0 прошла несколько часов валидации с участием человека и LM-помощника, чтобы гарантировать, что задачи (1) решаемы, (2) реалистичны и (3) правильно специфицированы. Мы поделимся подробностями о том, как это делалось, в нашей будущей препринтной публикации.
В: Что такое «Harbor» и почему я должен его использовать?
О: Harbor — это наш новый фреймворк для запуска агентных оценок и генерации RL-прогонов. Мы планируем выпустить его для общего использования в конце этого месяца. Мы учли всё, что узнали об оценке агентов, и переписали оригинальный eval-харнес Terminal-Bench с нуля для повышения надёжности, наблюдаемости, масштабируемости и производительности.
Если вы нашли наш бенчмарк полезным, пожалуйста, используйте следующую цитату:
@misc{tbench_2025,
title={Terminal-Bench: A Benchmark for AI Agents in Terminal Environments},
url={https://github.com/laude-institute/terminal-bench},
author={The Terminal-Bench Team}, year={2025}, month={Apr}}