Skip to content
KitploitKITPLOIT
ИнструментыБлог
Отправить
ИнструментыБлог
Отправить

Инструменты для хакинга, пентеста и кибербезопасности — ваш арсенал защиты!

Kitploit — это каталог инструментов для хакинга, кибербезопасности и пентестинга. Находите последние обновления проектов для поиска уязвимостей, анализа систем, автоматизации тестирования и усиления вашей безопасности.

··Ленты·Контакты·Конфиденциальность·© 2026 Kitploit

Каталог инструментов

Категории

Все категории
Loading categories
terminal-bench-2 — Бенчмарк для оценки ИИ-агентов на реальных задачах, включая устранение уязвимостей, отладку кода и сборку белков в контейнеризированных средах. Используется ведущими лабораториями для измерения возможностей агентов. | Kitploit
Инструменты/GitHubGitHub/harbor-framework/terminal-bench-2
Анализ уязвимостейСкриптинг и автоматизацияВиртуализация для безопасностиCTFТестирование на ПроникновениеDevSecOpsОбучение и ОбразованиеЛаборатории и Практика
GitHub
harbor-framework/terminal-bench-2

terminal-bench-2

Бенчмарк для оценки ИИ-агентов на реальных задачах, включая устранение уязвимостей, отладку кода и сборку белков в контейнеризированных средах. Используется ведущими лабораториями для измерения возможностей агентов.

Репозиторий
371109134 месяцев назадПроверено Kitploit

Популярное

Смотреть все →

Откройте для себя самые используемые инструменты нашего сообщества.

Изучить все инструменты

Просмотрите нашу коллекцию инструментов

Смотреть все инструменты →
Поделиться

Terminal-Bench 2.0

root@kitploit:~

######################################################################
#  _____                   _             _       ______________      #
# |_   _|__ _ __ _ __ ___ (_)_ __   __ _| |     ||            ||     #
#   | |/ _ \ '__| '_ ` _ \| | '_ \ / _` | |     || >          ||     #
#   | |  __/ |  | | | | | | | | | | (_| | |     ||            ||     #
#   |_|\___|_|  |_|_| |_| |_|_| |_|\__,_|_|     ||____________||     #
#   ____                  _       ____    ___   |______________|     #
#  | __ )  ___ _ __   ___| |__   |___ \  / _ \  \\############\\     #
#  |  _ \ / _ \ '_ \ / __| '_ \    __) || | | |  \\############\\    # 
#  | |_) |  __/ | | | (__| | | |  / __/ | |_| |   \      ____    \   #
#  |____/ \___|_| |_|\___|_| |_| |_____(_)___/     \_____\___\____\  #
#                                                                    #
######################################################################

Docs

Terminal-Bench — это популярный бенчмарк для измерения способностей агентов и языковых моделей выполнять полезную работу в контейнеризированных средах. Задачи включают сборку белков для синтеза, отладку асинхронного кода и устранение уязвимостей в безопасности.

Этот бенчмарк используется практически всеми ведущими лабораториями.

Начало работы

Сначала установите Harbor — наш пакет для оценки и оптимизации агентов:

root@kitploit:~
uv tool install harbor

или

root@kitploit:~
pip install harbor

Теперь вы должны быть в состоянии запустить TB 2.0! Проверьте это, выполнив эталонные решения набора данных в Docker-контейнерах локально:

root@kitploit:~
uv run harbor run --dataset [email protected] \
   --agent oracle \
   --n-concurrent 4 

Эта команда автоматически загружает задачи для бенчмарка. Вы можете просмотреть их по адресу https://github.com/laude-institute/terminal-bench-2

Также вы можете запустить с помощью Terminus:

root@kitploit:~
export ANTHROPIC_API_KEY=<YOUR-KEY>
uv run harbor run --dataset [email protected] \
   --agent terminus-2 \
   --model anthropic/claude-opus-4-1 \
   --n-concurrent 4 

Или используя одного из установленных сторонних агентов:

root@kitploit:~
export ANTHROPIC_API_KEY=<YOUR-KEY> 
uv run harbor run --dataset [email protected] \
   --agent claude-code \
   --model anthropic/claude-opus-4-1 \
   --n-concurrent 4 

Миграция из Terminal-Bench Harness в Harbor

Если вы ранее тестировали своего агента или модель внутри старого репозитория Terminal-Bench, то миграция в Harbor должна быть простой. Просто укажите ту же конечную точку модели в аргументе --model команды harbor run.

Для агентов вам нужно создать подкласс BaseInstalledAgent или BaseAgent. Пример вы можете посмотреть, как мы поддерживаем Claude Code.

Discord

Если у вас остались вопросы, обращайтесь в Discord: https://discord.gg/6xWPKhGDbA
Мы будем следить за каналом #tb-2.

FAQ

В: Почему вы сделали новую версию бенчмарка?
О: Мы всегда знали, что по мере роста возможностей моделей нам нужно будет обновлять terminal-bench в соответствии с передовыми возможностями. TB2.0 построен на более сложных задачах для проверки этих возможностей. Кроме того, мы хотели продвинуть границы возможного, уделяя особое внимание качеству задач. Каждая задача в TB2.0 прошла несколько часов валидации с участием человека и LM-помощника, чтобы гарантировать, что задачи (1) решаемы, (2) реалистичны и (3) правильно специфицированы. Мы поделимся подробностями о том, как это делалось, в нашей будущей препринтной публикации.

В: Что такое «Harbor» и почему я должен его использовать?
О: Harbor — это наш новый фреймворк для запуска агентных оценок и генерации RL-прогонов. Мы планируем выпустить его для общего использования в конце этого месяца. Мы учли всё, что узнали об оценке агентов, и переписали оригинальный eval-харнес Terminal-Bench с нуля для повышения надёжности, наблюдаемости, масштабируемости и производительности.

Цитирование Terminal-Bench

Если вы нашли наш бенчмарк полезным, пожалуйста, используйте следующую цитату:

root@kitploit:~
@misc{tbench_2025,
      title={Terminal-Bench: A Benchmark for AI Agents in Terminal Environments}, 
      url={https://github.com/laude-institute/terminal-bench}, 
      author={The Terminal-Bench Team}, year={2025}, month={Apr}} 
Скачать инструмент