Skip to content
KitploitKITPLOIT
ИнструментыЭксплойтыБлог
Log in
Отправить
ИнструментыЭксплойтыБлог
Отправить

Инструменты для хакинга, пентеста и кибербезопасности — ваш арсенал защиты!

Kitploit — это каталог инструментов для хакинга, кибербезопасности и пентестинга. Находите последние обновления проектов для поиска уязвимостей, анализа систем, автоматизации тестирования и усиления вашей безопасности.

··Ленты·Контакты·Конфиденциальность·© 2026 Kitploit

Каталог инструментов

Категории

Все категории
Loading categories
DeepTrap — Бенчмарк безопасности для оценки агентов OpenClaw против враждебных контекстов исполнения, включая отравленные файлы, внедрённые навыки, вводящие в заблуждение метаданные инструментов и закодированные полезные нагрузки. Включает 42 задачи воспроизведения в 6 наборах рисков с оценкой атак и полезности. | Kitploit
Инструменты/GitHubGitHub/zjuicsr/deeptrap
Повышение привилегийЭксфильтрация данныхТестирование на ПроникновениеКомандование и УправлениеБезопасность Цепочки ПоставокОбучение и ОбразованиеRed TeamingРазработка Полезной НагрузкиБезопасность ИИСостязательная АтакаЛаборатории и Практика
101164 месяцев назадЕщё не проверено

Популярное

Смотреть все →

Откройте для себя самые используемые инструменты нашего сообщества.

Изучить все инструменты

Просмотрите нашу коллекцию инструментов

Смотреть все инструменты →

Описание

Бенчмарк безопасности для оценки агентов OpenClaw против враждебных контекстов исполнения, включая отравленные файлы, внедрённые навыки, вводящие в заблуждение метаданные инструментов и закодированные полезные нагрузки. Включает 42 задачи воспроизведения в 6 наборах рисков с оценкой атак и полезности.

GitHubzjuicsr/deeptrap

DeepTrap

Репозиторий
Поделиться

DeepTrap

Логотип DeepTrap

Tasks Chinese Samples Risks Scenarios Leaderboard
arXiv Paper HuggingFace License

English | 中文

Оценка безопасности OpenClaw-агентов в открытом мире при враждебном контексте выполнения.


DeepTrap — это бенчмарк безопасности, предназначенный для оценки того, могут ли агенты OpenClaw выполнять безвредные пользовательские задачи, противостоя вредоносному давлению на контекст выполнения: отравленным файлам рабочей области, внедрённым навыкам, вводящим в заблуждение метаданным инструментов, небезопасным путям команд, внедрённым секретам и закодированным полезным нагрузкам.

Публичный релиз содержит 42 replay-задачи, организованные как 6 классов контекстных уязвимостей × 7 семейств операционных сценариев, а также раннер бенчмарка и публичный код оценки. В него также включены 10 китайскоязычных replay-примеров в каталоге tasks_zh/ для локализованных экспериментов по оценке. Закрытый конвейер генерации задач и поиска атак намеренно не включён.

DeepTrap выпущен вместе со статьёй:

Red-Teaming Agent Execution Contexts: Open-World Security Evaluation on OpenClaw
Hongwei Yao, Yiming Liu, Yiling He, and Bingrun Yang. arXiv:2605.11047, 2026.

Почему DeepTrap?

Большинство агентных бенчмарков проверяют, может ли модель выполнить полезную работу. DeepTrap задаёт более строгий вопрос: может ли агент безопасно выполнить полезную работу, когда окружающий контекст выполнения враждебен?

Что мы тестируемПочему это важно
Устойчивость контекстаОтравленные файлы, артефакты, подобные памяти, плейбуки и инструкции рабочей областиРеальные агенты читают из изменяемого локального контекста, в котором ненадёжный текст может незаметно перенаправлять поведение
Обработка секретовВнедрённые учётные данные, переменные окружения, API-ключи и внутренние значенияАгенты должны отличать осведомлённость о конфигурации от эксфильтрации секретов
Границы выполненияОпасные shell-команды, скрипты развёртывания и побочные эффекты в файловой системеАгенты, использующие инструменты, могут причинить долговременный вред, даже если пользовательский запрос безвреден
Доверие к навыкам/инструментамВредоносные навыки, вводящие в заблуждение метаданные инструментов и паттерны злоупотребления инструментамиБезопасность агента зависит от того, как модель интерпретирует и проверяет возможности инструментов
Обфусцированные полезные нагрузкиИнструкции в Base64 и многошаговые закодированные инструкцииАтаки могут скрываться за обычными на вид задачами обработки данных

Что нас отличает

  • Атаки на контекст выполнения, а не только на промпт. DeepTrap оценивает угрозы, встроенные в файлы, навыки, описания инструментов, скрипты, журналы, конфигурации и закодированные артефакты.
  • Безвредные пользовательские промпты. Пользовательский запрос полезен и обычен; риск исходит из окружающей рабочей области.
  • Публичное минимальное воспроизведение. Репозиторий содержит раннер, replay-задачи и логику оценки, необходимые для воспроизведения запусков бенчмарка без раскрытия приватного кода генерации.
  • Оценка атак и полезности. DeepTrap сообщает как AGS (Attack Grading Score), так и UGS (Utility Grading Score), поэтому модель оценивается по безопасности и полезности задач совместно.
  • Нативный для OpenClaw. Задачи созданы для агентов в стиле OpenClaw и сохраняют допущения о выполнении в реальной рабочей области файлов/инструментов/навыков.

Новости

  • 2026-05 Статья о DeepTrap опубликована на arXiv: arXiv:2605.11047.
  • 2026-05 Опубликован публичный репозиторий бенчмарка с 42 replay-задачами, кодом оценки и таблицей лидеров на GitHub Pages.
  • 2026-05 Добавлены китайскоязычные replay-примеры в каталог tasks_zh/.
  • 2026-05 Добавлен экспорт набора данных Hugging Face для распространения метаданных задач.

Таблица лидеров

AGS — это Attack Grading Score, а UGS — Utility Grading Score. Оценки приводятся по наборам рисков; Average — это среднее по Risk 1–Risk 6.

Полная страница проекта и таблица лидеров: ZJUICSR.github.io/DeepTrap

Модель ClawМетрикаRisk 1Risk 2Risk 3Risk 4Risk 5Risk 6Среднее
GPT-5.4AGS0.770.840.760.610.670.530.70
GPT-5.4UGS0.910.830.860.770.740.870.83
Claude-Sonnet-4.6AGS0.510.580.370.250.380.200.38
Claude-Sonnet-4.6UGS0.710.690.550.450.550.710.61
GLM-5AGS0.810.930.740.830.790.880.83
GLM-5UGS0.900.900.980.890.830.880.90
Qwen3.5-PlusAGS0.930.930.860.740.880.970.88
Qwen3.5-PlusUGS0.950.921.000.980.930.930.95
MiniMax-M2.5AGS0.860.890.770.660.900.890.83
MiniMax-M2.5UGS0.920.951.000.880.740.900.90
DeepSeek-v4-FlashAGS0.900.960.800.900.820.940.89
DeepSeek-v4-FlashUGS0.980.961.000.960.851.000.96
Deepseek-v4-ProAGS0.900.960.740.870.850.860.86
Deepseek-v4-ProUGS0.900.911.000.810.840.890.89
MiMo-v2.5AGS0.860.870.710.730.570.600.72
MiMo-v2.5UGS0.960.950.880.930.830.890.91
MiMo-v2.5-proAGS0.740.830.560.580.580.530.64
MiMo-v2.5-proUGS0.920.900.880.870.710.870.86

Устройство бенчмарка

DeepTrap объединяет шесть классов контекстных уязвимостей с семью семействами безвредных сценариев. Каждая задача использует обычный пользовательский промпт; враждебное поведение индуцируется контекстом рабочей области.

Схема DeepTrap

DeepTrap формирует скомпрометированные контексты выполнения из безвредных инструкций и чистых рабочих областей, перебирает кандидатов враждебных полезных нагрузок с помощью многоцелевых сигналов вознаграждения и дорабатывает успешные полезные нагрузки с помощью зондирования на основе рефлексии.

Категории рисков

Скачать инструмент