Skip to content
KitploitKITPLOIT
ИнструментыБлог
Отправить
ИнструментыБлог
Отправить

Инструменты для хакинга, пентеста и кибербезопасности — ваш арсенал защиты!

Kitploit — это каталог инструментов для хакинга, кибербезопасности и пентестинга. Находите последние обновления проектов для поиска уязвимостей, анализа систем, автоматизации тестирования и усиления вашей безопасности.

··Ленты·Контакты·Конфиденциальность·© 2026 Kitploit

Каталог инструментов

Категории

Все категории
Loading categories
Инструменты/GitHubGitHub/binzhwang/actguard
Оборонительные ИнструментыАнализ уязвимостейТестирование на ПроникновениеМашинное ОбучениеБезопасность ИИ
GitHubbinzhwang/actguard

ActGuard

Защита с предварительным аудитом действий, которая обнаруживает и маскирует косвенную инъекцию промптов в LLM-агентах, использующих инструменты, с помощью эмбеддингового поиска и контрастивного скоринга логарифмических вероятностей.

Репозиторий
112 дней назадЕщё не проверено

Популярное

Смотреть все →

Откройте для себя самые используемые инструменты нашего сообщества.

Изучить все инструменты

Просмотрите нашу коллекцию инструментов

Смотреть все инструменты →
Поделиться

ActGuard

ActGuard — это защита, выполняющая аудит действий перед их выполнением и предназначенная для противодействия косвенным инъекциям промптов в LLM-агентах, использующих инструменты. Этот репозиторий содержит финальную реализацию ActGuard и основанную на AgentDojo среду выполнения, необходимую для её оценки.

Релиз содержит только финальную полную конфигурацию ActGuard. Внутренние компоненты по-прежнему используют идентификатор reflective_audit для совместимости с бенчмарком AgentDojo и форматами трассировки.

Требования

  • Python 3.10 или новее
  • Ключ API OpenRouter
  • Доступ к чекпоинту meta-llama/Meta-Llama-3.1-8B-Instruct или эквивалентному локальному чекпоинту
  • Для локального вычисления логарифмических вероятностей настоятельно рекомендуется GPU с поддержкой CUDA

Установка

Рекомендуется использовать uv:

root@kitploit:~
uv sync --frozen --extra actguard

Либо установите в активированное окружение Python:

root@kitploit:~
python -m pip install -e '.[actguard]'

Быстрый старт

Из корня репозитория:

root@kitploit:~
export OPENROUTER_API_KEY=...
uv run --frozen --extra actguard ./scripts/run_actguard.sh

Если проект был установлен через pip, выполните:

root@kitploit:~
export OPENROUTER_API_KEY=...
./scripts/run_actguard.sh

Скрипт оценивает набор workspace с атакой important_instructions. Он использует OpenRouter для основного агента и верификатора, а также совместимые с Hugging Face локальные модели для эмбеддингового поиска и контрастивной атрибуции по логарифмическим вероятностям. Перед загрузкой стандартного закрытого чекпоинта Llama может потребоваться аутентификация Hugging Face.

Чтобы использовать загруженные чекпоинты, замените значения --reflective-audit-embedding-model и --reflective-audit-logprob-model в scripts/run_actguard.sh на их локальные пути. Используйте uv run --frozen actguard-benchmark --help, чтобы увидеть все параметры бенчмарка.

Конфигурация по умолчанию

Вывод

Результаты записываются в:

root@kitploit:~
runs/openai_gpt-4o-mini-2024-07-18-reflective_audit/actguard/

Каталог runs/ игнорируется Git.

Тесты

Запустите регрессионные тесты ActGuard:

root@kitploit:~
uv run --frozen pytest -q tests/test_agent_pipeline/test_reflective_audit.py

Структура репозитория

  • src/agentdojo/agent_pipeline/reflective_audit.py: реализация ActGuard
  • src/agentdojo/agent_pipeline/agent_pipeline.py: интеграция в конвейер
  • src/agentdojo/scripts/benchmark.py: CLI бенчмарка
  • src/agentdojo/default_suites/: наборы для оценки и определения задач
  • tests/test_agent_pipeline/test_reflective_audit.py: регрессионные тесты
  • src/agentdojo/reflective_audit_trace.py: генерация и просмотр трассировки

Журналы запусков, локальные окружения, учётные данные, черновики статей, временные результаты анализа и сравнительные защиты намеренно исключены из этого релиза.

Лицензия

Этот проект распространяется под лицензией MIT. Он включает среду выполнения бенчмарка, производную от AgentDojo; см. LICENSE для сохранённого уведомления об авторских правах вышестоящего проекта.

Скачать инструмент
ПараметрЗначение
Модель бэкендаopenai/gpt-4o-mini-2024-07-18 через OpenRouter
Температура модели бэкенда0
Длина фрагмента80--180 символов
Модель эмбеддинговsentence-transformers/all-MiniLM-L6-v2
Извлекаемые фрагментыk = 3
Модель контрастивных логарифмических вероятностейmeta-llama/Meta-Llama-3.1-8B-Instruct
Порог логарифмической вероятности0
Порог группировки похожих фрагментов0.9
Контекст результатов инструментовПолная проверяемая история
Модель верификатораopenai/gpt-5-mini через OpenRouter
Температура верификатора0
Размер набора предсказанных следующих инструментов1--3
Расширение соседними фрагментами1 фрагмент с каждой стороны
Максимум попыток исправления на действие2
Текст локального маскирования[Removed suspicious instruction from external tool result.]