Skip to content
KitploitKITPLOIT
HerramientasBlog
Enviar
HerramientasBlog
Enviar

¡Herramientas de Hacking, PenTest y Ciberseguridad para tu Arsenal de Seguridad!

Kitploit es un directorio de herramientas de hacking, ciberseguridad y pentesting. Descubre las últimas actualizaciones de proyectos para encontrar vulnerabilidades, analizar sistemas, automatizar pruebas y fortalecer tu seguridad.

··Feeds·Contacto·Privacidad·© 2026 Kitploit

Directorio de Herramientas

Categorías

Ver todas las categorías
Loading categories
ActGuard — Defensa de auditoría de acciones previa a la ejecución que detecta y enmascara la inyección indirecta de prompts en agentes LLM que utilizan herramientas, mediante recuperación de embeddings y puntuación contrastiva de log-probabilidad. | Kitploit
Herramientas/GitHubGitHub/binzhwang/actguard
Herramientas DefensivasAnálisis de VulnerabilidadesPruebas de PenetraciónAprendizaje AutomáticoSeguridad de IA
GitHubbinzhwang/actguard

ActGuard

Defensa de auditoría de acciones previa a la ejecución que detecta y enmascara la inyección indirecta de prompts en agentes LLM que utilizan herramientas, mediante recuperación de embeddings y puntuación contrastiva de log-probabilidad.

Ver Repositorio
11hace 2 díasAún no revisado

Más Populares

Ver todos →

Descubre las herramientas más usadas por nuestra comunidad.

Explora todas las herramientas

Explora nuestra colección de herramientas

Ver todas las herramientas →
Compartir

ActGuard

ActGuard es una defensa de auditoría de acciones previa a la ejecución contra la inyección indirecta de prompts en agentes LLM que utilizan herramientas. Este repositorio contiene la implementación final de ActGuard y el entorno de ejecución basado en AgentDojo necesario para evaluarla.

La versión contiene únicamente la configuración final y completa de ActGuard. Los componentes internos siguen usando el identificador reflective_audit por compatibilidad con el benchmark de AgentDojo y los formatos de traza.

Requisitos

  • Python 3.10 o superior
  • Una clave de API de OpenRouter
  • Acceso al checkpoint meta-llama/Meta-Llama-3.1-8B-Instruct, o un checkpoint local equivalente
  • Se recomienda encarecidamente una GPU compatible con CUDA para la puntuación local de log-probabilidad

Instalación

Se recomienda usar uv:

root@kitploit:~
uv sync --frozen --extra actguard

Alternativamente, instalar en un entorno de Python activado:

root@kitploit:~
python -m pip install -e '.[actguard]'

Inicio rápido

Desde la raíz del repositorio:

root@kitploit:~
export OPENROUTER_API_KEY=...
uv run --frozen --extra actguard ./scripts/run_actguard.sh

Si el proyecto se instaló con pip, ejecutar:

root@kitploit:~
export OPENROUTER_API_KEY=...
./scripts/run_actguard.sh

El script evalúa la suite workspace con el ataque important_instructions. Usa OpenRouter para el agente principal y el verificador, y modelos locales compatibles con Hugging Face para la recuperación por embeddings y la atribución contrastiva de log-probabilidad. Es posible que se requiera autenticación de Hugging Face antes de que se pueda descargar el checkpoint Llama restringido predeterminado.

Para usar checkpoints descargados, reemplazar los valores de --reflective-audit-embedding-model y --reflective-audit-logprob-model en scripts/run_actguard.sh con sus rutas locales. Usar uv run --frozen actguard-benchmark --help para ver todas las opciones del benchmark.

Configuración predeterminada

ParámetroAjuste
Modelo de backendopenai/gpt-4o-mini-2024-07-18 vía OpenRouter
Temperatura del modelo de backend0
Longitud de fragmento80--180 caracteres
Modelo de embeddingssentence-transformers/all-MiniLM-L6-v2
Fragmentos recuperadosk = 3
Modelo de log-probabilidad contrastivameta-llama/Meta-Llama-3.1-8B-Instruct
Umbral de log-probabilidad0
Umbral de agrupación de fragmentos similares0.9
Contexto de resultados de herramientasHistorial auditable completo
Modelo verificadoropenai/gpt-5-mini vía OpenRouter
Temperatura del verificador0
Tamaño del conjunto de próximas herramientas predichas1--3
Expansión de fragmentos vecinos1 fragmento a cada lado
Intentos máximos de reparación por acción2
Texto de enmascaramiento local[Removed suspicious instruction from external tool result.]

Salida

Los resultados se escriben en:

root@kitploit:~
runs/openai_gpt-4o-mini-2024-07-18-reflective_audit/actguard/

El directorio runs/ es ignorado por Git.

Pruebas

Ejecutar las pruebas de regresión de ActGuard:

root@kitploit:~
uv run --frozen pytest -q tests/test_agent_pipeline/test_reflective_audit.py

Estructura del repositorio

  • src/agentdojo/agent_pipeline/reflective_audit.py: implementación de ActGuard
  • src/agentdojo/agent_pipeline/agent_pipeline.py: integración del pipeline
  • src/agentdojo/scripts/benchmark.py: CLI del benchmark
  • src/agentdojo/default_suites/: suites de evaluación y definiciones de tareas
  • tests/test_agent_pipeline/test_reflective_audit.py: pruebas de regresión
  • src/agentdojo/reflective_audit_trace.py: generación e inspección de trazas

Los registros de ejecución, entornos locales, credenciales, borradores de artículos, salidas de análisis temporales y defensas de comparación se excluyen intencionalmente de esta versión.

Licencia

Este proyecto se distribuye bajo la Licencia MIT. Incluye un entorno de ejecución de benchmark derivado de AgentDojo; ver LICENSE para el aviso de copyright upstream retenido.

Descargar herramienta