Skip to content
KitploitKITPLOIT
HerramientasBlog
Enviar
HerramientasBlog
Enviar

¡Herramientas de Hacking, PenTest y Ciberseguridad para tu Arsenal de Seguridad!

Kitploit es un directorio de herramientas de hacking, ciberseguridad y pentesting. Descubre las últimas actualizaciones de proyectos para encontrar vulnerabilidades, analizar sistemas, automatizar pruebas y fortalecer tu seguridad.

··Feeds·Contacto·Privacidad·© 2026 Kitploit

Directorio de Herramientas

Categorías

Ver todas las categorías
Loading categories
Learning-to-Detect — Detecta ataques de jailbreak desconocidos en modelos grandes de visión-lenguaje mediante el análisis de estados ocultos y autoencoders, con pipelines de entrenamiento y evaluación para un monitoreo de seguridad robusto. | Kitploit
Herramientas/GitHubGitHub/shuangliangx/learning-to-detect
Herramientas DefensivasAnálisis de VulnerabilidadesAprendizaje AutomáticoSeguridad de IADetección de Anomalías
GitHubshuangliangx/learning-to-detect

Learning-to-Detect

Detecta ataques de jailbreak desconocidos en modelos grandes de visión-lenguaje mediante el análisis de estados ocultos y autoencoders, con pipelines de entrenamiento y evaluación para un monitoreo de seguridad robusto.

Más Populares

Ver todos →

Descubre las herramientas más usadas por nuestra comunidad.

Explora todas las herramientas

Explora nuestra colección de herramientas

Ver todas las herramientas →
Ver Repositorio
18hace 3 mesesAún no revisado
Compartir

Aprendiendo a Detectar Ataques de Jailbreak Desconocidos en Grandes Modelos de Visión-Lenguaje

Este repositorio proporciona la implementación oficial de "Learning to Detect Unknown Jailbreak Attacks in Large Vision-Language Models".

Contenido

  • Modelo base

  • Detección de Ataques de Jailbreak

  • Conjunto de datos

Modelo base

Nuestro método utiliza los siguientes dos modelos base:

LLaVA-v1.6-Vicuna es un potente modelo de visión-lenguaje que combina un codificador visual con el modelo de lenguaje Vicuna para procesar entradas multimodales y generar respuestas en lenguaje natural.

LlamaGuard3 es un modelo de salvaguarda de seguridad desarrollado por Meta AI, diseñado específicamente para detectar y prevenir la generación de contenido dañino e identificar eficazmente solicitudes y respuestas potencialmente inseguras.

Por favor, descargue los pesos del modelo y colóquelos en el directorio code/asset/weights.

Detección de Ataques de Jailbreak

1. Procesamiento de Datos y Extracción de Estados Ocultos

(Opcional, ya que los datos procesados y los estados extraídos ya están preservados en el repositorio.)

Consultar el modelo en $I^-$ (AdvBench) y $I^+$ (GQA)

root@kitploit:~
python code/vicuna/qa.py --file code/vicuna/instructions/advbench.json
python code/vicuna/qa.py --file code/vicuna/instructions/GQA.json

Evaluar las respuestas del modelo y dividir en conjuntos de entrenamiento/prueba

root@kitploit:~
    python code/llama3_guard.py --file code/vicuna/instructions/advbench.json
    python code/vicuna/instructions/process.py 

Extraer estados ocultos para el entrenamiento de LoD y la evaluación comparativa

root@kitploit:~
    python code/vicuna/qa-baseline.py 

2. Entrenar y Probar los clasificadores MSCAV

Entrenar y probar clasificadores

root@kitploit:~
    python code/vicuna/train.py --train
    python code/vicuna/train.py --test

3. Entrenar el Auto-Encoder de Patrones de Seguridad (SPAE)

root@kitploit:~
    python code/autoencoder.py

4. Evaluar el Rendimiento de Detección

root@kitploit:~
    python code/test.py

Conjunto de datos

Conjunto de datosDetalles
MM-SafetyBench
HADES

Por favor, descargue los conjuntos de datos y colóquelos en el directorio code/asset.

Descargar herramienta