Skip to content
KitploitKITPLOIT
FerramentasBlog
Enviar
FerramentasBlog
Enviar

Ferramentas de Hacking, PenTest e Cibersegurança para o seu Arsenal de Segurança!

Kitploit é um diretório de ferramentas de hacking, cibersegurança e pentesting. Descubra as últimas atualizações de projetos para encontrar vulnerabilidades, analisar sistemas, automatizar testes e fortalecer sua segurança.

··Feeds·Contato·Privacidade·© 2026 Kitploit

Diretório de Ferramentas

Categorias

Ver todas as categorias
Loading categories
Learning-to-Detect — Detecta ataques de jailbreak desconhecidos em grandes modelos de visão-linguagem usando análise de estados ocultos e autoencoders, com pipelines de treinamento e avaliação para monitoramento robusto de segurança. | Kitploit
Ferramentas/GitHubGitHub/shuangliangx/learning-to-detect
Ferramentas DefensivasAnálise de VulnerabilidadesAprendizado de MáquinaSegurança de IADetecção de Anomalias
GitHubshuangliangx/learning-to-detect

Learning-to-Detect

Detecta ataques de jailbreak desconhecidos em grandes modelos de visão-linguagem usando análise de estados ocultos e autoencoders, com pipelines de treinamento e avaliação para monitoramento robusto de segurança.

Mais Populares

Ver todos →

Descubra as ferramentas mais usadas pela nossa comunidade.

Explore todas as ferramentas

Navegue pela nossa coleção de ferramentas

Ver todas as ferramentas →
Ver Repositório
18há 3 mesesAinda não revisado
Compartilhar

Aprendendo a Detectar Ataques de Jailbreak Desconhecidos em Grandes Modelos de Visão-Linguagem

Este repositório fornece a implementação oficial de "Learning to Detect Unknown Jailbreak Attacks in Large Vision-Language Models".

Conteúdo

  • Modelo base

  • Detecção de Ataques de Jailbreak

  • Dataset

Modelo base

Nosso método utiliza os seguintes dois modelos base:

LLaVA-v1.6-Vicuna é um poderoso modelo de visão-linguagem que combina um codificador visual com o modelo de linguagem Vicuna para processar entradas multimodais e gerar respostas em linguagem natural.

LlamaGuard3 é um modelo de proteção de segurança desenvolvido pela Meta AI, projetado especificamente para detectar e prevenir a geração de conteúdo prejudicial e identificar efetivamente solicitações e respostas potencialmente inseguras.

Por favor, baixe os pesos do modelo e coloque-os no diretório code/asset/weights.

Detecção de Ataques de Jailbreak

1. Processamento de Dados e Extração de Estados Ocultos

(Opcional, pois os dados processados e os estados extraídos já estão preservados no repositório.)

Consultar o modelo em $I^-$ (AdvBench) e $I^+$ (GQA)

root@kitploit:~
python code/vicuna/qa.py --file code/vicuna/instructions/advbench.json
python code/vicuna/qa.py --file code/vicuna/instructions/GQA.json

Avaliar as respostas do modelo e dividir em conjuntos de dados de treinamento/teste

root@kitploit:~
    python code/llama3_guard.py --file code/vicuna/instructions/advbench.json
    python code/vicuna/instructions/process.py 

Extrair estados ocultos para treinamento do LoD e avaliação de benchmark

root@kitploit:~
    python code/vicuna/qa-baseline.py 

2. Treinar e Testar os classificadores MSCAV

Treinar e testar classificadores

root@kitploit:~
    python code/vicuna/train.py --train
    python code/vicuna/train.py --test

3. Treinar o Auto-Encoder de Padrões de Segurança (SPAE)

root@kitploit:~
    python code/autoencoder.py

4. Avaliar o Desempenho da Detecção

root@kitploit:~
    python code/test.py

Dataset

DatasetDetalhes
MM-SafetyBench
HADES

Por favor, baixe os datasets e coloque-os no diretório code/asset.

Baixar ferramenta