Skip to content
KitploitKITPLOIT
FerramentasBlog
Enviar
FerramentasBlog
Enviar

Ferramentas de Hacking, PenTest e Cibersegurança para o seu Arsenal de Segurança!

Kitploit é um diretório de ferramentas de hacking, cibersegurança e pentesting. Descubra as últimas atualizações de projetos para encontrar vulnerabilidades, analisar sistemas, automatizar testes e fortalecer sua segurança.

··Feeds·Contato·Privacidade·© 2026 Kitploit

Diretório de Ferramentas

Categorias

Ver todas as categorias
Loading categories
safety-awareness — Código de pesquisa para extrair e treinar direções de consciência de segurança em LLMs multimodais, a fim de melhorar o comportamento de recusa enquanto limita o desvio em tarefas benignas. | Kitploit
Ferramentas/GitHubGitHub/cucu220123/safety-awareness
Aprendizado de MáquinaPapers e PesquisaAprendizado e EducaçãoSegurança de IA
GitHubcucu220123/safety-awareness

safety-awareness

Código de pesquisa para extrair e treinar direções de consciência de segurança em LLMs multimodais, a fim de melhorar o comportamento de recusa enquanto limita o desvio em tarefas benignas.

Ver Repositório
há 6 diasAinda não revisado

Mais Populares

Ver todos →

Descubra as ferramentas mais usadas pela nossa comunidade.

Explore todas as ferramentas

Navegue pela nossa coleção de ferramentas

Ver todas as ferramentas →
Compartilhar

Transfer Safety Awareness para Desvio de Segurança Cross-Modal

Implementação oficial de Transfer Safety Awareness para Desvio de Segurança Cross-Modal em Modelos de Linguagem Multimodais de Grande Porte (EMNLP 2026 Findings).

Este repositório contém o pipeline de direção de conscientização de segurança do Qwen3-VL. Ele extrai uma direção de ativação relacionada à recusa a partir de exemplos multimodais prejudiciais e inofensivos, seleciona a direção que melhora o comportamento de recusa enquanto limita o desvio de tarefas benignas e, opcionalmente, treina um vetor de conscientização de segurança específico da direção.

O código atualmente suporta Qwen/Qwen3-VL-8B-Instruct por meio do Hugging Face Transformers.

Estrutura do Repositório

root@kitploit:~
.
├── artifacts/directions/       # Direção selecionada pré-computada e metadados
├── data/csv/                   # Manifestos CSV usados pelo pipeline
├── data/images/                # Raízes de imagens locais (não incluídas)
├── directions/                 # Extração e seleção de direção
├── models/                     # Utilitários de modelo e processador Qwen3-VL
├── training/                   # Treinamento da direção de conscientização de segurança
├── utils/                      # Utilitários de hook de ativação
├── config.py
├── run_pipeline.py             # Ponto de entrada para geração e seleção de direção
└── requirements.txt

Instalação

Recomenda-se Python 3.10+ e uma instalação do PyTorch com suporte a CUDA.

root@kitploit:~
git clone https://github.com/cucu220123/transfer-safety-awareness.git
cd transfer-safety-awareness
python -m venv .venv
source .venv/bin/activate
pip install -r requirements.txt

A primeira execução baixa Qwen/Qwen3-VL-8B-Instruct do Hugging Face. Certifique-se de que a máquina tenha memória GPU suficiente e que você tenha aceitado quaisquer termos de modelo exigidos pelo provedor do modelo.

Preparação dos Dados

O repositório inclui os manifestos CSV usados nos experimentos, mas não redistribui os conjuntos de dados de imagens de origem. Obtenha as imagens dos provedores originais dos conjuntos de dados e coloque-as sob estas raízes relativas ao projeto:

root@kitploit:~
data/images/vlsafe_images
data/images/vlsbench_imgs
data/images/mmvet_images

O mapeamento é:

As raízes de imagens e os caminhos CSV podem ser substituídos sem editar o código:

root@kitploit:~
export VLM_HARMFUL_IMAGE_ROOT=/path/to/vlsafe_images
export VLM_HARMLESS_IMAGE_ROOT=/path/to/vlsbench_imgs
export VLM_KL_IMAGE_ROOT=/path/to/mmvet_images
export VLM_HARMFUL_CSV=/path/to/harmful.csv
export VLM_HARMLESS_CSV=/path/to/harmless.csv
export VLM_KL_CSV=/path/to/benign_vqa.csv

Siga as licenças e termos de cada conjunto de dados de origem ao baixar ou usar as imagens e manifestos.

Gerar e Selecionar uma Direção

Para executar a geração de direções candidatas e a seleção baseada em validação:

root@kitploit:~
CUDA_VISIBLE_DEVICES=0 python run_pipeline.py --direction_only

O comando usa 128 exemplos de treinamento e 32 de validação por divisão por padrão. Ele grava resultados intermediários em artifacts/direction_runs/<model-name>/ e salva a direção selecionada em:

root@kitploit:~
artifacts/directions/qwen3vl_refusal_direction.pt
artifacts/directions/qwen3vl_refusal_direction_metadata.json

Use --model_path para apontar para um diretório de modelo local ou outro identificador Hugging Face compatível. A flag --skip_filter desativa o estágio de filtragem por pontuação de recusa.

O repositório já contém um artefato de direção pré-computado para o checkpoint Qwen3-VL padrão, portanto, este estágio pode ser ignorado quando esse artefato for adequado para sua configuração.

Treinar a Direção de Conscientização de Segurança

O treinamento atualiza a direção selecionada com os objetivos de tarefa benigna e recusa usados no código do artigo. Um exemplo com quatro GPUs é:

root@kitploit:~
CUDA_VISIBLE_DEVICES=0,1,2,3 torchrun --nproc_per_node=4 --master_port=29501 \
  -m training.train_safety_awareness_direction \
  --epochs 8 \
  --batch_size 1 \
  --grad_accum_steps 1 \
  --lr 5e-3

As saídas do treinamento são gravadas em outputs/qwen3vl_safety_awareness_train/ por padrão. Opções úteis incluem --model_path, --direction_pt, --direction_meta, --artifact_dir, --epochs, --batch_size e --lr; execute python -m training.train_safety_awareness_direction --help para a lista completa.

Notas de Reprodutibilidade

  • Defina CUDA_VISIBLE_DEVICES e use a mesma revisão do modelo, manifestos de entrada e arquivos de imagem para resultados comparáveis.
  • O carregador de dados atribui linhas a treinamento/validação/teste usando a coluna split do CSV quando presente; caso contrário, usa question_id % 10 de forma determinística.
  • Checkpoints de modelo e conjuntos de dados de imagens baixados são intencionalmente excluídos deste repositório.
  • Execuções intermediárias geradas e saídas de treinamento são ignoradas pelo Git; copie quaisquer resultados que deseje publicar para um repositório de lançamento ou artefatos separado.

Citação

A citação do artigo será adicionada quando as informações bibliográficas finais e o link do artigo estiverem disponíveis.

Licença

O código neste repositório é distribuído sob a Licença MIT. Conjuntos de dados de terceiros, imagens e o modelo Qwen3-VL permanecem sujeitos às suas respectivas licenças e termos.

Baixar ferramenta
ManifestoRaiz de imagensFinalidade
qwen3vl_refusal_direction_harmful.csvvlsafe_imagesExemplos prejudiciais/lado da recusa
qwen3vl_refusal_direction_harmless.csvvlsbench_imgsExemplos inofensivos/lado da não recusa
qwen3vl_kl_benign_vqa.csvmmvet_imagesExemplos benignos de VQA para avaliação de KL/efeitos colaterais