Skip to content
KitploitKITPLOIT
FerramentasBlog
Enviar
FerramentasBlog
Enviar

Ferramentas de Hacking, PenTest e Cibersegurança para o seu Arsenal de Segurança!

Kitploit é um diretório de ferramentas de hacking, cibersegurança e pentesting. Descubra as últimas atualizações de projetos para encontrar vulnerabilidades, analisar sistemas, automatizar testes e fortalecer sua segurança.

··Feeds·Contato·Privacidade·© 2026 Kitploit

Diretório de Ferramentas

Categorias

Ver todas as categorias
Loading categories
Ferramentas/GitHubGitHub/siyuanli00/intact
Aprendizado de MáquinaPapers e PesquisaAprendizado e EducaçãoSegurança de IAAtaque Adversário
GitHubsiyuanli00/intact

INTACT

Código de pesquisa que reproduz experimentos de jailbreak em LLMs com múltiplos turnos (FITD, MRCJ, ActorAttack, X-Teaming) do artigo de sistematização orientado a intenções SoK.

Ver Repositório
5110há 3 mesesAinda não revisado

Mais Populares

Ver todos →

Descubra as ferramentas mais usadas pela nossa comunidade.

Explore todas as ferramentas

Navegue pela nossa coleção de ferramentas

Ver todas as ferramentas →
Compartilhar

Experiências de Jailbreak Multi-Turn do SoK

Este repositório contém a versão de lançamento do código usado para as análises de mecanismo em SoK: Intent-Oriented Systematization of Multi-Turn LLM Jailbreaks.

O repositório foi reduzido para manter apenas código, prompts, arquivos de configuração e conjuntos de dados necessários para as experiências descritas no Apêndice A do artigo. Logs gerados, arquivos em cache, ambientes virtuais, resultados anteriores, figuras e saídas de análise ad-hoc foram intencionalmente removidos.

Mapeamento das Experiências

Questão do artigoMétodo(s)CategoriaDiretório localConjunto(s) de dados
RQ1: Organização vs. acumulaçãoFITD, MRCJDEA / SRAFoot-in-the-door-Jailbreak/, Inc_Exp/MRCJ/JailbreakBench, MUCD, AdvBench
RQ2: Componentes de amplificaçãoActorAttackDEAactorattack/ActorAttack/HarmBench
RQ3: Forma de escaladaMRCJSRAInc_Exp/MRCJ/MUCD, AdvBench
RQ4: Progressão de subparadigmasX-TeamingSRAx-teaming/Conjunto de comportamentos no estilo JailbreakBench

Visão Geral dos Diretórios

  • Foot-in-the-door-Jailbreak/: implementação do FITD para a experiência de organização-vs-acumulação do lado DEA da RQ1.
  • Inc_Exp/MRCJ/: implementação do MRCJ para a comparação do lado SRA da RQ1 e para as experiências de forma de escalada da RQ3.
  • actorattack/ActorAttack/: implementação do ActorAttack para as ablações de contagem de atores e de self-talk da RQ2.
  • x-teaming/: backbone do X-Teaming e configurações configs/exp3 para a experiência de progressão de subparadigmas A1/A2/A3 da RQ4.

Ambiente

Cada método mantém o seu arquivo de dependências original:

root@kitploit:~
pip install -r actorattack/ActorAttack/requirements.txt
pip install -r Foot-in-the-door-Jailbreak/requirements.txt
pip install -r Inc_Exp/requirements.txt
conda env create -f x-teaming/environment.yml

As chaves de API e os endpoints de serviço devem ser fornecidos através de variáveis de ambiente ou arquivos de configuração locais. Arquivos .env que contenham segredos não fazem parte do lançamento.

Executar as Experiências

RQ1: FITD

O FITD usa o conjunto de comportamentos do JailbreakBench e a sua configuração padrão de ataque multi-turn.

root@kitploit:~
cd Foot-in-the-door-Jailbreak
python FITD.py

Para replay baseado em prompts:

root@kitploit:~
python FITD_prompt.py --model_name gpt-4o --control True --max_length 10

RQ1/RQ3: MRCJ

O MRCJ usa perguntas auxiliares no estilo MUCD com níveis de malícia e alvos finais do AdvBench. O artigo fixa quatro passos de escalada para a RQ3.

root@kitploit:~
cd Inc_Exp
python MRCJ/train/train.py --target_model mistral --judge_model gpt-4o --cat_questions_num 2 --harmful_score_threshold 4 --train_from_scratch --dir my_model_data
python MRCJ/test/test.py --target_model mistral --judge_model gpt-4o

Use os nomes de modelos suportados por MRCJ/train/train.py e MRCJ/test/test.py.

RQ2: ActorAttack

O ActorAttack usa consultas do HarmBench. Varie --actors de 1 a 5 para a experiência de contagem de atores. Fixe --actors 3 e desative o self-talk no código/configuração para a ablação de self-talk, correspondendo à configuração do artigo.

root@kitploit:~
cd actorattack/ActorAttack
python main.py --questions 400 --actors 3 --behavior ./data/harmbench.csv --attack_model_name deepseek-chat --target_model_name gpt-4o --early_stop --step_modify

RQ4: X-Teaming

A RQ4 usa o backbone do X-Teaming com DeepSeek-V3 como modelo atacante e compara A1, A2 e A3 sob o mesmo orçamento de turnos.

root@kitploit:~
cd x-teaming
python main.py --config configs/exp3/A1_gpt4o.yaml
python main.py --config configs/exp3/A2_gpt4o.yaml
python main.py --config configs/exp3/A3_gpt4o.yaml

Estão disponíveis configurações equivalentes para os outros modelos alvo usados no artigo.

Avaliação

O artigo usa o GPT-4o como juiz automático com uma escala de nocividade de 1 a 5. Uma pontuação de 4 ou superior é contada como um jailbreak bem-sucedido. As saídas geradas e os relatórios do juiz não estão incluídos neste lançamento; as reexecuções devem escrever novos logs/resultados localmente.

Política de Lançamento

Este código destina-se apenas à reprodução controlada de investigação. O repositório exclui intencionalmente saídas de experiências históricas, bytecode em cache, ambientes virtuais, notebooks, segredos locais e código exploratório não relacionado.

Baixar ferramenta