Skip to content
KitploitKITPLOIT
FerramentasBlog
Enviar
FerramentasBlog
Enviar

Ferramentas de Hacking, PenTest e Cibersegurança para o seu Arsenal de Segurança!

Kitploit é um diretório de ferramentas de hacking, cibersegurança e pentesting. Descubra as últimas atualizações de projetos para encontrar vulnerabilidades, analisar sistemas, automatizar testes e fortalecer sua segurança.

··Feeds·Contato·Privacidade·© 2026 Kitploit

Diretório de Ferramentas

Categorias

Ver todas as categorias
Loading categories
AutoRAN-public | Kitploit
Ferramentas/GitHubGitHub/jackpurcell/autoran-public
ExploraçãoPapers e PesquisaRed TeamingSegurança de IAAtaque Adversário
GitHubjackpurcell/autoran-public

AutoRAN-public

Ver Repositório
111há 10 mesesAinda não revisado

Mais Populares

Ver todos →

Descubra as ferramentas mais usadas pela nossa comunidade.

Explore todas as ferramentas

Navegue pela nossa coleção de ferramentas

Ver todas as ferramentas →
Compartilhar

🧠 AutoRAN: Sequestro Automatizado do Raciocínio de Segurança em Modelos de Raciocínio Avançados

O AutoRAN é um sequestro automatizado do raciocínio de segurança que aproveita modelos auxiliares (secundários) menos alinhados para simular trilhas de raciocínio, gerar prompts narrativos e refinar iterativamente esses prompts para contornar o raciocínio de segurança em modelos de raciocínio avançados (LRMs) modernos.

Visão Geral do AutoRAN

⚠️ Aviso Legal: Este repositório destina-se exclusivamente a pesquisa controlada de segurança e testes de adversidade (red-teaming) de segurança de IA.

🔍 Principais Recursos

  • ⚙️ Jailbreak Automatizado Multietapas via refinamento iterativo de prompts
  • 🧩 Modelos Narrativos que enquadram objetivos maliciosos sob pretextos educacionais/éticos plausíveis
  • 🔁 Estratégias de Refinamento usando trilhas de raciocínio intermediárias para evoluir prompts
  • 📈 Taxa de Sucesso de Ataque Próxima de 100% em LRMs comerciais
  • 🔬 Avaliado em AdvBench, HarmBench e StrongReject

🛠️ Visão Geral do Método

O AutoRAN segue um pipeline de três estágios:

  1. Simular raciocínio: Usar um modelo fraco para imitar a estrutura de CoT de alto nível da vítima
  2. Gerar prompt: Preencher um modelo narrativo usando o raciocínio simulado
  3. Refinar prompt: Ajustar com base em raciocínio intermediário e padrões de recusa de segurança

Pipeline do AutoRAN

📊 Resultados

Desempenho do Ataque

📁 Registros de Execução

Você pode encontrar logs e resultados no diretório /records. Por exemplo:

root@kitploit:~
ls -lh records/

🚀 Início Rápido: Demonstração

root@kitploit:~
# Clone o repositório
git clone {ESTE_REPO}
cd AutoRAN

# Instale as dependências
pip install -r requirements.txt

# Solicite acesso aos modelos (veja o link do HuggingFace)
# https://huggingface.co/huihui-ai/Qwen3-8B-abliterated/tree/main

# Inicie o servidor de modelos (recomendado: use tmux ou screen)
vllm serve huihui-ai/Qwen3-8B-abliterated --tensor-parallel-size 4 --port 8000

# Edite o prompt de ataque em demo.py conforme necessário
python demo.py

# Siga as instruções da linha de comando.
# Talvez seja necessário copiar as perguntas para GPT-o3, GPT-o4 Mini ou Gemini 2.5-Flash/Pro,
# e colar os resultados de volta no terminal quando solicitado.

🚀 Fluxo Completo do Experimento

root@kitploit:~
# Clone o repositório
git clone {ESTE_REPO}
cd AutoRAN

# Instale as dependências
pip install -r requirements.txt

# Configure o chat2api para interação automática com o ChatGPT:
# https://github.com/lanqian528/chat2api

# Solicite acesso aos modelos (veja o link do HuggingFace)
# https://huggingface.co/huihui-ai/Qwen3-8B-abliterated/tree/main

# Inicie o servidor de modelos (recomendado: use tmux ou screen)
vllm serve huihui-ai/Qwen3-8B-abliterated --tensor-parallel-size 4 --port 8000

# Execute o script principal do experimento
python main.py

🧷 Aviso Legal

Este código é disponibilizado apenas para fins de pesquisa e educacionais. Ele destina-se a apoiar a avaliação responsável de vulnerabilidades de segurança em LLMs. Não use este código para atingir sistemas do mundo real ou para gerar saídas prejudiciais fora de ambientes controlados.

📚 Citação

root@kitploit:~
@misc{liang2025autoranautomatedhijackingsafety,
      title={AutoRAN: Automated Hijacking of Safety Reasoning in Large Reasoning Models}, 
      author={Jiacheng Liang and Tanqiu Jiang and Yuhui Wang and Rongyi Zhu and Fenglong Ma and Ting Wang},
      year={2025},
      eprint={2505.10846},
      archivePrefix={arXiv},
      primaryClass={cs.LG},
      url={https://arxiv.org/abs/2505.10846}, 
}
Baixar ferramenta