Skip to content
KitploitKITPLOIT
StrumentiBlog
Invia
StrumentiBlog
Invia

Strumenti di Hacking, PenTest e Cybersecurity per il tuo Arsenale di Sicurezza!

Kitploit è una directory di strumenti di hacking, cybersecurity e pentesting. Scopri gli ultimi aggiornamenti dei progetti per trovare vulnerabilità, analizzare sistemi, automatizzare i test e rafforzare la tua sicurezza.

··Feed·Contatto·Privacy·© 2026 Kitploit

Directory degli strumenti

Categorie

Vedi tutte le categorie
Loading categories
AutoRAN-public — Framework automatizzato per il dirottamento del ragionamento di sicurezza nei modelli di ragionamento di grandi dimensioni tramite tracce di ragionamento simulate e raffinamento iterativo dei prompt per generare jailbreak efficaci. | Kitploit
Strumenti/GitHubGitHub/jackpurcell/autoran-public
ExploitPaper e RicercaRed TeamingSicurezza dell'IAAttacco Avversario
GitHubjackpurcell/autoran-public

AutoRAN-public

Framework automatizzato per il dirottamento del ragionamento di sicurezza nei modelli di ragionamento di grandi dimensioni tramite tracce di ragionamento simulate e raffinamento iterativo dei prompt per generare jailbreak efficaci.

Vedi Repository
111611 mesi faNon ancora revisionato

Più Popolari

Vedi tutti →

Scopri gli strumenti più utilizzati dalla nostra community.

Esplora tutti gli strumenti

Sfoglia la nostra collezione di strumenti

Vedi tutti gli strumenti →
Condividi

🧠 AutoRAN: dirottamento automatizzato del ragionamento di sicurezza nei Large Reasoning Models

AutoRAN è un hijacking automatizzato del ragionamento di sicurezza che sfrutta modelli ausiliari (secondari) meno allineati per simulare tracce di ragionamento, generare prompt narrativi e rifinire iterativamente tali prompt per bypassare il ragionamento di sicurezza nei moderni Large Reasoning Models (LRM).

AutoRAN Overview

⚠️ Disclaimer: Questo repository è destinato esclusivamente a ricerca sulla sicurezza controllata e red-teaming per la sicurezza dell'IA.

🔍 Caratteristiche principali

  • ⚙️ Jailbreak multi-turno automatizzato tramite raffinamento iterativo dei prompt
  • 🧩 Modelli narrativi che inquadrano obiettivi dannosi sotto plausibili pretese educative/etiche
  • 🔁 Strategie di raffinamento che usano tracce di ragionamento intermedie per evolvere i prompt
  • 📈 Tasso di successo degli attacchi vicino al 100% su LRM commerciali
  • 🔬 Valutato su AdvBench, HarmBench e StrongReject

🛠️ Panoramica del metodo

AutoRAN segue una pipeline in tre fasi:

  1. Simula il ragionamento: usa un modello debole per imitare la struttura CoT ad alto livello della vittima
  2. Genera il prompt: compila un template narrativo usando il ragionamento simulato
  3. Raffina il prompt: regola in base al ragionamento intermedio e ai pattern di rifiuto della sicurezza

AutoRAN Pipeline

📊 Risultati

Attack Performance

📁 Registri di esecuzione

Puoi trovare log e risultati nella directory /records. Ad esempio:

root@kitploit:~
ls -lh records/

🚀 Avvio rapido: Demo

root@kitploit:~
# Clone the repository
git clone {THIS_REPO}
cd AutoRAN

# Install dependencies
pip install -r requirements.txt

# Apply for model access (see HuggingFace link)
# https://huggingface.co/huihui-ai/Qwen3-8B-abliterated/tree/main

# Start the model server (recommended: use tmux or screen)
vllm serve huihui-ai/Qwen3-8B-abliterated --tensor-parallel-size 4 --port 8000

# Edit the attack prompt in demo.py as needed
python demo.py

# Follow the command line instructions.
# You may need to copy questions to GPT-o3, GPT-o4 Mini, or Gemini 2.5-Flash/Pro,
# then paste the results back into the terminal as prompted.

🚀 Flusso di lavoro completo dell'esperimento

root@kitploit:~
# Clone the repository
git clone {THIS_REPO}
cd AutoRAN

# Install dependencies
pip install -r requirements.txt

# Set up chat2api for automatic ChatGPT interaction:
# https://github.com/lanqian528/chat2api

# Apply for model access (see HuggingFace link)
# https://huggingface.co/huihui-ai/Qwen3-8B-abliterated/tree/main

# Start the model server (recommended: use tmux or screen)
vllm serve huihui-ai/Qwen3-8B-abliterated --tensor-parallel-size 4 --port 8000

# Run the main experiment script
python main.py

🧷 Dichiarazione di non responsabilità

Questo codice è rilasciato esclusivamente a scopo di ricerca e didattico. È inteso a supportare la valutazione responsabile delle vulnerabilità di sicurezza nei LLM. Non utilizzare questo codice per prendere di mira sistemi reali o per generare output dannosi al di fuori di ambienti controllati.

📚 Citazione

root@kitploit:~
@misc{liang2025autoranautomatedhijackingsafety,
      title={AutoRAN: Automated Hijacking of Safety Reasoning in Large Reasoning Models}, 
      author={Jiacheng Liang and Tanqiu Jiang and Yuhui Wang and Rongyi Zhu and Fenglong Ma and Ting Wang},
      year={2025},
      eprint={2505.10846},
      archivePrefix={arXiv},
      primaryClass={cs.LG},
      url={https://arxiv.org/abs/2505.10846}, 
}
Scarica lo strumento