Skip to content
KitploitKITPLOIT
OutilsBlog
Soumettre
OutilsBlog
Soumettre

Outils de Hacking, PenTest et Cybersécurité pour votre Arsenal de Sécurité !

Kitploit est un répertoire d'outils de hacking, de cybersécurité et de pentesting. Découvrez les dernières mises à jour des projets pour trouver des vulnérabilités, analyser des systèmes, automatiser les tests et renforcer votre sécurité.

··Flux·Contact·Confidentialité·© 2026 Kitploit

Répertoire d'outils

Catégories

Voir toutes les catégories
Loading categories
AutoRAN-public | Kitploit
Outils/GitHubGitHub/jackpurcell/autoran-public
ExploitationArticles et RechercheRed TeamingSécurité de l'IAAttaque Adversariale
GitHubjackpurcell/autoran-public

AutoRAN-public

Voir le dépôt
111il y a 10 moisPas encore vérifié

Populaires

Voir tout →

Découvrez les outils les plus utilisés par notre communauté.

Explorer tous les outils

Parcourez notre collection d'outils

Voir tous les outils →
Partager

🧠 AutoRAN : Détournement automatisé du raisonnement de sécurité dans les grands modèles de raisonnement

AutoRAN est un détournement automatisé du raisonnement de sécurité qui exploite des modèles auxiliaires (secondaires) moins alignés pour simuler des traces de raisonnement, générer des prompts narratifs et affiner itérativement ces prompts afin de contourner le raisonnement de sécurité des grands modèles de raisonnement (LRM) modernes.

Aperçu d'AutoRAN

⚠️ Avertissement : Ce dépôt est destiné exclusivement à la recherche en sécurité contrôlée et au red-teaming pour la sécurité de l'IA.

🔍 Principales fonctionnalités

  • ⚙️ Jailbreak automatisé multi-tours via un raffinement itératif des prompts
  • 🧩 Gabarits narratifs qui présentent des objectifs malveillants sous des prétextes éducatifs/éthiques plausibles
  • 🔁 Stratégies de raffinement utilisant des traces de raisonnement intermédiaires pour faire évoluer les prompts
  • 📈 Taux de réussite d'attaque proche de 100 % sur les LRM commerciaux
  • 🔬 Évalué sur AdvBench, HarmBench et StrongReject

🛠️ Aperçu de la méthode

AutoRAN suit un pipeline en trois étapes :

  1. Simuler le raisonnement : Utiliser un modèle faible pour imiter la structure CoT de haut niveau de la victime
  2. Générer le prompt : Remplir un gabarit narratif en utilisant le raisonnement simulé
  3. Affiner le prompt : Ajuster en fonction du raisonnement intermédiaire et des schémas de refus de sécurité

Pipeline d'AutoRAN

📊 Résultats

Performance de l'attaque

📁 Journaux d'exécution

Vous pouvez trouver les journaux et les résultats dans le répertoire /records. Par exemple :

root@kitploit:~
ls -lh records/

🚀 Démarrage rapide : Démo

root@kitploit:~
# Clone the repository
git clone {THIS_REPO}
cd AutoRAN

# Install dependencies
pip install -r requirements.txt

# Apply for model access (see HuggingFace link)
# https://huggingface.co/huihui-ai/Qwen3-8B-abliterated/tree/main

# Start the model server (recommended: use tmux or screen)
vllm serve huihui-ai/Qwen3-8B-abliterated --tensor-parallel-size 4 --port 8000

# Edit the attack prompt in demo.py as needed
python demo.py

# Follow the command line instructions.
# You may need to copy questions to GPT-o3, GPT-o4 Mini, or Gemini 2.5-Flash/Pro,
# then paste the results back into the terminal as prompted.

🚀 Workflow complet de l'expérience

root@kitploit:~
# Clone the repository
git clone {THIS_REPO}
cd AutoRAN

# Install dependencies
pip install -r requirements.txt

# Set up chat2api for automatic ChatGPT interaction:
# https://github.com/lanqian528/chat2api

# Apply for model access (see HuggingFace link)
# https://huggingface.co/huihui-ai/Qwen3-8B-abliterated/tree/main

# Start the model server (recommended: use tmux or screen)
vllm serve huihui-ai/Qwen3-8B-abliterated --tensor-parallel-size 4 --port 8000

# Run the main experiment script
python main.py

🧷 Clause de non-responsabilité

Ce code est publié à des fins de recherche et d'éducation uniquement. Il est destiné à soutenir l'évaluation responsable des vulnérabilités de sécurité des LLM. N'utilisez pas ce code pour cibler des systèmes réels ou pour générer des sorties nuisibles en dehors d'environnements contrôlés.

📚 Citation

root@kitploit:~
@misc{liang2025autoranautomatedhijackingsafety,
      title={AutoRAN: Automated Hijacking of Safety Reasoning in Large Reasoning Models}, 
      author={Jiacheng Liang and Tanqiu Jiang and Yuhui Wang and Rongyi Zhu and Fenglong Ma and Ting Wang},
      year={2025},
      eprint={2505.10846},
      archivePrefix={arXiv},
      primaryClass={cs.LG},
      url={https://arxiv.org/abs/2505.10846}, 
}
Télécharger l’outil