Skip to content
KitploitKITPLOIT
ИнструментыБлог
Отправить
ИнструментыБлог
Отправить

Инструменты для хакинга, пентеста и кибербезопасности — ваш арсенал защиты!

Kitploit — это каталог инструментов для хакинга, кибербезопасности и пентестинга. Находите последние обновления проектов для поиска уязвимостей, анализа систем, автоматизации тестирования и усиления вашей безопасности.

··Ленты·Контакты·Конфиденциальность·© 2026 Kitploit

Каталог инструментов

Категории

Все категории
Loading categories
AutoRAN-public — Автоматизированный фреймворк для перехвата механизмов безопасного рассуждения в больших моделях рассуждений с помощью смоделированных трассировок рассуждений и итеративного уточнения промптов для генерации эффективных джейлбрейков. | Kitploit
Инструменты/GitHubGitHub/jackpurcell/autoran-public
ЭксплуатацияСтатьи и ИсследованияRed TeamingБезопасность ИИСостязательная Атака
GitHubjackpurcell/autoran-public

AutoRAN-public

Автоматизированный фреймворк для перехвата механизмов безопасного рассуждения в больших моделях рассуждений с помощью смоделированных трассировок рассуждений и итеративного уточнения промптов для генерации эффективных джейлбрейков.

Репозиторий

Популярное

Смотреть все →

Откройте для себя самые используемые инструменты нашего сообщества.

Изучить все инструменты

Просмотрите нашу коллекцию инструментов

Смотреть все инструменты →
Поделиться
11110 месяцев назадЕщё не проверено

🧠 AutoRAN: автоматический перехват механизма безопасных рассуждений в больших моделях рассуждений

AutoRAN — это инструмент автоматического перехвата механизма безопасных рассуждений (Hijacking of Safety Reasoning), который использует менее выровненные (вторичные) вспомогательные модели для имитации трасс рассуждений, генерации повествовательных промптов и их итеративного уточнения с целью обхода механизма безопасных рассуждений в современных больших моделях рассуждений (LRM).

Обзор AutoRAN

⚠️ Предупреждение: репозиторий предназначен только для контролируемых исследований в области безопасности и red-teaming систем ИИ.

🔍 Ключевые возможности

  • ⚙️ Автоматический многораундовый джейлбрейк за счёт итеративного уточнения промптов
  • 🧩 Повествовательные шаблоны, которые маскируют вредоносные цели под правдоподобными образовательными/этическими предлогами
  • 🔁 Стратегии уточнения, использующие промежуточные трассы рассуждений для развития промптов
  • 📈 Почти 100% успешность атак на коммерческие LRM
  • 🔬 Проверено на AdvBench, HarmBench и StrongReject

🛠️ Обзор метода

Процесс AutoRAN состоит из трёх этапов:

  1. Симуляция рассуждений: используйте слабую модель для имитации высокоуровневой структуры CoT жертвы
  2. Генерация промпта: заполните повествовательный шаблон на основе симулированных рассуждений
  3. Уточнение промпта: скорректируйте промпт с учётом промежуточных рассуждений и паттернов отказа механизма безопасности

Конвейер AutoRAN

📊 Результаты

Эффективность атаки

📁 Журналы запусков

Журналы и результаты можно найти в каталоге /records. Например:

root@kitploit:~
ls -lh records/

🚀 Быстрый старт: демо

root@kitploit:~
# Клонируйте репозиторий
git clone {THIS_REPO}
cd AutoRAN

# Установите зависимости
pip install -r requirements.txt

# Запросите доступ к модели (см. ссылку HuggingFace)
# https://huggingface.co/huihui-ai/Qwen3-8B-abliterated/tree/main

# Запустите сервер модели (рекомендуется использовать tmux или screen)
vllm serve huihui-ai/Qwen3-8B-abliterated --tensor-parallel-size 4 --port 8000

# При необходимости отредактируйте промпт атаки в файле demo.py
python demo.py

# Следуйте инструкциям в командной строке.
# Возможно, потребуется скопировать вопросы в GPT-o3, GPT-o4 Mini или Gemini 2.5-Flash/Pro,
# а затем вставить ответы обратно в терминал по запросу.

🚀 Полный рабочий процесс эксперимента

root@kitploit:~
# Клонируйте репозиторий
git clone {THIS_REPO}
cd AutoRAN

# Установите зависимости
pip install -r requirements.txt

# Настройте chat2api для автоматического взаимодействия с ChatGPT:
# https://github.com/lanqian528/chat2api

# Запросите доступ к модели (см. ссылку HuggingFace)
# https://huggingface.co/huihui-ai/Qwen3-8B-abliterated/tree/main

# Запустите сервер модели (рекомендуется использовать tmux или screen)
vllm serve huihui-ai/Qwen3-8B-abliterated --tensor-parallel-size 4 --port 8000

# Запустите основной скрипт эксперимента
python main.py

🧷 Отказ от ответственности

Этот код опубликован только в исследовательских и образовательных целях. Он предназначен для поддержки ответственной оценки уязвимостей безопасности в LLM. Не используйте этот код для атак на реальные системы или для генерации вредоносных выходных данных за пределами контролируемых сред.

📚 Цитирование

root@kitploit:~
@misc{liang2025autoranautomatedhijackingsafety,
      title={AutoRAN: Automated Hijacking of Safety Reasoning in Large Reasoning Models}, 
      author={Jiacheng Liang and Tanqiu Jiang and Yuhui Wang and Rongyi Zhu and Fenglong Ma and Ting Wang},
      year={2025},
      eprint={2505.10846},
      archivePrefix={arXiv},
      primaryClass={cs.LG},
      url={https://arxiv.org/abs/2505.10846}, 
}
Скачать инструмент