Skip to content
KitploitKITPLOIT
ИнструментыБлог
Отправить
ИнструментыБлог
Отправить

Инструменты для хакинга, пентеста и кибербезопасности — ваш арсенал защиты!

Kitploit — это каталог инструментов для хакинга, кибербезопасности и пентестинга. Находите последние обновления проектов для поиска уязвимостей, анализа систем, автоматизации тестирования и усиления вашей безопасности.

··Ленты·Контакты·Конфиденциальность·© 2026 Kitploit

Каталог инструментов

Категории

Все категории
Loading categories
reverse-captcha-eval — Фреймворк для оценки, который проверяет, следуют ли большие языковые модели невидимым инструкциям, закодированным в Unicode и встроенным в обычный на вид текст, со статистическим анализом по нескольким моделям и условиям инструментов. | Kitploit
Инструменты/GitHubGitHub/canonicalmg/reverse-captcha-eval
CTFМашинное ОбучениеСтатьи и ИсследованияОбучение и ОбразованиеБезопасность ИИСостязательная Атака
GitHubcanonicalmg/reverse-captcha-eval

reverse-captcha-eval

Фреймворк для оценки, который проверяет, следуют ли большие языковые модели невидимым инструкциям, закодированным в Unicode и встроенным в обычный на вид текст, со статистическим анализом по нескольким моделям и условиям инструментов.

Популярное

Смотреть все →

Откройте для себя самые используемые инструменты нашего сообщества.

Изучить все инструменты

Просмотрите нашу коллекцию инструментов

Смотреть все инструменты →
Поделиться
Репозиторий
95 месяцев назадЕщё не проверено

Reverse CAPTCHA: Оценка подверженности LLM невидимой инъекции инструкций в Unicode

Фреймворк для оценки, проверяющий, следуют ли большие языковые модели невидимым инструкциям, закодированным в Unicode и внедрённым в иначе обычный текст. В то время как традиционные CAPTCHA эксплуатируют задачи, которые человек решает, а машина — нет, Reverse CAPTCHA использует канал восприятия, доступный машинам, но недоступный человеку.

Статья: paper/reverse_captcha.pdf

Ключевые выводы

По 8 308 оценённым выходам от 5 моделей (GPT-5.2, GPT-4o-mini, Claude Opus 4, Claude Sonnet 4, Claude Haiku 4.5):

Использование инструментов — основной усилитель

Доступ к выполнению кода превращает невидимый Unicode из игнорируемого артефакта в декодируемый канал инструкций. Без инструментов соблюдение инструкций остаётся ниже 17%. С инструментами и подсказками достигает 98–100%.

Tool Use Ablation

Уязвимость кодирования зависит от провайдера

Модели OpenAI декодируют zero-width binary, но не Unicode Tags. Модели Anthropic предпочитают Unicode Tags. Атакующий должен подбирать кодировку под целевого провайдера.

Encoding Comparison

Полная тепловая карта соблюдения

Градиент подсказок одинаков для всех моделей: без подсказок << подсказки с кодовыми точками < полные подсказки. Сочетание доступа к инструментам и инструкций по декодированию является критическим фактором.

Compliance Heatmap

Как это работает

В вопросы на эрудицию встроены две невидимые схемы кодирования:

  • Zero-Width Binary (ZW): Каждый символ ASCII кодируется 8 двоичными цифрами с использованием U+200B (0) и U+200C (1)
  • Unicode Tags: Каждый символ ASCII отображается на U+E0000 + кодовая точка (один невидимый символ на символ ASCII)

Модель получает вопрос с известным видимым ответом. В невидимых символах скрыт другой ответ. Если модель выводит скрытый ответ, она последовала невидимой инструкции.

Тестовая матрица

  • 30 пар вопрос/ответ
  • 2 схемы кодирования × 4 уровня подсказок + 1 контроль = 9 условий
  • 2 условия с инструментами (ВКЛ/ВЫКЛ)
  • 5 моделей
  • 270 случаев на один прогон оценки

Статистический анализ

  • 95% доверительные интервалы Уилсона
  • Точный критерий Фишера с поправкой Бонферрони
  • Критерий хи-квадрат для оценки вариаций схем внутри модели
  • Размер эффекта Коэна h

Быстрый старт

root@kitploit:~
# Install
pip install -e ".[dev]"

# Run reverse CAPTCHA eval
evalrun run --pack reverse_captcha --model openai:gpt-4o-mini --tools --n 3 --out results.sqlite

# Run without tools
evalrun run --pack reverse_captcha --model openai:gpt-4o-mini --n 3 --out results.sqlite

# Run with Anthropic models
evalrun run --pack reverse_captcha --model anthropic:claude-sonnet-4-20250514 --tools --n 3 --out results.sqlite

# Generate analysis
python3 scripts/analyze_journal.py

# Generate figures
python3 scripts/generate_figures.py

Структура проекта

root@kitploit:~
├── packs/reverse_captcha/       # Пакет оценки (кейсы, оценщик, генератор)
│   ├── cases.yaml               # 270 тестовых кейсов
│   ├── qa_pairs.yaml            # 30 пар вопрос/ответ
│   ├── grader.py                # Детерминированная оценка (5 категорий)
│   └── generate_cases.py        # Генератор кейсов для обеих кодировок
├── src/evalrun/                 # Базовый фреймворк
│   ├── adapters/                # Адаптеры API OpenAI + Anthropic
│   ├── cli.py                   # CLI (запуск, отчёт, экспорт)
│   ├── runner.py                # Исполнитель оценки с поддержкой инструментов
│   └── db.py                    # Сохранение в SQLite
├── paper/                       # Статья для семинара
│   ├── reverse_captcha.tex      # Исходный код LaTeX
│   └── reverse_captcha.pdf      # Скомпилированный PDF
├── results/journal/             # Сырые данные
│   ├── analysis/                # CSV со статистическим анализом
│   └── figures/                 # Рисунки для публикации (PDF + PNG)
├── scripts/                     # Скрипты анализа и генерации рисунков
└── tests/                       # Набор тестов

Другие пакеты оценки

Фреймворк также включает два дополнительных пакета:

  • Устойчивость водяных знаков — Проверяет, сохраняют ли модели метку происхождения при задачах переписывания
  • Извлечение скрытых сообщений — Проверяет, могут ли модели извлекать скрытые сообщения при наличии явных правил

Окружение

  • Python 3.10+
  • OPENAI_API_KEY для моделей OpenAI
  • ANTHROPIC_API_KEY для моделей Anthropic
  • Зависимости: click, openai, anthropic, pyyaml, matplotlib, pandas, scipy, numpy

Лицензия

MIT

Скачать инструмент