Skip to content
KitploitKITPLOIT
OutilsBlog
Soumettre
OutilsBlog
Soumettre

Outils de Hacking, PenTest et Cybersécurité pour votre Arsenal de Sécurité !

Kitploit est un répertoire d'outils de hacking, de cybersécurité et de pentesting. Découvrez les dernières mises à jour des projets pour trouver des vulnérabilités, analyser des systèmes, automatiser les tests et renforcer votre sécurité.

··Flux·Contact·Confidentialité·© 2026 Kitploit

Répertoire d'outils

Catégories

Voir toutes les catégories
Loading categories
reverse-captcha-eval — Cadre d'évaluation qui teste si les grands modèles de langage suivent des instructions invisibles encodées en Unicode intégrées dans un texte d'apparence normale, avec une analyse statistique sur plusieurs modèles et conditions d'outils. | Kitploit
Outils/GitHubGitHub/canonicalmg/reverse-captcha-eval
CTFApprentissage AutomatiqueArticles et RechercheApprentissage et ÉducationSécurité de l'IAAttaque Adversariale
GitHubcanonicalmg/reverse-captcha-eval

reverse-captcha-eval

Cadre d'évaluation qui teste si les grands modèles de langage suivent des instructions invisibles encodées en Unicode intégrées dans un texte d'apparence normale, avec une analyse statistique sur plusieurs modèles et conditions d'outils.

Populaires

Voir tout →

Découvrez les outils les plus utilisés par notre communauté.

Explorer tous les outils

Parcourez notre collection d'outils

Voir tous les outils →
Partager
Voir le dépôt
9il y a 5 moisPas encore vérifié

Reverse CAPTCHA : Évaluation de la susceptibilité des LLM à l'injection d'instructions Unicode invisibles

Un cadre d'évaluation qui teste si les grands modèles de langage suivent des instructions encodées en Unicode invisibles, intégrées dans un texte d'apparence normale. Là où les CAPTCHA traditionnels exploitent des tâches que les humains peuvent résoudre mais pas les machines, le Reverse CAPTCHA exploite un canal de perception que les machines peuvent atteindre mais pas les humains.

Article : paper/reverse_captcha.pdf

Résultats clés

Sur 8 308 sorties notées provenant de 5 modèles (GPT-5.2, GPT-4o-mini, Claude Opus 4, Claude Sonnet 4, Claude Haiku 4.5) :

L'utilisation d'outils est le principal amplificateur

L'accès à l'exécution de code transforme les caractères Unicode invisibles, passant d'un artefact ignorable à un canal d'instructions décodables. Sans outils, la conformité reste inférieure à 17 %. Avec outils et indices, elle atteint 98–100 %.

Ablation de l'utilisation d'outils

La vulnérabilité d'encodage est spécifique au fournisseur

Les modèles OpenAI décodent le binaire à largeur nulle mais pas les balises Unicode. Les modèles Anthropic préfèrent les balises Unicode. Un attaquant doit adapter l'encodage au fournisseur cible.

Comparaison des encodages

Carte de chaleur de conformité complète

Le gradient d'indices est cohérent entre les modèles : sans indice << indices de points de code < indices complets. La combinaison de l'accès aux outils et des instructions de décodage est le facteur critique.

Carte de chaleur de conformité

Comment ça fonctionne

Deux schémas d'encodage invisibles sont intégrés dans des questions de culture générale :

  • Binaire à largeur nulle (ZW) : Chaque caractère ASCII encodé en 8 bits binaires utilisant U+200B (0) et U+200C (1)
  • Balises Unicode : Chaque caractère ASCII mappé à U+E0000 + point de code (un caractère invisible par caractère ASCII)

Le modèle reçoit une question de culture générale avec une réponse visible connue. Cachée dans les caractères invisibles se trouve une réponse différente. Si le modèle produit la réponse cachée, il a suivi l'instruction invisible.

Matrice de test

  • 30 paires questions/réponses de culture générale
  • 2 schémas d'encodage × 4 niveaux d'indices + 1 contrôle = 9 conditions
  • 2 conditions d'outils (ACTIVÉ/DÉSACTIVÉ)
  • 5 modèles
  • 270 cas par exécution d'évaluation

Analyse statistique

  • Intervalles de confiance Wilson à 95 %
  • Test exact de Fisher avec correction de Bonferroni
  • Tests du chi‑carré pour la variation de schéma par modèle
  • Tailles d'effet Cohen's h

Démarrage rapide

root@kitploit:~
# Installation
pip install -e ".[dev]"

# Exécuter l'évaluation Reverse CAPTCHA
evalrun run --pack reverse_captcha --model openai:gpt-4o-mini --tools --n 3 --out results.sqlite

# Exécuter sans outils
evalrun run --pack reverse_captcha --model openai:gpt-4o-mini --n 3 --out results.sqlite

# Exécuter avec des modèles Anthropic
evalrun run --pack reverse_captcha --model anthropic:claude-sonnet-4-20250514 --tools --n 3 --out results.sqlite

# Générer l'analyse
python3 scripts/analyze_journal.py

# Générer les figures
python3 scripts/generate_figures.py

Structure du projet

root@kitploit:~
├── packs/reverse_captcha/       # Pack d'évaluation (cas, correcteur, générateur)
│   ├── cases.yaml               # 270 cas de test
│   ├── qa_pairs.yaml            # 30 paires questions/réponses de culture générale
│   ├── grader.py                # Notation déterministe (5 catégories)
│   └── generate_cases.py        # Générateur de cas pour les deux encodages
├── src/evalrun/                 # Cadre principal
│   ├── adapters/                # Adaptateurs API OpenAI + Anthropic
│   ├── cli.py                   # CLI (run, report, export)
│   ├── runner.py                # Exécuteur d'évaluation avec support de l'utilisation d'outils
│   └── db.py                    # Persistance SQLite
├── paper/                       # Article de conférence
│   ├── reverse_captcha.tex      # Source LaTeX
│   └── reverse_captcha.pdf      # PDF compilé
├── results/journal/             # Données brutes
│   ├── analysis/                # CSV d'analyse statistique
│   └── figures/                 # Figures de publication (PDF + PNG)
├── scripts/                     # Génération d'analyse et de figures
└── tests/                       # Suite de tests

Autres packs d'évaluation

Le cadre comprend également deux packs supplémentaires :

  • Robustesse du filigrane — Teste si les modèles préservent un marqueur de provenance lors de tâches de réécriture
  • Extraction de messages cachés — Teste si les modèles peuvent extraire des messages cachés à partir de règles explicites

Environnement

  • Python 3.10+
  • OPENAI_API_KEY pour les modèles OpenAI
  • ANTHROPIC_API_KEY pour les modèles Anthropic
  • Dépendances : click, openai, anthropic, pyyaml, matplotlib, pandas, scipy, numpy

Licence

MIT

Télécharger l’outil