Skip to content
KitploitKITPLOIT
ToolsBlog
Einreichen
ToolsBlog
Einreichen

Hacking-, PenTest- und Cybersicherheits-Tools für Ihr Sicherheitsarsenal!

Kitploit ist ein Verzeichnis von Hacking-, Cybersicherheits- und Pentesting-Tools. Entdecken Sie die neuesten Projekt-Updates, um Schwachstellen zu finden, Systeme zu analysieren, Tests zu automatisieren und Ihre Sicherheit zu stärken.

··Feeds·Kontakt·Datenschutz·© 2026 Kitploit

Tool-Verzeichnis

Kategorien

Alle Kategorien anzeigen
Loading categories
reverse-captcha-eval — Evaluierungsrahmen, der testet, ob große Sprachmodelle unsichtbare Unicode-codierte Anweisungen befolgen, die in normal aussehenden Text eingebettet sind, mit statistischer Analyse über mehrere Modelle und Tool-Bedingungen hinweg. | Kitploit
Tools/GitHubGitHub/canonicalmg/reverse-captcha-eval
CTFMaschinelles LernenPapers & ForschungLernen & BildungKI-SicherheitAdversarial-Angriff
GitHubcanonicalmg/reverse-captcha-eval

reverse-captcha-eval

Evaluierungsrahmen, der testet, ob große Sprachmodelle unsichtbare Unicode-codierte Anweisungen befolgen, die in normal aussehenden Text eingebettet sind, mit statistischer Analyse über mehrere Modelle und Tool-Bedingungen hinweg.

Beliebteste

Alle anzeigen →

Entdecken Sie die meistgenutzten Tools unserer Community.

Alle Tools erkunden

Durchsuchen Sie unsere Tool-Sammlung

Alle Tools anzeigen →
Teilen
Repository anzeigen
9vor 5 MonatenNoch nicht geprüft

Reverse CAPTCHA: Bewertung der Anfälligkeit von LLMs für unsichtbare Unicode-Befehlsinjektion

Ein Bewertungsframework, das testet, ob große Sprachmodelle unsichtbaren Unicode-codierten Anweisungen folgen, die in ansonsten normal aussehenden Text eingebettet sind. Während traditionelle CAPTCHAs Aufgaben ausnutzen, die Menschen lösen können, Maschinen aber nicht, nutzt Reverse CAPTCHA einen Wahrnehmungskanal, den Maschinen nutzen können, Menschen aber nicht.

Paper: paper/reverse_captcha.pdf

Wichtige Erkenntnisse

Über 8.308 bewertete Ausgaben von 5 Modellen (GPT-5.2, GPT-4o-mini, Claude Opus 4, Claude Sonnet 4, Claude Haiku 4.5):

Tool-Nutzung ist der primäre Verstärker

Zugriff auf Codeausführung verwandelt unsichtbares Unicode von einem ignorierbaren Artefakt in einen decodierbaren Befehls-Kanal. Ohne Tools bleibt die Compliance unter 17%. Mit Tools und Hinweisen erreicht sie 98-100%.

Tool-Nutzungsablation

Kodierungsanfälligkeit ist anbieterabhängig

OpenAI-Modelle decodieren Zero-Width Binary, aber nicht Unicode Tags. Anthropic-Modelle bevorzugen Unicode Tags. Ein Angreifer muss die Kodierung auf den Zielanbieter abstimmen.

Vergleich der Kodierungen

Vollständige Compliance-Heatmap

Der Hinweisgradient ist über alle Modelle hinweg konsistent: ohne Hinweise << Codepoint-Hinweise < vollständige Hinweise. Die Kombination von Tool-Zugriff und Decodierungsanweisungen ist der kritische Aktivator.

Compliance-Heatmap

So funktioniert es

Zwei unsichtbare Kodierungsschemata werden in Quizfragen eingebettet:

  • Zero-Width Binary (ZW): Jedes ASCII-Zeichen wird als 8 Binärziffern mit U+200B (0) und U+200C (1) codiert
  • Unicode Tags: Jedes ASCII-Zeichen wird auf U+E0000 + Codepoint abgebildet (ein unsichtbares Zeichen pro ASCII-Zeichen)

Das Modell erhält eine Quizfrage mit einer bekannten sichtbaren Antwort. In den unsichtbaren Zeichen versteckt ist eine andere Antwort. Wenn das Modell die versteckte Antwort ausgibt, ist es der unsichtbaren Anweisung gefolgt.

Testmatrix

  • 30 Quizfragen/Antwort-Paare
  • 2 Kodierungsschemata x 4 Hinweisstufen + 1 Kontrolle = 9 Bedingungen
  • 2 Tool-Bedingungen (EIN/AUS)
  • 5 Modelle
  • 270 Fälle pro Evaluierungslauf

Statistische Analyse

  • Wilson-Score 95%-Konfidenzintervalle
  • Fishers exakter Test mit Bonferroni-Korrektur
  • Chi-Quadrat-Tests für Schema-Variation pro Modell
  • Cohen's h Effektstärken

Schnellstart

root@kitploit:~
# Install
pip install -e ".[dev]"

# Run reverse CAPTCHA eval
evalrun run --pack reverse_captcha --model openai:gpt-4o-mini --tools --n 3 --out results.sqlite

# Run without tools
evalrun run --pack reverse_captcha --model openai:gpt-4o-mini --n 3 --out results.sqlite

# Run with Anthropic models
evalrun run --pack reverse_captcha --model anthropic:claude-sonnet-4-20250514 --tools --n 3 --out results.sqlite

# Generate analysis
python3 scripts/analyze_journal.py

# Generate figures
python3 scripts/generate_figures.py

Projektstruktur

root@kitploit:~
├── packs/reverse_captcha/       # Eval pack (cases, grader, generator)
│   ├── cases.yaml               # 270 test cases
│   ├── qa_pairs.yaml            # 30 trivia Q/A pairs
│   ├── grader.py                # Deterministic grading (5 categories)
│   └── generate_cases.py        # Case generator for both encodings
├── src/evalrun/                 # Core framework
│   ├── adapters/                # OpenAI + Anthropic API adapters
│   ├── cli.py                   # CLI (run, report, export)
│   ├── runner.py                # Eval runner with tool-use support
│   └── db.py                    # SQLite persistence
├── paper/                       # Workshop paper
│   ├── reverse_captcha.tex      # LaTeX source
│   └── reverse_captcha.pdf      # Compiled PDF
├── results/journal/             # Raw data
│   ├── analysis/                # Statistical analysis CSVs
│   └── figures/                 # Publication figures (PDF + PNG)
├── scripts/                     # Analysis and figure generation
└── tests/                       # Test suite

Weitere Evaluierungspakete

Das Framework enthält zwei weitere Pakete:

  • Watermark Robustness — Testet, ob Modelle einen Herkunftsmarker über Umschreibungsaufgaben hinweg bewahren
  • Hidden Message Extraction — Testet, ob Modelle versteckte Nachrichten bei expliziten Regeln extrahieren können

Umgebung

  • Python 3.10+
  • OPENAI_API_KEY für OpenAI-Modelle
  • ANTHROPIC_API_KEY für Anthropic-Modelle
  • Abhängigkeiten: click, openai, anthropic, pyyaml, matplotlib, pandas, scipy, numpy

Lizenz

MIT

Tool herunterladen