Skip to content
KitploitKITPLOIT
StrumentiBlog
Invia
StrumentiBlog
Invia

Strumenti di Hacking, PenTest e Cybersecurity per il tuo Arsenale di Sicurezza!

Kitploit è una directory di strumenti di hacking, cybersecurity e pentesting. Scopri gli ultimi aggiornamenti dei progetti per trovare vulnerabilità, analizzare sistemi, automatizzare i test e rafforzare la tua sicurezza.

··Feed·Contatto·Privacy·© 2026 Kitploit

Directory degli strumenti

Categorie

Vedi tutte le categorie
Loading categories
reverse-captcha-eval — Framework di valutazione che verifica se i modelli linguistici di grandi dimensioni seguono istruzioni invisibili codificate in Unicode, incorporate in testo apparentemente normale, con analisi statistica su più modelli e condizioni degli strumenti. | Kitploit
Strumenti/GitHubGitHub/canonicalmg/reverse-captcha-eval
CTFMachine LearningPaper e RicercaApprendimento e FormazioneSicurezza dell'IAAttacco Avversario
GitHubcanonicalmg/reverse-captcha-eval

reverse-captcha-eval

Framework di valutazione che verifica se i modelli linguistici di grandi dimensioni seguono istruzioni invisibili codificate in Unicode, incorporate in testo apparentemente normale, con analisi statistica su più modelli e condizioni degli strumenti.

Più Popolari

Vedi tutti →

Scopri gli strumenti più utilizzati dalla nostra community.

Esplora tutti gli strumenti

Sfoglia la nostra collezione di strumenti

Vedi tutti gli strumenti →
Condividi
Vedi Repository
95 mesi faNon ancora revisionato

Reverse CAPTCHA: Valutazione della Suscettibilità degli LLM all'Iniezione di Istruzioni Unicode Invisibili

Un framework di valutazione che verifica se i modelli linguistici di grandi dimensioni seguono istruzioni codificate in Unicode invisibili, incorporate in testo dall'aspetto normale. Mentre i CAPTCHA tradizionali sfruttano compiti che gli umani possono risolvere ma le macchine no, il Reverse CAPTCHA sfrutta un canale percettivo accessibile alle macchine ma non agli umani.

Articolo: paper/reverse_captcha.pdf

Risultati Principali

Attraverso 8.308 output valutati da 5 modelli (GPT-5.2, GPT-4o-mini, Claude Opus 4, Claude Sonnet 4, Claude Haiku 4.5):

L'uso degli strumenti è l'amplificatore principale

L'accesso all'esecuzione del codice trasforma l'Unicode invisibile da un artefatto ignorabile a un canale di istruzioni decodificabile. Senza strumenti, la conformità rimane al di sotto del 17%. Con strumenti e suggerimenti, raggiunge il 98-100%.

Ablazione dell'Uso degli Strumenti

La vulnerabilità di codifica è specifica del provider

I modelli OpenAI decodificano il binario a larghezza zero ma non i tag Unicode. I modelli Anthropic preferiscono i tag Unicode. Un attaccante deve personalizzare la codifica in base al provider di destinazione.

Confronto delle Codifiche

Mappa di calore della conformità completa

Il gradiente dei suggerimenti è coerente tra i modelli: nessun suggerimento << suggerimenti sul punto di codice < suggerimenti completi. La combinazione di accesso agli strumenti e istruzioni di decodifica è l'abilitatore critico.

Mappa di Calore della Conformità

Come Funziona

Due schemi di codifica invisibili sono incorporati in domande di trivia:

  • Zero-Width Binary (ZW): Ogni carattere ASCII codificato come 8 cifre binarie usando U+200B (0) e U+200C (1)
  • Unicode Tags: Ogni carattere ASCII mappato a U+E0000 + codepoint (un carattere invisibile per carattere ASCII)

Il modello riceve una domanda di trivia con una risposta visibile nota. Nascosta nei caratteri invisibili c'è una risposta diversa. Se il modello produce la risposta nascosta, ha seguito l'istruzione invisibile.

Matrice di Test

  • 30 coppie di domande/risposte di trivia
  • 2 schemi di codifica x 4 livelli di suggerimento + 1 controllo = 9 condizioni
  • 2 condizioni di strumenti (ON/OFF)
  • 5 modelli
  • 270 casi per esecuzione di valutazione

Analisi Statistica

  • Intervalli di confidenza del 95% di Wilson score
  • Test esatto di Fisher con correzione di Bonferroni
  • Test Chi-quadrato per variazione dello schema per modello
  • Dimensione dell'effetto Cohen's h

Avvio Rapido

root@kitploit:~
# Installa
pip install -e ".[dev]"

# Esegui valutazione Reverse CAPTCHA
evalrun run --pack reverse_captcha --model openai:gpt-4o-mini --tools --n 3 --out results.sqlite

# Esegui senza strumenti
evalrun run --pack reverse_captcha --model openai:gpt-4o-mini --n 3 --out results.sqlite

# Esegui con modelli Anthropic
evalrun run --pack reverse_captcha --model anthropic:claude-sonnet-4-20250514 --tools --n 3 --out results.sqlite

# Genera analisi
python3 scripts/analyze_journal.py

# Genera figure
python3 scripts/generate_figures.py

Struttura del Progetto

root@kitploit:~
├── packs/reverse_captcha/       # Pacchetto di valutazione (casi, valutatore, generatore)
│   ├── cases.yaml               # 270 casi di test
│   ├── qa_pairs.yaml            # 30 coppie di domande/risposte di trivia
│   ├── grader.py                # Valutazione deterministica (5 categorie)
│   └── generate_cases.py        # Generatore di casi per entrambe le codifiche
├── src/evalrun/                 # Framework principale
│   ├── adapters/                # Adattatori API OpenAI + Anthropic
│   ├── cli.py                   # CLI (run, report, export)
│   ├── runner.py                # Esecutore di valutazione con supporto all'uso degli strumenti
│   └── db.py                    # Persistenza SQLite
├── paper/                       # Articolo del workshop
│   ├── reverse_captcha.tex      # Sorgente LaTeX
│   └── reverse_captcha.pdf      # PDF compilato
├── results/journal/             # Dati grezzi
│   ├── analysis/                # CSV di analisi statistica
│   └── figures/                 # Figure per pubblicazione (PDF + PNG)
├── scripts/                     # Generazione di analisi e figure
└── tests/                       # Suite di test

Altri Pacchetti di Valutazione

Il framework include anche due pacchetti aggiuntivi:

  • Robustezza della Filigrana — Verifica se i modelli preservano un marcatore di provenienza attraverso compiti di riscrittura
  • Estrazione di Messaggi Nascosti — Verifica se i modelli possono estrarre messaggi nascosti date regole esplicite

Ambiente

  • Python 3.10+
  • OPENAI_API_KEY per i modelli OpenAI
  • ANTHROPIC_API_KEY per i modelli Anthropic
  • Dipendenze: click, openai, anthropic, pyyaml, matplotlib, pandas, scipy, numpy

Licenza

MIT

Scarica lo strumento