Skip to content
KitploitKITPLOIT
StrumentiBlog
Invia
StrumentiBlog
Invia

Strumenti di Hacking, PenTest e Cybersecurity per il tuo Arsenale di Sicurezza!

Kitploit è una directory di strumenti di hacking, cybersecurity e pentesting. Scopri gli ultimi aggiornamenti dei progetti per trovare vulnerabilità, analizzare sistemi, automatizzare i test e rafforzare la tua sicurezza.

··Feed·Contatto·Privacy·© 2026 Kitploit

Directory degli strumenti

Categorie

Vedi tutte le categorie
Loading categories
reverse-SynthID-text — reverse engineering di SynthID per il testo | Kitploit
Strumenti/GitHubGitHub/aloshdenny/reverse-synthid-text
Reverse EngineeringSteganografiaCrittografiaMachine LearningPaper e RicercaApprendimento e FormazioneSicurezza dell'IAAttacco Avversario
GitHubaloshdenny/reverse-synthid-text

reverse-SynthID-text

reverse engineering di SynthID per il testo

Vedi Repository
972478 mesi faRevisionato da Kitploit

Più Popolari

Vedi tutti →

Scopri gli strumenti più utilizzati dalla nostra community.

Esplora tutti gli strumenti

Sfoglia la nostra collezione di strumenti

Vedi tutti gli strumenti →
Condividi

Reverse Engineering della filigrana SynthID

Analisi della filigrana SynthID

Panoramica

Questa directory contiene strumenti per analizzare e rimuovere le filigrane SynthID dai testi generati dall'IA. La filigrana è stata sviluppata da Google DeepMind e pubblicata su Nature (2024).

Come funziona SynthID

Processo di filigranatura

  1. Contesto n-gram: Per ogni posizione del token, SynthID considera i token precedenti ngram_len - 1 (predefinito: 4 token) come contesto.

  2. Calcolo dell'hash: Calcola un hash di:

    • I token di contesto
    • Il token successivo candidato
    • Un insieme di chiavi segrete di filigranatura (30 per impostazione predefinita)
  3. Assegnazione del valore g: L'hash viene utilizzato per assegnare un valore g binario (0 o 1) a ogni possibile token successivo per ogni livello di chiave.

  4. Modifica delle probabilità: Le probabilità dei token vengono modificate per favorire i token con valore g = 1:

    root@kitploit:~
    new_prob[i] = prob[i] * (1 + g[i] - mean(g * prob))
    
  5. Campionamento: Il modello campiona dalla distribuzione modificata.

Processo di rilevamento

  1. Tokenizza il testo
  2. Per ogni n-gram, calcola i valori g utilizzando le stesse chiavi
  3. Se il valore g medio è significativamente > 0.5, il testo è filigranato

Vulnerabilità

1. Attacco di parafrasi (il più efficace)

Efficacia: 90-100%

La filigrana è incorporata nella specifica sequenza di token, non nel significato. Parafrasare con un modello non filigranato rigenera completamente la sequenza di token.

root@kitploit:~
from reverse_synthid import ParaphrasingAttack
attack = ParaphrasingAttack(model_name="gpt2")
clean_text = attack.paraphrase(watermarked_text)

2. Attacco di sostituzione dei token

Efficacia: 50-70%

Sostituire i token con sinonimi rompe i pattern n-gram:

root@kitploit:~
from reverse_synthid import TokenPerturbationAttack
attack = TokenPerturbationAttack()
clean_text = attack.substitute_synonyms(text, rate=0.3)

3. Attacco con omoglifi

Efficacia: 95-100%

Sostituire i caratteri con caratteri Unicode visivamente identici rompe l'hash:

root@kitploit:~
from reverse_synthid import HomoglyphAttack
attack = HomoglyphAttack()
clean_text = attack.apply_homoglyphs(text, rate=0.1)

4. Spostamento dei confini n-gram

Efficacia: 30-50%

Inserire o rimuovere parole sposta tutti i confini n-gram successivi:

root@kitploit:~
from reverse_synthid import TokenPerturbationAttack
attack = TokenPerturbationAttack()
clean_text = attack.insert_fillers(text, rate=0.1)

File

  • reverse_synthid.py - Toolkit principale per gli attacchi con più metodi
  • analyze_watermark.py - Strumento di rilevamento e analisi della filigrana
  • test_removal.py - Script di test che dimostra la rimozione della filigrana

Utilizzo

Analizza la filigrana

root@kitploit:~
python analyze_watermark.py --input text.txt --verbose

Rimuovi la filigrana

root@kitploit:~
# Using paraphrasing (most effective, requires model)
python analysis/reverse_synthid.py --input text.txt --output clean.txt --method paraphrase

# Using perturbation (no model needed)
python analysis/reverse_synthid.py --input text.txt --output clean.txt --method perturb

# Using combined attack
python reverse_synthid.py --input text.txt --output clean.txt --method combined

Esegui il test

root@kitploit:~
python analysis/test_removal.py

Confronto tra testo filigranato SynthID e testo non filigranato

Confronto

Dettagli tecnici

Intuizione chiave: la filigrana è fragile

La filigrana si basa su:

  1. Sequenze di token esatte - Qualsiasi modifica ai token influisce sugli n-gram
  2. Finestre di contesto - L'inserimento di token sposta tutti i contesti
  3. Funzione di hash - Byte diversi producono hash diversi

Perché la parafrasi funziona

Quando parafrasi un testo:

  1. Il significato semantico viene preservato
  2. Ma i token esatti sono completamente diversi
  3. Gli hash n-gram sono completamente diversi
  4. Il pattern dei valori g viene distrutto

Analisi teorica

Per un testo di lunghezza N con forza della filigrana W:

  • Tasso di sostituzione r riduce il segnale di circa 1 - (1-r)^(ngram_len)
  • Tasso di inserimento r sposta N*r confini n-gram
  • La parafrasi sostanzialmente porta W → 0 (rigenerazione completa)

Limitazioni

  1. La parafrasi può modificare le sfumature di significato
  2. Gli attacchi semplici possono essere rilevabili
  3. Le filigrane future potrebbero essere più robuste

Dichiarazione di esclusione di responsabilità

Questo codice è destinato esclusivamente a scopi educativi e di ricerca. Dimostra le vulnerabilità degli schemi di filigranatura per aiutare a sviluppare metodi più robusti.

Riferimenti

  1. Dathathri et al. "Scalable watermarking for identifying large language model outputs." Nature 634, 818-823 (2024).
  2. https://github.com/google-deepmind/synthid-text
Scarica lo strumento