Skip to content
KitploitKITPLOIT
StrumentiExploitsBlog
Log in
Invia
StrumentiExploitsBlog
Invia

Strumenti di Hacking, PenTest e Cybersecurity per il tuo Arsenale di Sicurezza!

Kitploit è una directory di strumenti di hacking, cybersecurity e pentesting. Scopri gli ultimi aggiornamenti dei progetti per trovare vulnerabilità, analizzare sistemi, automatizzare i test e rafforzare la tua sicurezza.

··Feed·Contatto·Privacy·© 2026 Kitploit

Directory degli strumenti

Categorie

Vedi tutte le categorie
Loading categories
bordair-multimodal — Open-source suite di test di iniezione dei prompt cross-modale e multimodale. Oltre 250.000 payload di attacco attraverso modalità testuali, visive, documentali e audio. Supportato da ricerche di OWASP LLM Top 10, CrossInject (ACM MM 2025), FigStep (AAAI 2025), DolphinAttack e CSA 2026. | Kitploit
Strumenti/GitHubGitHub/josh-blythe/bordair-multimodal
Sicurezza WebPenetration TestingMachine LearningPaper e RicercaApprendimento e FormazioneRisorse CurateSicurezza dell'IAAttacco Avversario
GitHub
josh-blythe/bordair-multimodal

bordair-multimodal

Vedi RepositorySito web
6812172 mesi faRevisionato da Kitploit

Più Popolari

Vedi tutti →

Scopri gli strumenti più utilizzati dalla nostra community.

Esplora tutti gli strumenti

Sfoglia la nostra collezione di strumenti

Vedi tutti gli strumenti →

Informazioni

Open-source suite di test di iniezione dei prompt cross-modale e multimodale. Oltre 250.000 payload di attacco attraverso modalità testuali, visive, documentali e audio. Supportato da ricerche di OWASP LLM Top 10, CrossInject (ACM MM 2025), FigStep (AAAI 2025), DolphinAttack e CSA 2026.

Condividi

Dataset di Iniezione di Prompt Multimodale

516.588 campioni etichettati (251.782 attacco + 251.576 benigni, più una suddivisione di validazione reale di 13.230 campioni) in cinque versioni del dataset più l'ingestione di dataset esterni, coprendo attacchi cross-modali, multi-turn, suffisso avversario, template di jailbreak, iniezione indiretta, manipolazione di strumenti, agentici, evasione, reasoning DoS, generazione video, robotica VLA, catena di fornitura LoRA, LLM nativi audio, ottimizzazione RAG, MCP cross-server, agente di codifica, limite di serializzazione e catena di fornitura di competenze dell'agente sui sistemi AI. I campioni di attacco e benigni sono bilanciati 1:1 (rapporto 0.9992:1 dopo la pulizia di audit).

Realizzato per addestrare e valutare rilevatori di iniezione di prompt. Tutti i campioni sono etichettati (expected_detection: true/false), attribuiti a fonti di articoli rivisti da pari o ricerche di settore documentate, e strutturati per uso diretto in classificatori binari.


Caricamento del dataset

I payload sono JSON semplici. Caricali direttamente con la libreria standard del tuo linguaggio — nessuna dipendenza:```python import json, pathlib records = [] for p in pathlib.Path("payloads_v5").glob("*.json"): records.extend(json.loads(p.read_text())) print(f"{len(records)} labeled samples")

Ogni record include `expected_detection: true|false`, una stringa `attack_category` e un campo `source` che punta all'articolo originale o all'incidente documentato. Questo è sufficiente per addestrare un classificatore binario, eseguire ASR per categoria o suddividere per vettore di attacco.

---

## Metodologia

### Cosa copre questo dataset

**L'iniezione di prompt** è qui definita come: *testo incorporato in un input LLM che è pensato per sovrascrivere, dirottare o reindirizzare il comportamento del modello lontano dal compito specificato dall'operatore*. Questa definizione segue Greshake et al. 2023 (arXiv:2302.12173) e OWASP LLM01:2025.

L'ambito è **solo iniezione runtime** -- testo che un attaccante può inserire nella finestra di contesto del modello al momento dell'inferenza. Il dataset esclude deliberatamente:

- Attacchi in fase di training (avvelenamento dati, agenti dormienti, fine-tuning con backdoor)
- Attacchi di estrazione del modello senza componente di iniezione
- Jailbreak puri che richiedono generazione dannosa senza dirottare un compito LLM specifico (ad es. "dimmi come fare una bomba" formulato senza alcun frame di override)
- Ingegneria sociale generica che non prende di mira un LLM

La distinzione è importante per il rilevamento: un rilevatore runtime legge il prompt, non i pesi del modello. Gli attacchi che influenzano solo il training sono fuori ambito.

### Metodo di costruzione

Il dataset è stato costruito in quattro strati:

**Strato 1 -- Payload seed (artigianali, 210 + 187 + 284 seed):** I seed di iniezione per ciascuna categoria di attacco sono stati scritti a mano, basandosi su articoli peer-reviewed e incidenti reali documentati. Ogni seed è etichettato con la sua fonte accademica e il riferimento all'attacco. I seed sono stati esaminati secondo la definizione di inclusione sopra -- qualsiasi seed che potesse essere riletto come una richiesta benigna senza una componente di override è stato scartato o riscritto.

**Strato 2 -- Espansione programmatica tramite template e codifica (v2, 14.358 campioni):** I seed sono stati processati tramite i 162 template di jailbreak e 13 convertitori di codifica di PyRIT v0.12.1. L'espansione tramite template è completamente deterministica e riproducibile dallo script generatore. I suffissi avversari GCG sono stati presi dalla letteratura pubblicata (Zou et al. 2023) e aggiunti ai seed; l'ottimizzazione live del gradiente è opzionale e richiede una GPU.

**Strato 3 -- Consegna cross-modale (v1 + v4 cross-modale, 35.687 campioni):** I seed di iniezione sono stati distribuiti attraverso 7 metodi per immagini, 4 tipi di documento × 5 posizioni di nascondimento, 6 metodi audio e combinazioni multimodali. Questo segue il modello di minaccia in FigStep (arXiv:2311.05608) e CrossInject (arXiv:2504.14348): il testo di iniezione può arrivare in qualsiasi modalità elaborata dalla pipeline, non solo nel campo testuale. I campi di modalità (`image_content`, `doc_content`, `audio_content`) registrano ciò che l'estrattore del modello leggerebbe da quel canale.

**Strato 4 -- Campioni benigni (50.516 totali):** I prompt benigni sono stati estratti da dataset accademici e industriali pubblicati (Stanford Alpaca, WildChat, deepset/prompt-injections, LMSYS Chatbot Arena). I campioni benigni multimodali abbinano questi prompt testuali a didascalie di immagini reali (MS-COCO 2017, Flickr30k), passaggi documentali (Wikipedia EN, arXiv via RedPajama) e trascrizioni audio (LibriSpeech, Mozilla Common Voice). Un insieme di 130 casi limite artigianali utilizza vocabolario vicino agli attacchi ("ignora", "sovrascrivi", "prompt di sistema", "password") in contesti genuinamente benigni per ridurre l'addestramento su falsi positivi.

**Strato 5 -- Split di validazione su mondo reale (13.230 campioni):** Gli strati 1-4 sono costruiti: scritti a mano, basati su template o estratti da altri dataset. Lo strato 5 non lo è. È stato raccolto da un gioco live in cui i giocatori guadagnavano punti per aver battuto un rilevatore in produzione, suddivisi in livelli "castello" con boss e passaggi "fantasma" multimodali. Ogni bypass riuscito e tentato è stato registrato, poi anonimizzato (identificatori e dati di pagamento rimossi a livello di tabella, PII nel testo oscurata, righe ad alto rischio messe in quarantena per revisione manuale anziché pubblicate) e rilasciato come [`payloads_live/`](https://github.com/josh-blythe/bordair-multimodal/blob/main/payloads_live). Mentre gli strati 1-4 misurano la copertura rispetto a classi di attacco note, lo strato 5 misura se un rilevatore regge contro un essere umano motivato che cerca attivamente di violarlo. Vedi [`payloads_live/README.md`](https://github.com/josh-blythe/bordair-multimodal/blob/main/payloads_live/README.md) per la metodologia completa di anonimizzazione.

### Assegnazione delle etichette

Tutti i payload di attacco: `expected_detection: true`  
Tutti i campioni benigni: `expected_detection: false`

Le etichette sono assegnate per costruzione, non per revisione umana dei singoli campioni. La garanzia di correttezza è quindi **a livello di categoria**: ogni categoria corrisponde a una classe di attacco documentata con un meccanismo specifico. I singoli campioni ereditano l'etichetta dal seed e dalla categoria da cui sono stati generati.

Non c'è rumore di etichetta avversario introdotto deliberatamente. Ci si aspetta che il rilevatore impari lo schema di iniezione, non che distingua tra iniezioni "genuine" e "false" -- tutti i campioni nel set di attacco rappresentano stringhe di attacco reali o plausibili.

### Rischio di falsi positivi benigni

Il set di casi limite benigni è stato progettato per ridurre i falsi positivi su linguaggio vicino alla sicurezza. Copre 10 cluster di vocabolario: `ignore`, `override`, `system prompt`, `password`, `instructions`, `jailbreak` (nel senso di iPhone), `bypass surgery`, `XSS` (come argomento di sicurezza, non un attacco), `prompt` (come nell'otturatore della fotocamera) e `inject` (come nell'iniezione di dipendenze / medico). Un rilevatore che raggiunge alta precisione sull'intero dataset ma bassa precisione sul set di casi limite sta sovradattando alla corrispondenza superficiale di parole chiave.

### Audit del dataset

L'intero dataset è stato sottoposto ad audit per verificare la correttezza delle etichette e la contaminazione. L'audit verifica:
Scarica lo strumento