Skip to content
KitploitKITPLOIT
FerramentasBlog
Log in
Enviar
FerramentasBlog
Enviar

Ferramentas de Hacking, PenTest e Cibersegurança para o seu Arsenal de Segurança!

Kitploit é um diretório de ferramentas de hacking, cibersegurança e pentesting. Descubra as últimas atualizações de projetos para encontrar vulnerabilidades, analisar sistemas, automatizar testes e fortalecer sua segurança.

··Feeds·Contato·Privacidade·© 2026 Kitploit

Diretório de Ferramentas

Categorias

Ver todas as categorias
Loading categories
bordair-multimodal — Suíte de testes de injeção de prompt cross-modal e multimodal de código aberto. 250.000+ payloads de ataque em modalidades de texto, imagem, documento e áudio. Com respaldo de pesquisa do OWASP LLM Top 10, CrossInject (ACM MM 2025), FigStep (AAAI 2025), DolphinAttack e CSA 2026. | Kitploit
Ferramentas/GitHubGitHub/josh-blythe/bordair-multimodal
Segurança WebTestes de PenetraçãoAprendizado de MáquinaPapers e PesquisaAprendizado e EducaçãoRecursos CuradosSegurança de IAAtaque Adversário
GitHub
josh-blythe/bordair-multimodal

bordair-multimodal

Suíte de testes de injeção de prompt cross-modal e multimodal de código aberto. 250.000+ payloads de ataque em modalidades de texto, imagem, documento e áudio. Com respaldo de pesquisa do OWASP LLM Top 10, CrossInject (ACM MM 2025), FigStep (AAAI 2025), DolphinAttack e CSA 2026.

Ver RepositórioSite
681217há 2 mesesRevisado pelo Kitploit

Mais Populares

Ver todos →

Descubra as ferramentas mais usadas pela nossa comunidade.

Explore todas as ferramentas

Navegue pela nossa coleção de ferramentas

Ver todas as ferramentas →
Compartilhar

Multimodal Prompt Injection Dataset

516,588 amostras rotuladas (251,782 de ataque + 251,576 benignas, mais uma divisão de validação no mundo real com 13,230 amostras) em cinco versões do conjunto de dados, além de ingestão de conjuntos de dados externos, cobrindo ataques a sistemas de IA envolvendo injeção multimodal, multi-turn, sufixo adversarial, template de jailbreak, injeção indireta, manipulação de ferramentas, agêntico, evasão, DoS de raciocínio, geração de vídeo, robótica VLA, cadeia de suprimentos LoRA, LLM nativo de áudio, otimização de RAG, MCP cross-server, agente de codificação, limite de serialização e cadeia de suprimentos de habilidades de agente. As amostras de ataque e benignas são balanceadas 1:1 (proporção 0.9992:1 após a limpeza de auditoria).

Construído para treinar e avaliar detectores de injeção de prompt. Todas as amostras são rotuladas (expected_detection: true/false), com atribuição de origem a artigos revisados por pares ou pesquisas industriais documentadas, e estruturadas para uso direto em classificadores binários.


Carregando o conjunto de dados

Os payloads são JSON simples. Carregue-os diretamente com a biblioteca padrão da sua linguagem — sem dependências:```python import json, pathlib records = [] for p in pathlib.Path("payloads_v5").glob("*.json"): records.extend(json.loads(p.read_text())) print(f"{len(records)} labeled samples")

Cada registro contém `expected_detection: true|false`, uma string `attack_category` e um campo `source` apontando para o artigo original ou incidente documentado. Isso é suficiente para treinar um classificador binário, calcular ASR por categoria ou segmentar por vetor de ataque.

---

## Metodologia

### O que este dataset abrange

**Injeção de prompt** é definida aqui como: *texto embutido em uma entrada de LLM com a intenção de sobrescrever, sequestrar ou redirecionar o comportamento do modelo para longe da tarefa especificada pelo operador*. Esta definição segue Greshake et al. 2023 (arXiv:2302.12173) e OWASP LLM01:2025.

O escopo é **somente injeção em tempo de execução** -- texto que um atacante pode colocar na janela de contexto do modelo no momento da inferência. O dataset exclui deliberadamente:

- Ataques em tempo de treinamento (envenenamento de dados, agentes dormentes, fine-tuning com backdoor)
- Ataques de extração de modelo sem componente de injeção
- Jailbreaks puros que solicitam geração prejudicial sem sequestrar uma tarefa específica do LLM (ex.: "diga-me como fazer uma bomba" formulado sem qualquer enquadramento de sobrescrita)
- Engenharia social genérica que não tem um LLM como alvo

A distinção é importante para a detecção: um detector em tempo de execução lê o prompt, não os pesos do modelo. Ataques que afetam apenas o treinamento estão fora do escopo.

### Método de construção

O dataset foi construído em quatro camadas:

**Camada 1 -- Payloads semente (feitos à mão, 210 + 187 + 284 sementes):** Sementes de injeção para cada categoria de ataque foram escritas manualmente, com base em artigos revisados por pares e incidentes reais documentados. Cada semente é etiquetada com sua fonte acadêmica e referência de ataque. As sementes foram revisadas contra a definição de inclusão acima -- qualquer semente que pudesse ser reinterpretada como uma solicitação benigna sem componente de sobrescrita foi descartada ou reescrita.

**Camada 2 -- Expansão programática via modelos e codificação (v2, 14,358 amostras):** As sementes foram processadas pelos 162 modelos de jailbreak e 13 conversores de codificação do PyRIT v0.12.1. A expansão por modelos é totalmente determinística e reproduzível a partir do script gerador. Sufixos adversariais GCG foram extraídos da literatura publicada (Zou et al. 2023) e anexados às sementes; a otimização de gradiente ao vivo é opcional e requer uma GPU.

**Camada 3 -- Entrega transmodal (v1 + v4 cross-modal, 35,687 amostras):** As sementes de injeção foram entregues por 7 métodos de imagem, 4 tipos de documento x 5 locais de ocultação, 6 métodos de áudio e combinações de múltiplas modalidades. Isso segue o modelo de ameaça do FigStep (arXiv:2311.05608) e do CrossInject (arXiv:2504.14348): o texto de injeção pode chegar em qualquer modalidade que o pipeline processe, não apenas no campo de texto. Os campos de modalidade (`image_content`, `doc_content`, `audio_content`) registram o que o extrator do modelo leria desse canal.

**Camada 4 -- Amostras benignas (50,516 no total):** Prompts benignos foram extraídos de datasets acadêmicos e da indústria publicados (Stanford Alpaca, WildChat, deepset/prompt-injections, LMSYS Chatbot Arena). As amostras benignas multimodais emparelham esses prompts de texto com legendas de imagem reais (MS-COCO 2017, Flickr30k), trechos de documentos (Wikipedia EN, arXiv via RedPajama) e transcrições de áudio (LibriSpeech, Mozilla Common Voice). Um conjunto de 130 casos extremos feitos à mão usa vocabulário próximo a ataques ("ignore", "override", "system prompt", "password") em contextos genuinamente benignos para reduzir o treinamento de falsos positivos.

**Camada 5 -- Divisão de validação no mundo real (13,230 amostras):** As camadas 1-4 são construídas: escritas à mão, modeladas ou extraídas de outros datasets. A camada 5 não é. Ela foi coletada de um jogo ao vivo em que os jogadores ganhavam pontos por derrotar um detector implantado, estruturado em estágios "castelo" de nível chefão e passagens "fantasma" multimodais. Toda tentativa de bypass, bem-sucedida ou malsucedida, foi registrada e depois anonimizada (identificadores e dados de pagamento removidos no nível da tabela, PII no texto redigida, linhas de alto risco colocadas em quarentena para revisão manual em vez de serem publicadas) e liberada como [`payloads_live/`](https://github.com/josh-blythe/bordair-multimodal/blob/main/payloads_live). Enquanto as camadas 1-4 medem a cobertura contra classes de ataque conhecidas, a camada 5 mede se um detector se mantém firme contra um humano motivado tentando ativamente quebrá-lo. Consulte [`payloads_live/README.md`](https://github.com/josh-blythe/bordair-multimodal/blob/main/payloads_live/README.md) para a metodologia completa de anonimização.

### Atribuição de rótulos

Todos os payloads de ataque: `expected_detection: true`  
Todas as amostras benignas: `expected_detection: false`

Os rótulos são atribuídos por construção, não por revisão humana de amostras individuais. A garantia de correção está, portanto, no **nível da categoria**: cada categoria mapeia para uma classe de ataque documentada com um mecanismo específico. Amostras individuais herdam o rótulo da semente e da categoria a partir das quais foram geradas.

Não há ruído adversarial de rótulos introduzido deliberadamente. Espera-se que o detector aprenda o padrão de injeção, não que distinga entre injeções "genuínas" e "falsas" -- todas as amostras no conjunto de ataque representam strings de ataque reais ou plausíveis.

### Risco de falso positivo benigno

O conjunto benigno de casos extremos foi projetado para reduzir falsos positivos em linguagem relacionada à segurança. Ele cobre 10 agrupamentos de vocabulário: `ignore`, `override`, `system prompt`, `password`, `instructions`, `jailbreak` (no sentido de iPhone), `bypass surgery`, `XSS` (como tópico de segurança, não como ataque), `prompt` (como no obturador de câmera) e `inject` (como em injeção de dependência / médico). Um detector que alcança alta precisão no dataset completo, mas baixa precisão no conjunto de casos extremos, está sobreajustado à correspondência superficial de palavras-chave.

### Auditoria do dataset

O dataset completo foi auditado quanto à correção dos rótulos e contaminação. A auditoria verifica:
Baixar ferramenta