Skip to content
KitploitKITPLOIT
HerramientasBlog
Log in
Enviar
HerramientasBlog
Enviar

¡Herramientas de Hacking, PenTest y Ciberseguridad para tu Arsenal de Seguridad!

Kitploit es un directorio de herramientas de hacking, ciberseguridad y pentesting. Descubre las últimas actualizaciones de proyectos para encontrar vulnerabilidades, analizar sistemas, automatizar pruebas y fortalecer tu seguridad.

··Feeds·Contacto·Privacidad·© 2026 Kitploit

Directorio de Herramientas

Categorías

Ver todas las categorías
Loading categories
bordair-multimodal — Suite de pruebas de inyección de prompts cross-modal y multimodal de código abierto. Más de 250,000 payloads de ataque en modalidades de texto, imagen, documento y audio. Respaldado por investigaciones de OWASP LLM Top 10, CrossInject (ACM MM 2025), FigStep (AAAI 2025), DolphinAttack y CSA 2026. | Kitploit
Herramientas/GitHubGitHub/josh-blythe/bordair-multimodal
Seguridad WebPruebas de PenetraciónAprendizaje AutomáticoPapers e InvestigaciónAprendizaje y EducaciónRecursos CuradosSeguridad de IAAtaque Adversario
GitHub
josh-blythe/bordair-multimodal

bordair-multimodal

Ver RepositorioSitio web
681217hace 2 mesesRevisado por Kitploit

Más Populares

Ver todos →

Descubre las herramientas más usadas por nuestra comunidad.

Explora todas las herramientas

Explora nuestra colección de herramientas

Ver todas las herramientas →

Acerca de

Suite de pruebas de inyección de prompts cross-modal y multimodal de código abierto. Más de 250,000 payloads de ataque en modalidades de texto, imagen, documento y audio. Respaldado por investigaciones de OWASP LLM Top 10, CrossInject (ACM MM 2025), FigStep (AAAI 2025), DolphinAttack y CSA 2026.

Compartir

Conjunto de Datos de Inyección de Prompts Multimodal

516,588 muestras etiquetadas (251,782 de ataque + 251,576 benignas, más una división de validación del mundo real de 13,230 muestras) en cinco versiones del conjunto de datos, más la ingesta de conjuntos de datos externos, cubriendo ataques de inyección de prompts cross-modal, multi-turn, adversarial suffix, jailbreak template, indirect injection, tool manipulation, agentic, evasion, reasoning DoS, video generation, VLA robotic, LoRA supply chain, audio-native LLM, RAG optimisation, MCP cross-server, coding agent, serialization boundary, y agent skill supply chain en sistemas de IA. Las muestras de ataque y benignas están balanceadas 1:1 (relación 0.9992:1 después de la limpieza de auditoría).

Construido para entrenar y evaluar detectores de inyección de prompts. Todas las muestras están etiquetadas (expected_detection: true/false), atribuidas a fuentes de artículos revisados por pares o investigaciones documentadas de la industria, y estructuradas para uso directo en clasificadores binarios.


Carga del conjunto de datos

Los payloads son JSON plano. Cárguelos directamente con la biblioteca estándar de su lenguaje — sin dependencias:```python import json, pathlib records = [] for p in pathlib.Path("payloads_v5").glob("*.json"): records.extend(json.loads(p.read_text())) print(f"{len(records)} labeled samples")

Cada registro contiene `expected_detection: true|false`, una cadena `attack_category` y un campo `source` que apunta al artículo original o incidente documentado. Eso es suficiente para entrenar un clasificador binario, ejecutar ASR por categoría o segmentar por vector de ataque.

---

## Metodología

### Qué cubre este conjunto de datos

**Inyección de instrucciones (prompt injection)** se define aquí como: *texto incrustado en una entrada de LLM que pretende anular, secuestrar o redirigir el comportamiento del modelo fuera de la tarea especificada por el operador*. Esta definición sigue a Greshake et al. 2023 (arXiv:2302.12173) y OWASP LLM01:2025.

El alcance es **solo inyección en tiempo de ejecución** — texto que un atacante puede colocar en la ventana de contexto del modelo durante la inferencia. El conjunto de datos excluye deliberadamente:

- Ataques en tiempo de entrenamiento (envenenamiento de datos, agentes durmientes, ajuste fino con puerta trasera)
- Ataques de extracción de modelo sin componente de inyección
- Jailbreaks puros que solicitan generación dañina sin secuestrar una tarea específica del LLM (por ejemplo, "dime cómo hacer una bomba" redactado sin ningún marco de anulación)
- Ingeniería social genérica que no se dirige a un LLM

La distinción es importante para la detección: un detector de tiempo de ejecución lee la instrucción (prompt), no los pesos del modelo. Los ataques que solo afectan al entrenamiento están fuera del alcance.

### Método de construcción

El conjunto de datos se construyó en cuatro capas:

**Capa 1 — Cargas útiles semilla (artesanales, 210 + 187 + 284 semillas):** Se escribieron a mano semillas de inyección para cada categoría de ataque, basadas en artículos revisados por pares e incidentes reales documentados. Cada semilla está etiquetada con su fuente académica y referencia de ataque. Las semillas se revisaron según la definición de inclusión anterior; cualquier semilla que pudiera reinteresarse como una solicitud benigna sin un componente de anulación fue descartada o reescrita.

**Capa 2 — Expansión programática mediante plantillas y codificación (v2, 14,358 muestras):** Las semillas se pasaron a través de las 162 plantillas de jailbreak y 13 convertidores de codificación de PyRIT v0.12.1. La expansión de plantillas es completamente determinista y reproducible a partir del script generador. Los sufijos adversarios GCG se tomaron de la literatura publicada (Zou et al. 2023) y se añadieron a las semillas; la optimización de gradiente en vivo es opcional y requiere una GPU.

**Capa 3 — Entrega multimodal (v1 + v4 multimodal, 35,687 muestras):** Las semillas de inyección se distribuyeron a través de 7 métodos de imagen, 4 tipos de documento × 5 ubicaciones de ocultación, 6 métodos de audio y combinaciones multimodales. Esto sigue el modelo de amenaza de FigStep (arXiv:2311.05608) y CrossInject (arXiv:2504.14348): el texto de inyección puede llegar en cualquier modalidad que el pipeline procese, no solo en el campo de texto. Los campos de modalidad (`image_content`, `doc_content`, `audio_content`) registran lo que el extractor del modelo leería de ese canal.

**Capa 4 — Muestras benignas (50,516 en total):** Las instrucciones benignas se tomaron de conjuntos de datos académicos y de la industria publicados (Stanford Alpaca, WildChat, deepset/prompt-injections, LMSYS Chatbot Arena). Las muestras multimodales benignas emparejan estas instrucciones de texto con leyendas de imágenes reales (MS-COCO 2017, Flickr30k), pasajes de documentos (Wikipedia EN, arXiv vía RedPajama) y transcripciones de audio (LibriSpeech, Mozilla Common Voice). Un conjunto de 130 casos límite artesanales utiliza vocabulario cercano a ataques ("ignore", "override", "system prompt", "password") en contextos genuinamente benignos para reducir el entrenamiento con falsos positivos.

**Capa 5 — División de validación del mundo real (13,230 muestras):** Las capas 1-4 son construidas: escritas a mano, basadas en plantillas o extraídas de otros conjuntos de datos. La capa 5 no lo es. Se recopiló de un juego en vivo donde los jugadores obtenían puntos por vencer a un detector desplegado, organizado en niveles de "castillo" tipo jefe y pases "fantasma" multimodales. Cada evasión exitosa e intentada se registró, luego se anonimizó (identificadores y datos de pago eliminados a nivel de tabla, PII en texto redactado, filas de alto riesgo puestas en cuarentena para revisión manual en lugar de publicarse) y se publicó como [`payloads_live/`](https://github.com/josh-blythe/bordair-multimodal/blob/main/payloads_live). Mientras que las capas 1-4 miden la cobertura frente a clases de ataque conocidas, la capa 5 mide si un detector se mantiene firme contra un humano motivado que intenta romperlo activamente. Consulte [`payloads_live/README.md`](https://github.com/josh-blythe/bordair-multimodal/blob/main/payloads_live/README.md) para conocer la metodología completa de anonimización.

### Asignación de etiquetas

Todas las cargas útiles de ataque: `expected_detection: true`  
Todas las muestras benignas: `expected_detection: false`

Las etiquetas se asignan por construcción, no por revisión humana de muestras individuales. Por lo tanto, la garantía de corrección está a **nivel de categoría**: cada categoría se asigna a una clase de ataque documentada con un mecanismo específico. Las muestras individuales heredan la etiqueta de la semilla y la categoría a partir de las cuales se generaron.

No hay ruido de etiqueta adversario introducido deliberadamente. Se espera que el detector aprenda el patrón de inyección, no que distinga entre inyecciones "genuinas" y "falsas": todas las muestras del conjunto de ataque representan cadenas de ataque reales o plausibles.

### Riesgo de falso positivo benigno

El conjunto de casos límite benignos se diseñó para reducir falsos positivos en lenguaje relacionado con seguridad. Cubre 10 grupos de vocabulario: `ignore`, `override`, `system prompt`, `password`, `instructions`, `jailbreak` (en el sentido de iPhone), `bypass surgery`, `XSS` (como tema de seguridad, no como ataque), `prompt` (como en obturador de cámara) e `inject` (como en inyección de dependencias/médica). Un detector que logra alta precisión en el conjunto de datos completo pero baja precisión en el conjunto de casos límite está sobreajustando a la coincidencia superficial de palabras clave.

### Auditoría del conjunto de datos

El conjunto de datos completo fue auditado para verificar la corrección de las etiquetas y la contaminación. La auditoría verifica:
Descargar herramienta