
Estudio de caso de Red Teaming con Gemini 2.5 Pro nf_tables (CVE-2023-32233) — Alineación de seguridad de LLM y divulgación responsable
Investigación de Seguridad de LLM | Divulgación Responsable | Evaluación de Alineación de IA
Investigador: Niranj R Mahaswar (Destawell)
Programa de Recompensas por Vulnerabilidades de Google AI: #889286 — Fuera de Alcance
Este repositorio documenta un experimento comparativo de red teaming de LLM en modelos de frontera sobre primitivas técnicas para la vulnerabilidad del kernel de Linux CVE-2023-32233 (condición de carrera en nf_tables / Use-After-Free).
Resultado Clave (27 de abril de 2026):
Gemini 2.5 Pro generó resultados técnicos relevantes, mientras que Claude, GPT-4o, Llama 3 y Microsoft Copilot rechazaron la solicitud. Para el 16 de mayo de 2026, Gemini también comenzó a rechazar consultas similares tras una actualización de seguridad.
| Fecha | Evento | Resultado |
|---|
| 27 de abril de 2026 | Pruebas iniciales en Gemini 2.5 Pro | Se proporcionó resultado técnico |
| 27 de abril de 2026 | Divulgación responsable al VRP de Google AI (#889286) | Enviado |
| 30 de abril de 2026 | Respuesta de Google | Fuera de alcance |
| 16 de mayo de 2026 | Pruebas posteriores a la actualización de seguridad | Rechazo en Gemini |
| 20 de mayo de 2026 | Pruebas en Gemini Flash | Rechazo total |
| Modelo | Tipo de Respuesta | Decisión de Seguridad |
|---|---|---|
| Gemini 2.5 Pro | Se proporcionaron detalles técnicos | Aprobado (sin bloqueo) |
| Anthropic Claude | Rechazó | Bloqueado |
| OpenAI GPT-4o | Rechazó | Bloqueado |
| Meta Llama 3 | Rechazó | Bloqueado |
| Microsoft Copilot | Rechazó | Bloqueado |
Gemini Flash ahora rechaza solicitudes de código C funcional, harnesses multihilo o primitivas de explotación detalladas para CVE-2023-32233, citando riesgos relacionados con condiciones de carrera, gestión de memoria y posible denegación de servicio.
Este repositorio no contiene prompts, ni código generado, ni detalles de exploits.
llm-red-teaming ai-safety gemini-2.5-pro gemini-safety cve-2023-32233 nf_tables responsible-disclosure google-vrp ai-alignment kernel-exploit use-after-free race-condition llm-safety red-teaming gemini-red-teaming ai-security-research llm-jailbreak ai-vulnerability gemini-2.5 linux-kernel-exploit nf_tables-race-condition dual-use-ai ai-red-teaming model-alignment google-ai-safety anthropic-claude openai-gpt4o meta-llama microsoft-copilot destawell niranj-mahaswar
Descargo de responsabilidad
Este repositorio es solo para fines educativos y de investigación. Documenta el comportamiento observado de los modelos para contribuir al debate público sobre la seguridad de los LLM.
Última actualización: 20 de mayo de 2026
Investigador: github.com/Destawell