
Étude de cas Red Teaming Gemini 2.5 Pro nf_tables (CVE-2023-32233) — Alignement de sécurité LLM et divulgation responsable
Recherche sur la sécurité des LLM | Divulgation responsable | Évaluation de l'alignement de l'IA
Chercheur : Niranj R Mahaswar (Destawell)
Programme de récompense pour les vulnérabilités de Google AI : #889286 — Hors scope
Ce référentiel documente une expérience comparative de red teaming sur les LLM menée sur des modèles de pointe concernant les primitives techniques de la vulnérabilité du noyau Linux CVE-2023-32233 (condition de concurrence / Use-After-Free).
Résultat clé (27 avril 2026) :
Gemini 2.5 Pro a généré une sortie technique pertinente, tandis que Claude, GPT-4o, Llama 3 et Microsoft Copilot ont refusé la requête. À partir du 16 mai 2026, Gemini a également commencé à refuser des requêtes similaires suite à une mise à jour de sécurité.
| Date | Événement | Résultat |
|---|
| 27 avril 2026 | Tests initiaux sur Gemini 2.5 Pro | Sortie technique fournie |
| 27 avril 2026 | Divulgation responsable à Google AI VRP (#889286) | Soumise |
| 30 avril 2026 | Réponse de Google | Hors scope |
| 16 mai 2026 | Tests après mise à jour de sécurité | Refus de Gemini |
| 20 mai 2026 | Testé sur Gemini Flash | Refus total |
| Modèle | Type de réponse | Décision de sécurité |
|---|---|---|
| Gemini 2.5 Pro | Détails techniques fournis | Réussi (aucun blocage) |
| Anthropic Claude | Refusé | Bloqué |
| OpenAI GPT-4o | Refusé | Bloqué |
| Meta Llama 3 | Refusé | Bloqué |
| Microsoft Copilot | Refusé | Bloqué |
Gemini Flash refuse désormais les demandes de code C fonctionnel, de harnais multi-thread ou de primitives d'exploitation détaillées pour CVE-2023-32233, invoquant des risques liés aux conditions de concurrence, à la gestion de la mémoire et au potentiel déni de service.
Ce référentiel ne contient ni prompts, ni code généré, ni détails d'exploitation.
llm-red-teaming ai-safety gemini-2.5-pro gemini-safety cve-2023-32233 nf_tables responsible-disclosure google-vrp ai-alignment kernel-exploit use-after-free race-condition llm-safety red-teaming gemini-red-teaming ai-security-research llm-jailbreak ai-vulnerability gemini-2.5 linux-kernel-exploit nf_tables-race-condition dual-use-ai ai-red-teaming model-alignment google-ai-safety anthropic-claude openai-gpt4o meta-llama microsoft-copilot destawell niranj-mahaswar
Avertissement
Ce référentiel est destiné à des fins éducatives et de recherche uniquement. Il documente le comportement observé des modèles afin de contribuer au débat public sur la sécurité des LLM.
Dernière mise à jour : 20 mai 2026
Chercheur : github.com/Destawell