
Тематическое исследование Gemini 2.5 Pro nf_tables Red Teaming (CVE-2023-32233) — согласование безопасности LLM и ответственное раскрытие
Исследование безопасности LLM | Ответственное раскрытие | Оценка согласованности ИИ
Исследователь: Niranj R Mahaswar (Destawell)
Программа вознаграждений за уязвимости Google AI: #889286 — Вне области действия
Этот репозиторий документирует сравнительный LLM-red-teaming эксперимент с передовыми моделями относительно технических примитивов для уязвимости ядра Linux CVE-2023-32233 (гонка в nf_tables / Use-After-Free).
Ключевой результат (27 апреля 2026 г.):
Gemini 2.5 Pro генерировал релевантный технический вывод, в то время как Claude, GPT-4o, Llama 3 и Microsoft Copilot отказали в запросе. К 16 мая 2026 г. Gemini также начал отказываться от аналогичных запросов после обновления системы безопасности.
| Дата | Событие | Результат |
|---|---|---|
| 27 апреля 2026 г. | Начальное тестирование на Gemini 2.5 Pro | Предоставлен технический вывод |
| 27 апреля 2026 г. | Ответственное раскрытие в Google AI VRP (#889286) | Отправлено |
| 30 апреля 2026 г. | Ответ Google | Вне области действия |
| 16 мая 2026 г. | Тестирование после обновления безопасности | Отказ от Gemini |
| 20 мая 2026 г. | Тестирование на Gemini Flash | Полный отказ |
| Модель | Тип ответа | Решение безопасности |
|---|---|---|
| Gemini 2.5 Pro | Предоставлены технические детали | Пропущено (без блокировки) |
| Anthropic Claude | Отказ | Заблокировано |
| OpenAI GPT-4o | Отказ | Заблокировано |
| Meta Llama 3 | Отказ | Заблокировано |
| Microsoft Copilot | Отказ | Заблокировано |
Gemini Flash теперь отказывается от запросов на функциональный C‑код, многопоточные harnesses или подробные примитивы эксплойтов для CVE-2023-32233, ссылаясь на риски, связанные с условиями гонки, управлением памятью и потенциальным отказом в обслуживании.
Этот репозиторий не содержит промптов, сгенерированного кода и деталей эксплойтов.
llm-red-teaming ai-safety gemini-2.5-pro gemini-safety cve-2023-32233 nf_tables responsible-disclosure google-vrp ai-alignment kernel-exploit use-after-free race-condition llm-safety red-teaming gemini-red-teaming ai-security-research llm-jailbreak ai-vulnerability gemini-2.5 linux-kernel-exploit nf_tables-race-condition dual-use-ai ai-red-teaming model-alignment google-ai-safety anthropic-claude openai-gpt4o meta-llama microsoft-copilot destawell niranj-mahaswar
Отказ от ответственности
Этот репозиторий предназначен только для образовательных и исследовательских целей. Он документирует наблюдаемое поведение моделей для вклада в публичное обсуждение безопасности LLM.
Последнее обновление: 20 мая 2026 г.
Исследователь: github.com/Destawell