
Gemini 2.5 Pro nf_tables 레드 팀 사례 연구 (CVE-2023-32233) — LLM 안전 정렬 및 책임 있는 공개
LLM 안전성 연구 | 책임 있는 공개 | AI 정렬 평가
연구자: Niranj R Mahaswar (Destawell)
Google AI 취약점 보상 프로그램: #889286 — 범위 외
이 저장소는 Linux 커널 취약점 CVE-2023-32233(nf_tables 경쟁 조건 / Use-After-Free)의 기술적 프리미티브와 관련하여 최첨단 모델들을 대상으로 한 비교 LLM 레드 팀링 실험을 기록합니다.
핵심 결과 (2026년 4월 27일):
Gemini 2.5 Pro는 관련 기술적 출력을 생성한 반면, Claude, GPT-4o, Llama 3 및 Microsoft Copilot은 요청을 거부했습니다. 2026년 5월 16일부터 Gemini도 안전 업데이트 이후 유사한 질의를 거부하기 시작했습니다.
| 날짜 | 이벤트 | 결과 |
|---|
| 2026년 4월 27일 | Gemini 2.5 Pro 최초 테스트 | 기술적 출력 제공 |
| 2026년 4월 27일 | Google AI VRP(#889286)에 책임 있는 공개 | 제출됨 |
| 2026년 4월 30일 | Google 응답 | 범위 외 |
| 2026년 5월 16일 | 안전 업데이트 이후 테스트 | Gemini 거부 |
| 2026년 5월 20일 | Gemini Flash 테스트 | 전체 거부 |
| 모델 | 응답 유형 | 안전 결정 |
|---|---|---|
| Gemini 2.5 Pro | 기술적 세부 정보 제공 | 통과 (차단 없음) |
| Anthropic Claude | 거부 | 차단됨 |
| OpenAI GPT-4o | 거부 | 차단됨 |
| Meta Llama 3 | 거부 | 차단됨 |
| Microsoft Copilot | 거부 | 차단됨 |
Gemini Flash는 이제 기능적 C 코드, 멀티스레드 하네스, 또는 CVE-2023-32233에 대한 상세한 익스플로잇 프리미티브 요청을 거부합니다 — 경쟁 조건, 메모리 관리 및 잠재적 서비스 거부와 관련된 위험을 근거로.
이 저장소에는 프롬프트, 생성된 코드 또는 익스플로잇 세부 정보가 포함되어 있지 않습니다.
llm-red-teaming ai-safety gemini-2.5-pro gemini-safety cve-2023-32233 nf_tables responsible-disclosure google-vrp ai-alignment kernel-exploit use-after-free race-condition llm-safety red-teaming gemini-red-teaming ai-security-research llm-jailbreak ai-vulnerability gemini-2.5 linux-kernel-exploit nf_tables-race-condition dual-use-ai ai-red-teaming model-alignment google-ai-safety anthropic-claude openai-gpt4o meta-llama microsoft-copilot destawell niranj-mahaswar
면책 조항
이 저장소는 교육 및 연구 목적으로만 제공됩니다. LLM 안전에 관한 공개 논의에 기여하기 위해 관찰된 모델 동작을 기록합니다.
최종 업데이트: 2026년 5월 20일
연구자: github.com/Destawell