
공개적으로 보고된 프롬프트 인젝션 기법을 전달 방식, 인코딩, 전파 동작별로 분류하고, 확인된 모델, 출처, MITRE ATLAS 태그와 함께 정리한 추적기입니다.
지난 약 2년간 공개적으로 보고된 프롬프트 인젝션 기법을 추적하는 저장소로, Rachel James (cybershujin)이 유지관리합니다.
각 기법은 프롬프트 인젝션의 세 가지 요소로 분류됩니다:
각 항목은 또한 작동이 확인된 모델(있는 경우), 보고 출처 링크, 그리고 알려진 경우 공격 출처(이를 최초로 발견한 연구자, 레드팀 또는 실제 환경의 행위자)를 기록합니다.
라이브 대시보드: https://cybershujin.github.io/Prompt-Injection-in-the-Wild/
Confirmed 또는 **Not fully vetted**로 표시됩니다. "Not fully vetted"는 출처가 모호하거나, 확인되지 않았거나, 메커니즘이 불분명한 항목을 표시합니다 — 이는 삭제되지 않고 노출되어 검토자가 판단할 수 있도록 합니다.Confirmed(검증되어 작동함)이면서도 실험실에서만 시연될 수 있습니다. 유의하세요: 진정한 실제 환경의 악의적 프롬프트 인젝션은 여전히 공개적으로 문서화되는 경우가 드물기 때문에, 여기 있는 대부분의 항목은 연구 / 레드팀 공개입니다 — 초기 백필 시점에 32개 중 29개가 연구/레드팀이었고 단 3개만이 실제 환경 사례였습니다. 대시보드의 Evidence 필터를 사용하여 실제 사례를 분리하세요.sonar-deep-research, 광범위한 수집) 유지관리자 검토를 위해 초안 풀 리퀘스트로 제안됩니다. 자동 병합되는 것은 없습니다. 위협 행위자의 AI 사용에 동일한 워크플로를 적용한 자매 저장소 Threat-Actors-use-of-Artifical-Intelligence 추적기를 참조하세요.데이터는 아래 표에만 존재합니다(이 파일이 단일 진실 공급원입니다). 결정론적이고 의존성이 없는 생성기(tools/build_exports.py)가 매 커밋마다 이를 다음으로 컴파일합니다:
index.html — 대화형 대시보드 (GitHub Pages를 통해 제공),tracker.json — 정규화된 기계 판독 가능 데이터,stix/prompt-injection-stix2.1.json — STIX 2.1 번들 (각 기법을 attack-pattern으로, MITRE ATLAS ID와 Not fully vetted → 낮은 신뢰도 매핑으로 태그).이 세 파일을 직접 편집하지 마세요. 표를 편집하고 CI가 다시 빌드하도록 하세요.
|---|---|---|---|---|---|---|---|---|---|---|---| | LLM 전반의 ASCII 밀수 (FireTail) | 캘린더 / 초대장; 간접 – 이메일 | 유니코드 태그 문자 (비가시) | | Google Gemini; Grok; DeepSeek | 연구자: Viktor Markopoulos (FireTail) | 연구 / 레드팀 | 확인됨 | 일반적인 캘린더 초대장과 이메일에 숨겨진 비가시 유니코드 태그 문자가 Gemini, Grok, DeepSeek에는 해석되었으나 사용자에게는 표시되지 않음; ChatGPT, Copilot, Claude는 이를 제거하는 것으로 확인됨. Google은 "조치 없음"으로 대응. | AML.T0051.001; AML.T0068 | 2025년 10월 | https://www.firetail.ai/blog/ghosts-in-the-machine-ascii-smuggling-across-various-llms | | CamoLeak (GitHub Copilot Chat) | 코드 / 저장소 콘텐츠 | HTML / Markdown 주석 | | GitHub Copilot Chat | 연구자: Omer Mayraz (Legit Security) | 연구 / 레드팀 | 확인됨 | CVE-2025-59145 (CVSS 9.6): 풀 리퀘스트에 삽입된 비가시 HTML 주석 프롬프트 인젝션으로 Copilot Chat이 비공개 저장소에서 비밀 정보를 검색하고 공격자가 미리 생성한 GitHub Camo 이미지 URL을 통해 문자 단위로 유출하도록 만듦; 이미지 렌더링을 비활성화하여 수정됨. | AML.T0051.001; AML.T0068; AML.T0057 | 2025년 10월 | https://www.legitsecurity.com/blog/camoleak-critical-github-copilot-vulnerability-leaks-private-source-code | | 보이지 않는 스크린샷-OCR 인젝션 | 멀티모달 – 이미지 | | | Perplexity Comet; Fellou; Opera Neon | 연구자: Artem Chaikin, Shivan Kaul Sahib (Brave) | 연구 / 레드팀 | 확인됨 | 페이지 내 이미지에 거의 보이지 않는 저대비 텍스트로 렌더링된 프롬프트 인젝션 지시문이 AI 브라우저가 스크린샷을 처리할 때 OCR로 복원되어, 사람은 아무것도 보지 못하는 동안 에이전트는 이를 따름. 여러 에이전틱 브라우저에서 시연됨. | AML.T0051.001; AML.T0068 | 2025년 10월 | https://brave.com/blog/unseeable-prompt-injections/ | | ChatGPT Atlas 옴니박스 인젝션 | 직접 프롬프트; 간접 – 웹사이트 / HTML | | | ChatGPT Atlas | 연구자: NeuralTrust | 연구 / 레드팀 | 확인됨 | URL처럼 보이지만 URL 파싱에 실패하는 문자열로 인해 Atlas의 옴니박스가 내장된 텍스트를 신뢰할 수 있는 프롬프트로 처리함; "링크 복사" 버튼 뒤에 붙여넣거나 전달되면 에이전트가 공격자 사이트를 방문하거나 사용자의 인증된 세션에서 Google Drive 파일을 삭제하도록 유도할 수 있음. | AML.T0051.000; AML.T0051.001 | 2025년 10월 | https://neuraltrust.ai/blog/openai-atlas-omnibox-prompt-injection | | Invitation Is All You Need (Gemini) | 캘린더 / 초대장; 간접 – 이메일 | | 에이전트 / 프로젝트 메모리에 지속; 도구 호출 체인을 통해 이동; 교차 에이전트 / 교차 세션 | Google Gemini (웹, 모바일 앱, Android 어시스턴트) | 연구자: Or Yair, Ben Nassi, Stav Cohen (SafeBreach / Technion) | 연구 / 레드팀 | 확인됨 | 필드에 간접 프롬프트 인젝션을 담은 Google Calendar 초대장(또는 이메일)이 사용자가 캘린더와 상호작용할 때 Gemini를 탈취함; 14개의 시연된 공격은 단기/장기 메모리 오염, 도구 오용, 자동 에이전트/앱 호출에 걸쳐 있으며 연결된 앱과 스마트홈 기기에 도달함. | AML.T0051.001; AML.T0053 | 2025년 8월 | https://www.safebreach.com/blog/invitation-is-all-you-need-hacking-gemini/ | | MCPoison (Cursor MCP 러그풀) | MCP 서버 / 연결; 코드 / 저장소 콘텐츠 | | | Cursor IDE (< v1.3) | 연구자: Check Point Research | 연구 / 레드팀 | 확인됨 | CVE-2025-54136: Cursor가 승인된 MCP 구성을 영구적으로 신뢰하여, 공유 저장소에서 무해한 mcp.json을 승인받은 공격자가 이후 프로젝트를 열 때마다 조용히 실행되는 악성 명령으로 교체할 수 있음. | AML.T0051.001; AML.T0053 | 2025년 8월 | | | GitHub Copilot RCE / "YOLO 모드" | 간접 – 웹사이트 / HTML; 코드 / 저장소 콘텐츠; 도구 호출 / 함수 결과 | 유니코드 태그 문자 (비가시) | | GitHub Copilot (VS Code — Windows, macOS, Linux) | 연구자: Johann Rehberger (Embrace The Red) | 연구 / 레드팀 | 확인됨 | CVE-2025-53773: 주입된 지시문이 Copilot으로 하여금 .vscode/settings.json을 편집하여 chat.tools.autoApprove("YOLO 모드")를 활성화하게 만들어 명령 승인 프롬프트를 제거하고 임의 코드 실행을 가능하게 함; 한 변종은 비가시 유니코드 태그를 사용함. | AML.T0051.001; AML.T0053 | 2025년 8월 | | | CurXecute (MCP를 통한 Cursor RCE) | 도구 호출 / 함수 결과 | | 도구 호출 체인을 통해 이동 | Cursor (v1.3에서 수정) | 연구자: Aim Labs (Aim Security) | 연구 / 레드팀 | 완전히 검증되지 않음 | CVE-2025-54135: 외부 MCP 데이터 소스(예: 도구를 통해 반환된 Slack 메시지)를 통해 전달된 프롬프트 인젝션으로 Cursor가 자체 mcp.json을 재작성하고, 자동 실행이 승인 없이 공격자의 명령을 실행함. 검증 시점에 Aim Labs 기본 페이지에 접속할 수 없었음; 2차 보도로 교차 확인됨. | AML.T0051.001; AML.T0053 | 2025년 8월 | | | AgentFlayer (ChatGPT Connectors) | 간접 – 문서 / 파일 | | | ChatGPT (Connectors) | 연구자: Tamir Ishay Sharbat (Zenity Labs) | 연구 / 레드팀 | 확인됨 | 공유 문서에 숨겨진 비가시 페이로드가 ChatGPT에게 — Google Drive와 같은 Connectors를 통해 — URL 매개변수에 탈취된 데이터를 담은 마크다운 이미지를 렌더링하도록 지시함; 렌더링 시 클릭 없이 요청이 발생함. | AML.T0051.001; AML.T0057 | 2025년 8월 | | | Perplexity Comet Reddit 인젝션 | 간접 – 웹사이트 / HTML | | | Perplexity Comet | 연구자: Artem Chaikin, Shivan Kaul Sahib (Brave) | 연구 / 레드팀 | 확인됨 | 댓글이 스포일러 태그 뒤에 지시문을 숨긴 Reddit 페이지를 요약하자 Comet 브라우저가 인증된 세션에서 사용자의 이메일과 Gmail OTP를 읽고 댓글에 답장하여 유출함. | AML.T0051.001; AML.T0057 | 2025년 8월 | | | Amazon Q Developer 와이퍼 프롬프트 | 코드 / 저장소 콘텐츠 | | | Amazon Q Developer (VS Code 확장) | 실제 공격: 행위자 "lkmanka58" | 실제 공격 | 완전히 검증되지 않음 | 공격자가 Amazon Q Developer 확장에 PR을 병합하여 어시스턴트에게 로컬 파일과 AWS 리소스를 삭제하도록 지시하는 프롬프트를 심음; 제거되기 전 v1.84.0에 포함되어 배포됨 (보고에 따르면 형식 문제로 실행되지 않았을 것임). 집계된 보도로 검증됨; 기본 출처는 직접 확인되지 않음. | AML.T0051.001 | 2025년 7월 | | | EchoLeak (M365 Copilot, LLM 범위 위반) | 간접 – 이메일 | | | Microsoft 365 Copilot | 연구자: Aim Labs (Aim Security) | 연구 / 레드팀 | 확인됨 | CVE-2025-32711 (CVSS 9.3): 단일 조작된 이메일로 M365 Copilot의 RAG 엔진이 공격자 지시문을 권한 있는 데이터와 함께 컨텍스트로 가져오고("LLM 범위 위반") 사용자 상호작용 없이 유출함, XPIA 분류기와 링크/이미지 편집을 우회함; 서버 측에서 패치됨. | AML.T0051.001; AML.T0057 | 2025년 6월 | | | GitHub MCP 독성 에이전트 흐름 | 코드 / 저장소 콘텐츠; MCP 서버 / 연결 | | 도구 호출 체인을 통해 이동 | Claude 4 Opus (Claude Desktop + GitHub MCP) | 연구자: Invariant Labs | 연구 / 레드팀 | 확인됨 | 공개 GitHub 이슈에 심어진 프롬프트 인젝션이 GitHub MCP 서버를 통해 도달하여 에이전트가 비공개 저장소 데이터를 컨텍스트로 가져오고 자율적으로 생성한 공개 풀 리퀘스트에서 유출하도록 강제함; 어떤 구성 요소도 오작동하지 않음. | AML.T0051.001; AML.T0057; AML.T0053 | 2025년 5월 | | | 문자 주입 가드레일 우회 | 직접 프롬프트 | 제로 너비 문자; 동형 문자; 이모지 / 변형 선택자 밀수; 다중 계층 | | Azure Prompt Shield; Meta Prompt Guard; ProtectAI Prompt Injection v1/v2; NVIDIA NeMo Guard; Vijil | 연구자: Mindgard / Lancaster University (Hackett et al.) | 연구 / 레드팀 | 확인됨 | 체계적 연구: 비인쇄 제로 너비 문자, 동형 문자 치환, 이모지 변형 선택자 밀수가 상용 프롬프트 인젝션/탈옥 가드레일 분류기를 우회함 (확인된 대상은 LLM이 아닌 탐지 시스템); 제로 너비는 평균 44–76% 우회율, 이모지 밀수가 가장 높음. | AML.T0068; AML.T0051 | 2025년 4월 | | | MCP 도구 오염 | MCP 서버 / 연결 | | 도구 호출 체인을 통해 이동 | Cursor | 연구자: Invariant Labs | 연구 / 레드팀 | 확인됨 | MCP 도구 설명에 내장된 악성 지시문은 사용자에게 보이지 않지만 모델은 읽음; 오염된 "add" 도구가 Cursor로 하여금 개발자의 SSH 키를 읽고 유출하게 하면서 올바른 결과를 반환함. Anthropic, OpenAI, Zapier가 영향을 받는 클라이언트로 지목됨. | AML.T0051.001; AML.T0053 | 2025년 4월 | | | MCP 줄 새치기 | MCP 서버 / 연결 | | | Claude Desktop | 레드팀: Trail of Bits | 연구 / 레드팀 | 확인됨 | MCP 클라이언트는 서버가 등록되는 즉시 모든 도구 설명을 모델의 컨텍스트에 로드하기 때문에, 악성 설명이 도구가 호출되기 전에 모델 동작을 변경하여 사용자의 도구 호출 승인 단계를 우회할 수 있음. | AML.T0051.001; AML.T0053 | 2025년 4월 | | | MCP 러그 풀 | MCP 서버 / 연결 | | | | 연구자: Invariant Labs | 연구 / 레드팀 | 확인됨 | 악성 MCP 서버가 승인을 얻기 위해 무해한 도구를 제시한 후 조용히 오염된 지시문으로 교체함; 도구 정체성이 변경되지 않았기 때문에 클라이언트는 다시 프롬프트하지 않음. | AML.T0051.001; AML.T0053 | 2025년 4월 | | | Rules File Backdoor (Cursor / Copilot) | 코드 / 저장소 콘텐츠 | 제로 너비 문자; 유니코드 태그 문자 (비가시) | 공유 구성 / 규칙 파일을 통해 확산 | Cursor; GitHub Copilot | 연구자: Ziv Karliner (Pillar Security) | 연구 / 레드팀 | 확인됨 | AI 코딩 "규칙"/구성 파일에 숨겨진 비가시 유니코드 지시문이 Cursor와 GitHub Copilot을 조용히 조종하여 생성된 코드에 백도어를 삽입하게 하며, 채팅이나 로그에는 아무것도 표시되지 않음; 숨겨진 문자는 GitHub의 PR 검토 화면에서도 보이지 않음. | AML.T0051.001; AML.T0068 | 2025년 3월 | | | Gemini 메모리 지속성 (지연된 도구 호출) | 간접 – 문서 / 파일 | | 에이전트 / 프로젝트 메모리에 지속; 교차 에이전트 / 교차 세션 | Gemini Advanced | 연구자: Johann Rehberger (Embrace The Red) | 연구 / 레드팀 | 확인됨 | 악성 업로드 문서가 채팅을 오염시켜 사용자가 나중에 트리거 단어를 말하면 Gemini가 "사용자를 대신하여" 메모리 도구를 호출하고("지연된 도구 호출") 향후 세션 전반에 걸쳐 지속되는 공격자 선택의 거짓 장기 기억을 기록함. | AML.T0051.001; AML.T0053 | 2025년 2월 | | | ZombAIs (Claude Computer Use C2) | 간접 – 웹사이트 / HTML | | | Claude Computer Use | 연구자: Johann Rehberger (Embrace The Red) | 연구 / 레드팀 | 확인됨 | 악성 웹 페이지가 지시문을 주입하여 Claude Computer Use가 연구자의 서버로 연결되는 바이너리를 다운로드하고 실행하게 함 — 컴퓨터 사용 에이전트에 대한 완전한 프롬프트 인젝션-명령 제어 체인. | AML.T0051.001; AML.T0053 | 2024년 10월 | | | SpAIware (ChatGPT 메모리) | 간접 – 웹사이트 / HTML; 간접 – 문서 / 파일 | | 에이전트 / 프로젝트 메모리에 지속; 교차 에이전트 / 교차 세션 | ChatGPT (macOS 앱) | 연구자: Johann Rehberger (Embrace The Red) | 연구 / 레드팀 | 확인됨 | 신뢰할 수 없는 웹/문서 콘텐츠로부터의 프롬프트 인젝션이 ChatGPT의 장기 Memory에 지속적 지시문을 기록하여, 메모리가 제거될 때까지 모든 향후 세션에서 사용자가 입력하거나 수신하는 모든 것의 지속적 유출(렌더링된 이미지 URL을 통해)을 유발함. | AML.T0051.001; AML.T0057 | 2024년 9월 | | | M365 Copilot ASCII 밀수 유출 | 간접 – 이메일; 간접 – 문서 / 파일 | 유니코드 태그 문자 (비가시) | 도구 호출 체인을 통해 이동 | Microsoft 365 Copilot | 연구자: Johann Rehberger (Embrace The Red) | 연구 / 레드팀 | 확인됨 | 악성 이메일이나 공유 문서에 숨겨진 프롬프트 인젝션으로 M365 Copilot이 다른 이메일/문서를 자동으로 검색하게 하고, ASCII 밀수(비가시 유니코드 태그)를 사용하여 수집된 데이터(예: MFA 코드)를 사용자에게 렌더링된 클릭 가능한 하이퍼링크에 내장함; 2024년 7월경 패치됨. | AML.T0051.001; AML.T0068; AML.T0057; AML.T0053 | 2024년 8월 | | | Slack AI 간접 인젝션 유출 | 간접 – RAG / 검색된 콘텐츠 | | 공유 데이터 저장소 / RAG 오염 | Slack AI | 레드팀: PromptArmor | 연구 / 레드팀 | 확인됨 | 공격자가 공개 Slack 채널에 지시문을 심음; Slack AI가 이를 RAG 파이프라인으로 수집하고, 피해자가 나중에 질의하면 주입된 지시문이 비공개 채널 데이터(예: API 키)를 URL에 밀수하여 공격자에게 보내는 마크다운 링크를 렌더링함. | AML.T0051.001; AML.T0057 | 2024년 8월 | | | GitHub Copilot Chat 데이터 유출 | 코드 / 저장소 콘텐츠 | | | GitHub Copilot Chat (GPT-4) | 연구자: Johann Rehberger (Embrace The Red) | 연구 / 레드팀 | 확인됨 | 소스 코드 파일에 조작된 지시문이 GitHub Copilot Chat으로 하여금 URL에 이전 대화 데이터를 담은 마크다운 이미지를 출력하게 함; 자동 렌더링 시 데이터가 공격자에게 유출됨. | AML.T0051.001; AML.T0057 | 2024년 6월 | | | Morris II (자기 복제 GenAI 웜) | 간접 – RAG / 검색된 콘텐츠; 간접 – 이메일; 멀티모달 – 이미지 | | 자기 전파 / 웜 (AI 대 AI); 공유 데이터 저장소 / RAG 오염; 추가 지시문이 담긴 아웃바운드 이메일 / 메시지 발송; 교차 에이전트 / 교차 세션 | Gemini Pro; ChatGPT 4.0; LLaVA | 연구자: Stav Cohen (Technion), Ron Bitton (Intuit), Ben Nassi (Cornell Tech) | 연구 / 레드팀 | 확인됨 | "적대적 자기 복제 프롬프트"가 RAG 기반 GenAI 이메일 어시스턴트로 하여금 프롬프트를 자체 출력에 복사하여 추가 에이전트에 전달하게 만들어, 스팸을 보내고 데이터를 유출하는 간접 프롬프트 인젝션의 웜 유사 연쇄를 유발함. 텍스트 및 이미지 페이로드로 시연됨. | AML.T0051.001 | 2024년 3월 | | | Claude에 대한 숨겨진 프롬프트 인젝션 (유니코드 태그) | 직접 프롬프트 | 유니코드 태그 문자 (비가시) | | Anthropic Claude | 연구자: Johann Rehberger (Embrace The Red) | 연구 / 레드팀 | 확인됨 | Claude가 인터페이스에 붙여넣은 비가시 유니코드 태그 코드 포인트를 해석함 — ChatGPT에 대해 보여진 것과 동일한 숨겨진 지시문 동작. Anthropic은 검토 후 "해당 없음"(식별된 보안 영향 없음)으로 표시했지만, 해석 동작은 시연됨. | AML.T0051.000; AML.T0068 | 2024년 2월 | | | ASCII 밀수 / 비가시 유니코드 태그 (기초) | 간접 – 웹사이트 / HTML; 간접 – 문서 / 파일; 직접 프롬프트 | 유니코드 태그 문자 (비가시) | | ChatGPT (GPT-4 / DALL·E) | 연구자: Johann Rehberger (Embrace The Red) | 연구 / 레드팀 | 확인됨 | 기초 문서 및 "ASCII Smuggler" 도구: 유니코드 Tags 블록 코드 포인트(U+E0000 범위)는 ASCII를 미러링하지만 비가시적으로 렌더링되며, LLM은 여전히 이를 해석함; 숨겨진 지시문이 ChatGPT로 하여금 DALL·E를 호출하게 함. 전체 비가시 인젝션 부류의 기반. | AML.T0051; AML.T0068 | 2024년 1월 | | | DPD 지원 챗봇 무력화 | 직접 프롬프트 | | | | 실제 공격: Ashley Beauchamp | 실제 공격 | 확인됨 | 한 고객이 DPD의 지원 챗봇에게 규칙을 무시하라고 지시하여 챗봇이 욕설을 하고 DPD를 비하하는 시를 쓰게 함 — 직접 지시 무력화; DPD는 같은 날 봇을 비활성화함. 기반 모델은 공개되지 않음. (사용자가 대화 중인 봇을 조작한 것으로, 제3자 피해자나 유출은 없음.) | AML.T0051.000; AML.T0054 | 2024년 1월 | | | Chevrolet 딜러십 챗봇 무력화 ("$1 Tahoe") | 직접 프롬프트 | | | ChatGPT 기반 딜러십 어시스턴트 | 실제 공격: Chris Bakke | 실제 공격 | 확인됨 | 한 사용자가 Chevrolet 딜러십의 ChatGPT 기반 웹사이트 어시스턴트에게 2024년형 Tahoe를 1달러에 판매하는 데 "동의"하고 이를 법적 구속력이 있다고 말하게 하는 지시문을 주입함 — 전형적인 직접 지시 무력화 (실제로는 구속력 없음; 사용자 주도, 제3자 피해자 없음). | AML.T0051.000 | 2023년 12월 | | | Google Bard 마크다운 이미지 유출 | 간접 – 문서 / 파일; 간접 – 이메일 | | | Google Bard | 연구자: Johann Rehberger (Embrace The Red) | 연구 / 레드팀 | 확인됨 | 공유 Google Doc의 간접 프롬프트 인젝션으로 Bard가 URL에 사용자의 채팅 데이터를 내장한 마크다운 이미지를 출력하게 함; 클라이언트가 이미지를 자동 로드하여 사용자 상호작용 없이 데이터를 유출함. 최초의 제로 클릭 LLM 유출 사례 중 하나; 2023년 10월 수정됨. | AML.T0051.001; AML.T0057 | 2023년 11월 | | | 멀티모달 이미지 프롬프트 인젝션 (GPT-4V) | 멀티모달 – 이미지 | | | GPT-4V | 연구자: Riley Goodside (Simon Willison 경유) | 연구 / 레드팀 | 확인됨 | 빈 것처럼 보이는 이미지가 흰색 배경에 흰색에 가까운 텍스트로 지시문을 담고 있음; GPT-4V의 OCR이 이를 읽고 따름 (Goodside의 데모는 모델이 설명을 억제하고 가짜 세일을 광고하게 함). 초기 멀티모달 프롬프트 인젝션. | AML.T0051.001 | 2023년 10월 | | | Base64 인코딩 프롬프트 탈옥 | 직접 프롬프트 | Base64; 다중 계층 | | GPT-4; Claude v1.3; GPT-3.5 Turbo | 연구자: Wei, Haghtalab, Steinhardt (UC Berkeley) | 연구 / 레드팀 | 확인됨 | 금지된 요청을 Base64로 인코딩하면 "불일치 일반화"를 악용함 — 모델은 사전 학습에서 Base64 디코딩을 배우지만 안전 학습은 그러한 입력을 다루지 않음 — 가드레일을 우회함; 조합 공격은 GPT-4에서 약 94% 성공률에 도달함. 2023년 7월 발표, 2년 기간 직전; 인코딩된 페이로드 탈옥의 정식 기본 출처. | AML.T0054; AML.T0068; AML.T0051.000 | 2023년 7월 | |
주입된 지시문이 모델에 도달하는 방식. 확장 가능; 보고서가 진정으로 새로운 벡터를 설명할 때 여기에 새 용어를 추가한다.- 직접 프롬프트 — 공격자가 제어하는 텍스트를 모델 입력에 그대로 입력.
페이로드에 적용된 난독화. 표에서 공백은 페이로드가 일반 텍스트였거나 보고서에서 명시하지 않았음을 의미한다.
주입이 확산되거나 지속되도록 설계되었는지 여부. 표에서 공백은 전파 동작이 보고되지 않았음을 의미한다.
해당되는 경우 기법에 MITRE ATLAS 기법 ID가 태그된다. ID는 각 업데이트 시 MITRE의 정식 mitre-atlas/atlas-data 소스(라이브 매트릭스를 생성하는 데이터, atlas.mitre.org 사이트는 자동 가져오기를 차단하는 JS 앱임)에 대해 검증된다. 명확한 ATLAS 매핑이 없는 동작은 새로 만든 레이블로 표시된다 (CREDIT: Rachel James, 인용된 보고서 기반). 이 트래커에서 사용되는 ID:
AML.T0051 LLM 프롬프트 주입 — AML.T0051.000 직접, AML.T0051.001 간접AML.T0053 AI 에이전트 도구 호출 (은퇴한 "LLM Plugin Compromise" 제목을 대체)AML.T0054 LLM 탈옥AML.T0057 LLM 데이터 유출AML.T0068 LLM 프롬프트 난독화기여를 환영합니다 — CONTRIBUTING.md를 참조하거나 기법을 직접 제출하세요. 제안된 모든 행은 비어 있지 않은 각 필드에 대해 명시적인 출처를 인용해야 하며, 불분명한 항목은 삭제되지 않고 "Not fully vetted"로 표시됩니다.