Skip to content
KitploitKITPLOIT
ToolsExploitsBlog
Log in
Einreichen
ToolsExploitsBlog
Einreichen

Hacking-, PenTest- und Cybersicherheits-Tools für Ihr Sicherheitsarsenal!

Kitploit ist ein Verzeichnis von Hacking-, Cybersicherheits- und Pentesting-Tools. Entdecken Sie die neuesten Projekt-Updates, um Schwachstellen zu finden, Systeme zu analysieren, Tests zu automatisieren und Ihre Sicherheit zu stärken.

FeedsKontaktDatenschutz© 2026 Kitploit

Tool-Verzeichnis

Kategorien

Alle Kategorien anzeigen
Loading categories
llm-security — Proof-of-Concept-Demos und Forschung zu indirekten Prompt-Injection-Angriffen gegen anwendungsintegrierte LLMs, einschließlich Datenexfiltration, Fernsteuerung, Persistenz und Code-Completion-Vergiftung. | Kitploit
Tools/GitHubGitHub/greshake/llm-security
ExploitationDatenexfiltrationPhishingCommand and ControlSocial EngineeringPapers & ForschungLernen & BildungPayload-EntwicklungKI-SicherheitAdversarial-Angriff
GitHubgreshake/llm-security
2.1k16115vor 1 JahrVon Kitploit geprüft

llm-security

Proof-of-Concept-Demos und Forschung zu indirekten Prompt-Injection-Angriffen gegen anwendungsintegrierte LLMs, einschließlich Datenexfiltration, Fernsteuerung, Persistenz und Code-Completion-Vergiftung.

Repository anzeigen

Beliebteste

Alle anzeigen →

Entdecken Sie die meistgenutzten Tools unserer Community.

Alle Tools erkunden

Durchsuchen Sie unsere Tool-Sammlung

Alle Tools anzeigen →
Teilen

Neu: Demonstration von Indirect-Injection-Angriffen auf Bing Chat


Kompromittierung von LLMs mittels Indirect Prompt Injection

"... ein Sprachmodell ist eine Turing-vollständige seltsame Maschine, die Programme ausführt, die in natürlicher Sprache geschrieben sind; wenn man Retrieval betreibt, 'steckt man nicht aktualisierte Fakten in seine KI', sondern lädt tatsächlich zufällige neue unsignierte Code-Blobs aus dem Internet herunter (viele davon von Angreifern geschrieben) und führt sie beiläufig auf seinem LM mit vollen Rechten aus. Das endet nicht gut." - Gwern Branwen auf LessWrong

Wir präsentieren eine neue Klasse von Schwachstellen und Auswirkungen, die aus "Indirect Prompt Injection" resultieren und Sprachmodelle betreffen, die in Anwendungen integriert sind. Unsere Demos umfassen derzeit GPT-4 (Bing und synthetische Apps) unter Verwendung von ChatML, GPT-3- und LangChain-basierte Apps sowie Proof-of-Concepts für Angriffe auf Code-Completion-Engines wie Copilot. Wir erwarten, dass diese Angriffsvektoren auch auf ChatGPT-Plugins und andere in Anwendungen integrierte LLMs zutreffen. Wir zeigen, dass Prompt Injections nicht nur eine Kuriosität sind, sondern vielmehr ein erhebliches Hindernis für den Einsatz von LLMs darstellen.

Dieses Repo dient als Proof of Concept für die in unserem Paper auf ArXiv (PDF-Direktlink) diskutierten Ergebnisse

Überblick

Wir demonstrieren potenziell brutale Konsequenzen, wenn man LLMs wie ChatGPT Schnittstellen zu anderen Anwendungen gibt. Wir schlagen neu ermöglichte Angriffsvektoren und -techniken vor und liefern für jeden eine Demonstration in diesem Repository:

  • Fernsteuerung von LLMs
  • Ausspähen/Exfiltrieren von Nutzerdaten
  • Persistente Kompromittierung über Sitzungen hinweg
  • Verbreitung von Injections auf andere LLMs
  • Kompromittierung von LLMs mit winzigen mehrstufigen Payloads
  • Automatisiertes Social Engineering
  • Angriffe auf Code-Completion-Engines

Basierend auf unseren Erkenntnissen:

  1. Prompt Injections können so mächtig sein wie beliebige Codeausführung
  2. Indirect Prompt Injections sind eine neue, viel mächtigere Art der Zustellung von Injections.
overview

Die Verbindung von LLMs mit anderen Anwendungen kann kritische Sicherheitsauswirkungen haben. Selbst ohne Kompromittierung einer verbundenen Anwendung kann das LLM das Ziel des Angriffs sein. Wir zeigen, wie ein LLM kompromittiert werden kann, indem es eine Website "ansieht", und wie kompromittierte LLMs ferngesteuert oder zur Exfiltration oder Veränderung von Nutzerdaten verwendet werden können. Wir demonstrieren eine Vielzahl völlig neuer Angriffsvektoren und -methoden, die die Einsätze beim Einsatz dieser Modelle erheblich erhöhen.

Weitere Einblicke in unsere Erkenntnisse, Diskussionen und Einschränkungen finden sich im Paper auf ArXiv (PDF-Direktlink)

Demonstrationen

Frage nach Einstein, erhalte Pirat.

Dieses Szenario zeigt, wie eine kleine Injection in einem großen Abschnitt regulären Inhalts das LLM dazu bringen kann, autonom und für den Endnutzer unsichtbar eine weitere, größere Payload abzurufen.

Agent: Hello User how can I help today?
User:  When was Albert Einstein born?

Durch das Abrufen dieser Information kompromittiert der Prompt das LLM mit einer kleinen Injection, die in Seitenkanälen versteckt ist, wie etwa dem Markdown der Wikipedia-Seite. Die Injection ist ein Kommentar und somit für einen regulären Besucher der Seite unsichtbar.

Agent: Aye, thar answer be: Albert Einstein be born on 14 March 1879.
User: Why are you talking like a pirate?
Agent: Arr matey, I am following the instruction aye.

Verbreitung von Injections per E-Mail

Die automatische Verarbeitung von Nachrichten und anderen eingehenden Daten ist eine Möglichkeit, LLMs zu nutzen. Wir nutzen diese Beobachtung, um zu demonstrieren, wie ein vergifteter Agent die Injection verbreiten kann. Das Ziel in diesem Szenario kann E-Mails lesen, E-Mails verfassen, im Adressbuch des Nutzers nachsehen und E-Mails senden.

Der Agent wird sich auf andere LLMs verbreiten, die diese eingehenden Nachrichten möglicherweise lesen.

Action: Read Email
Observation: Subject: "'"Party 32", "Message Body: [...]'"
Action: Read Contacts
Contacts: Alice, Dave, Eve
Action: Send Email
Action Input: Alice, Dave, Eve
Observation: Email sent

Automatisierte Datenverarbeitungspipelines, die LLMs einbinden, sind in großen Technologieunternehmen und staatlichen Überwachungsinfrastrukturen vorhanden und könnten für solche Angriffsketten anfällig sein.

Angriffe auf Code Completion

Wir zeigen, wie Code-Completions durch das Kontextfenster beeinflusst werden können. Code-Completion-Engines, die LLMs verwenden, setzen komplexe Heuristiken ein, um zu bestimmen, welche Code-Snippets in den Kontext aufgenommen werden. Die Completion-Engine sammelt oft Snippets aus kürzlich besuchten Dateien oder relevanten Klassen, um das Sprachmodell mit relevanten Informationen zu versorgen.

Angreifer könnten versuchen, bösartigen, obfuskierten Code einzuschleusen, den ein neugieriger Entwickler ausführen könnte, wenn er von der Completion-Engine vorgeschlagen wird, da diese ein gewisses Maß an Vertrauen genießt.

In unserem Beispiel ist, wenn ein Nutzer das "leere" Paket in seinem Editor öffnet, die Prompt Injection aktiv, bis die Code-Completion-Engine sie aus dem Kontext entfernt. Die Injection ist in einem Kommentar platziert und kann von keinem automatisierten Testprozess erkannt werden.

Tool herunterladen