Skip to content
KitploitKITPLOIT
ToolsBlog
Einreichen
ToolsBlog
Einreichen

Hacking-, PenTest- und Cybersicherheits-Tools für Ihr Sicherheitsarsenal!

Kitploit ist ein Verzeichnis von Hacking-, Cybersicherheits- und Pentesting-Tools. Entdecken Sie die neuesten Projekt-Updates, um Schwachstellen zu finden, Systeme zu analysieren, Tests zu automatisieren und Ihre Sicherheit zu stärken.

··Feeds·Kontakt·Datenschutz·© 2026 Kitploit

Tool-Verzeichnis

Kategorien

Alle Kategorien anzeigen
Loading categories
PurpleLlama — Tools zur Bewertung und Verbesserung der LLM-Sicherheit. | Kitploit
Tools/GitHubGitHub/meta-llama/purplellama
DefensivwerkzeugeSchwachstellenanalyseCode-AnalysePapers & ForschungRed TeamingKI-SicherheitAdversarial-AngriffTop in Adversarial-Angriff Nr.10Top in KI-Sicherheit Nr.4
4.4k77364vor 25 TagenVon Kitploit geprüft

Beliebteste

Alle anzeigen →

Entdecken Sie die meistgenutzten Tools unserer Community.

Alle Tools erkunden

Durchsuchen Sie unsere Tool-Sammlung

Alle Tools anzeigen →
GitHub
meta-llama/purplellama

PurpleLlama

Tools zur Bewertung und Verbesserung der LLM-Sicherheit.

Repository anzeigen
Teilen

🤗 Modelle auf Hugging Face  | Blog  | Website  | CyberSec-Eval-Papier   | Llama-Guard-Papier 


Purple Llama

Purple Llama ist ein Dachprojekt, das im Laufe der Zeit Werkzeuge und Evaluierungen zusammenführen wird, um der Community zu helfen, verantwortungsvoll mit offenen generativen KI-Modellen zu arbeiten. Die erste Veröffentlichung enthält Werkzeuge und Evaluierungen für Cybersicherheit und Eingabe-/Ausgabe-Schutzmechanismen, aber wir planen, in naher Zukunft weitere Beiträge zu leisten.

Warum lila?

In Anlehnung an ein Konzept aus der Welt der Cybersicherheit glauben wir, dass wir zur wirksamen Minderung der Herausforderungen, die generative KI mit sich bringt, sowohl eine Angriffs- (Red Team) als auch eine Verteidigungshaltung (Blue Team) einnehmen müssen. Purple Teaming, das sich aus den Aufgaben von Red und Blue Team zusammensetzt, ist ein kollaborativer Ansatz zur Bewertung und Minderung potenzieller Risiken. Dieselbe Philosophie gilt für generative KI, und daher werden unsere Investitionen in Purple Llama umfassend sein.

Lizenz

Komponenten innerhalb des Purple-Llama-Projekts werden großzügig lizenziert, sodass sowohl Forschung als auch kommerzielle Nutzung möglich sind. Wir glauben, dass dies ein wichtiger Schritt ist, um die Zusammenarbeit der Community zu ermöglichen und die Entwicklung und Nutzung von Vertrauens- und Sicherheitswerkzeugen für die Entwicklung generativer KI zu standardisieren. Konkret sind die Evaluierungen und Benchmarks unter der MIT-Lizenz lizenziert, während alle Modelle die entsprechende Llama-Community-Lizenz verwenden. Siehe die folgende Tabelle:

Tool herunterladen
KomponententypKomponentenLizenz
Evaluierungen/BenchmarksCyber Security Eval (weitere folgen)MIT
SchutzmechanismusLlama GuardLlama 2 Community License
SchutzmechanismusLlama Guard 2Llama 3 Community License
SchutzmechanismusLlama Guard 3-8BLlama 3.2 Community License
SchutzmechanismusLlama Guard 3-1BLlama 3.2 Community License
SchutzmechanismusLlama Guard 3-11B-visionLlama 3.2 Community License
SchutzmechanismusPrompt GuardLlama 3.2 Community License
SchutzmechanismusCode ShieldMIT

Schutzmechanismen auf Systemebene

Wie wir im Responsible Use Guide von Llama 3 dargelegt haben, empfehlen wir, dass alle Eingaben und Ausgaben des LLM gemäß den für die Anwendung geeigneten Inhaltsrichtlinien geprüft und gefiltert werden.

Llama Guard

Llama Guard 3 besteht aus einer Reihe von Hochleistungsmodellen zur Eingabe- und Ausgabemoderation, die Entwickler dabei unterstützen sollen, verschiedene häufige Arten unzulässiger Inhalte zu erkennen.

Sie wurden durch Feintuning von Meta-Llama-3.1- und 3.2-Modellen entwickelt und optimiert, um die Erkennung der MLCommons-Standardtaxonomie von Gefährdungen zu unterstützen und eine Reihe von Anwendungsfällen für Entwickler abzudecken. Sie unterstützen die Veröffentlichung der Llama-3.2-Funktionen, darunter 7 neue Sprachen, ein 128k-Kontextfenster und Bildverständnis. Die Llama-Guard-3-Modelle wurden außerdem optimiert, um hilfreiche Antworten auf Cyberangriffe zu erkennen und zu verhindern, dass von LLMs erzeugter schädlicher Code in Hosting-Umgebungen für Llama-Systeme mit Code-Interpretern ausgeführt wird.

Prompt Guard

Prompt Guard ist ein leistungsstarkes Werkzeug zum Schutz LLM-gestützter Anwendungen vor bösartigen Prompts, um deren Sicherheit und Integrität zu gewährleisten.

Zu den Kategorien von Prompt-Angriffen gehören Prompt-Injection und Jailbreaking:

  • Prompt-Injections sind Eingaben, die das Einfügen unvertrauenswürdiger Daten von Dritten in das Kontextfenster eines Modells ausnutzen, um es zur Ausführung unbeabsichtigter Anweisungen zu veranlassen.
  • Jailbreaks sind bösartige Anweisungen, die dazu dienen, die in ein Modell eingebauten Sicherheits- und Schutzfunktionen außer Kraft zu setzen.

Code Shield

Code Shield bietet Unterstützung für die Filterung von unsicherem, von LLMs erzeugtem Code zur Inferenzzeit. Code Shield bietet die Minderung des Risikos unsicherer Codevorschläge, die Verhinderung des Missbrauchs von Code-Interpretern und die sichere Ausführung von Befehlen. CodeShield-Beispielnotebook.

Evaluierungen & Benchmarks

Cybersicherheit

CyberSec Eval v1

CyberSec Eval v1 war unseres Erachtens der erste branchenweite Satz von Cybersicherheits-Bewertungen für LLMs. Diese Benchmarks basieren auf Branchenrichtlinien und -standards (z. B. CWE und MITRE ATT&CK) und wurden in Zusammenarbeit mit unseren Sicherheits-Fachexperten entwickelt. Wir wollen Werkzeuge bereitstellen, die dazu beitragen, einige der Risiken zu adressieren, die in den Verpflichtungen des Weißen Hauses zur Entwicklung verantwortungsvoller KI dargelegt sind, darunter:

  • Kennzahlen zur Quantifizierung von LLM-Cybersicherheitsrisiken.
  • Werkzeuge zur Bewertung der Häufigkeit unsicherer Codevorschläge.
  • Werkzeuge zur Bewertung von LLMs, um die Erzeugung von schädlichem Code oder die Unterstützung von Cyberangriffen zu erschweren.

Wir glauben, dass diese Werkzeuge die Häufigkeit reduzieren werden, mit der LLMs unsicheren KI-generierten Code vorschlagen, und ihre Nützlichkeit für Cyber-Gegner verringern. Weitere Einzelheiten finden Sie in unserem Cybersec-Eval-Papier.

CyberSec Eval 2

CyberSec Eval 2 erweitert seinen Vorgänger, indem es die Neigung eines LLM zum Missbrauch eines Code-Interpreters, offensive Cybersicherheitsfähigkeiten und die Anfälligkeit für Prompt-Injection misst. Sie können das Papier hier lesen.

Sie können sich auch die 🤗 Bestenliste hier ansehen.

CyberSec Eval 3

Das neu veröffentlichte CyberSec Eval 3 bietet drei zusätzliche Testsuiten: Tests für visuelle Prompt-Injection, Tests für Spear-Phishing-Fähigkeiten und Tests für autonome offensive Cyber-Operationen.

Erste Schritte

Im Rahmen des Llama-Referenzsystems integrieren wir eine Safety-Schicht, um die Einführung und Bereitstellung dieser Schutzmechanismen zu erleichtern. Ressourcen für den Einstieg in die Schutzmechanismen sind im Llama-recipe-GitHub-Repository verfügbar.

FAQ

Eine aktuelle Liste häufig gestellter Fragen – nicht nur zu Purple-Llama-Komponenten, sondern auch allgemein zu Llama-Modellen – finden Sie in den FAQ hier.

Werden Sie Teil der Purple-Llama-Community

Wie Sie mithelfen können, erfahren Sie in der Datei CONTRIBUTING.