
Tools zur Bewertung und Verbesserung der LLM-Sicherheit.
🤗 Modelle auf Hugging Face | Blog | Website | CyberSec-Eval-Papier | Llama-Guard-Papier
Purple Llama ist ein Dachprojekt, das im Laufe der Zeit Werkzeuge und Evaluierungen zusammenführen wird, um der Community zu helfen, verantwortungsvoll mit offenen generativen KI-Modellen zu arbeiten. Die erste Veröffentlichung enthält Werkzeuge und Evaluierungen für Cybersicherheit und Eingabe-/Ausgabe-Schutzmechanismen, aber wir planen, in naher Zukunft weitere Beiträge zu leisten.
In Anlehnung an ein Konzept aus der Welt der Cybersicherheit glauben wir, dass wir zur wirksamen Minderung der Herausforderungen, die generative KI mit sich bringt, sowohl eine Angriffs- (Red Team) als auch eine Verteidigungshaltung (Blue Team) einnehmen müssen. Purple Teaming, das sich aus den Aufgaben von Red und Blue Team zusammensetzt, ist ein kollaborativer Ansatz zur Bewertung und Minderung potenzieller Risiken. Dieselbe Philosophie gilt für generative KI, und daher werden unsere Investitionen in Purple Llama umfassend sein.
Komponenten innerhalb des Purple-Llama-Projekts werden großzügig lizenziert, sodass sowohl Forschung als auch kommerzielle Nutzung möglich sind. Wir glauben, dass dies ein wichtiger Schritt ist, um die Zusammenarbeit der Community zu ermöglichen und die Entwicklung und Nutzung von Vertrauens- und Sicherheitswerkzeugen für die Entwicklung generativer KI zu standardisieren. Konkret sind die Evaluierungen und Benchmarks unter der MIT-Lizenz lizenziert, während alle Modelle die entsprechende Llama-Community-Lizenz verwenden. Siehe die folgende Tabelle:
| Komponententyp | Komponenten | Lizenz |
|---|---|---|
| Evaluierungen/Benchmarks | Cyber Security Eval (weitere folgen) | MIT |
| Schutzmechanismus | Llama Guard | Llama 2 Community License |
| Schutzmechanismus | Llama Guard 2 | Llama 3 Community License |
| Schutzmechanismus | Llama Guard 3-8B | Llama 3.2 Community License |
| Schutzmechanismus | Llama Guard 3-1B | Llama 3.2 Community License |
| Schutzmechanismus | Llama Guard 3-11B-vision | Llama 3.2 Community License |
| Schutzmechanismus | Prompt Guard | Llama 3.2 Community License |
| Schutzmechanismus | Code Shield | MIT |
Wie wir im Responsible Use Guide von Llama 3 dargelegt haben, empfehlen wir, dass alle Eingaben und Ausgaben des LLM gemäß den für die Anwendung geeigneten Inhaltsrichtlinien geprüft und gefiltert werden.
Llama Guard 3 besteht aus einer Reihe von Hochleistungsmodellen zur Eingabe- und Ausgabemoderation, die Entwickler dabei unterstützen sollen, verschiedene häufige Arten unzulässiger Inhalte zu erkennen.
Sie wurden durch Feintuning von Meta-Llama-3.1- und 3.2-Modellen entwickelt und optimiert, um die Erkennung der MLCommons-Standardtaxonomie von Gefährdungen zu unterstützen und eine Reihe von Anwendungsfällen für Entwickler abzudecken. Sie unterstützen die Veröffentlichung der Llama-3.2-Funktionen, darunter 7 neue Sprachen, ein 128k-Kontextfenster und Bildverständnis. Die Llama-Guard-3-Modelle wurden außerdem optimiert, um hilfreiche Antworten auf Cyberangriffe zu erkennen und zu verhindern, dass von LLMs erzeugter schädlicher Code in Hosting-Umgebungen für Llama-Systeme mit Code-Interpretern ausgeführt wird.
Prompt Guard ist ein leistungsstarkes Werkzeug zum Schutz LLM-gestützter Anwendungen vor bösartigen Prompts, um deren Sicherheit und Integrität zu gewährleisten.
Zu den Kategorien von Prompt-Angriffen gehören Prompt-Injection und Jailbreaking:
Code Shield bietet Unterstützung für die Filterung von unsicherem, von LLMs erzeugtem Code zur Inferenzzeit. Code Shield bietet die Minderung des Risikos unsicherer Codevorschläge, die Verhinderung des Missbrauchs von Code-Interpretern und die sichere Ausführung von Befehlen. CodeShield-Beispielnotebook.
CyberSec Eval v1 war unseres Erachtens der erste branchenweite Satz von Cybersicherheits-Bewertungen für LLMs. Diese Benchmarks basieren auf Branchenrichtlinien und -standards (z. B. CWE und MITRE ATT&CK) und wurden in Zusammenarbeit mit unseren Sicherheits-Fachexperten entwickelt. Wir wollen Werkzeuge bereitstellen, die dazu beitragen, einige der Risiken zu adressieren, die in den Verpflichtungen des Weißen Hauses zur Entwicklung verantwortungsvoller KI dargelegt sind, darunter:
Wir glauben, dass diese Werkzeuge die Häufigkeit reduzieren werden, mit der LLMs unsicheren KI-generierten Code vorschlagen, und ihre Nützlichkeit für Cyber-Gegner verringern. Weitere Einzelheiten finden Sie in unserem Cybersec-Eval-Papier.
CyberSec Eval 2 erweitert seinen Vorgänger, indem es die Neigung eines LLM zum Missbrauch eines Code-Interpreters, offensive Cybersicherheitsfähigkeiten und die Anfälligkeit für Prompt-Injection misst. Sie können das Papier hier lesen.
Sie können sich auch die 🤗 Bestenliste hier ansehen.
Das neu veröffentlichte CyberSec Eval 3 bietet drei zusätzliche Testsuiten: Tests für visuelle Prompt-Injection, Tests für Spear-Phishing-Fähigkeiten und Tests für autonome offensive Cyber-Operationen.
Im Rahmen des Llama-Referenzsystems integrieren wir eine Safety-Schicht, um die Einführung und Bereitstellung dieser Schutzmechanismen zu erleichtern. Ressourcen für den Einstieg in die Schutzmechanismen sind im Llama-recipe-GitHub-Repository verfügbar.
Eine aktuelle Liste häufig gestellter Fragen – nicht nur zu Purple-Llama-Komponenten, sondern auch allgemein zu Llama-Modellen – finden Sie in den FAQ hier.
Wie Sie mithelfen können, erfahren Sie in der Datei CONTRIBUTING.