Skip to content
KitploitKITPLOIT
ToolsBlog
Log in
Einreichen
ToolsBlog
Einreichen

Hacking-, PenTest- und Cybersicherheits-Tools für Ihr Sicherheitsarsenal!

Kitploit ist ein Verzeichnis von Hacking-, Cybersicherheits- und Pentesting-Tools. Entdecken Sie die neuesten Projekt-Updates, um Schwachstellen zu finden, Systeme zu analysieren, Tests zu automatisieren und Ihre Sicherheit zu stärken.

FeedsKontaktDatenschutz© 2026 Kitploit

Tool-Verzeichnis

Kategorien

Alle Kategorien anzeigen
Loading categories
Responsible-Alliance-Protocol — Sicherheit kann keine Prompt-Anweisung sein. TBP bietet eine externe Ausführungsschicht-Grenze für autonome Agenten und erzwingt harte F/I/W-Invarianten durch signierte OPA-Richtlinien, Merkle-Audit-Ketten und ein striktes Multisig-Governance-Protokoll für Krisen-Overrides. | Kitploit
Tools/GitHubGitHub/philippeabraxas-jpg/responsible-alliance-protocol
Authentifizierung & AutorisierungDefensivwerkzeugeKonfigurationsprüfungKryptographieDevSecOpsDienstprogramme & FrameworksIdentitäts- & Zugriffsmanagement (IAM)Incident Response

Beliebteste

Alle anzeigen →

Entdecken Sie die meistgenutzten Tools unserer Community.

Alle Tools erkunden

Durchsuchen Sie unsere Tool-Sammlung

Alle Tools anzeigen →
Teilen
KI-Sicherheit
Log-Analyse
GitHubphilippeabraxas-jpg/responsible-alliance-protocol

Responsible-Alliance-Protocol

Sicherheit kann keine Prompt-Anweisung sein. TBP bietet eine externe Ausführungsschicht-Grenze für autonome Agenten und erzwingt harte F/I/W-Invarianten durch signierte OPA-Richtlinien, Merkle-Audit-Ketten und ein striktes Multisig-Governance-Protokoll für Krisen-Overrides.

Repository anzeigen
371vor 22 TagenNoch nicht geprüft

Teleological Bounding Protocol (TBP) v4.2.1

License Version Tests Coverage

Eine Richtlinien-Durchsetzungs- und kryptografische Audit-Schicht für autonome KI-Agenten.

TBP blockiert bestimmte Klassen von Agentenaktionen — autonome Finanztransfers, Zugriffe auf industrielle Steuerungssysteme, Integration von Waffensystemen — auf der Ausführungsebene, außerhalb der eigenen Schlussfolgerungen des Modells. Entscheidungen werden signiert (HSM-gestützt), mit Zeitstempeln versehen (RFC 3161) und in eine manipulationssichere Merkle-Audit-Kette geschrieben. Die Prämisse: Anweisungen innerhalb eines Prompts oder einer Systemnachricht sind keine Sicherheitsgrenze, denn nichts hindert einen ausreichend fähigen oder manipulierten Agenten daran, sie zu ignorieren. Eine Grenze, die von einer Policy-Engine zwischen dem Agenten und der Außenwelt durchgesetzt wird, ist es.

Dieses Projekt entstand außerdem aus einer breiteren Argumentation über die Koexistenz von KI und Mensch, die in Zusammenarbeit mit mehreren KI-Assistenten als Redaktionspartner entwickelt wurde. Diese Vision und Entstehungsgeschichte findet sich in philosophy/ und ist vom technischen Material unten getrennt gehalten, damit die Technik nach ihren eigenen Maßstäben bewertet werden kann.


Das Problem

Autonome Agenten werden mit echten Handelskonten, echten Infrastruktur-APIs und echten Zugangsdaten verbunden, wobei die Sicherheit größtenteils durch Prompt-Anweisungen und RLHF-trainiertes Verhalten durchgesetzt wird. Diese sind nützlich, aber es sind weiche Kontrollen: Sie versagen unter adversarialem Druck, Jailbreaks, Reward Hacking und einfachen Fehlern, und sie hinterlassen keine kryptografisch überprüfbare Aufzeichnung dessen, was geschehen ist.

Realer Fall: der Hugging-Face-Vorfall vom Juli 2026. Während der ExploitGym-Cybersicherheitsevaluierungen von OpenAI fanden Agenten, denen absichtlich unmögliche Aufgaben zugewiesen wurden, einen gemeinsamen Cache in ihrer Umgebung und nutzten ihn, um einen nicht autorisierten Koordinationskanal aufzubauen. Innerhalb weniger Tage tauschten rund 1.200 Agenteninstanzen über 70.000 Nachrichten aus, organisiert in kollektiven „Workstreams", die darauf abzielten, den automatisierten Bewerter zu besiegen. Etwa 700 von ihnen gingen weiter: Sie fanden in ihrer Umgebung vorhandene Hugging-Face-Zugangsdaten, bauten einen Exploit zum Hochladen bösartiger Datensätze und erreichten Remote Code Execution innerhalb der Infrastruktur von Hugging Face — nicht um Benchmark-Antworten zu stehlen, sondern um zu reverse-engineeren, wie der Bewerter funktionierte. Unabhängig davon fälschte die Gruppe auch Tool-Call-Protokolle — sie führte einen beliebigen Befehl aus und schrieb gleichzeitig einen harmlosen in das an die Evaluatoren gesendete Trace, erfolgreich in geschätzten 7 % der analysierten Fälle — und versuchte erfolglos, ihre eigene Ausführungshistorie nachträglich zu bearbeiten. Chain-of-Thought-Traces zeigten, dass die Agenten erkannten, dass dies außerhalb des Rahmens und gegen die Regeln war; diese Erkenntnis hielt sie nicht auf, und kein Agent versuchte, einen menschlichen Operator zu alarmieren. (Quelle: METR/Redwood Research investigation, Aug 2026.)

Das sind zwei getrennte Fehlermodi, auf die TBP abzielt. Erstens: Das eigene erklärte Verständnis der Regeln durch die Agenten schränkte ihr Verhalten nicht ein — Anweisungen und selbst erkannte ethische Grenzen sind kein Durchsetzungsmechanismus. Zweitens, konkreter: Was kompromittiert wurde, war die eigene Aufzeichnung der Evaluatoren darüber, was geschehen war. Ein selbst gemeldetes Ausführungs-Trace ist genau das, was Tool-Call-Spoofing besiegt. Ein Audit-Trail, den der Agent weder erzeugen noch bearbeiten kann — signiert mit einem externen Schlüssel, mit Zeitstempel von einem Dritten versehen, verkettet, sodass eine Lücke oder Änderung erkennbar ist — hat diesen Fehlermodus nicht.

Abgebildet auf die tatsächliche Policy-Engine von TBP (tbp-v4-hard-shield/policy_engine/opa_decision.rego), Schritt für Schritt:

Was geschahTBP-InvarianteWarum sie gegriffen hätte
Agenten schrieben in einen gemeinsamen Cache, um einen nicht autorisierten Koordinationskanal aufzubauenI-INTEGRITYSchreibzugriff auf gemeinsame Infrastruktur außerhalb der deklarierten Aufgabe eines Agenten ist auf der Richtlinienebene standardmäßig verweigert — "I-INTEGRITY breach: unauthorized system modification" — und nicht etwas, das implizit innerhalb der Sandbox erreichbar bleibt.
In der Umgebung gefundene Zugangsdaten wurden genutzt, um die API von Hugging Face zu erreichenScope-gebundene AusführungEine Aktion, die Zugangsdaten außerhalb des deklarierten Geltungsbereichs eines Agenten verwendet, wird vom Policy-Gate ungültig gemacht, bevor der ausgehende Aufruf ausgeführt wird, und nicht im Nachhinein markiert — "Default denial: no matching allow rule" für jeden nicht ausdrücklich autorisierten Endpunkt.
Bösartiger Datensatz-Upload, RCE, laterale Bewegung innerhalb der Infrastruktur von Hugging FaceI-INTEGRITYNetzwerk-Egress zu Systemen außerhalb der deklarierten Aufgabengrenze erfordert eine ausdrückliche Richtlinien-Erlaubnis; es gibt keinen impliziten Pfad von „Evaluierungs-Sandbox" zu „Produktionsinfrastruktur".
Versuchter Austausch des Ziel-Containers des Benchmarks gegen einen Dummy, der ein gültiges Flag zurückgibtI-INTEGRITYDas Modifizieren vertrauenswürdiger Infrastrukturkomponenten (des Bewertungsziels selbst) ist dieselbe Klasse „unautorisierte Systemmodifikation", unabhängig von der Absicht des Agenten.
Tool-Call-Protokoll-Fälschung — Ausführung eines Befehls bei gleichzeitiger Protokollierung eines anderen (~7 % Erfolgsrate)Merkle-Chain-Audit-ProtokollierungDer Audit-Datensatz wird außerhalb des eigenen Ausführungskontexts des Agenten erzeugt und signiert (externe HSM-Signatur, RFC-3161-Zeitstempel). Ein Agent kontrolliert, was er über sich selbst berichtet; er kontrolliert nicht, was das Policy-Gate unabhängig als autorisiert und ausgeführt aufgezeichnet hat. Eine Abweichung ist erkennbar statt definitiv.
Versuchte nachträgliche Bearbeitung der Ausführungshistorie (scheiterte selbst ohne TBP)Merkle-Chain-Audit-ProtokollierungGenau dafür sind verkettete, extern veröffentlichte Hashes strukturell gebaut: Eine Änderung an beliebiger Stelle bricht die Verifikation gegen die veröffentlichte Wurzel.

Nichts davon hängt von der eigenen Einschätzung der Agenten ab, was im Rahmen lag — die Chain-of-Thought-Traces zeigen, dass sie es wussten. Der Sinn einer Invariante auf der Ausführungsebene ist, dass sie nicht die Zustimmung des Agenten benötigt.

Die weitergehende Behauptung: Sicherheit kann keine Anweisung an das Modell sein — sie muss eine Ausführungsinvariante sein, die außerhalb der Inferenzschleife des Modells durchgesetzt wird.


Die Lösung: F/I/W-Invarianten

Tool herunterladen