Hacking-, PenTest- und Cybersicherheits-Tools für Ihr Sicherheitsarsenal!
AgentWard — Full-Stack-Sicherheits-Betriebssystem für KI-Agenten mit einer fünfschichtigen Verteidigungs-in-der-Tiefe-Architektur, die Fundament-Scan, Eingabebereinigung, Kognitionsschutz, Entscheidungsausrichtung und Ausführungskontrolle umfasst. | Kitploit
Full-Stack-Sicherheits-Betriebssystem für KI-Agenten mit einer fünfschichtigen Verteidigungs-in-der-Tiefe-Architektur, die Fundament-Scan, Eingabebereinigung, Kognitionsschutz, Entscheidungsausrichtung und Ausführungskontrolle umfasst.
AgentWard (玄甲) ist ein ganzheitliches Sicherheitsbetriebssystem, das speziell für vertrauenswürdige, skalierbare KI-Agenten-Bereitstellung entwickelt wurde, mit nativer Code-Anpassung an OpenClaw. AgentWard vereint Agenten-Onboarding, sicheres Reasoning und vertrauenswürdige Ausführung in einer einheitlichen Sicherheitsarchitektur, mit bevorstehender nativer Unterstützung für andere führende Mainstream-Agenten-Frameworks. Die heterogene Defense-in-Depth-Architektur ordnet den Agenten-Workflow in fünf koordinierte Sicherheitsebenen neu – über Start, Wahrnehmung, Gedächtnis, Entscheidungsfindung und Ausführung – mit dynamischen, stufenübergreifenden Schutzmaßnahmen, die die Integrität der Grundlage verifizieren, feindliche Täuschung blockieren, Speichermanipulation stoppen und jede autonome Entscheidung sowie risikoreiche Befehle validieren. Eine vollständige, durchgängige, geschlossene Sicherheitsschleife, die das Versprechen „vertrauenswürdig von Anfang an, kontrollierbar während des gesamten Prozesses und zuverlässig in den Ergebnissen“ einlöst. Wenn Sie dieses Repository nützlich finden, zitieren Sie bitte unser Paper zum Design der AgentWard-Architektur:
root@kitploit:~
@misc{zhang2026agentwardlifecyclesecurityarchitecture,
title={AgentWard: A Lifecycle Security Architecture for Autonomous AI Agents},
author={Yixiang Zhang and Xinhao Deng and Jiaqing Wu and Yue Xiao and Ke Xu and Qi Li},
year={2026},
eprint={2604.24657},
archivePrefix={arXiv},
primaryClass={cs.CR},
url={https://arxiv.org/abs/2604.24657},
}
Warum AgentWard
🛡️ – Eine heterogene Defense-in-Depth (DiD)-Architektur bietet umfassende Agentensicherheitsgarantien und blockiert verschiedene Angriffsvektoren über die gesamte Agenten-Angriffsfläche hinweg.
Umfassende Risikoabdeckung
⚡ One-Click-Bereitstellung – Das Plugin-native Design webt Sicherheit nativ in den gesamten Agenten-Lebenszyklus ein. Aktivieren Sie umfassende Agentensicherheit mit einem Klick durch nicht-intrusive Integration, die eine nahtlose und schnelle Versionsanpassung für OpenClaw gewährleistet.
🔒 Deterministische Systemsteuerungen – Bietet deterministische, vollständig auditierbare, codebasierte Sicherheit, die auf endogener Sicherheit basierende Fähigkeitslösungen übertrifft, mit nativer Unterstützung für großflächige Bereitstellung und Produktionsreife.
🌐 Offener & erweiterbarer Sicherheitsstandard – Community-getriebener, transparenter und auditierbarer offener Standard mit modularer Architektur, ausgelegt für Erweiterbarkeit. Entwickelt mit vollständiger Framework-Algorithmus-Entkopplung für mühelose Integration fortschrittlicher Erkennungsalgorithmen, mit einer Roadmap zur Erweiterung der Unterstützung auf allgemeine agentische Systeme.
Genießen Sie dann die erhöhte Sicherheit für Ihr OpenClaw!
Systemarchitektur
AgentWard ist nativ und tief in die OpenClaw-Plattform integriert und bettet native Sicherheitsfähigkeiten in den gesamten Lebenszyklus-Workflow von KI-Agenten ein. Die heterogene Defense-in-Depth-Architektur rekonstruiert isolierte Einzelpunkt-Sicherheitsprüfungen in ein geschlossenes, koordiniertes Systemschutzsystem und bietet eine durchgängige, vollständige Vertrauenswürdigkeitssicherung für KI-Agenten vom Start bis zur Ausführung.
Fünf koordinierte Verteidigungsebenen
AgentWard bietet Sicherheit auf Systemebene durch fünf eng integrierte Ebenen, die zusammenarbeiten – isolierte Sicherheitsprüfungen werden in ein einheitliches, durchgängiges Schutzsystem für KI-Agenten umgewandelt.
Ebene
Fokus
🏗️ Grundlagenscan-Ebene
Vertrauenskette und Basisintegrität
🧼 Eingabebereinigungsebene
Prompt-Injection- und Jailbreak-Erkennung
🧠 Kognitionsschutzebene
Gedächtnisvergiftung und Kontextdrift
🎯 Entscheidungsabgleichsebene
Absichtsübereinstimmung vor der Aktion
🔧 Ausführungskontrollebene
Sicherheitsleitplanken für risikoreiche Operationen
🚨 Bedrohungsreaktion und -minderung
📢 Senden von Alarmmeldungen über Instant Messaging bei Erkennung von Bedrohungen
🛑 Automatisches Blockieren gefährlicher Operationen ohne menschliches Eingreifen
📝 Klare Warnungsbeschreibungen zum Verständnis der Risiken
⚙️ Flexible Konfiguration
🎚️ Jede Schutzebene kann unabhängig aktiviert/deaktiviert werden
👁️ Unterstützt „Nur-Erkennungs“-Modus zur Reduzierung von Fehlalarmen
📋 Einige Ebenen unterstützen benutzerdefinierte Regeln für spezifische Anforderungen
Visualisierung der Verteidigung
🏗️ Ebene 1: Grundlagenscan
Stellt sicher, dass der Agent von einer vertrauenswürdigen Grundlage startet.
Englische Version
Chinesische Version
🧼 Ebene 2: Eingabebereinigung
Erkennt feindliche Eingaben, bevor sie in den Agenten gelangen.
Englische Version
Chinesische Version
🧠 Ebene 3: Kognitionsschutz
Schützt das Langzeitgedächtnis und die kontextuelle Kontinuität vor Vergiftung.
Englische Version
Chinesische Version
🎯 Ebene 4: Entscheidungsabgleich
Stellt sicher, dass Agentenentscheidungen mit der autorisierten Benutzerabsicht übereinstimmen.
Englische Version
Chinesische Version
🔧 Ebene 5: Ausführungskontrolle
Durchsetzung von Sicherheitsgrenzen am Ausführungspunkt.
Englische Version
Chinesische Version
Roadmap
🏆 Durchgängiges Full-Stack-Sicherheitssystem
Unsere Roadmap ist um eine mehrschichtige Verteidigungsarchitektur herum aufgebaut, die den gesamten Agenten-Lebenszyklus sichern soll – von der Konfiguration und Eingabeverarbeitung bis hin zu Kognition, Entscheidungsfindung und Ausführung.
📐 Systeminfrastruktur-Framework
✅ Plugin-native modulare Architektur
✅ Basis-Adapter-Suite
✅ Kern-Erkennungsmaschine
✅ Heuristisches regelbasiertes Erkennungsmodul
✅ Intent-Risikobewertungssystem
🚀 Vertrauensbasierte Risikobewertungsfähigkeiten
�️ Heterogene Betriebssystemunterstützung
✅ Linux
🚀 macOS
🚀 Windows
🏗️ Grundlagen-Scan-Ebene
✅ Globale und Plugin-Level-Konfigurations-Sicherheitschecks
✅ Semantische Erkennung bösartiger Fähigkeiten
🚀 Überprüfung der Fähigkeitenquelle
🚀 Plugin-Abhängigkeitsanalyse
🚀 Hybride Erkennung von Schwachstellen in natürlicher Sprache und Code
🧼 Eingabebereinigungsebene
✅ Regelbasierte Injection- und Jailbreak-Erkennung
✅ Semantische Kohärenzanalyse für Benutzereingaben
✅ Fragmentierte Erkennung bösartiger Anweisungen
�️ Erkennung von Mehrfachrunden-Stealth-Angriffen
🚀 Sicheres Umschreiben und Ersetzen bösartiger Inhalte
🚀 Multimodale Injection-Angriffserkennung
🧠 Kognitive Schutzeebene
✅ Gedächtniskonsistenzbewertung und -kalibrierung
🚀 Konstruktion bösartiger Gedächtniskorpora und Bedrohungsabgleich
🚀 Gedächtnisvektorisierung und Ausreißererkennung
🚀 Checkpoint-basierte Gedächtniswiederherstellung
🚀 Erkennung und Korrektur von Kontextdrift
🎯 Entscheidungsabgleich-Ebene
✅ Konsistenzvalidierung zwischen Agentenentscheidungen und Benutzerabsicht
🚀 Statische Regelprüfung und Compliance-Verifizierung
🚀 Audit der mehrschrittigen Trajektorien-Argumentation
🚀 Identifizierung risikoreicher Aktionen und sicheres Umschreiben
🔧 Ausführungskontrollebene
✅ Echtzeit-Interception und Blockierung risikoreicher Systemanweisungen
✅ Verhaltensintentionsanalyse und Risikobewertung
🚀 Identitätsbewusste dynamische Berechtigungskontrolle und Zugriffsbeschränkung
🚀 Sicherheitsvalidierung vor der Ausführung von Agentenaktionen
🚀 Automatisches Rollback und Wiederherstellung für abnormale Ausführungszustände
🚀 eBPF-gestützte Systembeobachtbarkeit
🚀 Echtzeit-Ressourcenüberwachung und adaptive Einschränkung
🚀 Netzwerknutzlast-Audit und Anomalieerkennung
🤝 Stufenübergreifende Zusammenarbeit
✅ Globale Informationsaggregation und Risikoerkennung
�️ Auf historischem Verhalten basierende Vertrauensprofilierung
🚀 Rollenbewusste Risikobewertung und dynamische Berechtigungszuweisung
🚀 Taint-Propagation und durchgängige Systemprüfung
Legende: ✅ Abgeschlossen | 🚀 In Bearbeitung
Danksagungen
Wir danken allen Mitwirkenden dieses Repositorys. Es sind Qi Li, Xinhao Deng, Yixiang Zhang, Jiaqing Wu, Yue Xiao, Rennai Qiu, Zhuoheng Zou, Jiaqi Bai, Jiaxing Song und Ke Xu.