
Richtliniendurchsetzung, Zero-Trust-Identität, Ausführungssandboxing und Audit-Logging für autonome KI-Agenten. Deckt 10/10 des OWASP Agentic Top 10 mit deterministischer, fail-closed Governance ab.
🌍 English | Español | 日本語 | 简体中文 | 한국어
🚀 Quick Start · 📋 Specifications · 📦 PyPI · 📝 Changelog
[!IMPORTANT] Public Preview -- öffentliche Preview-Releases in Produktionsqualität. Vor dem GA können Breaking Changes auftreten.
Policy-Durchsetzung, Identität, Sandboxing und SRE für autonome KI-Agenten. Ein pip install, jedes Framework.
Ihre KI-Agenten rufen Tools auf, durchsuchen das Web, fragen Datenbanken ab und delegieren an andere Agenten. Einmal bereitgestellt, treffen sie Entscheidungen autonom. Sie brauchen Antworten auf drei Fragen:
1. Ist diese Aktion erlaubt? Ein Agent mit Zugriff auf send_email und query_database sollte nicht in der Lage sein, drop_table auszuführen. OAuth-Scopes und IAM-Rollen steuern, welche Dienste ein Agent erreichen kann, nicht, was er tut, sobald er verbunden ist.
2. Welcher Agent hat das getan? In einem Multi-Agenten-System teilen sich möglicherweise fünf Agenten einen einzigen API-Schlüssel. Wenn etwas schiefgeht, ist „ein Agent war es" keine Incident-Response.
3. Können Sie beweisen, was passiert ist? Auditoren und Regulierungsbehörden benötigen manipulationssichere Aufzeichnungen jeder Entscheidung: welche Policy aktiv war, was der Agent angefordert hat und warum sie erlaubt oder verweigert wurde.
Sicherheit auf Prompt-Ebene („bitte befolge die Regeln") ist keine Kontrollfläche. Sie ist eine höfliche Bitte an ein stochastisches System. OWASP LLM01:2025 stellt dies explizit fest: „es ist unklar, ob es narrensichere Methoden zur Prävention von Prompt-Injection gibt." Die veröffentlichten Zahlen belegen dies. Andriushchenko et al. (ICLR 2025) berichten von einer 100%igen Angriffserfolgsrate bei GPT-4o, GPT-3.5, Claude 3 und Llama-3 unter Verwendung adaptiver Angriffe mit Logprob-Zugriff und Suffix-Optimierung, evaluiert gegen den JailbreakBench-Benchmark (Chao et al., NeurIPS 2024). Microsofts eigener AI Red Teaming Agent formalisiert die Attack Success Rate (ASR), die Rate der Policy-Verstöße unter adversarialem Input, als kanonische Metrik für diese Fehlerklasse. Lessons from Red Teaming 100 Generative AI Products unterstreicht den Punkt: „Mitigationen beseitigen Risiken nicht vollständig" und Red Teaming muss ein kontinuierlicher Prozess sein, weil Verteidigungen auf Modellebene konstruktionsbedingt probabilistisch sind.
AGT versucht nicht, diesen Kampf innerhalb des Prompts zu gewinnen. Jeder Tool-Aufruf, jede Nachricht und jede Delegierung wird in deterministischem Anwendungscode abgefangen, bevor die Absicht des Modells die Leitung erreicht. Aktionen, die der AGT-Kernel verweigert, sind nicht „unwahrscheinlich". Sie sind strukturell unmöglich. Das ist der Unterschied zwischen einen Agenten zu bitten, sich zu benehmen, und ihn unfähig zu machen, sich danebenzubenehmen.
Voraussetzungen: Python 3.11+```bash pip install "agent-governance-toolkit[full]"
Verwende die `[full]`-Extra für die untenstehenden Quick-Start-Importe. Das Basis-`agent-governance-toolkit`-Wheel installiert nur die Compliance-CLI; die Governance-Module befinden sich in der konsolidierten Core-Distribution. Der `agentmesh`-Quick-Start-Import bleibt die aktuelle Wrapper-API. Der Import von `agent_os` gibt eine `DeprecationWarning` aus, da die alte `agent-os-kernel`-Distribution veraltet ist. Verwende `agent-governance-toolkit-core` (oder das `[full]`-Extra, das es enthält) als Ersatz-Distribution. Der Host-Code der Policy-Engine verwendet das ACS SDK; `agt-policies` stellt den Einweg-Migrationsbefehl von v4 auf v5 bereit. Das Pre-ACS-Regelmodell `agent_os.policies` ist nicht mehr vorhanden, und `BREAKING_CHANGES.md` listet seine Ersetzungen auf.
Für Claude Code füge AGT als Plugin-Marketplace hinzu und installiere das Governance-Plugin:```text
/plugin marketplace add microsoft/agent-governance-toolkit
/plugin install agt-governance@agent-governance-toolkit
Beliebige Tool-Funktion in zwei Zeilen steuern:```python from agentmesh.governance import govern
safe_tool = govern(my_tool, policy="policy.yaml") # every call checked, logged, enforced
Bei jedem Aufruf wertet `safe_tool` die YAML-Richtlinie aus, protokolliert die Entscheidung in einem Audit-Trail und löst `GovernanceDenied` aus, wenn die Richtlinie die Aktion blockiert.```yaml
# policy.yaml
apiVersion: governance.toolkit/v1
name: production-policy
default_action: allow
rules:
- name: block-destructive
condition: "action.type in ['drop', 'delete', 'truncate']"
action: deny
description: "Destructive operations require human approval"