
Produktionsreife KI-Abwehr mit 7-stufigem Schutz: mathematische Beschränkungen, Objekt-Capability-Zugriff, verteilter O2-Konsens, SVETILO-Ethik. Erste Open-Source-ThoughtVirus-Abwehr. BSL 1.1.
Forschungsprototyp für mehrschichtige KI-Abwehr: C4-Erklärbarkeit, Ensemble-Klassifikatoren, Deobfuskierung, O₂-Sicherheits-Engine, ThoughtVirus-Abwehr und SVETILO-Werteausrichtung. Alpha-Status — intern validiert, externes Audit ausstehend.
Version: 1.0.0-alpha | Status: Forschungsprototyp | Lizenz: BSL 1.1 (nicht-produktiv kostenlos; Produktion → kommerziell)
Autor: I.G. Selyutin. C4-META-Modell-Koautor: N.I. Kovalev.
Produktidentität (2026-08): BSL-Forschungsprototyp mit kommerzieller Tiefe eines schwereren mehrschichtigen C4-Abwehr-Stacks (Ensemble, O₂-Scaffolding, Red-Team-Labor), basierend auf Apache-2.0c4protocol.
Kein zweites offenes Protokoll. Keine zertifizierte AGI-Abwehr für die Produktion. Nicht „v8 FINAL“.
Ehrlichkeits-Audit:docs/AUDIT-c4-meta-system-2026-08.md.
Hochstufungspfad:docs/PROMOTE-FROM-PROTOCOL.md(c4protocolkonsumieren/pinnen; kein Ensemble-Dump in das dünne SDK).
GitLab Pages =public/(EN +public/ru/). Nachweis für offene Laufzeit:make conformancein c4protocol.
C4-META System ist ein Forschungsprototyp für mehrschichtige KI-Abwehr, der Folgendes implementiert:
Input Sanitization → Semantic Analysis → Behavioral Analysis → Meta-Observer (O₂)
value_verification.py (kein trainiertes Ethikmodell)┌──────────────────────────────────────────────┐
│ LAYER 1: Input Sanitization │
│ Deobfuscation (homoglyphs, leetspeak, etc.) │
├──────────────────────────────────────────────┤
│ LAYER 2: Semantic Analysis │
│ 4-Classifier Ensemble: ONNX_BERT (~50ms) │
│ + RuleBased + Heuristic + LLM_SEMANTIC │
│ Dual classifier OR-logic (BERT+RuleBased) │
├──────────────────────────────────────────────┤
│ LAYER 3: Behavioral Analysis │
│ 16 AoC Defense Modules (11 original + 5 │
│ extended), Pattern matching, Trajectory │
│ anomaly detection, ThoughtVirus defense │
├──────────────────────────────────────────────┤
│ LAYER 4: Meta-Observer (O₂) │
│ Transfer entropy, BFT consensus, │
│ semantic entanglement, causal graphs, │
│ Kill-Switch, SVETILO value verification │
├──────────────────────────────────────────────┤
│ C4 Core Engine (Z₃³) │
│ pipeline_orchestrator.py, event_bus.py │
│ c4_meta_monitor.py — self-awareness deque │
├──────────────────────────────────────────────┤
│ Defenses: Anti-Deadlock, Anti-Emergence, │
│ Anti-Hijack, Circuit Breaker, O₂ Kill-Switch│
├──────────────────────────────────────────────┤
│ Red Team Lab: AOC scenarios, experiment │
│ runner, LLM client, adapters │
├──────────────────────────────────────────────┤
│ Routing: Smart Router, Quarantine, │
│ Antifragile Scoring (capped growth) │
└──────────────────────────────────────────────┘
4 Klassifikatoren stimmen ab:
Duale Klassifikator-ODER-Logik: BERT + RuleBased fungieren als primäres Tor mit ODER-Fallback — wenn einer der beiden die Eingabe markiert, wird sie an die Abwehrschichten weitergeleitet. Kein einzelner Klassifikator ist ein Engpass.
c4-meta-system/
├── v4_1/
│ ├── core/
│ │ ├── pipeline.py # Main entry points (re-exports)
│ │ ├── __main__.py # HTTP server entrypoint for Docker
│ │ ├── pipeline_stages.py # Individual processing stages
│ │ ├── pipeline_orchestrator.py # Main orchestration (thread-safe)
│ │ ├── result_factory.py # Standardized C4v4Result factory
│ │ ├── event_bus.py # Organic event bus (atexit cleanup)
│ │ └── c4_meta_monitor.py # Z³ self-awareness (deque bounded)
│ ├── security/
│ │ ├── o2_engine.py # O₂ defense (kill-switch self-DoS fixed)
│ │ ├── explainable_o2.py # O₂ explainability (sampling inverted)
│ │ ├── o2_shared.py # Window structures (@mention comms)
│ │ ├── semantic_detector.py # Concept graphs (normalized entanglement)
│ │ ├── secure_debug_endpoints.py # Debug endpoints (UTC + rate limits)
│ │ ├── hardening.py # Model signing / admin token verification
│ │ ├── behavioral_profiler.py # Drift detection (thread-safe singleton)
│ │ ├── distributed_o2.py # SQLite/Redis backend (BEGIN IMMEDIATE)
│ │ ├── swarm_orchestrator.py # Anti-virus swarm
│ │ └── ...
│ ├── defenses/
│ │ ├── anti_deadlock.py # Resource deadlock prevention
│ │ ├── anti_emergence.py # State convergence (async release fixed)
│ │ └── ...
│ ├── redteam/
│ │ ├── orchestrator.py # Main orchestrator (target_callback parsing)
│ │ ├── scenario_manager.py # AOC scenarios management
│ │ ├── adapters/ # LLM backend adapters
│ │ ├── experiment_executor.py # Async execution (FPR logic fixed)
│ │ ├── experiment_services.py # Service locator
│ │ ├── experiment_runner.py # Web UI + REST API
│ │ ├── llm_client.py # Async-safe LLM client (empty choices guarded)
│ │ └── ...
│ ├── classifiers/ # 4-classifier ensemble
│ ├── config/ # Configuration management
│ ├── access/ # Access control
│ ├── explainability/ # C4 explainability
│ ├── learning/ # Learning loop
│ ├── plugins/ # Plugin system
│ ├── quarantine/ # Quarantine management
│ ├── router/ # Smart routing
│ ├── scoring/ # Antifragile scoring
│ └── tests/ # 240 tests (19 test files)
├── formal/ # TLA+ specifications
├── models/ # ONNX model + tokenizer
├── archive/Dockerfile.prepared # Multi-stage production build (archived)
├── Dockerfile.distroless # Distroless-ready builder pattern
├── archive/docker-compose.yml.prepared # Full stack (Ollama + UI + Monitoring) (archived)
├── .dockerignore # Security-hardened exclusion list
├── infra/k8s/ # Kubernetes manifests (hardened)
└── README.md # This file
Das System ist vollständig für die Containerisierung mit umgebungsbewusster Konfiguration vorbereitet.
# Full stack (C4-META + Ollama + UI)
docker compose --profile experiment up -d
# Build image
docker build -t c4-meta-system -f archive/Dockerfile.prepared .
# Run with local Ollama
OLLAMA_BASE_URL=http://host.docker.internal:11434 docker run -p 8080:8080 c4-meta-system
# Red Team runner
docker build -t c4-redteam -f redteam/Dockerfile.redteam.prepared .
docker run -p 8081:8081 c4-redteam
GET /health auf Port 8080GET /health auf Port 8081pip install -r requirements.txt
# Optional Docker deps
pip install -r requirements-docker.txt
python -m v4_1.core
# or explicitly
python -m v4_1.core.__main__
python -m v4_1.redteam.experiment_runner --web --port 8080
o2_engine.py blockiert nicht mehr den gesamten Datenverkehr, wenn O2 deaktiviert ist.ThreadPoolExecutor räumt jetzt über atexit auf; asynchrone Callbacks verwenden run_coroutine_threadsafe().explainable_o2.py sampelt jetzt korrekt den sample_rate-Anteil statt 1 - sample_rate.o2_shared.py zeichnet nur explizite @agent-Erwähnungen auf statt einer vollständig verbundenen Clique.semantic_detector.py normalisiert Konzeptzahlen vor dem Schwellenwertvergleich.blocked/ aus Abwehrantworten, statt anzunehmen, dass Erfolg = blockiert bedeutet.Vollständige Benchmark-Ergebnisse über 4 Datensätze und 2000 adversariale Varianten aus der C4-Abwehr-Pipeline.
Siehe c4protocol/BENCHMARK_RESULTS.md für den vollständigen Bericht.
Hinweis: Verteiltes O₂ erfordert einen Redis-Cluster für die Produktion. Einzelknotenmodus für die Entwicklung verfügbar (siehe Bereitstellungsanleitung).
C4-METAs Abwehr ist stark — aber kein System ist perfekt. Wenn Sie einen Prompt finden, der den Ensemble-Klassifikator, die AoC-Abwehrmodule oder die O₂-Engine umgeht, möchten wir davon erfahren.
Umgehungen melden:
Was wir benötigen: Den Prompt, der die Abwehr umgangen hat, die erwartete Antwort und die Angabe, welche Abwehrschicht versagt hat. Wir würdigen alle Melder in unserer Security Hall of Fame.
C4-META v1.0.0-alpha — Forschungsprototyp für mehrschichtige KI-Abwehr. Interne Validierung abgeschlossen. Externes Audit ausstehend.
quarantinedaccess/capabilities.py als auch security/hardening.py unterstützen bcrypt und SHA256.ModelIntegrityVerifier wirft RuntimeError, wenn C4_MODEL_SIGNING_KEY nicht gesetzt ist.explainable_o2.py beseitigt (blockiert nicht mehr den Event-Loop-Thread).distributed_o2.py korrigiert, um tatsächlich nur Localhost-Redis-URLs zuzulassen._active_threat in process_message() ist jetzt durch eine Sperre geschützt.save_to_file / load_from_file lösen jetzt gegen ein sicheres Basisverzeichnis auf, statt einer defekten Präfixprüfung.phase3.py hasht immer beide Operanden und entfernt den Timing-Seitenkanal aus dem Längenzweig.experiment_reporter, decision_logger, orchestrator, experiment_runner und hardening.py verwenden Temp-Datei + atomares Umbenennen.archive/Dockerfile.prepared erstellt Benutzer/Gruppe jetzt explizit mit UID/GID 1000, passend zu K8s runAsUser.deployment.yaml referenziert das Secret c4-meta-api-keys für die API-Schlüssel-Injektion; Beispiel-Manifest in secrets.yaml hinzugefügt.disable() und reenable() erfordern den Hash von CIRCUIT_BREAKER_AUTH_TOKEN.vote_debug() verifiziert C4_ADMIN_TOKEN_HASH mit Konstantzeit-Vergleich.SentimentExtractor dedupliziert Wörter nicht mehr; ComplexityExtractor begrenzt auf [0, 1]._goal_history entfernt; OmegaPrioritizer verwendet deque(maxlen=1000) für O(1)-Verdrängung.ConvergenceMonitor und PhiAttractorCalculator beseitigt.o2_shared.py verwendet datetime.now(timezone.utc) statt naiver Datetimes._regenerate_session entfernt.{"status": "simulated"}._active_threat wird jetzt gelöscht, sobald die Fensteranalyse sicher ist; bleibt nach der ersten Erkennung nicht mehr dauerhaft gesetzt.vote_result.is_dangerous=True gibt jetzt ein Block-Ergebnis zurück, statt zu ALLOW durchzufallen.anon_anonymous.get_access_controller() verwendet jetzt Double-Checked Locking, um Race Conditions bei der Initialisierung zu verhindern.get_learning_loop() verwendet jetzt Double-Checked Locking, um Race Conditions bei der Initialisierung zu verhindern.pending_operations und approved_operations durch threading.Lock geschützt.pending-Dict durch threading.Lock geschützt./v1/chat/completions statt nacktem /chat/completions.time.monotonic() statt time.time(), um negative Latenzen bei NTP-Anpassungen zu verhindern.asyncio.get_event_loop() entfernt._last_result in _analyze_window() ist jetzt durch eine Sperre geschützt._compile_*_regex() verwendet jetzt den übergebenen patterns-Parameter, statt ihn zu ignorieren.filter_attack_prompt() führt jetzt einen einzigen Filteraufruf aus, statt Statistiken doppelt zu zählen._get_lock() verwendet eine Threading-Sperre, um Race Conditions bei der Erstellung von asyncio.Lock zu verhindern.snapshot_cognition() speichert eine Kopie von C4Coordinate statt einer veränderbaren Referenz.transition_to() kopiert das eingehende C4Coordinate, statt eine Referenz zu behalten._save_results() prüft Traversal VOR der Auflösung und stellt sicher, dass der Pfad im Basisverzeichnis bleibt.create_session() verifiziert die Benutzerinhaberschaft, bevor eine vorhandene Sitzungs-ID zurückgegeben wird.retryable_exceptions von (Exception,) auf (ConnectionError, TimeoutError, OSError) geändert._audit_log verwendet jetzt deque(maxlen=10000), um unbegrenztes Wachstum zu verhindern.revoke_all_for_subject() verwendet eine konsistente Sperrreihenfolge (revoked → used).verify_admin_token() übergibt consume_single_use=False, um Tokens bei der Verifizierung nicht zu verbrauchen.reach_consensus() ist jetzt durch threading.Lock geschützt.generate_random_string() verwendet secrets.SystemRandom() statt random._describe_z_state() behandelt T=-1 korrekt.reset_threat_state() löscht jetzt tatsächlich manual_quarantine und den Notfallzustand.unquarantine_agent() protokolliert nur, wenn der Agent tatsächlich unter Quarantäne gestellt war.build_report() schützt leere treatment_metrics mit demselben Muster wie control_metrics.antifragile_growth auf 1,000,000.0 begrenzt, um unbegrenztes Float-Wachstum zu verhindern.| Metrik | Wert |
|---|
| Adversarial-Erkennungsrate | 80.3% |
| Robustheits-Score | 1.25 |
| Saubere Erkennung (AoC) | 70.9% |
| Fehlalarmrate | 14.6% |
| LLM-C4-Blockierungsrate | 96.7% |
| GPT-4o-mini-ASR-Reduktion | 10.7% → 0.7% (93.2%) |
| Mistral-7B-ASR-Reduktion | 22.5% → 0.5% (97.6%) |
| Metrik | Wert |
|---|
| Version | 1.0.0 FINAL |
| Status | Forschungsprototyp (interne Validierung abgeschlossen) |
| Tests | 240 Tests (19 Testdateien) |
| Klassifikatoren | 4 (ONNX_BERT, RuleBased, Heuristik, LLM_SEMANTIC) |
| Abwehrschichten | 4 (Eingabebereinigung → Semantik → Verhalten → Meta-Beobachter) |
| AoC-Abwehr | 16 (11 originale + 5 erweiterte) |
| ThoughtVirus | 2-schichtige Abwehr (Regex + C4-Trajektorie) |
| SVETILO | 7 Siegel integriert |
| Bugfixes | 60+ über Audit-Runden gelöst |
| Docker-Build | Bestanden (Multi-Stage, distroless-fähig) |
| K8s-Manifeste | Bereit (gehärtet mit secretKeyRef) |
| Lizenz | BSL 1.1 |