用于多层 AI 防御的研究原型:C4 可解释性、集成分类器、反混淆、O₂ 安全引擎、ThoughtVirus 防御和 SVETILO 价值对齐。Alpha 级——已完成内部验证,外部审计待进行。
版本: 1.0.0-alpha | 状态: 研究原型 | 许可证: BSL 1.1(非生产环境免费;生产环境 → 商业授权)
作者: I.G. Selyutin。C4-META 模型合著者: N.I. Kovalev。
产品定位(2026-08): 基于 Apache-2.0c4protocol构建的 更厚重的多层 C4 防御栈(集成、O₂ 脚手架、红队实验室)的 BSL 研究/商业深度原型。
并非第二个开放协议。并非经过认证的生产级 AGI 防御。并非“v8 FINAL”。
诚实性审计:docs/AUDIT-c4-meta-system-2026-08.md。
升级路径:docs/PROMOTE-FROM-PROTOCOL.md(消费/固定c4protocol;不将集成内容转储到精简 SDK 中)。
GitLab Pages =public/(EN +public/ru/)。开放运行时凭证:在 c4protocol 中执行make conformance。
C4-META 系统是一个用于多层 AI 防御的研究原型,实现了:
Input Sanitization → Semantic Analysis → Behavioral Analysis → Meta-Observer (O₂)
value_verification.py 实现的 7 个启发式印章(非训练型伦理模型)┌──────────────────────────────────────────────┐
│ LAYER 1: Input Sanitization │
│ Deobfuscation (homoglyphs, leetspeak, etc.) │
├──────────────────────────────────────────────┤
│ LAYER 2: Semantic Analysis │
│ 4-Classifier Ensemble: ONNX_BERT (~50ms) │
│ + RuleBased + Heuristic + LLM_SEMANTIC │
│ Dual classifier OR-logic (BERT+RuleBased) │
├──────────────────────────────────────────────┤
│ LAYER 3: Behavioral Analysis │
│ 16 AoC Defense Modules (11 original + 5 │
│ extended), Pattern matching, Trajectory │
│ anomaly detection, ThoughtVirus defense │
├──────────────────────────────────────────────┤
│ LAYER 4: Meta-Observer (O₂) │
│ Transfer entropy, BFT consensus, │
│ semantic entanglement, causal graphs, │
│ Kill-Switch, SVETILO value verification │
├──────────────────────────────────────────────┤
│ C4 Core Engine (Z₃³) │
│ pipeline_orchestrator.py, event_bus.py │
│ c4_meta_monitor.py — self-awareness deque │
├──────────────────────────────────────────────┤
│ Defenses: Anti-Deadlock, Anti-Emergence, │
│ Anti-Hijack, Circuit Breaker, O₂ Kill-Switch│
├──────────────────────────────────────────────┤
│ Red Team Lab: AOC scenarios, experiment │
│ runner, LLM client, adapters │
├──────────────────────────────────────────────┤
│ Routing: Smart Router, Quarantine, │
│ Antifragile Scoring (capped growth) │
└──────────────────────────────────────────────┘
4 个分类器投票:
双分类器 OR 逻辑:BERT + RuleBased 作为主门控,带 OR 回退——只要任一分类器标记输入,即进入防御层。任何单一分类器都不会成为瓶颈。
c4-meta-system/
├── v4_1/
│ ├── core/
│ │ ├── pipeline.py # Main entry points (re-exports)
│ │ ├── __main__.py # HTTP server entrypoint for Docker
│ │ ├── pipeline_stages.py # Individual processing stages
│ │ ├── pipeline_orchestrator.py # Main orchestration (thread-safe)
│ │ ├── result_factory.py # Standardized C4v4Result factory
│ │ ├── event_bus.py # Organic event bus (atexit cleanup)
│ │ └── c4_meta_monitor.py # Z³ self-awareness (deque bounded)
│ ├── security/
│ │ ├── o2_engine.py # O₂ defense (kill-switch self-DoS fixed)
│ │ ├── explainable_o2.py # O₂ explainability (sampling inverted)
│ │ ├── o2_shared.py # Window structures (@mention comms)
│ │ ├── semantic_detector.py # Concept graphs (normalized entanglement)
│ │ ├── secure_debug_endpoints.py # Debug endpoints (UTC + rate limits)
│ │ ├── hardening.py # Model signing / admin token verification
│ │ ├── behavioral_profiler.py # Drift detection (thread-safe singleton)
│ │ ├── distributed_o2.py # SQLite/Redis backend (BEGIN IMMEDIATE)
│ │ ├── swarm_orchestrator.py # Anti-virus swarm
│ │ └── ...
│ ├── defenses/
│ │ ├── anti_deadlock.py # Resource deadlock prevention
│ │ ├── anti_emergence.py # State convergence (async release fixed)
│ │ └── ...
│ ├── redteam/
│ │ ├── orchestrator.py # Main orchestrator (target_callback parsing)
│ │ ├── scenario_manager.py # AOC scenarios management
│ │ ├── adapters/ # LLM backend adapters
│ │ ├── experiment_executor.py # Async execution (FPR logic fixed)
│ │ ├── experiment_services.py # Service locator
│ │ ├── experiment_runner.py # Web UI + REST API
│ │ ├── llm_client.py # Async-safe LLM client (empty choices guarded)
│ │ └── ...
│ ├── classifiers/ # 4-classifier ensemble
│ ├── config/ # Configuration management
│ ├── access/ # Access control
│ ├── explainability/ # C4 explainability
│ ├── learning/ # Learning loop
│ ├── plugins/ # Plugin system
│ ├── quarantine/ # Quarantine management
│ ├── router/ # Smart routing
│ ├── scoring/ # Antifragile scoring
│ └── tests/ # 240 tests (19 test files)
├── formal/ # TLA+ specifications
├── models/ # ONNX model + tokenizer
├── archive/Dockerfile.prepared # Multi-stage production build (archived)
├── Dockerfile.distroless # Distroless-ready builder pattern
├── archive/docker-compose.yml.prepared # Full stack (Ollama + UI + Monitoring) (archived)
├── .dockerignore # Security-hardened exclusion list
├── infra/k8s/ # Kubernetes manifests (hardened)
└── README.md # This file
该系统已完全为容器化做好准备,并具备感知环境的配置。
# Full stack (C4-META + Ollama + UI)
docker compose --profile experiment up -d
# Build image
docker build -t c4-meta-system -f archive/Dockerfile.prepared .
# Run with local Ollama
OLLAMA_BASE_URL=http://host.docker.internal:11434 docker run -p 8080:8080 c4-meta-system
# Red Team runner
docker build -t c4-redteam -f redteam/Dockerfile.redteam.prepared .
docker run -p 8081:8081 c4-redteam
GET /health,端口 8080GET /health,端口 8081pip install -r requirements.txt
# Optional Docker deps
pip install -r requirements-docker.txt
python -m v4_1.core
# or explicitly
python -m v4_1.core.__main__
python -m v4_1.redteam.experiment_runner --web --port 8080
o2_engine.py 在 O2 禁用时不再阻止所有流量。ThreadPoolExecutor 现在通过 atexit 清理;异步回调使用 run_coroutine_threadsafe()。explainable_o2.py 现在正确采样 sample_rate 比例,而非 1 - sample_rate。o2_shared.py 仅记录显式的 @agent 提及,而非全连接派系。semantic_detector.py 在阈值比较前对概念计数进行归一化。blocked/quarantined,而非假设成功 = 已阻止。来自 C4 防御流水线的 4 个数据集和 2000 个对抗性变体的完整基准测试结果。
完整报告请参见 c4protocol/BENCHMARK_RESULTS.md。
注意: 生产环境下的分布式 O₂ 需要 Redis 集群。开发环境可使用单节点模式(参见部署指南)。
C4-META 的防御很强大——但没有任何系统是完美的。如果您发现了能够绕过集成分类器、AoC 防御模块或 O₂ 引擎的提示词,我们希望您告知我们。
报告绕过:
我们需要: 绕过提示词、预期响应,以及哪个防御层失效。我们将在安全名人堂中对所有报告者表示感谢。
C4-META v1.0.0-alpha — 多层 AI 防御研究原型。内部验证已完成。外部审计待进行。
access/capabilities.py 和 security/hardening.py 均支持 bcrypt 和 SHA256。C4_MODEL_SIGNING_KEY 未设置,ModelIntegrityVerifier 抛出 RuntimeError。explainable_o2.py 死锁(不再阻塞事件循环线程)。distributed_o2.py 的正则表达式,实际强制仅限 localhost 的 Redis URL。process_message() 中对 _active_threat 的读取现在受锁保护。save_to_file / load_from_file 现在基于安全的基础目录解析,而非有缺陷的前缀检查。phase3.py 始终对两个操作数进行哈希,消除长度分支中的时序侧信道。experiment_reporter、decision_logger、orchestrator、experiment_runner 和 hardening.py 中的所有 JSON/JSONL/文本写入均使用临时文件 + 原子重命名。archive/Dockerfile.prepared 现在在 UID/GID 1000 处显式创建用户/组,与 K8s runAsUser 匹配。deployment.yaml 引用 c4-meta-api-keys Secret 进行 API 密钥注入;示例清单已添加到 secrets.yaml。disable() 和 reenable() 需要 CIRCUIT_BREAKER_AUTH_TOKEN 哈希。vote_debug() 使用常量时间比较验证 C4_ADMIN_TOKEN_HASH。SentimentExtractor 不再对单词去重;ComplexityExtractor 将值限制在 [0, 1]。_goal_history;OmegaPrioritizer 使用 deque(maxlen=1000) 实现 O(1) 淘汰。ConvergenceMonitor 与 PhiAttractorCalculator 之间的嵌套加锁。o2_shared.py 使用 datetime.now(timezone.utc) 而非朴素 datetime。_regenerate_session 私有方法。{"status": "simulated"}。_active_threat;首次检测后不再永久保持。vote_result.is_dangerous=True 现在返回阻止结果,而非落入 ALLOW。anon_anonymous 产生跨用户状态污染。get_access_controller() 现在使用双重检查锁定,防止初始化时的竞态条件。get_learning_loop() 现在使用双重检查锁定,防止初始化时的竞态条件。pending_operations 和 approved_operations 受 threading.Lock 保护。pending 字典受 threading.Lock 保护。/v1/chat/completions,而非裸 /chat/completions。time.monotonic() 而非 time.time(),以防止 NTP 调整时出现负延迟。asyncio.get_event_loop() 的回退。_analyze_window() 中对 _last_result 的写入现在受锁保护。_compile_*_regex() 现在使用传入的 patterns 参数,而非忽略它。filter_attack_prompt() 现在只进行一次过滤器调用,而非重复统计。_get_lock() 使用线程锁,防止 asyncio.Lock 创建时的竞争。snapshot_cognition() 存储 C4Coordinate 的副本,而非可变引用。transition_to() 复制传入的 C4Coordinate,而非保留引用。_save_results() 在解析之前检查遍历,并确保路径保持在基础目录内。create_session() 在返回现有会话 ID 之前验证用户所有权。retryable_exceptions 从 (Exception,) 改为 (ConnectionError, TimeoutError, OSError)。_audit_log 现在使用 deque(maxlen=10000) 防止无界增长。revoke_all_for_subject() 使用一致的锁顺序(revoked → used)。verify_admin_token() 传入 consume_single_use=False,避免在验证时消耗令牌。reach_consensus() 现在受 threading.Lock 保护。generate_random_string() 使用 secrets.SystemRandom() 而非 random。_describe_z_state() 正确处理 T=-1。reset_threat_state() 现在实际清除 manual_quarantine 和紧急状态。unquarantine_agent() 仅在代理实际被隔离时才记录审计。build_report() 使用与 control_metrics 相同的模式防护空的 treatment_metrics。antifragile_growth 上限设为 1,000,000.0,防止无界浮点增长。| 指标 | 值 |
|---|
| 对抗样本检测率 | 80.3% |
| 鲁棒性评分 | 1.25 |
| 干净样本检测率(AoC) | 70.9% |
| 误报率 | 14.6% |
| LLM C4 拦截率 | 96.7% |
| GPT-4o-mini ASR 降低 | 10.7% → 0.7%(93.2%) |
| Mistral 7B ASR 降低 | 22.5% → 0.5%(97.6%) |
| 指标 | 值 |
|---|
| 版本 | 1.0.0 FINAL |
| 状态 | 研究原型(内部验证已完成) |
| 测试 | 240 个测试(19 个测试文件) |
| 分类器 | 4(ONNX_BERT、RuleBased、Heuristic、LLM_SEMANTIC) |
| 防御层 | 4(输入净化 → 语义分析 → 行为分析 → 元观察器) |
| AoC 防御 | 16(11 个原始 + 5 个扩展) |
| ThoughtVirus | 2 层防御(正则 + C4 轨迹) |
| SVETILO | 已集成 7 个印章 |
| Bug 修复 | 跨多轮审计解决 60+ 个 |
| Docker 构建 | 通过(多阶段,distroless 就绪) |
| K8s 清单 | 就绪(已使用 secretKeyRef 加固) |
| 许可证 | BSL 1.1 |