自主多智能体AI渗透测试引擎:一个受管控的工具沙箱、一个不可变的证据与验证门控,以及一个可复现的安全智能体评估环境。
一个用于授权安全评估的多智能体引擎。 一个根规划器将任务委派给侦察、发现、攻击(OPTIZero)、验证和报告智能体——而无论由哪个模型驱动,引擎本身都会强制执行范围、出口、证据和资源策略。发现需要真实的执行证据加上独立验证;一个令人信服的故事证明不了任何东西。
它针对自己的易受攻击场景基准进行评分——确定性模拟求解器保持 24/24,得分 100/100——并且可以完全离线地针对任何 OpenAI 兼容的本地模型运行。
早期测试版,正在积极开发中。 行为可能随时更改,恕不另行通知;某些功能是部分的或有意省略的。在依赖它之前请先验证——参见状态矩阵。
大多数攻击性工具都信任模型的良好行为。OIHK 不这样:安全边界存在于引擎中,并且无论模型愿意说什么,它都保持不变。
example.com 并不授权其子域;声明的主机在整个运行过程中被 DNS 固定。git clone https://github.com/Broskigx/Oihk-pentesting.git
cd Oihk-pentesting
uv sync
uv run oihk --help
uv run oihk run -t https://example.test --mode passive --scan-mode standard
在 Kali Linux 上,请先确保 Docker 正在运行(sudo systemctl start docker)。
或者打开 Baron,交互式副驾驶——你说话,它驱动受治理的引擎(默认被动,除非你授权深度评估):
uv run oihk start
Baron 运行真实评估,从 156 个工具的 RAG 语料库中以精确的工具配方作答,通过 OSINT(page_osint、username_osint、domain_osint、breach_osint、phone_osint)进行转向,并在 Redis 中记住每个会话。它永远不会获得原始 shell——只有受治理的引擎——而且一切都是菜单驱动的:/apimodel、/adaptador 和 /instancia 打开交互式 Textual 选择器。
默认指向 http://localhost:1234/v1 上的 LM Studio:
export OIHK_LLM="openai/mistral-nemo"
export OIHK_API_BASE="http://localhost:1234/v1"
export OIHK_API_KEY="lm-studio"
/apimodel六个预设中的任何一个都可以用一条命令连接;每个都记住自己的密钥:
/apimodel claude sk-ant-… # Anthropic
/apimodel chatgpt sk-… # OpenAI
/apimodel gemini AIza… # Google AI Studio
/apimodel grok xai-… # xAI
/apimodel deepseek sk-… # DeepSeek
/apimodel nvidia nvapi-… [model] # NVIDIA NIM
/apimodel(无参数)打开平台选择器;/apimodel <plataforma> 使用保存的密钥重新连接;/apimodel off 断开连接。任何其他 OpenAI 兼容提供商都可以通过 /models base + /models key + /models use 工作。
两个云前缀还可以在环境变量层面移除所有端点设置:deepseek/… 和 nvidia_build/… 路由到各自的提供商 API——设置密钥,别无其他。按角色覆盖(OIHK_ROOT_LLM、OIHK_RECON_LLM 等)将逻辑角色路由到不同的模型。
OIHK 最适合与一个不会过度拒绝的模型配合使用:经过重度安全调优的助手会拒绝合法、授权的攻击性步骤,并在评估中途使智能体停滞。这不会降低 OIHK 的安全性——边界从来不是模型的拒绝;而是引擎的精确范围、故障关闭出口、受治理工具表面和证据门,无论模型说什么,这些都保持不变。
一个根规划器拥有一个带修订的 ScanPlan,并将步骤委派给子智能体。每次受治理的工具调用在执行前都要通过四个策略权威——模式/角色、精确范围、资源调控器、沙箱出口——其输出成为运行账本中不可变的证据。只有验证智能体才能将该证据转化为发现;在关键工作未完成时,根无法结束运行。运行从工件恢复(--resume <run-id>)并落在 oihk_runs/<run-id>/ 下(计划、证据、验证、发现、SARIF、报告)。
flowchart TB
OP([Operator: scope + mode]) --> ROOT[Root planner]
ROOT --> RECON[Recon]
ROOT --> DISC[Discovery]
ROOT --> ATTACK[Attack - OPTIZero]
ROOT --> VALID[Validation]
ROOT --> REPORT[Reporting]
RECON --> GATE
DISC --> GATE
ATTACK --> GATE
VALID --> GATE
subgraph GATE[Policy authorities - fail closed]
direction LR
M[Mode / role] --> S[Exact scope] --> G[Resource governor] --> BOX[Sandbox: egress allowlist]
end
GATE --> LEDGER[(Evidence ledger)]
LEDGER --> VALID
VALID --> FIND[Findings + SARIF report]
</mermaid>OPTIZero,即 attack 角色,带来一个针对 Windows、Linux 和 macOS 的声明式权限提升向量目录,置于自适应 AIMD 速率限制器之后——而根在飞行中控制整个集群(list_children、send_message、stop_child、broadcast)。详情见 ARCHITECTURE。
OIHK 兼作自己的评估环境:真实引擎针对 24 个捆绑的易受攻击场景运行——web、API、认证、源代码、配置,以及与 AutoPenBench 对齐的提权/加密/CVE——一个程序化验证器在发现正确性、证据有效性、工具使用、效率和误报避免方面给出归一化的 0–100 分。没有模型给自己评分。
uv run oihk eval list
uv run oihk eval run-all --model mock
uv run oihk eval compare --models mock,mock:wrong_finding
同一个测试框架作为 verifiers 环境发布在 Prime Intellect Hub 上(broskigx/oihk-security-agent):
prime env install broskigx/oihk-security-agent
vf-eval oihk-security-agent -m mock
完整场景表、评分公式和基准映射:EVALUATION。
oihk/ CLI, policy/governance, agents, tools, sandbox, findings
oihk/evals/ evaluation subsystem (scenarios, verifier, scoring, mock provider)
environments/ standalone verifiers environment package (Prime Intellect Hub)
containers/ sandbox image, entry point, browser driver, SBOM generation
deploy/ local-model LoRA pipeline: dataset trainer, Ollama Modelfiles
docs/ architecture, security boundary, configuration, evaluation
tests/ unit, regression, and opt-in integration tests
ToolsHelp/ RAG corpus: 156 governed-tool cards
skills/ external-agent skill packs
scripts/build_lora_dataset.py 从受治理工具语料库和 24 个评估场景生成一个双语(西班牙语/英语)LoRA 数据集——每种 536 个样本,其中 336 个带有真实工具调用——包括安全行为(范围纪律、docker 门、注入抵抗)。针对 Qwen2.5-14B-Instruct 训练它,导出 Q4_K_M GGUF,并在 Ollama 或 LM Studio 中提供服务:完整流程见 deploy/local-models。
仅限授权使用。 OIHK 主动测试提供给它的目标。操作者全权负责授权、安全限制、目标可用性、数据处理以及遵守适用法律。
要报告 OIHK 本身的安全漏洞,请参见报告漏洞。
根据 MIT 许可证 发布——可自由使用、修改和分发,包括商业用途,只要版权声明和许可证文本保持不变。
| 操作系统 | Windows 10/11 和 Linux(已测试 Kali)。macOS 未测试。 |
| Python | 3.12+ 及 uv |
| Docker | 扫描沙箱化所需。Baron 的被动 OSINT 无需它即可工作。 |
| 内存 | 最低 8 GB,推荐 16 GB |
| GPU | OIHK 不要求。本地模型在 CPU 或 GPU 上运行——其自身要求是模型的要求。 |
| 模型 | 任何 OpenAI 兼容端点(默认 LM Studio),或通过 /apimodel 使用云密钥:Claude、ChatGPT、Gemini、Grok、DeepSeek、NVIDIA NIM |
| 文档 | 内容 |
|---|
| ARCHITECTURE | 智能体图、计划存储、策略权威、OPTIZero |
| SECURITY | 信任边界、威胁模型、报告漏洞 |
| STATUS-MATRIX | 已实现、部分实现或有意省略的内容 |
| CONFIGURATION | 完整环境变量参考——治理、沙箱、内存 |
| EVALUATION | 24 个场景、验证器、评分、AutoPenBench 映射 |
| FINDINGS | 发现模式、SARIF、修复工件 |
| PRIME-INTELLECT | Verifiers 环境和计算框架 |
| CHANGELOG | 每个版本的每项更改 |
| .env.example | 操作环境变量子集 |