Skip to content
KitploitKITPLOIT
工具博客
提交
工具博客
提交

黑客、渗透测试和网络安全工具,武装您的安全武器库!

Kitploit 是一个黑客、网络安全和渗透测试工具的目录。发现最新的项目更新,查找漏洞、分析系统、自动化测试并加强你的安全。

··订阅源·联系·隐私·© 2026 Kitploit

工具目录

分类

查看所有分类
Loading categories
pentagi — 完全自主的AI智能体系统,能够执行复杂的渗透测试任务 | Kitploit
工具/GitHubGitHub/vxcontrol/pentagi
渗透测试框架侦察漏洞扫描器漏洞利用框架信息收集Web安全渗透测试学习与教育AI 安全
GitHubvxcontrol/pentagi

pentagi

完全自主的AI智能体系统,能够执行复杂的渗透测试任务

查看仓库
21.8k2.9k191个月前Kitploit 审核通过
网站

最受欢迎

查看全部 →

发现我们社区最常用的工具。

探索所有工具

浏览我们的工具集合

查看所有工具 →
分享

PentAGI

P渗透测试 A人工 G通用 I智能

加入社区! 与安全研究人员、AI 爱好者和同道道德黑客建立联系。获取支持,分享见解,及时了解 PentAGI 的最新进展。

Discord⠀Telegram

vxcontrol%2Fpentagi | Trendshift

目录

  • 概述
  • 功能特性
  • 架构
    • 高级智能体监督
  • 快速开始
  • 登录后如何使用 PentAGI
  • API 访问
    • LLM 提供商配置
      • Ollama
      • OpenAI
      • Anthropic
      • Google AI (Gemini)
      • AWS Bedrock
  • DeepSeek
  • GLM
  • Kimi
  • Qwen
  • 高级设置
    • Langfuse 集成
    • 监控与可观测性
    • 知识图谱 (Graphiti)
    • OAuth 集成
    • Docker 镜像配置
  • 开发
  • 测试 LLM 智能体
  • 嵌入配置与测试
  • 使用 ftester 进行功能测试
  • 构建
  • 致谢
  • 许可证
  • 概述

    PentAGI 是一款创新的自动化安全测试工具,利用前沿的人工智能技术。该项目专为信息安全专业人士、研究人员和爱好者设计,他们需要一种强大且灵活的渗透测试解决方案。

    您可以观看视频 PentAGI 概述: PentAGI 概述视频

    功能特性

    • 安全且隔离。所有操作均在沙盒化的 Docker 环境中执行,实现完全隔离。
    • 完全自主。AI 驱动的智能体自动确定并执行渗透测试步骤,并可选执行监控和智能任务规划以增强可靠性。
    • 专业渗透测试工具。内置 20 多种专业安全工具,包括 nmap、metasploit、sqlmap 等。
    • 智能记忆系统。长期存储研究成果和成功方法,供将来使用。
    • 知识图谱集成。基于 Graphiti 的知识图谱,使用 Neo4j 进行语义关系追踪和高级上下文理解。
    • 网络智能。通过 scraper 内置浏览器,从网络来源收集最新信息。
    • 外部搜索系统。集成高级搜索 API,包括 Tavily、Traversaal、Perplexity、DuckDuckGo、Google Custom Search、Sploitus Search 和 Searxng,用于全面信息收集。
    • 专家团队。委派系统配备专门的 AI 智能体,用于研究、开发和基础设施任务,并可选增强执行监控和智能任务规划,以在较小模型上实现最佳性能。
    • 全面监控。详细日志记录并与 Grafana/Prometheus 集成,实现实时系统观察。
    • 详细报告。生成详尽的漏洞报告及利用指南。
    • 智能容器管理。根据具体任务要求自动选择 Docker 镜像。
    • 现代化界面。简洁直观的 Web UI,用于系统管理和监控。
    • 全面的 API。功能完善的 REST 和 GraphQL API,支持 Bearer token 认证,用于自动化和集成。
    • 持久化存储。所有命令和输出均存储在支持 pgvector 扩展的 PostgreSQL 中。
    • 可扩展架构。基于微服务的设计,支持水平扩展。
    • 自托管解决方案。完全控制您的部署和数据。
    • 灵活的身份验证。支持 10 多种 LLM 提供商(OpenAI、Anthropic、Google AI/Gemini、AWS Bedrock、Ollama、DeepSeek、GLM、Kimi、Qwen、自定义)以及聚合器(OpenRouter、DeepInfra)。针对生产环境本地部署,请参阅我们的 vLLM + Qwen3.5-27B-FP8 指南。
    • API Token 认证。安全的 Bearer token 系统,用于以编程方式访问 REST 和 GraphQL API。
    • 快速部署。通过 Docker Compose 轻松设置,并提供全面的环境配置。

    当前能力边界

    • PentAGI 目前是一个自主且由助手引导的渗透测试平台,而非 CALDERA 式的入侵与攻击模拟 (BAS) 或对手仿真产品,不包含预定义的活动或攻击计划。
    • 类似 BAS 的智能体编写的攻击脚本应视为概念性或未来工作,而非当前已实现的功能。
    • 当前的流程报告 UI 支持网页视图、复制到剪贴板、Markdown 下载和 PDF 下载。JSON 流程报告导出目前未列为支持的输出格式。
    • 目前可通过内置提供商和自定义/OpenAI 兼容端点获得提供商灵活性。请参阅自定义 LLM 提供商配置和 vLLM + Qwen3.5-27B-FP8 指南。

    架构

    系统上下文```mermaid

    flowchart TB classDef person fill:#08427B,stroke:#073B6F,color:#fff classDef system fill:#1168BD,stroke:#0B4884,color:#fff classDef external fill:#666666,stroke:#0B4884,color:#fff

    root@kitploit:~
    pentester["👤 Security Engineer
    (User of the system)"]
    
    pentagi["✨ PentAGI
    (Autonomous penetration testing system)"]
    
    target["🎯 target-system
    (System under test)"]
    llm["🧠 llm-provider
    (OpenAI/Anthropic/Ollama/Bedrock/Gemini/Custom)"]
    search["🔍 search-systems
    (Google/DuckDuckGo/Tavily/Traversaal/Perplexity/Sploitus/Searxng)"]
    langfuse["📊 langfuse-ui
    (LLM Observability Dashboard)"]
    grafana["📈 grafana
    (System Monitoring Dashboard)"]
    
    pentester --> |Uses HTTPS| pentagi
    pentester --> |Monitors AI HTTPS| langfuse
    pentester --> |Monitors System HTTPS| grafana
    pentagi --> |Tests Various protocols| target
    pentagi --> |Queries HTTPS| llm
    pentagi --> |Searches HTTPS| search
    pentagi --> |Reports HTTPS| langfuse
    pentagi --> |Reports HTTPS| grafana
    
    class pentester person
    class pentagi system
    class target,llm,search,langfuse,grafana external
    
    linkStyle default stroke:#ffffff,color:#ffffff
    
    root@kitploit:~
    <details>
    <summary><b>容器架构</b>(点击展开)</summary>```mermaid
    graph TB
        subgraph Core Services
            UI[Frontend UI<br/>React + TypeScript]
            API[Backend API<br/>Go + GraphQL]
            DB[(Vector Store<br/>PostgreSQL + pgvector)]
            MQ[Task Queue<br/>Async Processing]
            Agent[AI Agents<br/>Multi-Agent System]
        end
    
        subgraph Knowledge Graph
            Graphiti[Graphiti<br/>Knowledge Graph API]
            Neo4j[(Neo4j<br/>Graph Database)]
        end
    
        subgraph Monitoring
            Grafana[Grafana<br/>Dashboards]
            VictoriaMetrics[VictoriaMetrics<br/>Time-series DB]
            Jaeger[Jaeger<br/>Distributed Tracing]
            Loki[Loki<br/>Log Aggregation]
            OTEL[OpenTelemetry<br/>Data Collection]
        end
    
        subgraph Analytics
            Langfuse[Langfuse<br/>LLM Analytics]
            ClickHouse[ClickHouse<br/>Analytics DB]
            Redis[Redis<br/>Cache + Rate Limiter]
            MinIO[MinIO<br/>S3 Storage]
        end
    
        subgraph Security Tools
            Scraper[Web Scraper<br/>Isolated Browser]
            PenTest[Security Tools<br/>20+ Pro Tools<br/>Sandboxed Execution]
        end
    
        UI --> |HTTP/WS| API
        API --> |SQL| DB
        API --> |Events| MQ
        MQ --> |Tasks| Agent
        Agent --> |Commands| PenTest
        Agent --> |Queries| DB
        Agent --> |Knowledge| Graphiti
        Graphiti --> |Graph| Neo4j
    
        API --> |Telemetry| OTEL
        OTEL --> |Metrics| VictoriaMetrics
        OTEL --> |Traces| Jaeger
        OTEL --> |Logs| Loki
    
        Grafana --> |Query| VictoriaMetrics
        Grafana --> |Query| Jaeger
        Grafana --> |Query| Loki
    
        API --> |Analytics| Langfuse
        Langfuse --> |Store| ClickHouse
        Langfuse --> |Cache| Redis
        Langfuse --> |Files| MinIO
    
        classDef core fill:#f9f,stroke:#333,stroke-width:2px,color:#000
        classDef knowledge fill:#ffa,stroke:#333,stroke-width:2px,color:#000
        classDef monitoring fill:#bbf,stroke:#333,stroke-width:2px,color:#000
        classDef analytics fill:#bfb,stroke:#333,stroke-width:2px,color:#000
        classDef tools fill:#fbb,stroke:#333,stroke-width:2px,color:#000
    
        class UI,API,DB,MQ,Agent core
        class Graphiti,Neo4j knowledge
        class Grafana,VictoriaMetrics,Jaeger,Loki,OTEL monitoring
        class Langfuse,ClickHouse,Redis,MinIO analytics
        class Scraper,PenTest tools
    
    实体关系 (点击展开)```mermaid erDiagram Flow ||--o{ Task : contains Task ||--o{ SubTask : contains SubTask ||--o{ Action : contains Action ||--o{ Artifact : produces Action ||--o{ Memory : stores
    root@kitploit:~
    Flow {
        string id PK
        string name "Flow name"
        string description "Flow description"
        string status "active/completed/failed"
        json parameters "Flow parameters"
        timestamp created_at
        timestamp updated_at
    }
    
    Task {
        string id PK
        string flow_id FK
        string name "Task name"
        string description "Task description"
        string status "pending/running/done/failed"
        json result "Task results"
        timestamp created_at
        timestamp updated_at
    }
    
    SubTask {
        string id PK
        string task_id FK
        string name "Subtask name"
        string description "Subtask description"
        string status "queued/running/completed/failed"
        string agent_type "researcher/developer/executor"
        json context "Agent context"
        timestamp created_at
        timestamp updated_at
    }
    
    Action {
        string id PK
        string subtask_id FK
        string type "command/search/analyze/etc"
        string status "success/failure"
        json parameters "Action parameters"
        json result "Action results"
        timestamp created_at
    }
    
    Artifact {
        string id PK
        string action_id FK
        string type "file/report/log"
        string path "Storage path"
        json metadata "Additional info"
        timestamp created_at
    }
    
    Memory {
        string id PK
        string action_id FK
        string type "observation/conclusion"
        vector embedding "Vector representation"
        text content "Memory content"
        timestamp created_at
    }
    
    root@kitploit:~
    </details>
    
    <details>
    <summary><b>智能体交互</b> (点击展开)</summary>```mermaid
    sequenceDiagram
        participant O as Orchestrator
        participant R as Researcher
        participant D as Developer
        participant E as Executor
        participant VS as Vector Store
        participant KB as Knowledge Base
    
        Note over O,KB: Flow Initialization
        O->>VS: Query similar tasks
        VS-->>O: Return experiences
        O->>KB: Load relevant knowledge
        KB-->>O: Return context
    
        Note over O,R: Research Phase
        O->>R: Analyze target
        R->>VS: Search similar cases
        VS-->>R: Return patterns
        R->>KB: Query vulnerabilities
        KB-->>R: Return known issues
        R->>VS: Store findings
        R-->>O: Research results
    
        Note over O,D: Planning Phase
        O->>D: Plan attack
        D->>VS: Query exploits
        VS-->>D: Return techniques
        D->>KB: Load tools info
        KB-->>D: Return capabilities
        D-->>O: Attack plan
    
        Note over O,E: Execution Phase
        O->>E: Execute plan
        E->>KB: Load tool guides
        KB-->>E: Return procedures
        E->>VS: Store results
        E-->>O: Execution status
    
    内存系统(点击展开)```mermaid graph TB subgraph "Long-term Memory" VS[(Vector Store
    Embeddings DB)] KB[Knowledge Base
    Domain Expertise] Tools[Tools Knowledge
    Usage Patterns] end
    root@kitploit:~
    subgraph "Working Memory"
        Context[Current Context<br/>Task State]
        Goals[Active Goals<br/>Objectives]
        State[System State<br/>Resources]
    end
    
    subgraph "Episodic Memory"
        Actions[Past Actions<br/>Commands History]
        Results[Action Results<br/>Outcomes]
        Patterns[Success Patterns<br/>Best Practices]
    end
    
    Context --> |Query| VS
    VS --> |Retrieve| Context
    
    Goals --> |Consult| KB
    KB --> |Guide| Goals
    
    State --> |Record| Actions
    Actions --> |Learn| Patterns
    Patterns --> |Store| VS
    
    Tools --> |Inform| State
    Results --> |Update| Tools
    
    VS --> |Enhance| KB
    KB --> |Index| VS
    
    classDef ltm fill:#f9f,stroke:#333,stroke-width:2px,color:#000
    classDef wm fill:#bbf,stroke:#333,stroke-width:2px,color:#000
    classDef em fill:#bfb,stroke:#333,stroke-width:2px,color:#000
    
    class VS,KB,Tools ltm
    class Context,Goals,State wm
    class Actions,Results,Patterns em
    
    root@kitploit:~
    </details>
    
    <details>
    <summary><b>链式摘要</b> (点击展开)</summary>
    
    链式摘要系统通过选择性地总结较旧的消息来管理对话上下文的增长。这对于防止超出令牌限制同时保持对话连贯性至关重要。```mermaid
    flowchart TD
        A[Input Chain] --> B{Needs Summarization?}
        B -->|No| C[Return Original Chain]
        B -->|Yes| D[Convert to ChainAST]
        D --> E[Apply Section Summarization]
        E --> F[Process Oversized Pairs]
        F --> G[Manage Last Section Size]
        G --> H[Apply QA Summarization]
        H --> I[Rebuild Chain with Summaries]
        I --> J{Is New Chain Smaller?}
        J -->|Yes| K[Return Optimized Chain]
        J -->|No| C
    
        classDef process fill:#bbf,stroke:#333,stroke-width:2px,color:#000
        classDef decision fill:#bfb,stroke:#333,stroke-width:2px,color:#000
        classDef output fill:#fbb,stroke:#333,stroke-width:2px,color:#000
    
        class A,D,E,F,G,H,I process
        class B,J decision
        class C,K output
    

    该算法基于对话链的结构化表示(ChainAST)运行,该表示保留了消息类型,包括工具调用及其响应。所有摘要操作都保持关键对话流程,同时减小上下文大小。

    全局摘要器配置选项

    助手摘要器配置选项

    助手实例可以使用自定义的摘要设置来微调上下文管理行为:

    与全局设置相比,助手摘要器配置为上下文保留提供了更多内存,保留了更多最近的对话历史,同时确保高效的令牌使用。

    摘要器环境配置```bash

    Default values for global summarizer logic

    SUMMARIZER_PRESERVE_LAST=true SUMMARIZER_USE_QA=true SUMMARIZER_SUM_MSG_HUMAN_IN_QA=false SUMMARIZER_LAST_SEC_BYTES=51200 SUMMARIZER_MAX_BP_BYTES=16384 SUMMARIZER_MAX_QA_SECTIONS=10 SUMMARIZER_MAX_QA_BYTES=65536 SUMMARIZER_KEEP_QA_SECTIONS=1

    Default values for assistant summarizer logic

    ASSISTANT_SUMMARIZER_PRESERVE_LAST=true ASSISTANT_SUMMARIZER_LAST_SEC_BYTES=76800 ASSISTANT_SUMMARIZER_MAX_BP_BYTES=16384 ASSISTANT_SUMMARIZER_MAX_QA_SECTIONS=7 ASSISTANT_SUMMARIZER_MAX_QA_BYTES=76800 ASSISTANT_SUMMARIZER_KEEP_QA_SECTIONS=3

    root@kitploit:~
    </details>
    
    <a id="advanced-agent-supervision"></a>
    <details>
    <summary><b>高级代理监督</b>(点击展开)</summary>
    
    PentAGI 包含多层的精密代理监督机制,以确保高效的任务执行、防止无限循环,并针对卡死状态提供智能恢复:
    
    ### 执行监控(测试版)
    - **自动导师介入**:当执行模式表明可能存在问题时,自动调用顾问代理(导师)
    - **模式检测**:监控相同工具调用次数(阈值:5,可配置)和工具调用总数(阈值:10,可配置)
    - **进度分析**:评估代理是否朝着子任务目标前进,检测循环和低效行为
    - **替代策略**:当前策略失败时推荐不同方法
    - **信息检索指导**:建议搜索已有解决方案而非重新发明
    - **增强的响应格式**:工具响应包含 `<original_result>` 和 `<mentor_analysis>` 两部分
    - **可配置**:通过 `EXECUTION_MONITOR_ENABLED` 启用(默认:false),使用 `EXECUTION_MONITOR_SAME_TOOL_LIMIT` 和 `EXECUTION_MONITOR_TOTAL_TOOL_LIMIT` 自定义阈值
    
    **最佳适用**:较小模型(< 32B 参数)、需要持续指导的复杂攻击场景、防止代理在单一方法上卡住
    
    **性能影响**:执行时间和 token 消耗增加 2-3 倍,但基于 Qwen3.5-27B-FP8 测试显示**结果质量提升 2 倍**
    
    ### 智能任务规划(测试版)
    - **自动分解**:规划器(处于规划模式的顾问)在专业代理开始工作前生成 3-7 个具体、可操作的步骤
    - **上下文感知规划**:通过增强器代理分析完整执行上下文以制定明智计划
    - **结构化分配**:原始请求包含在 `<task_assignment>` 结构中,附带执行计划和指令
    - **范围管理**:通过将代理聚焦在当前子任务上防止范围蔓延
    - **增强指令**:计划突出关键操作、潜在陷阱和验证点
    - **可配置**:通过 `AGENT_PLANNING_STEP_ENABLED` 启用(默认:false)
    
    **最佳适用**:< 32B 参数的模型、复杂的渗透测试工作流、提升复杂任务的成功率
    
    **增强的顾问配置**:当顾问代理使用更强模型或增强设置时效果极佳。示例:对顾问使用相同基础模型并启用最大推理模式(参见 [`vllm-qwen3.5-27b-fp8.provider.yml`](https://github.com/vxcontrol/pentagi/blob/main/examples/configs/vllm-qwen3.5-27b-fp8.provider.yml)),可在相同模型架构下实现全面的任务分析和战略规划。
    
    **性能影响**:增加规划开销,但显著提高完成率并减少重复工作
    
    ### 工具调用限制(始终激活)
    - **硬限制**:无论监督模式状态如何,防止失控执行
    - **按代理类型区分**:
      - 通用代理(助手、主要代理、渗透测试员、编码员、安装员):`MAX_GENERAL_AGENT_TOOL_CALLS`(默认:100)
      - 限制代理(搜索员、增强器、记忆员、生成器、报告员、顾问、反射器、规划员):`MAX_LIMITED_AGENT_TOOL_CALLS`(默认:20)
    - **优雅终止**:当接近限制时,反射器指导代理正确完成
    - **资源保护**:确保系统稳定性,防止资源耗尽
    
    ### 反射器集成(始终激活)
    - **自动纠正**:当 LLM 在 3 次尝试后未能生成工具调用时被调用
    - **战略指导**:分析失败原因并引导代理正确使用工具,或使用屏障工具(`done`、`ask`)
    - **恢复机制**:根据具体失败模式提供上下文指导
    - **限制执行**:当达到工具调用限制时协调优雅终止
    
    ### 开源模型建议
    
    **< 32B 参数的模型必备**:
    使用 Qwen3.5-27B-FP8 的测试表明,启用执行监控和任务规划对于较小的开源模型**至关重要**:
    - **质量提升**:与无监督基线执行相比,结果提升 2 倍
    - **防止循环**:显著减少无限循环和重复工作
    - **攻击多样性**:鼓励探索多个攻击向量,而非固守单一方法
    - **隔离部署**:在封闭网络环境下,使用本地 LLM 推理实现生产级自主渗透测试
    
    **权衡**:
    - Token 消耗:由于导师/规划器调用,增加 2-3 倍
    - 执行时间:由于分析和规划步骤,延长 2-3 倍
    - 结果质量:完整性、准确性和攻击覆盖度提升 2 倍
    - 模型要求:当顾问使用增强配置(更高的推理参数、更强的模型变体或不同模型)时效果最佳
    
    **配置策略**:
    为在较小模型上获得最佳性能,使用增强设置配置顾问代理:
    - 使用相同模型并启用最大推理模式(示例:[`vllm-qwen3.5-27b-fp8.provider.yml`](https://github.com/vxcontrol/pentagi/blob/main/examples/configs/vllm-qwen3.5-27b-fp8.provider.yml))
    - 或对顾问使用更强模型,而对其他代理保留基础模型
    - 根据任务复杂度和模型能力调整监控阈值
    
    
    
    </details>
    
    PentAGI 的架构设计为模块化、可扩展且安全。以下是关键组件:
    
    1. **核心服务**
       - 前端 UI:基于 React 的 Web 界面,使用 TypeScript 实现类型安全
       - 后端 API:基于 Go 的 REST 和 GraphQL API,使用 Bearer token 认证实现程序化访问
       - 向量存储:使用 PostgreSQL 和 pgvector 实现语义搜索和记忆存储
       - 任务队列:异步任务处理系统,确保可靠运行
       - AI 代理:多代理系统,具备专门角色以实现高效测试
    
    2. **知识图谱**
       - Graphiti:知识图谱 API,用于语义关系追踪和上下文理解
       - Neo4j:图数据库,用于存储和查询实体、动作和结果之间的关系
       - 自动捕获代理响应和工具执行,构建综合知识库
    
    3. **监控栈**
       - OpenTelemetry:统一的可观测性数据收集与关联
       - Grafana:实时可视化与告警仪表盘
       - VictoriaMetrics:高性能时间序列指标存储
       - Jaeger:端到端分布式追踪,用于调试
       - Loki:可扩展的日志聚合与分析
    
    4. **分析平台**
       - Langfuse:高级 LLM 可观测性与性能分析
       - ClickHouse:列式分析数据仓库
       - Redis:高速缓存与速率限制
       - MinIO:S3 兼容的对象存储,用于工件
    
    5. **安全工具**
       - Web 爬虫:隔离的浏览器环境,用于安全的 Web 交互
       - 渗透测试工具:20+ 专业安全工具的综合性套件
       - 沙箱执行:所有操作在隔离容器中运行
    
    6. **记忆系统**
       - 长期记忆:知识与经验的持久化存储
       - 工作记忆:当前操作的活跃上下文与目标
       - 情节记忆:历史动作与成功模式
       - 知识库:结构化的领域专长与工具能力
       - 上下文管理:使用链式摘要智能管理不断增长的 LLM 上下文窗口
    
    系统使用 Docker 容器实现隔离和轻松部署,核心服务、监控和分析使用独立的网络以维护适当的安全边界。每个组件都设计为可水平扩展,并可在生产环境中配置为高可用。
    
    ## 快速开始
    
    ### 系统要求
    
    - Docker 和 Docker Compose(或 Podman - 请参阅 [Podman 配置](#running-pentagi-with-podman))
    - 最低 2 vCPU
    - 最低 4GB 内存
    - 20GB 空闲磁盘空间
    - 互联网连接以下载镜像和更新
    
    ### 使用安装程序(推荐)
    
    PentAGI 提供交互式安装程序,具有终端界面,可简化配置和部署。安装程序指导您完成系统检查、LLM 提供程序设置、搜索引擎配置和安全加固。
    
    **支持的平台:**
    - **Linux**:amd64 [下载](https://pentagi.com/downloads/linux/amd64/installer-latest.zip) | arm64 [下载](https://pentagi.com/downloads/linux/arm64/installer-latest.zip)
    - **Windows**:amd64 [下载](https://pentagi.com/downloads/windows/amd64/installer-latest.zip)
    - **macOS**:amd64 (Intel) [下载](https://pentagi.com/downloads/darwin/amd64/installer-latest.zip) | arm64 (M 系列) [下载](https://pentagi.com/downloads/darwin/arm64/installer-latest.zip)
    
    **快速安装(Linux amd64):**```bash
    # Create installation directory
    mkdir -p pentagi && cd pentagi
    
    # Download installer
    wget -O installer.zip https://pentagi.com/downloads/linux/amd64/installer-latest.zip
    
    # Extract
    unzip installer.zip
    
    # Run interactive installer
    ./installer
    

    前提条件和权限:

    安装程序需要适当的权限才能与Docker API交互以正常运行。默认情况下,它使用Docker套接字(/var/run/docker.sock),这需要以下任一方式:

    • 选项1(推荐用于生产环境): 以root身份运行安装程序: ```bash sudo ./installer

      root@kitploit:~
    • 选项2(开发环境): 通过将用户添加到 docker 组来授予其对 Docker 套接字的访问权限: ```bash

      Add your user to the docker group

      sudo usermod -aG docker $USER

      Log out and log back in, or activate the group immediately

      newgrp docker

      Verify Docker access (should run without sudo)

      docker ps

      root@kitploit:~

    ⚠️ 安全提示: 将用户添加到 docker 组等同于授予 root 权限。仅在受控环境中对受信任的用户执行此操作。对于生产部署,请考虑使用无根 Docker 模式或使用 sudo 运行安装程序。

    安装程序将:

    1. 系统检查:验证 Docker、网络连接和系统要求
    2. 环境设置:创建并配置 .env 文件,使用最佳默认值
    3. 提供商配置:设置 LLM 提供商(OpenAI、Anthropic、Gemini、Bedrock、Ollama、自定义)
    4. 搜索引擎:配置 DuckDuckGo、Google、Tavily、Traversaal、Perplexity、Sploitus、Searxng
    5. 安全加固:生成安全凭据并配置 SSL 证书
    6. 部署:使用 docker-compose 启动 PentAGI

    当前 Web 设置覆盖范围

    PentAGI Web 控制台在服务器启动并运行后已经管理了几个设置区域:

    • 设置 -> 提供商:为支持的提供商类型创建、编辑、删除和测试用户定义的提供商配置文件。这些配置文件控制每个代理的模型选择、运行时参数、推理选项和定价元数据。
    • 设置 -> 提示词:管理系统、人类和工具提示模板。
    • 设置 -> PentAGI API:创建和管理用于 REST 和 GraphQL 访问的 PentAGI Bearer 令牌。
    • 其他 UI 管理的首选项:收藏的流程作为用户首选项存储,主题选择从主侧边栏/配置文件控制处理,而不是从设置页面。

    仍由服务器管理

    以下配置区域仍需要在服务器上通过环境变量、compose 文件或挂载的配置文件进行设置:

    • LLM 凭据和连接详细信息:API 密钥、端点、认证模式和 OpenAI、Anthropic、Bedrock、Ollama、自定义提供商等后端的提供商特定连接设置;配置路径设置仅适用于受支持的地方,例如 OLLAMA_SERVER_CONFIG_PATH 和 LLM_SERVER_CONFIG_PATH。
    • 搜索提供商凭据和选项:设置如 DUCKDUCKGO_*、GOOGLE_*、TAVILY_API_KEY、TRAVERSAAL_API_KEY、PERPLEXITY_*、SEARXNG_* 和 SPLOITUS_ENABLED。
    • 第三方集成:Langfuse、Graphiti 和类似的外部服务仍然是服务器端配置。
    • MCP 服务器管理:MCP 设置页面目前不作为实时 Web 控制台功能公开。

    对于生产环境和增强安全性:

    对于生产部署或安全敏感环境,我们强烈建议使用分布式双节点架构,其中工作器操作在单独服务器上隔离。这可以防止在主系统上执行不受信任的代码和网络访问问题。

    查看详细指南:工作器节点设置

    双节点设置提供:

    • 隔离执行:工作器容器在专用硬件上运行
    • 网络隔离:渗透测试的独立网络边界
    • 安全边界:使用 TLS 认证的 Docker-in-Docker
    • OOB 攻击支持:用于带外技术的专用端口范围

    手动安装

    1. 创建工作目录或克隆仓库:```bash mkdir pentagi && cd pentagi
    root@kitploit:~
    2. 将 `.env.example` 复制到 `.env` 或下载它:```bash
    curl -o .env https://raw.githubusercontent.com/vxcontrol/pentagi/master/.env.example
    
    1. Touch 示例文件 (example.custom.provider.yml, example.ollama.provider.yml) 或下载它:```bash curl -o example.custom.provider.yml https://raw.githubusercontent.com/vxcontrol/pentagi/master/examples/configs/custom-openai.provider.yml curl -o example.ollama.provider.yml https://raw.githubusercontent.com/vxcontrol/pentagi/master/examples/configs/ollama-llama318b.provider.yml
    root@kitploit:~
    4. 在 `.env` 文件中填写所需的 API 密钥。```bash
    # Required: At least one of these LLM providers
    OPEN_AI_KEY=your_openai_key
    ANTHROPIC_API_KEY=your_anthropic_key
    GEMINI_API_KEY=your_gemini_key
    
    # Optional: AWS Bedrock provider (enterprise-grade models)
    BEDROCK_REGION=us-east-1
    # Choose one authentication method:
    BEDROCK_DEFAULT_AUTH=true                        # Option 1: Use AWS SDK default credential chain (recommended for EC2/ECS)
    # BEDROCK_BEARER_TOKEN=your_bearer_token         # Option 2: Bearer token authentication
    # BEDROCK_ACCESS_KEY_ID=your_aws_access_key      # Option 3: Static credentials
    # BEDROCK_SECRET_ACCESS_KEY=your_aws_secret_key
    
    # Optional: Ollama provider (local or cloud)
    # OLLAMA_SERVER_URL=http://ollama-server:11434   # Local server
    # OLLAMA_SERVER_URL=https://ollama.com           # Cloud service
    # OLLAMA_SERVER_API_KEY=your_ollama_cloud_key    # Required for cloud, empty for local
    
    # Optional: Chinese AI providers
    # DEEPSEEK_API_KEY=your_deepseek_key             # DeepSeek (strong reasoning)
    # GLM_API_KEY=your_glm_key                       # GLM (Zhipu AI)
    # KIMI_API_KEY=your_kimi_key                     # Kimi (Moonshot AI, ultra-long context)
    # QWEN_API_KEY=your_qwen_key                     # Qwen (Alibaba Cloud, multimodal)
    
    # Optional: Local LLM provider (zero-cost inference)
    OLLAMA_SERVER_URL=http://localhost:11434
    OLLAMA_SERVER_MODEL=your_model_name
    
    # Optional: Additional search capabilities
    DUCKDUCKGO_ENABLED=true
    DUCKDUCKGO_REGION=us-en
    DUCKDUCKGO_SAFESEARCH=
    DUCKDUCKGO_TIME_RANGE=
    SPLOITUS_ENABLED=true
    GOOGLE_API_KEY=your_google_key
    GOOGLE_CX_KEY=your_google_cx
    TAVILY_API_KEY=your_tavily_key
    TRAVERSAAL_API_KEY=your_traversaal_key
    PERPLEXITY_API_KEY=your_perplexity_key
    PERPLEXITY_MODEL=sonar-pro
    PERPLEXITY_CONTEXT_SIZE=medium
    
    # Searxng meta search engine (aggregates results from multiple sources)
    SEARXNG_URL=http://your-searxng-instance:8080
    SEARXNG_CATEGORIES=general
    SEARXNG_LANGUAGE=
    SEARXNG_SAFESEARCH=0
    SEARXNG_TIME_RANGE=
    SEARXNG_TIMEOUT=
    
    ## Graphiti knowledge graph settings
    GRAPHITI_ENABLED=true
    GRAPHITI_TIMEOUT=30
    GRAPHITI_URL=http://graphiti:8000
    GRAPHITI_MODEL_NAME=gpt-5-mini
    
    # Neo4j settings (used by Graphiti stack)
    NEO4J_USER=neo4j
    NEO4J_DATABASE=neo4j
    NEO4J_PASSWORD=devpassword
    NEO4J_URI=bolt://neo4j:7687
    
    # Assistant configuration
    ASSISTANT_USE_AGENTS=false         # Default value for agent usage when creating new assistants
    
    1. 更改 .env 文件中所有与安全相关的环境变量以提高安全性。
    安全相关环境变量

    主要安全设置

    • COOKIE_SIGNING_SALT - 用于 Cookie 签名的盐值,请更改为随机值
    • PUBLIC_URL - 你的服务器的公共 URL(例如 https://pentagi.example.com)
    • SERVER_SSL_CRT 和 SERVER_SSL_KEY - 你现有 SSL 证书和密钥的自定义路径(用于 HTTPS,这些路径应在 docker-compose.yml 文件中以卷挂载方式使用)

    抓取器访问

    • SCRAPER_PUBLIC_URL - 抓取器的公共 URL,如果你希望为公共 URL 使用不同的抓取器服务器
    • SCRAPER_PRIVATE_URL - 抓取器的私有 URL(docker-compose.yml 文件中的本地抓取器服务器,用于访问本地 URL)

    访问凭据

    • PENTAGI_POSTGRES_USER 和 PENTAGI_POSTGRES_PASSWORD - PostgreSQL 凭据
    • NEO4J_USER 和 - Neo4j 凭据(用于 Graphiti 知识图谱)
    1. 如果你希望在 VSCode 或其他 IDE 中将 .env 文件用作 envFile 选项,请删除所有内联注释:```bash perl -i -pe 's/\s+#.*$//' .env
    root@kitploit:~
    7. 运行PentAGI堆栈:```bash
    curl -O https://raw.githubusercontent.com/vxcontrol/pentagi/master/docker-compose.yml
    docker compose up -d
    

    访问 localhost:8443 以进入 PentAGI Web UI(默认账户为 [email protected] / admin)

    Web UI 账户

    PentAGI 不向公众开放从登录页面的自助注册。全新安装会创建默认的本地管理员账户:

    • 邮箱: [email protected]
    • 密码: admin

    首次登录时,请更改默认密码,然后再将实例用于实际工作。如果之后管理员密码丢失,请使用安装程序的维护菜单来重置默认 [email protected] 账户的密码。

    对于多用户设置,经过身份验证的管理员可以通过 Users REST API(/api/v1/users/)管理本地用户。OpenAPI UI 在实例运行后可访问 https://localhost:8443/api/v1/swagger/index.html。

    [!NOTE] 如果遇到关于 pentagi-network、observability-network 或 langfuse-network 的错误,你需要先运行 docker-compose.yml 以创建这些网络,然后再运行 docker-compose-langfuse.yml、docker-compose-graphiti.yml 和 docker-compose-observability.yml 来使用 Langfuse、Graphiti 和 Observability 服务。

    你必须至少设置一个语言模型提供商(OpenAI、Anthropic、Gemini、AWS Bedrock 或 Ollama)才能使用 PentAGI。AWS Bedrock 提供了企业级访问多个来自领先 AI 公司的基础模型的权限,而 Ollama 如果你有足够的计算资源则可以提供零成本的本地推理。额外的搜索引擎 API 密钥是可选的,但建议使用以获得更好的结果。

    对于完全本地部署并使用高级模型:请参阅我们的综合指南 使用 vLLM 和 Qwen3.5-27B-FP8 运行 PentAGI 以获取生产级本地 LLM 设置。该配置在 4× RTX 5090 GPU 上实现了约 13,000 TPS 的提示处理速度和约 650 TPS 的完成速度,支持 12 个以上并发流程,完全独立于云提供商。

    LLM_SERVER_* 环境变量是实验性功能,将来会发生变化。现在你可以使用它们来指定自定义的 LLM 服务器 URL 以及为所有代理类型指定一个模型。

    PROXY_URL 是所有 LLM 提供商和外部搜索系统的全局代理 URL。你可以用它来隔离外部网络。

    docker-compose.yml 文件以 root 用户身份运行 PentAGI 服务,因为它需要访问 docker.sock 进行容器管理。如果你使用 TCP/IP 网络连接到 Docker 而不是套接字文件,则可以移除 root 权限并使用默认的 用户以提高安全性。

    从外部网络访问 PentAGI

    默认情况下,PentAGI 绑定到 127.0.0.1(仅 localhost)以保证安全。要允许网络中的其他机器访问 PentAGI,你需要配置外部访问。

    配置步骤

    1. 更新 .env 文件,填入你服务器的 IP 地址:```bash

    Network binding - allow external connections

    PENTAGI_LISTEN_IP=0.0.0.0 PENTAGI_LISTEN_PORT=8443

    Public URL - use your actual server IP or hostname

    Replace 192.168.1.100 with your server's IP address

    PUBLIC_URL=https://192.168.1.100:8443

    CORS origins - list all URLs that will access PentAGI

    Include localhost for local access AND your server IP for external access

    CORS_ORIGINS=https://localhost:8443,https://192.168.1.100:8443

    root@kitploit:~
    > [!IMPORTANT]
    > - 将 `192.168.1.100` 替换为你服务器的实际 IP 地址
    > - 不要在 `PUBLIC_URL` 或 `CORS_ORIGINS` 中使用 `0.0.0.0`——请使用实际 IP 地址
    > - 为灵活起见,将 localhost 和你的服务器 IP 都包含在 `CORS_ORIGINS` 中
    
    2. **重新创建容器** 以应用更改:```bash
    docker compose down
    docker compose up -d --force-recreate
    
    1. 验证端口绑定:```bash docker ps | grep pentagi
    root@kitploit:~
    您应该会看到 `0.0.0.0:8443->8443/tcp` 或 `:::8443->8443/tcp`。
    
    如果您看到 `127.0.0.1:8443->8443/tcp`,说明环境变量未被正确读取。在这种情况下,请直接编辑 `docker-compose.yml` 的第31行:```yaml
    ports:
      - "0.0.0.0:8443:8443"
    

    然后再次重新创建容器。

    1. 配置防火墙,允许端口 8443 的传入连接:```bash

    Ubuntu/Debian with UFW

    sudo ufw allow 8443/tcp sudo ufw reload

    CentOS/RHEL with firewalld

    sudo firewall-cmd --permanent --add-port=8443/tcp sudo firewall-cmd --reload

    root@kitploit:~
    5. **访问 PentAGI:**
    
    - **本地访问:** `https://localhost:8443`
    - **网络访问:** `https://your-server-ip:8443`
    
    > [!NOTE]
    > 通过 IP 地址访问时,您需要在浏览器中接受自签名 SSL 证书警告。
    
    ---
    
    ### 使用 Podman 运行 PentAGI
    
    PentAGI 完全支持将 Podman 作为 Docker 的替代方案。但是,在使用 **根用户无权限模式下的 Podman** 时,爬虫服务需要特殊配置,因为无权限容器无法绑定特权端口(低于 1024 的端口)。
    
    #### Podman 无权限配置
    
    默认的爬虫配置使用 443 端口(HTTPS),这是一个特权端口。对于无权限 Podman,请将爬虫重新配置为非特权端口:
    
    **1. 编辑 `docker-compose.yml`** - 修改 `scraper` 服务(大约在第 199 行):```yaml
    scraper:
      image: vxcontrol/scraper:latest
      restart: unless-stopped
      container_name: scraper
      hostname: scraper
      expose:
        - 3000/tcp  # Changed from 443 to 3000
      ports:
        - "${SCRAPER_LISTEN_IP:-127.0.0.1}:${SCRAPER_LISTEN_PORT:-9443}:3000"  # Map to port 3000
      environment:
        - MAX_CONCURRENT_SESSIONS=${LOCAL_SCRAPER_MAX_CONCURRENT_SESSIONS:-10}
        - USERNAME=${LOCAL_SCRAPER_USERNAME:-someuser}
        - PASSWORD=${LOCAL_SCRAPER_PASSWORD:-somepass}
      logging:
        options:
          max-size: 50m
          max-file: "7"
      volumes:
        - scraper-ssl:/usr/src/app/ssl
      networks:
        - pentagi-network
      shm_size: 2g
    

    2. 更新 .env 文件 - 将爬取器的URL改为使用HTTP和3000端口:```bash

    Scraper configuration for Podman rootless

    SCRAPER_PRIVATE_URL=http://someuser:somepass@scraper:3000/ LOCAL_SCRAPER_USERNAME=someuser LOCAL_SCRAPER_PASSWORD=somepass

    root@kitploit:~
    > [!IMPORTANT]
    > Podman 的关键变更:
    > - 将 `SCRAPER_PRIVATE_URL` 使用 **HTTP** 而非 HTTPS
    > - 使用端口 **3000** 而非 443
    > - 将内部 `expose` 改为 `3000/tcp`
    > - 更新端口映射,目标为 `3000` 而非 `443`
    
    **3. 重新创建容器:**```bash
    podman-compose down
    podman-compose up -d --force-recreate
    

    4. 测试爬虫连接性:```bash

    Test from within the pentagi container

    podman exec -it pentagi wget -O- "http://someuser:somepass@scraper:3000/html?url=http://example.com"

    root@kitploit:~
    如果你看到 HTML 输出,说明爬虫工作正常。
    
    #### Podman 根模式
    
    如果你以根模式(使用 sudo)运行 Podman,可以直接使用默认配置而无需修改。爬虫将按预期在 443 端口上工作。
    
    #### Docker 兼容性
    
    所有 Podman 配置完全兼容 Docker。非特权端口方法在两种容器运行时上运行方式一致。
    
    ### 助手配置
    
    PentAGI 允许你配置助手的默认行为:
    
    | 变量                   | 默认值  | 描述                                                     |
    | ---------------------- | ------- | -------------------------------------------------------- |
    | `ASSISTANT_USE_AGENTS` | `false` | 控制创建新助手时代理使用的默认值                         |
    
    `ASSISTANT_USE_AGENTS` 设置影响在 UI 中创建新助手时“使用代理”切换开关的初始状态:
    - `false`(默认):新助手默认禁用代理委派
    - `true`:新助手默认启用代理委派
    
    请注意,用户始终可以通过在 UI 中创建或编辑助手时切换“使用代理”按钮来覆盖此设置。此环境变量仅控制初始默认状态。
    
    ## 登录后如何使用 PentAGI
    
    一旦堆栈运行起来并且你可以登录到 Web 界面,最快的方法是使用 Flows 工作流。
    
    ### 1. 创建你的第一个流程
    
    1. 在侧边栏中打开 **Flows**。
    2. 点击 **New Flow**。
    3. 选择适合你目标的模式:
       - **Automation**:完全自主执行,针对你想要 PentAGI 端到端执行的测试目标
       - **Assistant**:交互式来回帮助,当你想逐步引导调查时。在此模式下,你还可以启用 **Use Agents** 开关,让 PentAGI 将子任务委派给专门的子代理,以进行更复杂的调查。
    4. 选择要用于此流程的 LLM 提供商。
    5. 在消息框中用自然语言描述目标和目的。
    
    好的初始提示通常包括:
    
    - 目标系统或 URL
    - 你想要的评估类型
    - 任何范围限制或交战规则
    - 你期望的结果,例如漏洞报告或假设验证
    
    示例:```text
    Assess https://target.example for common web application vulnerabilities. Focus on authentication, file handling, and injection issues. Stay within the provided target only and summarize confirmed findings with reproduction steps.
    

    仅测试你拥有或明确授权评估的系统。请参阅 EULA.md 了解可接受使用要求。

    2. 使用模板实现可重复工作流

    新的流程表单包含一个模板选择器,可以用保存的流程模板预填充消息框。当您反复运行类似评估时,这非常有用。

    • 如果已在 Templates 中保存了现有模板,请直接使用
    • 如果需要 Web 测试的实用基线,可以从 examples/prompts/base_web_pentest.md 中的示例提示开始
    • 在启动流程前调整目标、范围和约束条件

    模板只是起点。使用 PentAGI 不需要特殊语法:只要目标和目标明确,纯自然语言指令就能很好地工作。

    3. 监控执行并检查输出

    提交流程后,PentAGI 会自动打开流程页面。

    • 使用主流程视图跟踪消息、代理活动和任务进度
    • 在流程运行时检查工具活动和终端输出
    • 查看生成的任务和子任务以了解 PentAGI 正在做什么

    一旦流程获得足够结果,请使用流程页面上的 报告 菜单:

    • 在 Web 视图中打开报告
    • 将生成的报告复制到剪贴板
    • 将报告下载为 Markdown 格式
    • 将报告下载为 PDF 格式

    4. 使用助手视图引导活动流程

    每个流程还包含一个 助手 视图,用于交互式指导。当自主运行发现需要人工指导而非硬重启时,这非常有用。

    • 当您想要在更改任何内容之前检查当前状态时,打开同一流程的 助手 视图。
    • 使用助手检查流程状态、停止当前任务、提交后续指令,或在下一步运行前修补剩余的计划子任务。
    • 将其视为当前流程的显式控制路径,而非不可见的后台队列。如果您想改变方向,请清晰说明,并让新指令与当前参与范围保持一致。
    • 这最适合用于澄清范围、根据中间发现重定向优先级,或在不丢失流程上下文其余部分的情况下回答自动化检查点。

    5. 管理流程作用域内的文件

    每个流程在流程页面中都有自己的 文件 选项卡。文件作用域限定于父流程:它们位于主机上的 {dataDir}/flow-{id}-data/ 目录中,绝不会泄漏到其他流程中。

    该选项卡公开三种文件来源:

    • 上传(uploads/):您从 Web 界面提供的文件。使用 上传文件 操作,或直接拖放到文件选项卡上。当代理容器正在运行时,上传的文件也会被推送到容器内的 /work/uploads/ 路径,以便代理可以使用常规 Shell 工具读取。
    • 资源(resources/):通过 从库中附加资源 从您保存的用户资源库中附加的文件。附加的资源会被复制到流程中,并推送到运行中容器内的 /work/resources/ 路径。
    • 容器(container/):通过 从容器拉取文件或目录 从运行中的代理容器拉取的快照。这些文件在流程端是只读的,永远不会被送回容器。

    文件选项卡中的单个文件操作包括 下载、复制路径、保存为资源(将流程文件提升到可重用资源库)和 删除。当容器未运行时,拉取操作会被禁用,并显示工具提示“容器未运行”。

    上传的文件和附加的资源会自动通过 {{.UserFiles}} 模板变量列在代理的系统提示中,该变量会呈现一个紧凑的 <task_files> XML 块(包含嵌套的 <uploads> 和 <resources> 部分),因此助手和自动化代理可以通过路径引用它们,而无需您将内容粘贴到聊天框中。容器快照仅在 UI 中可见,不会自动重新注入到提示中。

    当前需要注意的限制和局限性:

    • 最大上传文件大小为 300 MB;每次上传请求最多 1000 个文件,总大小不超过 2 GB。文件名长度上限为 255 字节(约 255 个 ASCII 字符;非 ASCII 名称使用每个字符多字节编码)。
    • 上传和资源会镜像到运行中容器的固定路径 /work/uploads/ 和 /work/resources/;写入其他容器路径的文件不会自动镜像回流程文件模型。容器快照可以来自您拉取的任何容器路径(例如 /etc/...),并在流程端缓存到 container/ 目录下;它们不会推回容器。
    • 容器快照是时间点的拉取。在 UI 中编辑快照不会写回运行中的容器。
    • 删除一个流程目前会删除流程记录及其长期记忆条目,但不会归档或删除磁盘上的流程 flow-{id}-data/ 目录。操作员仍需手动清理数据目录以回收空间。

    对于早期测试,请从狭窄的目标和单一明确目标开始。这会使输出更易于审查,并帮助您在运行更大规模评估之前优化提示。

    API 访问

    PentAGI 通过 REST 和 GraphQL API 提供全面的编程访问,允许您将渗透测试工作流集成到自动化流水线、CI/CD 流程和自定义应用程序中。

    生成 API 令牌

    API 令牌通过 PentAGI Web 界面管理:

    1. 在 Web UI 中导航至 设置 → API 令牌
    2. 点击 创建令牌 生成新的 API 令牌
    3. 配置令牌属性:
      • 名称(可选):令牌的描述性名称
      • 到期日期:令牌将到期的时间(最少 1 分钟,最长 3 年)
    4. 点击 创建 并 立即复制令牌 - 出于安全原因,它只会显示一次
    5. 在 API 请求中将令牌用作 Bearer 令牌

    每个令牌都与您的用户账户关联,并继承您角色的权限。

    使用 API 令牌

    在 HTTP 请求的 Authorization 标头中包含 API 令牌:```bash

    GraphQL API example

    curl -X POST https://your-pentagi-instance:8443/api/v1/graphql
    -H "Authorization: Bearer YOUR_API_TOKEN"
    -H "Content-Type: application/json"
    -d '{"query": "{ flows { id title status } }"}'

    REST API example

    curl https://your-pentagi-instance:8443/api/v1/flows
    -H "Authorization: Bearer YOUR_API_TOKEN"

    root@kitploit:~
    ### API 探索与测试
    
    PentAGI 提供用于探索和测试 API 端点的交互式文档:
    
    #### GraphQL Playground
    
    访问 GraphQL Playground,地址为 `https://your-pentagi-instance:8443/api/v1/graphql/playground`
    
    1. 点击底部的 **HTTP Headers** 选项卡
    2. 添加您的 authorization header:   ```json
       {
         "Authorization": "Bearer YOUR_API_TOKEN"
       }
    
    1. 浏览模式(schema),运行查询和交互式测试变更(mutations)

    Swagger UI

    在 https://your-pentagi-instance:8443/api/v1/swagger/index.html 访问 REST API 文档

    1. 点击 Authorize 按钮
    2. 以格式 Bearer YOUR_API_TOKEN 输入你的令牌
    3. 点击 Authorize 以应用
    4. 从 Swagger UI 直接测试端点

    生成 API 客户端

    你可以使用 PentAGI 附带的模式文件为你偏好的编程语言生成类型安全的 API 客户端:

    GraphQL 客户端

    GraphQL 模式可在以下位置获取:

    • Web UI: 导航至设置以下载 schema.graphqls
    • 直接文件: 仓库中的 backend/pkg/graph/schema.graphqls

    使用如下工具生成客户端:

    • GraphQL Code Generator (JavaScript/TypeScript): https://the-guild.dev/graphql/codegen
    • genqlient (Go): https://github.com/Khan/genqlient
    • Apollo iOS (Swift): https://www.apollographql.com/docs/ios

    REST API 客户端

    OpenAPI 规范可在以下位置获取:

    • Swagger JSON: https://your-pentagi-instance:8443/api/v1/swagger/doc.json
    • Swagger YAML: 可在 backend/pkg/server/docs/swagger.yaml 获取

    使用以下工具生成客户端:

    • OpenAPI Generator: https://openapi-generator.tech ```bash openapi-generator-cli generate
      -i https://your-pentagi-instance:8443/api/v1/swagger/doc.json
      -g python
      -o ./pentagi-client
      root@kitploit:~
    • Swagger Codegen: https://github.com/swagger-api/swagger-codegen ```bash swagger-codegen generate
      -i https://your-pentagi-instance:8443/api/v1/swagger/doc.json
      -l typescript-axios
      -o ./pentagi-client
      root@kitploit:~
    • swagger-typescript-api (TypeScript): https://github.com/acacode/swagger-typescript-api ```bash npx swagger-typescript-api
      -p https://your-pentagi-instance:8443/api/v1/swagger/doc.json
      -o ./src/api
      -n pentagi-api.ts
      root@kitploit:~

    API 使用示例

    创建新流程 (GraphQL)```graphql mutation CreateFlow { createFlow( modelProvider: "openai" input: "Test the security of https://example.com" ) { id title status createdAt } } ```
    列出流程 (REST API)```bash curl https://your-pentagi-instance:8443/api/v1/flows \ -H "Authorization: Bearer YOUR_API_TOKEN" \ | jq '.flows[] | {id, title, status}' ```
    Python客户端示例```python import requests

    class PentAGIClient: def init(self, base_url, api_token): self.base_url = base_url self.headers = { "Authorization": f"Bearer {api_token}", "Content-Type": "application/json" }

    root@kitploit:~
    def create_flow(self, provider, target):
        query = """
        mutation CreateFlow($provider: String!, $input: String!) {
          createFlow(modelProvider: $provider, input: $input) {
            id
            title
            status
          }
        }
        """
        response = requests.post(
            f"{self.base_url}/api/v1/graphql",
            json={
                "query": query,
                "variables": {
                    "provider": provider,
                    "input": target
                }
            },
            headers=self.headers
        )
        return response.json()
    
    def get_flows(self):
        response = requests.get(
            f"{self.base_url}/api/v1/flows",
            headers=self.headers
        )
        return response.json()
    

    Usage

    client = PentAGIClient( "https://your-pentagi-instance:8443", "your_api_token_here" )

    Create a new flow

    flow = client.create_flow("openai", "Scan https://example.com for vulnerabilities") print(f"Created flow: {flow}")

    List all flows

    flows = client.get_flows() print(f"Total flows: {len(flows['flows'])}")

    root@kitploit:~
    </details>
    
    <details>
    <summary><b>TypeScript Client 示例</b></summary>```typescript
    import axios, { AxiosInstance } from 'axios';
    
    interface Flow {
      id: string;
      title: string;
      status: string;
      createdAt: string;
    }
    
    class PentAGIClient {
      private client: AxiosInstance;
    
      constructor(baseURL: string, apiToken: string) {
        this.client = axios.create({
          baseURL: `${baseURL}/api/v1`,
          headers: {
            'Authorization': `Bearer ${apiToken}`,
            'Content-Type': 'application/json',
          },
        });
      }
    
      async createFlow(provider: string, input: string): Promise<Flow> {
        const query = `
          mutation CreateFlow($provider: String!, $input: String!) {
            createFlow(modelProvider: $provider, input: $input) {
              id
              title
              status
              createdAt
            }
          }
        `;
    
        const response = await this.client.post('/graphql', {
          query,
          variables: { provider, input },
        });
    
        return response.data.data.createFlow;
      }
    
      async getFlows(): Promise<Flow[]> {
        const response = await this.client.get('/flows');
        return response.data.flows;
      }
    
      async getFlow(flowId: string): Promise<Flow> {
        const response = await this.client.get(`/flows/${flowId}`);
        return response.data;
      }
    }
    
    // Usage
    const client = new PentAGIClient(
      'https://your-pentagi-instance:8443',
      'your_api_token_here'
    );
    
    // Create a new flow
    const flow = await client.createFlow(
      'openai',
      'Perform penetration test on https://example.com'
    );
    console.log('Created flow:', flow);
    
    // List all flows
    const flows = await client.getFlows();
    console.log(`Total flows: ${flows.length}`);
    

    安全最佳实践

    使用 API 令牌时:

    • 切勿将令牌提交到版本控制系统 - 请使用环境变量或密钥管理
    • 定期轮换令牌 - 设置合适的过期日期并定期创建新令牌
    • 为不同应用使用独立令牌 - 便于在需要时撤销访问权限
    • 监控令牌使用情况 - 在“设置”页面查看 API 令牌活动
    • 撤销未使用的令牌 - 禁用或删除不再需要的令牌
    • 仅使用 HTTPS - 切勿通过未加密的连接发送 API 令牌

    令牌管理

    • 查看令牌:在“设置”→“API 令牌”中查看所有活跃令牌
    • 编辑令牌:更新令牌名称或撤销令牌
    • 删除令牌:永久移除令牌(此操作不可撤销)
    • 令牌 ID:每个令牌都有唯一 ID,可复制作为参考

    令牌列表显示:

    • 令牌名称(如果有)
    • 令牌 ID(唯一标识符)
    • 状态(活跃/已撤销/已过期)
    • 创建日期
    • 过期日期

    自定义 LLM 提供商配置

    使用带有 LLM_SERVER_* 变量的自定义 LLM 提供商时,可以微调控件请求中使用的推理格式。

    [!TIP] 对于生产级本地部署,建议使用 vLLM 配合 Qwen3.5-27B-FP8 以获得最佳性能。请参阅我们的 综合部署指南,其中包含硬件需求、配置模板(思考模式 和 非思考模式),以及在 4× RTX 5090 GPU 上实现 13K TPS 提示处理的性能基准测试。

    LLM_SERVER_PROVIDER 设置在使用 LiteLLM 代理 时特别有用,它会在模型名称前添加提供商前缀。例如,通过 LiteLLM 连接 Moonshot API 时,kimi-2.5 这样的模型会变成 moonshot/kimi-2.5。通过设置 LLM_SERVER_PROVIDER=moonshot,您可以在不修改配置文件的情况下,对直接 API 访问和 LiteLLM 代理访问使用相同的提供商配置文件。

    LLM_SERVER_LEGACY_REASONING 设置影响向 LLM 发送推理参数的方式:

    • false(默认):使用现代格式,推理作为包含 max_tokens 参数的结构化对象发送
    • true:使用基于字符串的 reasoning_effort 参数的旧版格式

    此设置在使用不同 LLM 提供商时很重要,因为不同提供商可能在其 API 请求中期望不同的推理格式。如果自定义提供商出现推理相关错误,请尝试更改此设置。

    LLM_SERVER_PRESERVE_REASONING 设置控制多轮对话中是否保留推理内容:

    • false(默认):推理内容不会保留在对话历史中
    • true:推理内容被保留并在后续 API 调用中发送

    某些 LLM 提供商(例如 Moonshot)需要此设置,当多轮对话中不包含推理内容时,它们会返回类似“思考已启用,但助手工具调用消息中缺少 reasoning_content”的错误。如果您的提供商要求保留推理内容,请启用此设置。

    Ollama 提供商配置

    PentAGI 支持 Ollama 用于本地 LLM 推理(零成本、增强隐私)以及 Ollama Cloud(托管服务,提供免费套餐)。

    配置变量

    Ollama Cloud 配置

    Ollama Cloud 提供托管推理服务,拥有慷慨的免费套餐和可扩展的付费计划。

    免费套餐设置(单一模型)```bash

    Free tier allows one model at a time

    OLLAMA_SERVER_URL=https://ollama.com OLLAMA_SERVER_API_KEY=your_ollama_cloud_api_key OLLAMA_SERVER_MODEL=gpt-oss:120b # Example: OpenAI OSS 120B model

    root@kitploit:~
    **付费层级设置(多模型且预配置)**
    
    对于支持多个并发模型的付费层级,请使用预构建的 Ollama Cloud 配置:```bash
    # Using pre-built Ollama Cloud configuration (included in Docker image)
    OLLAMA_SERVER_URL=https://ollama.com
    OLLAMA_SERVER_API_KEY=your_ollama_cloud_api_key
    OLLAMA_SERVER_CONFIG_PATH=/opt/pentagi/conf/ollama-cloud.provider.yml
    

    预构建的 ollama-cloud.provider.yml 配置包含针对所有代理类型的优化模型分配:

    • 简单/助手:nemotron-3-super:cloud - 快速通用模型
    • 主要代理:qwen3-coder-next:cloud - 高级推理,高努力模式
    • 编码/渗透测试:qwen3-coder-next:cloud - 专用编码模型
    • 搜索器:qwen3.5:397b-cloud - 大上下文,用于信息收集
    • 优化/重构:glm-5:cloud - 高质量文本优化
    • 顾问/丰富:minimax-m2.7:cloud - 高效的咨询任务
    • 安装器:devstral-2:123b-cloud - 安装和设置任务

    自定义配置(高级)

    要创建自己的代理配置,请从主机文件系统挂载自定义文件:```bash

    Using custom provider configuration

    OLLAMA_SERVER_URL=https://ollama.com OLLAMA_SERVER_API_KEY=your_ollama_cloud_api_key OLLAMA_SERVER_CONFIG_PATH=/opt/pentagi/conf/ollama.provider.yml

    Mount custom configuration from host filesystem (in .env or docker-compose override)

    PENTAGI_OLLAMA_SERVER_CONFIG_PATH=/path/on/host/my-ollama-config.yml

    root@kitploit:~
    `PENTAGI_OLLAMA_SERVER_CONFIG_PATH` 环境变量将您的主机配置文件映射到容器内的 `/opt/pentagi/conf/ollama.provider.yml`。
    
    **自定义配置示例**(`my-ollama-config.yml`):```yaml
    primary_agent:
      model: "qwen3-coder-next:cloud"
      temperature: 1.0
      top_p: 0.9
      max_tokens: 32768
      reasoning:
        effort: high
    
    coder:
      model: "qwen3-coder:32b"
      temperature: 1.0
      max_tokens: 20480
    

    本地 Ollama 配置

    对于自托管的 Ollama 实例:```bash

    Basic local Ollama setup

    OLLAMA_SERVER_URL=http://localhost:11434 OLLAMA_SERVER_MODEL=llama3.1:8b-instruct-q8_0

    Production setup with auto-pull and model discovery

    OLLAMA_SERVER_URL=http://ollama-server:11434 OLLAMA_SERVER_PULL_MODELS_ENABLED=true OLLAMA_SERVER_PULL_MODELS_TIMEOUT=900 OLLAMA_SERVER_LOAD_MODELS_ENABLED=true

    Using pre-built configurations from Docker image

    OLLAMA_SERVER_CONFIG_PATH=/opt/pentagi/conf/ollama-llama318b.provider.yml

    or

    OLLAMA_SERVER_CONFIG_PATH=/opt/pentagi/conf/ollama-qwen332b-fp16-tc.provider.yml

    or

    OLLAMA_SERVER_CONFIG_PATH=/opt/pentagi/conf/ollama-qwq32b-fp16-tc.provider.yml

    root@kitploit:~
    **性能考虑:**
    
    - **模型发现**(`OLLAMA_SERVER_LOAD_MODELS_ENABLED=true`):增加 1-2 秒启动延迟(需查询 Ollama API)
    - **自动拉取**(`OLLAMA_SERVER_PULL_MODELS_ENABLED=true`):首次启动可能需要几分钟下载模型
    - **拉取超时**(`OLLAMA_SERVER_PULL_MODELS_TIMEOUT=900`):15分钟(以秒计)
    - **静态配置**:禁用两个标志,在配置文件中指定模型,可获得最快启动速度
    
    #### 创建自定义 Ollama 模型以扩展上下文
    
    PentAGI 需要的模型上下文窗口大于默认的 Ollama 配置。你必须通过 Modelfile 创建自定义模型并增加 `num_ctx` 参数。虽然典型的工作流消耗约 64K 令牌,但 PentAGI 使用 110K 上下文大小以提供安全余量并应对复杂的渗透测试场景。
    
    **重要**:`num_ctx` 参数只能在通过 Modelfile 创建模型时设置 —— 创建后无法更改,也无法在运行时覆盖。
    
    ##### 示例:Qwen3 32B FP16 扩展上下文
    
    创建一个名为 `Modelfile_qwen3_32b_fp16_tc` 的 Modelfile:```dockerfile
    FROM qwen3:32b-fp16
    PARAMETER num_ctx 110000
    PARAMETER temperature 0.3
    PARAMETER top_p 0.8
    PARAMETER min_p 0.0
    PARAMETER top_k 20
    PARAMETER repeat_penalty 1.1
    

    构建自定义模型:```bash ollama create qwen3:32b-fp16-tc -f Modelfile_qwen3_32b_fp16_tc

    root@kitploit:~
    ##### 示例:QwQ 32B FP16 扩展上下文
    
    创建一个名为 `Modelfile_qwq_32b_fp16_tc` 的 Modelfile:```dockerfile
    FROM qwq:32b-fp16
    PARAMETER num_ctx 110000
    PARAMETER temperature 0.2
    PARAMETER top_p 0.7
    PARAMETER min_p 0.0
    PARAMETER top_k 40
    PARAMETER repeat_penalty 1.2
    

    构建自定义模型:```bash ollama create qwq:32b-fp16-tc -f Modelfile_qwq_32b_fp16_tc

    root@kitploit:~
    > **注意**:QwQ 32B FP16 模型进行推理时大约需要 **71.3 GB VRAM**。请确保系统具有足够的 GPU 内存后再尝试使用此模型。
    
    这些自定义模型在预构建的提供者配置文件中被引用(`ollama-qwen332b-fp16-tc.provider.yml` 和 `ollama-qwq32b-fp16-tc.provider.yml`),它们包含在 Docker 镜像的 `/opt/pentagi/conf/` 目录下。
    
    ### OpenAI 提供者配置
    
    PentAGI 与 OpenAI 的完整模型系列集成,具备先进的推理能力(支持扩展思维链)、增强的工具集成智能体模型,以及用于安全工程的专业代码模型。
    
    #### 配置变量
    
    | 变量                 | 默认值                     | 描述                          |
    | -------------------- | --------------------------- | ----------------------------- |
    | `OPEN_AI_KEY`        |                             | OpenAI 服务的 API 密钥        |
    | `OPEN_AI_SERVER_URL` | `https://api.openai.com/v1` | OpenAI API 端点               |
    
    #### 配置示例```bash
    # Basic OpenAI setup
    OPEN_AI_KEY=your_openai_api_key
    OPEN_AI_SERVER_URL=https://api.openai.com/v1
    
    # Using with proxy for enhanced security
    OPEN_AI_KEY=your_openai_api_key
    PROXY_URL=http://your-proxy:8080
    

    支持的模型

    PentAGI 支持 31 个 OpenAI 模型,具备工具调用、流式传输、推理模式和提示缓存功能。标记为 * 的模型在默认配置中使用。

    GPT-5.2 系列 - 最新旗舰智能体(2025年12月)

    GPT-5/5.1 系列 - 高级智能体模型

    GPT-5/5.1 Codex 系列 - 代码专用模型

    GPT-4.1 系列 - 增强智能

    GPT-4o 系列 - 多模态旗舰

    模型 ID推理价格(输入/输出/缓存)用例
    gpt-4o❌$2.50/$10.00/$1.25多模态旗舰,具备视觉、图像分析、Web UI 评估、多工具编排
    gpt-4o-mini❌$0.15/$0.60/$0.08

    o系列 - 高级推理模型

    价格:每百万 tokens。推理模型的输出定价包含思考 tokens。

    [!警告] GPT-5 型号 - 需要信任访问权限*

    所有 GPT-5 系列模型(gpt-5, gpt-5.1, gpt-5.2, gpt-5-pro, gpt-5.2-pro 及所有 Codex 变体)在 PentAGI 中使用不稳定,若无已验证访问权可能会触发 OpenAI 的网络安全安全机制。

    若要可靠使用 GPT-5 模型:*

    1. 个人用户:在 chatgpt.com/cyber 验证您的身份
    2. 企业团队:通过您的 OpenAI 代表请求信任访问权
    3. 安全研究员:申请 网络安全资助计划 (包含1000万美元的 API 额度)

    无需验证的推荐替代方案:

    • 使用 o系列 模型(o3、o4-mini、o1)进行推理任务
    • 使用 gpt-4.1 系列获得通用智能和函数调用
    • 所有 o系列 和 gpt-4.x 模型无需特殊访问权即可可靠工作

    推理努力级别:

    • 高:最大推理深度(refiner - o3,高努力)
    • 中:平衡推理(primary_agent、assistant、reflector - o4-mini/o3,中努力)
    • 低:高效目标推理(coder、installer、pentester - o3/o4-mini,低努力;adviser - gpt-5.2,低努力)

    关键特性:

    • 扩展推理:o系列模型基于思维链进行复杂安全分析
    • 智能体智能:GPT-5/5.1/5.2 系列具有增强的工具集成和自主能力
    • 提示缓存:重复上下文的成本降低(输入价格的10-50%)
    • 代码专业化:专用于漏洞发现和利用开发的 Codex 模型
    • 多模态支持:GPT-4o 系列用于基于视觉的安全评估
    • 工具调用:所有模型的强大函数调用,用于渗透测试工具编排
    • 流式传输:实时响应流式传输,支持交互式工作流
    • 已验证的成果:行业领先模型,拥有 CVE 发现和真实世界安全应用

    Anthropic 提供商配置

    PentAGI 集成了 Anthropic 的 Claude 模型,具备先进扩展思考能力、卓越安全机制以及对复杂安全上下文的复杂理解,并支持提示缓存。

    配置变量

    变量默认值描述
    ANTHROPIC_API_KEYAnthropic 服务的 API 密钥
    ANTHROPIC_SERVER_URLhttps://api.anthropic.com/v1Anthropic API 端点

    配置示例```bash

    Basic Anthropic setup

    ANTHROPIC_API_KEY=your_anthropic_api_key ANTHROPIC_SERVER_URL=https://api.anthropic.com/v1

    Using with proxy for secure environments

    ANTHROPIC_API_KEY=your_anthropic_api_key PROXY_URL=http://your-proxy:8080

    root@kitploit:~
    > [!NOTE]
    > **Google Vertex AI 对 Claude 模型的支持**
    >
    > PentAGI 当前未在 `.env` 中为 Anthropic Claude 暴露专用的 Google Vertex AI 配置路径。目前没有独立的 Vertex AI API 密钥字段,现有的 Anthropic 变量(`ANTHROPIC_API_KEY`、`ANTHROPIC_SERVER_URL`)直接指向 Anthropic API。Claude 的支持途径包括:
    >
    > - **直接 Anthropic API**:`ANTHROPIC_API_KEY` 和 `ANTHROPIC_SERVER_URL`(见上文)。
    > - **AWS Bedrock**:`BEDROCK_*` 变量(参见 [AWS Bedrock 提供商配置](#aws-bedrock-provider-configuration))。
    >
    > 如果你今天需要使用 Vertex AI,最安全的受支持变通方案是通过一个兼容 OpenAI 的代理或网关来暴露 Vertex AI,该网关将 Vertex AI 调用转换为 Chat Completions 格式,同时保留 PentAGI 所依赖的聊天和工具调用行为,然后通过 `LLM_SERVER_URL`、`LLM_SERVER_KEY` 和 `LLM_SERVER_MODEL` 将自定义 LLM 提供商指向该网关。此路径的可靠性完全取决于你选择的网关。
    
    #### 支持模型
    
    PentAGI 支持 10 个 Claude 模型,具备工具调用、流式传输、扩展思维、自适应思维和提示缓存功能。标有 `*` 的模型用于默认配置。
    
    **Claude 4 系列——最新模型(2025-2026)**
    
    | 模型 ID                 | 思维 | 发布日期 | 价格(输入/输出/缓存读/写) | 用途                                        |
    | ------------------------ | -------- | ------------ | ------------------------------ | ----------------------------------------------- |
    | `claude-opus-4-6`*       | ✅        | 2025年5月    | $5.00/$25.00/$0.50/$6.25       | 用于自主智能体和编码的最智能模型。扩展+自适应思维用于复杂漏洞利用开发、多阶段攻击模拟 |
    | `claude-sonnet-4-6`*     | ✅        | 2025年8月    | $3.00/$15.00/$0.30/$3.75       | 具备自适应思维的最佳速度/智能平衡。多阶段安全评估、智能漏洞分析、实时威胁狩猎 |
    | `claude-haiku-4-5`*      | ✅        | 2025年10月   | $1.00/$5.00/$0.10/$1.25        | 具备接近前沿智能的最快模型。高频扫描、实时监控、批量自动化测试 |
    
    **旧版模型——仍受支持**
    
    | 模型 ID                 | 思维 | 发布日期 | 价格(输入/输出/缓存读/写) | 用途                                        |
    | ------------------------ | -------- | ------------ | ------------------------------ | ----------------------------------------------- |
    | `claude-sonnet-4-5`      | ✅        | 2025年9月    | $3.00/$15.00/$0.30/$3.75       | 最先进的推理(已被4-6取代)。复杂渗透测试、高级威胁分析 |
    | `claude-opus-4-5`        | ✅        | 2025年11月   | $5.00/$25.00/$0.50/$6.25       | 终极推理(已被opus-4-6取代)。关键安全研究、零日漏洞发现、红队行动 |
    | `claude-opus-4-1`        | ✅        | 2025年8月    | $15.00/$75.00/$1.50/$18.75     | 高级推理(已被取代)。复杂渗透测试、高级威胁建模 |
    | `claude-sonnet-4-0`      | ✅        | 2025年5月    | $3.00/$15.00/$0.30/$3.75       | 高性能推理(已被取代)。复杂威胁建模、多工具协调 |
    | `claude-opus-4-0`        | ✅        | 2025年5月    | $15.00/$75.00/$1.50/$18.75     | 第一代Opus(已被取代)。多步漏洞利用开发、自主渗透测试工作流 |
    
    **已弃用模型——迁移至当前模型**
    
    | 模型 ID                     | 思维 | 发布日期 | 价格(输入/输出/缓存读/写) | 备注                                        |
    | ---------------------------- | -------- | ------------ | ------------------------------ | -------------------------------------------- |
    | `claude-3-haiku-20240307`    | ❌        | 2024年3月    | $0.25/$1.25/$0.03/$0.30        | 将于2026年4月19日退役。请迁移至claude-haiku-4-5 |
    
    **价格**:每百万Token。缓存定价包含读取和写入成本。
    
    **扩展思维配置**:
    - **最大Token 4096**:生成器(claude-opus-4-6),用于复杂漏洞利用开发的最大推理深度
    - **最大Token 2048**:编码器(claude-sonnet-4-6),用于均衡的代码分析和漏洞研究  
    - **最大Token 1024**:主智能体、助手、优化器、顾问、反射器、搜索器、安装器、渗透测试器,用于特定任务的聚焦推理
    - **扩展思维**:所有Claude 4.5+和4.6模型均支持可配置的扩展思维,适用于深度推理任务
    
    **关键特性**:
    - **扩展思维**:所有Claude 4.5+和4.6模型,为复杂安全分析提供可配置的思维链推理深度
    - **自适应思维**:Claude 4.6系列(Opus/Sonnet)根据任务复杂度动态调整推理深度,实现最优性能
    - **提示缓存**:通过独立的读/写定价大幅降低成本(读取为输入的10%,写入为输入的125%)
    - **扩展上下文窗口**:标准200K Token,Claude Opus/Sonnet 4.6最高可达1M Token(测试版),用于全面的代码库分析
    - **工具调用**:稳健的函数调用,安全工具编排准确度极高
    - **流式传输**:实时响应流,适用于交互式渗透测试工作流
    - **安全优先设计**:内置安全机制,确保负责任的安防测试实践
    - **多模态支持**:最新模型具备视觉能力,可用于截图分析和用户界面安全评估
    - **基础AI(Constitutional AI)**:高级安全训练,提供可靠且合乎道德的安全指导
    
    ### Google AI (Gemini) 提供商配置
    
    PentAGI 通过 Google AI API 与 Google 的 Gemini 模型集成,提供最先进的多模态推理能力,支持扩展思维和上下文缓存。
    
    #### 配置变量
    
    | 变量                      | 默认值                                     | 描述                        |
    | ------------------------- | ------------------------------------------- | ------------------------------ |
    | `GEMINI_API_KEY`          |                                             | Google AI 服务的 API 密钥      |
    | `GEMINI_SERVER_URL`       | `https://generativelanguage.googleapis.com` | Google AI API 端点             |
    
    #### 配置示例```bash
    # Basic Gemini setup
    GEMINI_API_KEY=your_gemini_api_key
    GEMINI_SERVER_URL=https://generativelanguage.googleapis.com
    
    # Using with proxy
    GEMINI_API_KEY=your_gemini_api_key
    PROXY_URL=http://your-proxy:8080
    

    支持的模型

    PentAGI 支持 9 个具有工具调用、流式传输、思考模式和上下文缓存的 Gemini 模型。标记为 * 的模型用于默认配置。

    Gemini 3.5 系列 - 最新稳定版 Flash(2026年5月)

    模型 ID思考上下文价格(输入/输出/缓存)用例
    gemini-3.5-flash*✅1M$1.50/$9.00/$0.15最智能的 Flash 模型,在代理和编码任务上拥有持续的尖端性能,卓越的搜索和地面实况

    Gemini 3.1 系列 - 稳定版 Flash-Lite + Pro 预览(2026年2月至5月)

    Gemini 2.5 系列 - 高级思考模型(有效期至2026年10月16日)

    Gemma 4 开源模型(Apache 2.0,免费层级)

    价格:每1M token(标准付费层级)。上下文窗口为输入 token 限制。

    [!NOTE] Gemini 2.5 系列下线

    gemini-2.5-pro、gemini-2.5-flash 和 gemini-2.5-flash-lite 将于 2026年10月16日下线。推荐的迁移路径:

    • gemini-2.5-pro → gemini-3.1-pro-preview(相同的 $2.00 输入价格层级)
    • gemini-2.5-flash → gemini-3.5-flash(改进的前沿能力)
    • gemini-2.5-flash-lite → gemini-3.1-flash-lite(相同的 $0.25 输入价格)

    默认模型分配(config.yml):

    • gemini-3.1-pro-preview - primary_agent、assistant、generator、refiner、adviser、coder、pentester
    • gemini-3.5-flash - reflector、searcher、enricher、installer
    • gemini-3.1-flash-lite - simple、

    关键特性:

    • 扩展思考:对复杂安全分析进行逐步推理(所有 Gemini 3.x、2.5 系列和 Gemma 4,支持可切换思考)
    • 上下文缓存:对重复上下文大幅降低成本(大多数模型为输入价格的 10%)
    • 超长上下文:Gemini 聊天模型支持 1M tokens,Gemma 4 开源模型支持 256K tokens
    • 多模态支持:支持文本、图像、视频、音频和 PDF 处理,用于全面评估
    • 工具调用:通过函数调用与 20+ 渗透测试工具无缝集成
    • 流式传输:实时响应流式传输,用于交互式安全工作流
    • 代码执行:内置代码执行,用于攻击性工具测试和漏洞验证
    • 搜索地面实况:集成 Google 搜索,用于威胁情报和 CVE 研究
    • 文件搜索:文档检索和 RAG 能力,用于基于知识的评估
    • 批量 API:非实时批量处理降低 50% 成本
    • 自定义工具端点:专用的 gemini-3.1-pro-preview-customtools 路由,适用于偏好注册工具而非 bash 的密集工具型代理工作流

    推理努力级别:

    • 高:针对复杂多步骤分析的最大思考深度(generator)
    • 中:针对通用代理任务的平衡推理(primary_agent、assistant、refiner、adviser)
    • 低:针对聚焦任务的高效思考(coder、installer、pentester)

    AWS Bedrock 提供者配置

    PentAGI 与 Amazon Bedrock 集成,提供来自领先 AI 公司(包括 Anthropic、Amazon、Cohere、DeepSeek、OpenAI、Qwen、Mistral 和 Moonshot)的 20+ 基础模型。

    配置变量

    认证优先级:BEDROCK_DEFAULT_AUTH → BEDROCK_BEARER_TOKEN → BEDROCK_ACCESS_KEY_ID+BEDROCK_SECRET_ACCESS_KEY

    配置示例```bash

    Recommended: Default AWS SDK authentication (EC2/ECS/Lambda roles)

    BEDROCK_REGION=us-east-1 BEDROCK_DEFAULT_AUTH=true

    Bearer token authentication (AWS STS, custom auth)

    BEDROCK_REGION=us-east-1 BEDROCK_BEARER_TOKEN=your_bearer_token

    Static credentials (development, testing)

    BEDROCK_REGION=us-east-1 BEDROCK_ACCESS_KEY_ID=your_aws_access_key BEDROCK_SECRET_ACCESS_KEY=your_aws_secret_key

    With proxy and custom endpoint

    BEDROCK_REGION=us-east-1 BEDROCK_DEFAULT_AUTH=true BEDROCK_SERVER_URL=https://bedrock-runtime.us-east-1.vpce-xxx.amazonaws.com PROXY_URL=http://your-proxy:8080

    root@kitploit:~
    #### 支持的模型
    
    PentAGI 支持 21 个 AWS Bedrock 模型,具备工具调用、流式传输和多模态能力。标记为 `*` 的模型在默认配置中使用。
    
    | 模型 ID                                         | 提供商        | 深度思考 | 多模态 | 价格(输入/输出) | 用例                                    |
    | ------------------------------------------------ | --------------- | -------- | ---------- | -------------------- | --------------------------------------- |
    | `us.amazon.nova-2-lite-v1:0`                     | Amazon Nova     | ❌        | ✅          | $0.33/$2.75          | 自适应推理,高效思考                      |
    | `us.amazon.nova-premier-v1:0`                    | Amazon Nova     | ❌        | ✅          | $2.50/$12.50         | 复杂推理,高级分析                        |
    | `us.amazon.nova-pro-v1:0`                        | Amazon Nova     | ❌        | ✅          | $0.80/$3.20          | 平衡准确性、速度和成本                     |
    | `us.amazon.nova-lite-v1:0`                       | Amazon Nova     | ❌        | ✅          | $0.06/$0.24          | 快速处理,高吞吐量操作                    |
    | `us.amazon.nova-micro-v1:0`                      | Amazon Nova     | ❌        | ❌          | $0.035/$0.14         | 超低延迟,实时监控                        |
    | `us.anthropic.claude-opus-4-6-v1`*               | Anthropic       | ✅        | ✅          | $5.00/$25.00         | 世界一流编程,企业级代理                  |
    | `us.anthropic.claude-sonnet-4-6`                 | Anthropic       | ✅        | ✅          | $3.00/$15.00         | 前沿智能,企业级规模                      |
    | `us.anthropic.claude-opus-4-5-20251101-v1:0`     | Anthropic       | ✅        | ✅          | $5.00/$25.00         | 多日软件开发                              |
    | `us.anthropic.claude-haiku-4-5-20251001-v1:0`*   | Anthropic       | ✅        | ✅          | $1.00/$5.00          | 接近前沿性能,高速度                      |
    | `us.anthropic.claude-sonnet-4-5-20250929-v1:0`*  | Anthropic       | ✅        | ✅          | $3.00/$15.00         | 真实世界代理,编程卓越                    |
    | `us.anthropic.claude-sonnet-4-20250514-v1:0`     | Anthropic       | ✅        | ✅          | $3.00/$15.00         | 平衡性能,可用于生产                      |
    | `us.anthropic.claude-3-5-haiku-20241022-v1:0`    | Anthropic       | ❌        | ❌          | $0.80/$4.00          | 最快模型,成本高效的扫描                  |
    | `cohere.command-r-plus-v1:0`                     | Cohere          | ❌        | ❌          | $3.00/$15.00         | 大规模操作,卓越的 RAG                    |
    | `deepseek.v3.2`                                  | DeepSeek        | ❌        | ❌          | $0.58/$1.68          | 长上下文推理,效率                        |
    | `openai.gpt-oss-120b-1:0`*                       | OpenAI (OSS)    | ✅        | ❌          | $0.15/$0.60          | 强大推理,科学分析                        |
    | `openai.gpt-oss-20b-1:0`                         | OpenAI (OSS)    | ✅        | ❌          | $0.07/$0.30          | 高效编程,软件开发                        |
    | `qwen.qwen3-next-80b-a3b`                        | Qwen            | ❌        | ❌          | $0.15/$1.20          | 超长上下文,旗舰推理                      |
    | `qwen.qwen3-32b-v1:0`                            | Qwen            | ❌        | ❌          | $0.15/$0.60          | 平衡推理,研究用例                        |
    | `qwen.qwen3-coder-30b-a3b-v1:0`                  | Qwen            | ❌        | ❌          | $0.15/$0.60          | 氛围编码,自然语言优先                    |
    | `qwen.qwen3-coder-next`                          | Qwen            | ❌        | ❌          | $0.45/$1.80          | 工具使用,函数调用优化                    |
    | `mistral.mistral-large-3-675b-instruct`          | Mistral         | ❌        | ✅          | $4.00/$12.00         | 高级多模态,长上下文                      |
    | `moonshotai.kimi-k2.5`                           | Moonshot        | ❌        | ✅          | $0.60/$3.00          | 视觉、语言、代码于一体的模型              |
    
    **价格**:每百万 tokens。支持深度思考/推理的模型在推理阶段会产生额外计算成本。
    
    #### 已测试但不兼容的模型
    
    部分 AWS Bedrock 模型已测试但**不支持**,原因如下:
    
    | 模型系列                  | 不兼容原因                                                                  |
    | ------------------------- | --------------------------------------------------------------------------- |
    | **GLM (Z.AI)**            | 工具调用格式与 Converse API 不兼容(期望字符串而非 JSON)                    |
    | **AI21 Jamba**            | 速率限制严格(1-2 请求/分钟),无法进行可靠测试和生产使用                    |
    | **Meta Llama 3.3/3.1**    | 工具调用结果处理不稳定,在多轮工作流中导致意外失败                          |
    | **Mistral Magistral**     | 模型不支持工具调用                                                            |
    | **Moonshot K2-Thinking**  | 工具调用时流式传输行为不稳定,生产中不可靠                                  |
    | **Qwen3-VL**              | 工具调用时流式传输不稳定,多模态与工具组合间歇性失败                          |
    
    > [!IMPORTANT]
    > **速率限制与配额管理**
    >
    > 默认情况下,AWS Bedrock 对 Claude 模型的配额非常严格(新账户每分钟 2-20 个请求)。对于生产性渗透测试:
    >
    > 1. 通过 AWS Service Quotas 控制台为您计划使用的模型申请提高配额
    > 2. **使用 Amazon Nova 模型** - 默认配额更高,性能出色
    > 3. **启用预置吞吐量**以实现一致的高容量测试
    > 4. **监控使用情况** - AWS 在达到配额限制时会主动限流
    >
    > 如果不提高配额,预计会出现频繁延迟和工作流中断。
    
    > [!WARNING]
    > **Converse API 要求**
    >
    > PentAGI 使用 Amazon Bedrock **Converse API** 实现统一模型访问。所有支持的模型需要:
    >
    > - ✅ Converse/ConverseStream API 支持
    > - ✅ 工具使用(函数调用)以进行渗透测试工作流
    > - ✅ 流式工具使用以实现实时反馈
    >
    > 在以下页面验证模型能力:[AWS Bedrock 模型功能](https://docs.aws.amazon.com/bedrock/latest/userguide/conversation-inference-supported-models-features.html)
    
    **主要特性**:
    - **自动提示缓存**:重复上下文成本降低 40-70%(Claude 4.x 模型)
    - **扩展思考**:分步推理,用于复杂安全分析(Claude、DeepSeek R1、OpenAI GPT)
    - **多模态分析**:处理截图、图表、视频,实现全面测试(Nova、Claude、Mistral、Kimi)
    - **工具调用**:通过函数调用与 20+ 渗透测试工具无缝集成
    - **流式传输**:实时响应流式传输,用于交互式安全评估工作流
    
    ### DeepSeek 提供商配置
    
    PentAGI 集成了 DeepSeek,提供对具备强大推理、编程能力以及上下文缓存的高级 AI 模型的访问,价格具有竞争力。
    
    #### 配置变量
    
    | 变量                | 默认值                    | 描述                                            |
    | ------------------- | -------------------------- | ----------------------------------------------- |
    | `DEEPSEEK_API_KEY`  |                            | DeepSeek API 密钥,用于身份验证                  |
    | `DEEPSEEK_SERVER_URL` | `https://api.deepseek.com` | DeepSeek API 端点 URL                           |
    | `DEEPSEEK_PROVIDER` |                            | 用于 LiteLLM 集成的提供商前缀(可选)            |
    
    #### 配置示例```bash
    # Direct API usage
    DEEPSEEK_API_KEY=your_deepseek_api_key
    DEEPSEEK_SERVER_URL=https://api.deepseek.com
    
    # With LiteLLM proxy
    DEEPSEEK_API_KEY=your_litellm_key
    DEEPSEEK_SERVER_URL=http://litellm-proxy:4000
    DEEPSEEK_PROVIDER=deepseek  # Adds prefix to model names (deepseek/deepseek-v4-flash) for LiteLLM
    

    支持的模型

    PentAGI 支持 2 个 DeepSeek V4 模型,具备工具调用、流式传输、混合思考/非思考模式以及上下文缓存功能。两个模型默认启用思考模式,可通过 extra_body 切换为非思考模式。标记 * 的模型用于默认配置。

    价格:每百万 Token。缓存价格适用于从缓存中提供的提示 Token(输入缓存命中,自 2026-04-26 起降至发布价的 1/10)。两个模型均支持混合思考模式 — thinking 模式默认启用;传递 extra_body.thinking.type: disabled 可切换至非思考模式以获得更快/更便宜的响应。

    定价说明 (deepseek-v4-pro):deepseek-v4-pro 的 75% 促销折扣已于 2026-05-31 15:59 UTC 正式结束。上述价格为促销后的标准价格。如果您使用打折价格($0.435/$0.87/$0.003625)的旧配置,请更新为当前价格以确保成本核算准确。

    旧版模型名称 deepseek-chat 和 deepseek-reasoner 计划于 2026-07-24 由 DeepSeek 弃用。引用旧名称的用户配置在此之前仍然有效;上面的默认值使用当前的 V4 名称。deepseek-chat 映射到 deepseek-v4-flash 非思考模式;deepseek-reasoner 映射到 deepseek-v4-flash 思考模式。

    默认代理配置:

    策略:优先使用 deepseek-v4-flash(输入价格便宜 12 倍,输出价格便宜 12 倍)作为实用/轻量级代理的主力模型;将 deepseek-v4-pro 保留用于复杂的多步骤推理。installer 代理在 Flash 上运行并启用思考模式,因为环境设置任务(shell 命令、配置编辑)很少需要专业级的推理。在将更多代理升级到 Pro 之前,请在自己的工作负载上运行 A/B 测试。

    注意:启用思考模式时,DeepSeek 会静默忽略 temperature、top_p、presence_penalty 和 frequency_penalty。当设置 reasoning_effort 时,langchaingo 客户端会自动置空 temperature/top_p,因此它们在上表中显示为“(自动)”。所有启用思考模式的代理还显式传递 extra_body.thinking.type: enabled,作为针对未来提供商默认更改的防御性编码。

    主要特性:

    • 混合思考模式:通过 extra_body.thinking.type 在思考(深度推理)和非思考(快速)模式间切换
    • 自动提示缓存:通过缓存命中定价(发布价的 1/10)显著降低重复上下文的成本
    • 扩展思考:用于复杂安全分析的强化学习 CoT(两种 V4 模型均支持)
    • 强编码能力:针对代码生成和漏洞利用开发进行了优化
    • 长上下文:1M Token 上下文窗口,最多 384K 输出 Token
    • 工具调用:通过函数调用与 20 多种渗透测试工具无缝集成
    • 流式传输:交互式工作流的实时响应流式传输
    • 多语言:强大的中英文支持
    • 额外功能:JSON 输出、聊天前缀补全(测试版)、FIM/中间填充补全(仅非思考模式)

    并发限制:deepseek-v4-flash:2500 个并发请求;deepseek-v4-pro:500 个并发请求。

    LiteLLM 集成:设置 DEEPSEEK_PROVIDER=deepseek 可在使用 PentAGI 默认配置与 LiteLLM 代理时启用模型名称前缀。如果直接使用 API,则留空。

    GLM 提供商配置

    PentAGI 与 Zhipu AI (Z.AI) 的 GLM 集成,提供基于 MoE 架构的先进语言模型,具备强大的推理和代理能力,由清华大学开发。

    配置变量

    变量默认值描述
    GLM_API_KEY用于认证的 GLM API 密钥
    GLM_SERVER_URL

    配置示例```bash

    Direct API usage (international endpoint)

    GLM_API_KEY=your_glm_api_key GLM_SERVER_URL=https://api.z.ai/api/paas/v4

    Alternative endpoints

    GLM_SERVER_URL=https://open.bigmodel.cn/api/paas/v4 # China GLM_SERVER_URL=https://api.z.ai/api/coding/paas/v4 # Coding-specific

    With LiteLLM proxy

    GLM_API_KEY=your_litellm_key GLM_SERVER_URL=http://litellm-proxy:4000 GLM_PROVIDER=zai # Adds prefix to model names (zai/glm-4) for LiteLLM

    root@kitploit:~
    #### 支持的模型
    
    PentAGI 支持 13 个 GLM 模型,具备工具调用、流式传输、混合思考模式和提示缓存功能。标记有 `*` 的模型用于默认配置。思考模式通过 `extra_body.thinking.type`("enabled"/"disabled")控制;与 Kimi 不同,GLM 在任一模式下对温度参数都比较宽容。
    
    **GLM-5.x 系列 - 最新一代(200K 上下文,128K 最大输出)**
    
    | 模型 ID        | 思考模式 | 上下文 | 最大输出 | 价格(输入/输出/缓存) | 使用场景                                                            |
    | ---------------- | -------- | ------- | ---------- | -------------------------- | ------------------------------------------------------------------- |
    | `glm-5.1`*       | ✅ 混合 | 200K    | 128K       | $1.40/$4.40/$0.26          | 最新旗舰:8小时持续自主执行,与Claude Opus 4.6对齐(生成器/精炼器/顾问/编码器/渗透测试者默认) |
    | `glm-5`          | ✅ 混合 | 200K    | 128K       | $1.00/$3.20/$0.20          | 智能工程基础,MoE 744B/40B活跃参数,Claude Opus 4.5级别编码 |
    | `glm-5-turbo`*   | ✅ 混合 | 200K    | 128K       | $1.20/$4.00/$0.24          | OpenClaw原生:针对工具调用、持久化任务、长链执行优化(主代理/助手默认) |
    
    **GLM-4.7 系列 - 高级交错思考**
    
    | 模型 ID         | 思考模式 | 上下文 | 最大输出 | 价格(输入/输出/缓存) | 使用场景                                            |
    | ----------------- | -------- | ------- | ---------- | -------------------------- | --------------------------------------------------- |
    | `glm-4.7`         | ✅ 混合 | 200K    | 128K       | $0.60/$2.20/$0.11          | 增强型编程,稳定的多步推理   |
    | `glm-4.7-flashx`  | ✅ 混合 | 200K    | 128K       | $0.07/$0.40/$0.01          | 超低价带优先GPU,但RPM限制较低(避免高频使用) |
    | `glm-4.7-flash`   | ✅ 混合 | 200K    | 128K       | Free/Free/Free             | 免费~30B SOTA模型,1个并发请求          |
    
    **GLM-4.6 系列 - 自动思考平衡**
    
    | 模型 ID | 思考模式 | 上下文 | 最大输出 | 价格(输入/输出/缓存) | 使用场景                                          |
    | --------- | -------- | ------- | ---------- | -------------------------- | ------------------------------------------------- |
    | `glm-4.6` | ✅ 自动   | 200K    | 128K       | $0.60/$2.20/$0.11          | 平衡型,流式工具调用,token高效   |
    
    **GLM-4.5 系列 - 统一推理/编码/代理**
    
    | 模型 ID        | 思考模式 | 上下文 | 最大输出 | 价格(输入/输出/缓存) | 使用场景                                          |
    | ---------------- | -------- | ------- | ---------- | -------------------------- | ------------------------------------------------- |
    | `glm-4.5`        | ✅ 自动   | 128K    | 96K        | $0.60/$2.20/$0.11          | 统一型,MoE 355B/32B活跃参数                      |
    | `glm-4.5-x`      | ✅ 自动   | 128K    | 96K        | $2.20/$8.90/$0.45          | 超快高级版,最低延迟                |
    | `glm-4.5-air`*   | ✅ 自动   | 128K    | 96K        | $0.20/$1.10/$0.03          | 成本效益型MoE 106B/12B(简单/简单JSON/反射器/搜索器/丰富器/安装器默认) |
    | `glm-4.5-airx`   | ✅ 自动   | 128K    | 96K        | $1.10/$4.50/$0.22          | 加速版Air,优先GPU                 |
    | `glm-4.5-flash`  | ✅ 自动   | 128K    | 96K        | Free/Free/Free             | 免费,支持推理/编码/代理         |
    
    **GLM-4 经典 - 密集架构**
    
    | 模型 ID               | 思考模式 | 上下文 | 最大输出 | 价格(输入/输出) | 使用场景                                      |
    | --------------------- | -------- | ------- | ---------- | -------------------- | --------------------------------------------- |
    | `glm-4-32b-0414-128k` | ❌        | 128K    | 16K        | $0.10/$0.10          | 超预算密集32B,无推理的解析         |
    
    **价格**:每百万token。缓存价格用于提示缓存命中;根据Z.AI推广,缓存存储目前免费。GLM-4-32B不支持缓存。
    
    **默认代理配置**:
    
    策略:`glm-5.1`(最新旗舰,$1.40输入)用于关键推理,`glm-5-turbo`(OpenClaw原生,代理优化)用于编排,`glm-4.5-air`(廉价MoE,混合思考,可靠RPM)用于所有实用/安装器代理。`glm-4.7-flashx`因RPM限制较低导致高频下频繁429错误而避免作为默认。
    
    | 代理角色                          | 默认模型 | 思考模式 | 温度 | Top P | 最大输出 |
    | ----------------------------------- | ------------- | -------- | ----------- | ----- | ---------- |
    | 生成器/精炼器                 | `glm-5.1`     | 启用  | 1.0         | 0.95  | 32768      |
    | 编码器                               | `glm-5.1`     | 启用  | 1.0         | 0.95  | 20480      |
    | 顾问/渗透测试者                 | `glm-5.1`     | 启用  | 1.0         | 0.95  | 16384      |
    | 主代理/助手           | `glm-5-turbo` | 启用  | 1.0         | 0.95  | 16384      |
    | 安装器                           | `glm-4.5-air` | 启用  | 1.0         | 0.95  | 16384      |
    | 简单/反射器                  | `glm-4.5-air` | 禁用 | 0.6         | 0.9   | 8192       |
    | 搜索器/丰富器/简单 JSON   | `glm-4.5-air` | 禁用 | 0.6         | 0.9   | 4096       |
    
    > **关于温度的说明**:GLM 在思考/非思考模式下均接受 `1.0` 和 `0.6`(根据 Z.AI 文档)。langchaingo 的 `IsReasoningModel` 匹配 `glm-4.5*`/`glm-4.6*`/`glm-4.7*` 前缀,并在 `createChatRequest` 中强制将温度覆盖为 1.0 — 这对 GLM 无害(与 Kimi 不同),但意味着 YAML 中这些模型的温度值仅为建议。`glm-5`/`glm-5.1`/`glm-5-turbo` 不匹配,因此显式值原样传递。
    
    **思考模式**:
    - **混合**(GLM-5.x, GLM-4.7):通过 `extra_body.thinking.type` 显式切换
    - **自动**(GLM-4.6, GLM-4.5 系列):模型自动决定何时需要推理
    - **保持思考**(Z.AI 编码能力):PentAGI 中所有启用思考的代理还传递 `extra_body.thinking.clear_thinking: false`,以便在对话中保留先前助手轮的 `reasoning_content`。这在标准 API 端点上必需(`/api/paas/v4`)— 在 Coding Plan 端点上默认启用。可提高多轮工具调用链中的推理连续性和缓存命中率。
    - 所有启用思考的代理还防御性传递 `extra_body.tool_choice: auto`
    
    **关键特性**:
    - **长周期任务**:GLM-5.1 支持 8 小时持续自主执行,适合复杂的多阶段智能体工作流
    - **OpenClaw 原生编排**:GLM-5-Turbo 专门针对工具调用、指令遵循和长链执行优化
    - **提示缓存**:重复上下文显著降低成本(显示缓存输入定价)
    - **超长上下文**:GLM-5.x/4.7/4.6 系列 200K token
    - **MoE 架构**:GLM-5/5.1 高效 744B/40B 活跃参数,GLM-4.5 为 355B/32B,GLM-4.5-Air 为 106B/12B
    - **工具调用**:通过函数调用与 20+ 渗透测试工具无缝集成
    - **流式传输**:实时流式传输,支持流式工具调用(GLM-4.6+)
    - **多语言**:卓越的中文和英文自然语言处理能力
    - **免费选项**:GLM-4.7-Flash 和 GLM-4.5-Flash 用于原型设计和实验
    
    **LiteLLM 集成**:设置 `GLM_PROVIDER=zai` 可在使用默认 PentAGI 配置与 LiteLLM 代理时启用模型名称前缀。留空则直接使用 API。
    
    ### Kimi 提供商配置
    
    PentAGI 集成了来自 Moonshot AI 的 Kimi,提供超长上下文模型和多模态能力,非常适合分析大型代码库和文档。
    
    #### 配置变量
    
    | 变量               | 默认值                        | 描述                                         |
    | ------------------ | -----------------------------| --------------------------------------------------- |
    | `KIMI_API_KEY`     |                              | Kimi API 密钥,用于身份验证                     |
    | `KIMI_SERVER_URL`  | `https://api.moonshot.ai/v1` | Kimi API 端点 URL(国际版)               |
    | `KIMI_PROVIDER`    |                              | LiteLLM 集成的提供商前缀(可选)              |
    
    #### 配置示例```bash
    # Direct API usage (international endpoint)
    KIMI_API_KEY=your_kimi_api_key
    KIMI_SERVER_URL=https://api.moonshot.ai/v1
    
    # Alternative endpoint
    KIMI_SERVER_URL=https://api.moonshot.cn/v1  # China
    
    # With LiteLLM proxy
    KIMI_API_KEY=your_litellm_key
    KIMI_SERVER_URL=http://litellm-proxy:4000
    KIMI_PROVIDER=moonshot  # Adds prefix to model names (moonshot/kimi-k2.5) for LiteLLM
    

    支持的模型

    PentAGI 支持 8 种 Kimi/Moonshot 模型,具备工具调用、流式输出、混合思考模式以及多模态能力(K2.x 型号支持文本/图像/视频)。所有 kimi-k2-* 旧版模型(turbo-preview、0905-preview、0711-preview、thinking、thinking-turbo)已于 2026-05-25 被 Moonshot 废弃,不再包含。标有 * 的模型用于默认配置。

    Kimi K2.x 系列 - 多模态旗舰

    Moonshot V1 系列 - 生成模型(灵活参数)

    Moonshot V1 Vision 系列 - 图像理解

    价格:每 1M 令牌。缓存定价适用于从自动上下文缓存提供的提示令牌(仅 Kimi K2.x 模型支持缓存)。

    关键 — Kimi K2.6/K2.5 参数约束:对于任何偏离,API 会返回 invalid_request_error:

    • temperature:思考模式下必须为 1.0,非思考模式下必须为 0.6
    • top_p:必须为 0.95
    • n:必须为 1
    • presence_penalty 和 frequency_penalty:必须为 0(不可修改)

    Moonshot V1 模型使用标准 OpenAI 兼容参数,无此类约束。

    默认代理配置:

    策略:优先使用 kimi-k2.5 作为性价比高的主力模型(输入成本比 kimi-k2.6 低 36%);将 kimi-k2.6 保留用于关键推理。所有 kimi-k2.x 代理都配置了 API 要求的固定参数(temp/top_p/n)和显式的 extra_body.thinking.type。对于启用思考模式的代理,设置 extra_body.thinking.keep: "all" 以保留多轮工具调用链中的历史 reasoning_content(否则 Moonshot 会返回“思考已启用但缺少 reasoning_content”)。

    关键特性:

    • 超长上下文:最高 256K 令牌(K2.x),用于全面的代码库/文档分析
    • 原生多模态:K2.6/K2.5 原生支持文本 + 图像 + 视频输入
    • 混合思考:K2.6/K2.5 通过 extra_body.thinking.type 在思考与非思考模式间切换
    • 保留思考内容(K2.6):thinking.keep: "all" 保留跨轮次的历史 reasoning_content — 这是多轮工具调用链所必需的
    • 自动上下文缓存:K2.x 模型缓存重复前缀(K2.6 约降低 17% 未命中价格,K2.5 同样)
    • 工具调用:K2.x 和 Moonshot V1 完全支持函数调用
    • 自我纠错:K2.6 改进了指令遵循和自我纠错能力
    • 多语言:强大的中文、英文和多语言支持

    多轮思考 + 工具调用:PentAGI 的通用推理保留模式(TextPartWithReasoning + WithPreserveReasoningContent)自动确保 reasoning_content 以要求的 TextContent → ToolCall 顺序发送回,从而满足 Moonshot 的“思考已启用但 assistant 工具调用消息中缺少 reasoning_content”要求。

    LiteLLM 集成:设置 KIMI_PROVIDER=moonshot 可在使用默认 PentAGI 配置配合 LiteLLM 代理时启用模型名称前缀。留空则直接使用 API。

    Qwen 提供商配置

    PentAGI 集成了阿里云模型服务平台(DashScope)的 Qwen,提供强大的多语言模型,具备推理能力和上下文缓存支持。

    配置变量

    变量默认值描述
    QWEN_API_KEY用于身份验证的 Qwen API 密钥
    QWEN_SERVER_URL

    配置示例```bash

    Direct API usage (Global/US endpoint)

    QWEN_API_KEY=your_qwen_api_key QWEN_SERVER_URL=https://dashscope-us.aliyuncs.com/compatible-mode/v1

    Alternative endpoints

    QWEN_SERVER_URL=https://dashscope-intl.aliyuncs.com/compatible-mode/v1 # International (Singapore) QWEN_SERVER_URL=https://dashscope.aliyuncs.com/compatible-mode/v1 # Chinese Mainland (Beijing)

    With LiteLLM proxy

    QWEN_API_KEY=your_litellm_key QWEN_SERVER_URL=http://litellm-proxy:4000 QWEN_PROVIDER=dashscope # Adds prefix to model names (dashscope/qwen-plus) for LiteLLM

    root@kitploit:~
    #### 支持模型
    
    PentAGI 支持 33 个专为智能体工作流精选的 Qwen 模型:文本推理、代码生成以及视觉语言(浏览器截图)。所有模型均为非快照版本的主别名,支持工具调用、流式传输、思考模式以及上下文缓存。标记有 `*` 的模型用于默认配置。
    
    **旗舰模型(顶级推理)**
    
    | 模型 ID                     | 思考 | 国际 | 全球/美国 | 中国 | 价格(输入/输出/缓存) | 使用场景                                                |
    | ---------------------------- | -------- | ---- | --------- | ----- | -------------------------- | ------------------------------------------------------- |
    | `qwen3.7-max`*               | ✅        | ✅    | ✅         | ✅     | 2.50 美元/7.50 美元/0.50 美元          | 下一代旗舰,专为智能体时代设计(生成器/精炼器/顾问默认) |
    | `qwen3.6-max-preview`        | ✅        | ✅    | ✅         | ✅     | 1.30 美元/7.80 美元/0.13 美元          | 预览版 Max,增强的 vibe 编码和前端技能 |
    | `qwen3-max`                  | ✅        | ✅    | ✅         | ✅     | 1.20 美元/6.00 美元/0.24 美元          | 上一代旗舰,集成了智能体编程升级   |
    | `qwen-plus`                  | ✅        | ✅    | ✅         | ✅     | 0.40 美元/4.00 美元/0.08 美元          | 基于 Qwen3 的 Plus,可切换思考模式      |
    
    **均衡 Plus 模型(中端)**
    
    | 模型 ID                     | 思考 | 国际 | 全球/美国 | 中国 | 价格(输入/输出/缓存) | 使用场景                                                |
    | ---------------------------- | -------- | ---- | --------- | ----- | -------------------------- | ------------------------------------------------------- |
    | `qwen3.6-plus`*              | ✅        | ✅    | ✅         | ✅     | 0.50 美元/3.00 美元/0.05 美元          | 原生 VL Plus,具备智能体编码能力(主智能体/辅助/渗透测试默认) |
    | `qwen3.5-plus`               | ✅        | ✅    | ✅         | ✅     | 0.40 美元/2.40 美元/0.04 美元          | 上一代原生 VL,具备强大的多模态能力 |
    
    **快速 Flash 模型(成本优化)**
    
    | 模型 ID                     | 思考 | 国际 | 全球/美国 | 中国 | 价格(输入/输出/缓存) | 使用场景                                                |
    | ---------------------------- | -------- | ---- | --------- | ----- | -------------------------- | ------------------------------------------------------- |
    | `qwen3.6-flash`              | ✅        | ✅    | ✅         | ✅     | 0.25 美元/1.50 美元/0.025 美元         | 最新 Flash,显著提升智能体编码能力      |
    | `qwen3.5-flash`*             | ✅        | ✅    | ✅         | ✅     | 0.10 美元/0.40 美元/0.01 美元          | 超快轻量级(简单/反射/搜索/丰富默认) |
    | `qwen-flash`                 | ✅        | ✅    | ✅         | ✅     | 0.05 美元/0.40 美元/0.01 美元          | Qwen3 系列 Flash,1M 上下文,分层定价      |
    
    **代码专用模型**
    
    | 模型 ID                     | 思考 | 国际 | 全球/美国 | 中国 | 价格(输入/输出/缓存) | 使用场景                                                |
    | ---------------------------- | -------- | ---- | --------- | ----- | -------------------------- | ------------------------------------------------------- |
    | `qwen3-coder-plus`*          | ❌        | ✅    | ✅         | ✅     | 1.00 美元/5.00 美元/0.20 美元          | 强大的编码智能体,具备自主编程能力(编码器默认) |
    | `qwen3-coder-flash`*         | ❌        | ✅    | ✅         | ✅     | 0.30 美元/1.50 美元/0.06 美元          | 快速代码生成,多轮工具稳定性(安装器默认) |
    | `qwen3-coder-next`           | ❌        | ✅    | ✅         | ✅     | 0.30 美元/1.50 美元/—              | 开源代码生成,同量级最优      |
    
    **视觉语言模型(浏览器和截图分析)**
    
    | 模型 ID                     | 思考 | 国际 | 全球/美国 | 中国 | 价格(输入/输出/缓存) | 使用场景                                                |
    | ---------------------------- | -------- | ---- | --------- | ----- | -------------------------- | ------------------------------------------------------- |
    | `qwen3-vl-plus`              | ✅        | ✅    | ✅         | ✅     | 0.20 美元/1.60 美元/0.04 美元          | VL 具备视觉智能体能力,超长视频理解 |
    | `qwen3-vl-flash`             | ✅        | ✅    | ✅         | ✅     | 0.05 美元/0.40 美元/0.01 美元          | 小型 VL,2D/3D 定位,用于浏览器分诊     |
    | `qvq-max`                    | ✅        | ✅    | ✅         | ✅     | 1.20 美元/4.80 美元/—              | 视觉推理,具有思维链                  |
    
    **开源 Qwen3.6 系列**
    
    | 模型 ID                     | 思考 | 国际 | 全球/美国 | 中国 | 价格(输入/输出/缓存) | 使用场景                                                |
    | ---------------------------- | -------- | ---- | --------- | ----- | -------------------------- | ------------------------------------------------------- |
    | `qwen3.6-27b`                | ✅        | ✅    | ✅         | ✅     | 0.60 美元/3.60 美元/—              | 原生 VL,基于混合架构,可本地部署     |
    | `qwen3.6-35b-a3b`            | ✅        | ✅    | ✅         | ✅     | 0.25 美元/1.49 美元/—              | 高效的 35B MoE(约 3B 激活),用于持续监控 |
    
    **开源 Qwen3.5 系列**
    
    | 模型 ID                     | 思考 | 国际 | 全球/美国 | 中国 | 价格(输入/输出/缓存) | 使用场景                                                |
    | ---------------------------- | -------- | ---- | --------- | ----- | -------------------------- | ------------------------------------------------------- |
    | `qwen3.5-397b-a17b`          | ✅        | ✅    | ✅         | ✅     | 0.60 美元/3.60 美元/—              | 最大参数 397B(约 17B 激活),卓越推理能力 |
    | `qwen3.5-122b-a10b`          | ✅        | ✅    | ✅         | ✅     | 0.40 美元/3.20 美元/—              | 大参数 122B(约 10B 激活),良好平衡         |
    | `qwen3.5-35b-a3b`            | ✅        | ✅    | ✅         | ✅     | 0.25 美元/2.00 美元/—              | 高效的 35B MoE(约 3B 激活),成本效益佳          |
    | `qwen3.5-27b`                | ✅        | ✅    | ✅         | ✅     | 0.30 美元/2.40 美元/—              | 中等规模 27B,混合线性注意力 + 稀疏 MoE    |
    
    **开源 Qwen3 Coder 系列**
    
    | 模型 ID                              | 思考 | 国际 | 全球/美国 | 中国 | 价格(输入/输出/缓存) | 使用场景                                                |
    | ------------------------------------- | -------- | ---- | --------- | ----- | -------------------------- | ------------------------------------------------------- |
    | `qwen3-coder-480b-a35b-instruct`      | ❌        | ✅    | ✅         | ✅     | 1.50 美元/7.50 美元/—              | 最大开源编码 MoE(480B/~35B 激活)               |
    | `qwen3-coder-30b-a3b-instruct`        | ❌        | ✅    | ✅         | ✅     | 0.45 美元/2.25 美元/—              | 高效的 30B MoE(约 3B 激活),仓库级应用        |
    
    **开源 Qwen3 Dense & MoE 系列**
    
    | 模型 ID                              | 思考 | 国际 | 全球/美国 | 中国 | 价格(输入/输出/缓存) | 使用场景                                                |
    | ------------------------------------- | -------- | ---- | --------- | ----- | -------------------------- | ------------------------------------------------------- |
    | `qwen3-next-80b-a3b-thinking`         | ✅        | ✅    | ✅         | ✅     | 0.15 美元/1.20 美元/—              | 下一代 80B MoE(约 3B 激活),纯思考             |
    | `qwen3-next-80b-a3b-instruct`         | ❌        | ✅    | ✅         | ✅     | 0.15 美元/1.20 美元/—              | 下一代 80B MoE 指令跟随                  |
    | `qwen3-235b-a22b`                     | ✅        | ✅    | ✅         | ✅     | 0.70 美元/8.40 美元/—              | 双模式 235B MoE(约 22B 激活)                        |
    | `qwen3-32b`                           | ✅        | ✅    | ✅         | ✅     | 0.16 美元/0.64 美元/—              | 多功能 32B 密集双模式                           |
    | `qwen3-30b-a3b`                       | ✅        | ✅    | ✅         | ✅     | 0.20 美元/2.40 美元/—              | 高效的 30B MoE(约 3B 激活)                          |
    | `qwen3-14b`                           | ✅        | ✅    | ✅         | ✅     | 0.35 美元/4.20 美元/—              | 中等 14B 密集性能成本平衡               |
    | `qwen3-8b`                            | ✅        | ✅    | ✅         | ✅     | 0.18 美元/2.10 美元/—              | 紧凑型 8B 密集效率                             |
    | `qwen3-4b`                            | ✅        | ✅    | ✅         | ✅     | 0.11 美元/1.26 美元/—              | 轻量级 4B 密集,适用于简单任务                   |
    | `qwen3-1.7b`                          | ✅        | ✅    | ✅         | ✅     | 0.11 美元/1.26 美元/—              | 超紧凑型 1.7B,基本检查                         |
    | `qwen3-0.6b`                          | ✅        | ✅    | ✅         | ✅     | 0.11 美元/1.26 美元/—              | 最小 0.6B,用于边缘监控                       |
    
    **价格**:每 1M 令牌。缓存价格反映隐式缓存命中(可用时);MoE/密集开源模型不展示缓存价格。分层模型(Max/Plus)显示最低层级定价(通常 ≤32k 或 ≤256k 输入);更大上下文根据阿里云定价产生更高费率。
    
    **区域可用性**:
    - **国际**:新加坡区域(`dashscope-intl.aliyuncs.com`)
    - **全球/美国**:美国弗吉尼亚区域(`dashscope-us.aliyuncs.com`)
    - **中国**:中国大陆北京区域(`dashscope.aliyuncs.com`)
    
    **默认智能体配置**:
    | 智能体角色                                       | 默认模型        | 层级      |
    | ------------------------------------------------ | -------------------- | --------- |
    | 生成器 / 精炼器 / 顾问(规划、导师) | `qwen3.7-max`        | 旗舰  |
    | 主智能体 / 辅助 / 渗透测试                  | `qwen3.6-plus`       | 均衡  |
    | 编码器(漏洞利用开发)                      | `qwen3-coder-plus`   | 代码+     |
    | 安装器(环境搭建)                            | `qwen3-coder-flash`  | 代码快速 |
    | 简单 / 反射 / 搜索 / 丰富         | `qwen3.5-flash`      | 快速      |
    
    **关键特性**:
    - **智能体中心设计**:Qwen3.7-Max 专为长周期自主执行和工具调用打造
    - **自动上下文缓存**:对重复上下文减少 30-50% 成本,通过隐式缓存
    - **扩展思考能力**:思维链推理,用于复杂安全分析(Qwen3.7/3.6/3.5/3-Max,QVQ-Max)
    - **代码专业化**:Qwen3-Coder 系列,支持多轮工具交互和仓库级理解
    - **视觉语言**:Qwen3-VL 系列,用于浏览器截图分诊、2D/3D 定位、OCR 级别分析
    - **工具调用**:通过函数调用无缝集成 20 多个渗透测试工具
    - **流式传输**:实时响应流式传输,支持交互式工作流
    - **多语言**:强大的中文、英文和多语言支持
    - **开源变体**:从 0.6B 到 480B 的密集和 MoE 模型,适用于本地/气隙部署
    
    **LiteLLM 集成**:设置 `QWEN_PROVIDER=dashscope` 可在使用默认 PentAGI 配置与 LiteLLM 代理时启用模型名称前缀。留空则直接使用 API。
    
    #### 替代集成
    
    DashScope 完全兼容 OpenAI,因此 Qwen 也可以通过标准 OpenAI 客户端驱动 PentAGI 的其他两个子系统。
    
    ---
    
    [Read more](https://github.com/vxcontrol/pentagi)
    
    下载工具
    参数环境变量默认值描述
    保留最后一个部分SUMMARIZER_PRESERVE_LASTtrue是否完整保留最后一个部分中的所有消息
    使用 QA 对SUMMARIZER_USE_QAtrue是否使用 QA 对摘要策略
    在 QA 中摘要人类消息SUMMARIZER_SUM_MSG_HUMAN_IN_QAfalse是否对 QA 对中的人类消息进行摘要
    最后一个部分大小SUMMARIZER_LAST_SEC_BYTES51200最后一个部分的最大字节大小(50KB)
    最大主体对大小SUMMARIZER_MAX_BP_BYTES16384单个主体对的最大字节大小(16KB)
    最大 QA 部分数SUMMARIZER_MAX_QA_SECTIONS10要保留的最大 QA 对部分数
    最大 QA 大小SUMMARIZER_MAX_QA_BYTES65536QA 对部分的最大字节大小(64KB)
    保留 QA 部分SUMMARIZER_KEEP_QA_SECTIONS1不进行摘要而保留的最近 QA 部分数
    参数环境变量默认值描述
    保留最后一个部分ASSISTANT_SUMMARIZER_PRESERVE_LASTtrue是否保留助手最后一个部分中的所有消息
    最后一个部分大小ASSISTANT_SUMMARIZER_LAST_SEC_BYTES76800助手最后一个部分的最大字节大小(75KB)
    最大主体对大小ASSISTANT_SUMMARIZER_MAX_BP_BYTES16384助手上下文中单个主体对的最大字节大小(16KB)
    最大 QA 部分数ASSISTANT_SUMMARIZER_MAX_QA_SECTIONS7助手上下文中保留的最大 QA 部分数
    最大 QA 大小ASSISTANT_SUMMARIZER_MAX_QA_BYTES76800助手 QA 部分的最大字节大小(75KB)
    保留 QA 部分ASSISTANT_SUMMARIZER_KEEP_QA_SECTIONS3不进行摘要而保留的最近 QA 部分数
    NEO4J_PASSWORD
    pentagi
    变量默认值描述
    LLM_SERVER_URL自定义 LLM API 端点的基本 URL
    LLM_SERVER_KEY自定义 LLM 提供商的 API 密钥
    LLM_SERVER_MODEL默认使用的模型(可在提供商配置中覆盖)
    LLM_SERVER_CONFIG_PATH代理特定模型的 YAML 配置文件路径
    LLM_SERVER_PROVIDER模型名称的提供商前缀(例如 LiteLLM 代理的 openrouter、deepseek)
    LLM_SERVER_LEGACY_REASONINGfalse控制 API 请求中的推理格式
    LLM_SERVER_PRESERVE_REASONINGfalse在多轮对话中保留推理内容(某些提供商需要)
    变量默认值描述
    OLLAMA_SERVER_URLOllama 服务器或 Ollama Cloud 的 URL
    OLLAMA_SERVER_API_KEYOllama Cloud 身份验证的 API 密钥
    OLLAMA_SERVER_MODEL推理的默认模型
    OLLAMA_SERVER_CONFIG_PATH自定义代理配置文件的路径
    OLLAMA_SERVER_PULL_MODELS_TIMEOUT600模型下载超时时间(秒)
    OLLAMA_SERVER_PULL_MODELS_ENABLEDfalse启动时自动下载模型
    OLLAMA_SERVER_LOAD_MODELS_ENABLEDfalse查询服务器以获取可用模型
    模型 ID推理价格(输入/输出/缓存)用例
    gpt-5.2*✅$1.75/$14.00/$0.18最新旗舰,增强推理与工具集成,自主安全研究
    gpt-5.2-pro✅$21.00/$168.00/$0.00高级版本,卓越智能体编码,关键安全研究,零日发现
    gpt-5.2-codex✅$1.75/$14.00/$0.18最先进的代码专用模型,上下文压缩,强网络安全能力
    模型 ID推理价格(输入/输出/缓存)用例
    gpt-5✅$1.25/$10.00/$0.13高级智能体,具备先进推理,自主安全研究,利用链开发
    gpt-5.1✅$1.25/$10.00/$0.13增强智能体,自适应推理,平衡渗透测试,强工具协调
    gpt-5-pro✅$15.00/$120.00/$0.00高级版本,重大推理改进,减少幻觉,关键安全操作
    gpt-5-mini✅$0.25/$2.00/$0.03高效平衡速度与智能,自动化漏洞分析,利用生成
    gpt-5-nano✅$0.05/$0.40/$0.01高速扫描、侦察、批量漏洞检测最快
    模型 ID推理价格(输入/输出/缓存)用例
    gpt-5.1-codex-max✅$1.25/$10.00/$0.13增强推理,适用于复杂编码,经过验证的 CVE 发现,系统化利用开发
    gpt-5.1-codex✅$1.25/$10.00/$0.13标准代码优化,强推理,利用生成,漏洞分析
    gpt-5-codex✅$1.25/$10.00/$0.13基础代码专用,漏洞扫描,基础利用生成
    gpt-5.1-codex-mini✅$0.25/$2.00/$0.03紧凑高性能,4倍容量,快速漏洞检测
    codex-mini-latest✅$1.50/$6.00/$0.38最新紧凑代码模型,自动化代码审查,基础漏洞分析
    模型 ID推理价格(输入/输出/缓存)用例
    gpt-4.1❌$2.00/$8.00/$0.50增强旗舰模型,卓越函数调用,复杂威胁分析,高级利用开发
    gpt-4.1-mini*❌$0.40/$1.60/$0.10平衡性能,效率提升,常规安全评估,自动化代码分析
    gpt-4.1-nano❌$0.10/$0.40/$0.03超快轻量,批量安全扫描,快速侦察,持续监控
    紧凑多模态,强函数调用,高频扫描,低成本批量操作
    模型 ID推理价格(输入/输出/缓存)用例
    o4-mini*✅$1.10/$4.40/$0.28新一代推理,速度提升,有条理的安全评估,系统化利用开发
    o3*✅$2.00/$8.00/$0.50高级推理引擎,多阶段攻击链,深度漏洞分析
    o3-mini✅$1.10/$4.40/$0.55紧凑推理,扩展思考,逐步攻击规划,逻辑漏洞链
    o1✅$15.00/$60.00/$7.50顶级推理,最大深度,高级渗透测试,新颖利用研究
    o3-pro✅$20.00/$80.00/$0.00最先进推理,比 o1-pro 便宜80%,零日研究,关键安全调查
    o1-pro✅$150.00/$600.00/$0.00上一代高级推理,详尽安全分析,关键任务挑战
    模型 ID思考上下文价格(输入/输出/缓存)用例
    gemini-3.1-pro-preview*✅1M$2.00/$12.00/$0.20最新旗舰版,带有精细思考,改进的 token 效率,针对软件工程和代理工作流优化
    gemini-3.1-pro-preview-customtools✅1M$2.00/$12.00/$0.20优化了 bash 和自定义工具(view_file、search_code)优先级的自定义工具端点
    gemini-3.1-flash-lite*✅1M$0.25/$1.50/$0.025最具成本效益的稳定多模态模型,在高容量代理任务和低延迟应用中具有前沿性能
    模型 ID思考上下文价格(输入/输出/缓存)用例
    gemini-2.5-pro✅1M$1.25/$10.00/$0.125复杂编码和推理的最先进模型,复杂的威胁建模
    gemini-2.5-flash✅1M$0.30/$2.50/$0.03首个混合推理模型,具有思考预算,大规模评估的最佳性价比
    gemini-2.5-flash-lite✅1M$0.10/$0.40/$0.01最小且最具成本效益的大规模使用模型,高通量扫描
    模型 ID思考上下文价格(输入/输出/缓存)用例
    gemma-4-31b-it✅256K免费/免费/免费最大的开源 Gemma 4 稠密模型(约31B参数),多模态文本+图像,支持140+种语言,适用于本地安全运维
    gemma-4-26b-a4b-it✅256K免费/免费/免费MoE 架构(约26B总/约3.8B活跃参数),在消费级 GPU 上实现高效推理,适用于本地高通量扫描
    simple_json
    变量默认值描述
    BEDROCK_REGIONus-east-1Bedrock 服务的 AWS 区域
    BEDROCK_DEFAULT_AUTHfalse使用 AWS SDK 默认凭证链(环境变量、EC2 角色、~/.aws/credentials)- 最高优先级
    BEDROCK_BEARER_TOKENBearer token 认证 - 优先级高于静态凭证
    BEDROCK_ACCESS_KEY_ID静态凭证的 AWS 访问密钥 ID
    BEDROCK_SECRET_ACCESS_KEY静态凭证的 AWS 秘密访问密钥
    BEDROCK_SESSION_TOKEN临时凭证的 AWS 会话 token(可选,与静态凭证一起使用)
    BEDROCK_SERVER_URL自定义 Bedrock 端点(VPC 端点、本地测试)
    模型 ID思考模式最大输出上下文价格(输入/输出/缓存)用途
    deepseek-v4-flash*✅ 混合384K1M$0.14/$0.28/$0.0028实用代理、通用对话、快速工具调用
    deepseek-v4-pro*✅ 混合384K1M$1.74/$3.48/$0.0145高级推理、复杂逻辑、安全分析
    代理角色默认模型思考模式推理努力最大输出温度Top P
    生成器 / 精炼器deepseek-v4-pro启用高32768(自动)(自动)
    编码器deepseek-v4-pro启用高20480(自动)(自动)
    主要代理 / 助手 / 渗透测试者deepseek-v4-pro启用高16384(自动)(自动)
    顾问(导师/规划者)deepseek-v4-pro启用高8192(自动)(自动)
    安装器deepseek-v4-flash启用高12288(自动)(自动)
    反思器 / 搜索器 / 丰富器deepseek-v4-flash禁用—40960.50.9
    简单 / 简单 JSONdeepseek-v4-flash禁用—20480.30.9
    https://api.z.ai/api/paas/v4
    GLM API 端点 URL(国际版)
    GLM_PROVIDER用于 LiteLLM 集成的提供商前缀(可选)
    模型 ID思考模式多模态上下文价格 (输入 / 输出 / 缓存命中)用途
    kimi-k2.6*✅ 混合✅256K$0.95 / $4.00 / $0.16最新旗舰:原生多模态、更强的代码能力、改进的指令遵循(生成器/优化器/顾问/编码器/渗透测试者的默认模型)
    kimi-k2.5*✅ 混合✅256K$0.60 / $3.00 / $0.10前代产品:输入成本降低 36%,架构相同(主代理/辅助代理/安装器/实用工具的默认模型)
    模型 ID思考模式多模态上下文价格 (输入 / 输出)用途
    moonshot-v1-8k❌❌8K$0.20 / $2.00短文本生成,超低成本
    moonshot-v1-32k❌❌32K$1.00 / $3.00长文本生成
    moonshot-v1-128k❌❌128K$2.00 / $5.00超长上下文
    模型 ID思考模式多模态上下文价格 (输入 / 输出)用途
    moonshot-v1-8k-vision-preview❌✅8K$0.20 / $2.00视觉 + 短上下文
    moonshot-v1-32k-vision-preview❌✅32K$1.00 / $3.00视觉 + 中等上下文
    moonshot-v1-128k-vision-preview❌✅128K$2.00 / $5.00视觉 + 长上下文
    代理角色默认模型思考模式温度Top P最大输出
    生成器 / 优化器kimi-k2.6启用 (keep=all)1.00.9532768
    编码器kimi-k2.6启用 (keep=all)1.00.9520480
    渗透测试者kimi-k2.6启用 (keep=all)1.00.9516384
    顾问 (导师/规划器)kimi-k2.6启用 (keep=all)1.00.958192
    主代理 / 辅助代理kimi-k2.5启用 (keep=all)1.00.9516384
    安装器kimi-k2.5启用 (keep=all)1.00.9512288
    反射器 / 搜索器 / 增强器kimi-k2.5禁用0.60.954096
    简单 / 简单 JSONkimi-k2.5禁用0.60.952048
    https://dashscope-us.aliyuncs.com/compatible-mode/v1
    Qwen API 端点 URL(国际版)
    QWEN_PROVIDER用于 LiteLLM 集成的提供商前缀(可选)