Skip to content
KitploitKITPLOIT
FerramentasBlog
Enviar
FerramentasBlog
Enviar

Ferramentas de Hacking, PenTest e Cibersegurança para o seu Arsenal de Segurança!

Kitploit é um diretório de ferramentas de hacking, cibersegurança e pentesting. Descubra as últimas atualizações de projetos para encontrar vulnerabilidades, analisar sistemas, automatizar testes e fortalecer sua segurança.

··Feeds·Contato·Privacidade·© 2026 Kitploit

Diretório de Ferramentas

Categorias

Ver todas as categorias
Loading categories
pentagi — Sistema de Agentes de IA totalmente autônomos capaz de realizar tarefas complexas de teste de penetração | Kitploit
Ferramentas/GitHubGitHub/vxcontrol/pentagi
Frameworks de Testes de PenetraçãoReconhecimentoScanners de VulnerabilidadesFrameworks de ExploraçãoColeta de InformaçõesSegurança WebTestes de PenetraçãoAprendizado e EducaçãoSegurança de IA
GitHubvxcontrol/pentagi

pentagi

Sistema de Agentes de IA totalmente autônomos capaz de realizar tarefas complexas de teste de penetração

21.8k2.9k1há 14 diasRevisado pelo Kitploit

Mais Populares

Ver todos →

Descubra as ferramentas mais usadas pela nossa comunidade.

Explore todas as ferramentas

Navegue pela nossa coleção de ferramentas

Ver todas as ferramentas →
Compartilhar
Ver RepositórioSite

PentAGI

Penetração teste Artificial Geral Inteligência

Junte-se à Comunidade! Conecte-se com pesquisadores de segurança, entusiastas de IA e hackers éticos. Obtenha suporte, compartilhe ideias e fique atualizado com os últimos desenvolvimentos do PentAGI.

Discord⠀Telegram

vxcontrol%2Fpentagi | Trendshift

Índice

  • Visão Geral
  • Recursos
  • Arquitetura
    • Supervisão de Agentes
  • Início Rápido
  • Como Usar o PentAGI Após o Login
  • Acesso à API
    • Configuração de Provedor LLM
      • Ollama
      • OpenAI
      • Anthropic
      • Google AI (Gemini)
      • AWS Bedrock
      • DeepSeek
      • GLM
      • Kimi
      • Qwen
  • Configuração Avançada
    • Integração Langfuse
    • Monitoramento e Observabilidade
    • Grafo de Conhecimento (Graphiti)
    • Integração OAuth
    • Configuração de Imagem Docker
  • Desenvolvimento
  • Testando Agentes LLM
  • Configuração e Teste de Embeddings
  • Teste de Funções com ftester
  • Compilação
  • Créditos
  • Licença

Visão Geral

PentAGI é uma ferramenta inovadora para testes de segurança automatizados que utiliza tecnologias de inteligência artificial de ponta. O projeto é projetado para profissionais de segurança da informação, pesquisadores e entusiastas que precisam de uma solução poderosa e flexível para realizar testes de penetração.

Você pode assistir ao vídeo Visão geral do PentAGI: PentAGI Overview Video

Recursos

  • Seguro e Isolado. Todas as operações são realizadas em um ambiente Docker em sandbox com isolamento completo.
  • Totalmente Autônomo. Agente baseado em IA que determina e executa automaticamente as etapas de teste de penetração, com monitoramento opcional de execução e planejamento inteligente de tarefas para maior confiabilidade.
  • Ferramentas Profissionais de Pentest. Conjunto integrado de mais de 20 ferramentas de segurança profissionais, incluindo nmap, metasploit, sqlmap e muito mais.
  • Sistema de Memória Inteligente. Armazenamento de longo prazo de resultados de pesquisa e abordagens bem-sucedidas para uso futuro.
  • Integração com Grafo de Conhecimento. Grafo de conhecimento alimentado por Graphiti usando Neo4j para rastreamento de relações semânticas e compreensão avançada de contexto.
  • Inteligência Web. Navegador integrado via scraper para coletar as informações mais recentes de fontes web.
  • Sistemas de Busca Externa. Integração com APIs de busca avançadas, incluindo Tavily, Traversaal, Perplexity, DuckDuckGo, Google Custom Search, Sploitus Search e Searxng para coleta abrangente de informações.
  • Equipe de Especialistas. Sistema de delegação com agentes de IA especializados para tarefas de pesquisa, desenvolvimento e infraestrutura, aprimorado com monitoramento opcional de execução e planejamento inteligente de tarefas para desempenho ideal com modelos menores.
  • Monitoramento Abrangente. Log detalhado e integração com Grafana/Prometheus para observação do sistema em tempo real.
  • Relatórios Detalhados. Geração de relatórios completos de vulnerabilidades com guias de exploração.
  • Gerenciamento Inteligente de Contêineres. Seleção automática de imagem Docker com base nos requisitos específicos da tarefa.
  • Interface Moderna. Interface web limpa e intuitiva para gerenciamento e monitoramento do sistema.
  • APIs Abrangentes. APIs REST e GraphQL completas com autenticação via token Bearer para automação e integração.
  • Armazenamento Persistente. Todos os comandos e saídas são armazenados em PostgreSQL com extensão pgvector.
  • Arquitetura Escalável. Design baseado em microsserviços que suporta escalabilidade horizontal.

Limites Atuais de Capacidade

  • PentAGI hoje é uma plataforma de teste de penetração autônoma e assistida por guia, não um produto de Simulação de Violação e Ataque (BAS) estilo CALDERA ou simulação de adversário com campanhas ou planos de ataque predefinidos.
  • Scripts de ataque criados por agente estilo BAS devem ser tratados como trabalho conceitual ou futuro, não como um recurso implementado hoje.
  • A interface atual de relatório de fluxo suporta visualização web, cópia para área de transferência, download em Markdown e PDF. A exportação de relatório de fluxo em JSON não está documentada como formato de saída suportado atualmente.
  • A flexibilidade de provedores está disponível hoje através de provedores integrados e endpoints customizados/compatíveis com OpenAI. Consulte Configuração de Provedor LLM Personalizado e o guia vLLM + Qwen3.5-27B-FP8.

Arquitetura

Contexto do Sistema```mermaid

flowchart TB classDef person fill:#08427B,stroke:#073B6F,color:#fff classDef system fill:#1168BD,stroke:#0B4884,color:#fff classDef external fill:#666666,stroke:#0B4884,color:#fff

root@kitploit:~
pentester["👤 Security Engineer
(User of the system)"]

pentagi["✨ PentAGI
(Autonomous penetration testing system)"]

target["🎯 target-system
(System under test)"]
llm["🧠 llm-provider
(OpenAI/Anthropic/Ollama/Bedrock/Gemini/Custom)"]
search["🔍 search-systems
(Google/DuckDuckGo/Tavily/Traversaal/Perplexity/Sploitus/Searxng)"]
langfuse["📊 langfuse-ui
(LLM Observability Dashboard)"]
grafana["📈 grafana
(System Monitoring Dashboard)"]

pentester --> |Uses HTTPS| pentagi
pentester --> |Monitors AI HTTPS| langfuse
pentester --> |Monitors System HTTPS| grafana
pentagi --> |Tests Various protocols| target
pentagi --> |Queries HTTPS| llm
pentagi --> |Searches HTTPS| search
pentagi --> |Reports HTTPS| langfuse
pentagi --> |Reports HTTPS| grafana

class pentester person
class pentagi system
class target,llm,search,langfuse,grafana external

linkStyle default stroke:#ffffff,color:#ffffff
root@kitploit:~
<details>
<summary><b>Arquitetura do Contêiner</b> (clique para expandir)</summary>```mermaid
graph TB
    subgraph Core Services
        UI[Frontend UI<br/>React + TypeScript]
        API[Backend API<br/>Go + GraphQL]
        DB[(Vector Store<br/>PostgreSQL + pgvector)]
        MQ[Task Queue<br/>Async Processing]
        Agent[AI Agents<br/>Multi-Agent System]
    end

    subgraph Knowledge Graph
        Graphiti[Graphiti<br/>Knowledge Graph API]
        Neo4j[(Neo4j<br/>Graph Database)]
    end

    subgraph Monitoring
        Grafana[Grafana<br/>Dashboards]
        VictoriaMetrics[VictoriaMetrics<br/>Time-series DB]
        Jaeger[Jaeger<br/>Distributed Tracing]
        Loki[Loki<br/>Log Aggregation]
        OTEL[OpenTelemetry<br/>Data Collection]
    end

    subgraph Analytics
        Langfuse[Langfuse<br/>LLM Analytics]
        ClickHouse[ClickHouse<br/>Analytics DB]
        Redis[Redis<br/>Cache + Rate Limiter]
        MinIO[MinIO<br/>S3 Storage]
    end

    subgraph Security Tools
        Scraper[Web Scraper<br/>Isolated Browser]
        PenTest[Security Tools<br/>20+ Pro Tools<br/>Sandboxed Execution]
    end

    UI --> |HTTP/WS| API
    API --> |SQL| DB
    API --> |Events| MQ
    MQ --> |Tasks| Agent
    Agent --> |Commands| PenTest
    Agent --> |Queries| DB
    Agent --> |Knowledge| Graphiti
    Graphiti --> |Graph| Neo4j

    API --> |Telemetry| OTEL
    OTEL --> |Metrics| VictoriaMetrics
    OTEL --> |Traces| Jaeger
    OTEL --> |Logs| Loki

    Grafana --> |Query| VictoriaMetrics
    Grafana --> |Query| Jaeger
    Grafana --> |Query| Loki

    API --> |Analytics| Langfuse
    Langfuse --> |Store| ClickHouse
    Langfuse --> |Cache| Redis
    Langfuse --> |Files| MinIO

    classDef core fill:#f9f,stroke:#333,stroke-width:2px,color:#000
    classDef knowledge fill:#ffa,stroke:#333,stroke-width:2px,color:#000
    classDef monitoring fill:#bbf,stroke:#333,stroke-width:2px,color:#000
    classDef analytics fill:#bfb,stroke:#333,stroke-width:2px,color:#000
    classDef tools fill:#fbb,stroke:#333,stroke-width:2px,color:#000

    class UI,API,DB,MQ,Agent core
    class Graphiti,Neo4j knowledge
    class Grafana,VictoriaMetrics,Jaeger,Loki,OTEL monitoring
    class Langfuse,ClickHouse,Redis,MinIO analytics
    class Scraper,PenTest tools
Relacionamento entre Entidades (clique para expandir)```mermaid erDiagram Flow ||--o{ Task : contains Task ||--o{ SubTask : contains SubTask ||--o{ Action : contains Action ||--o{ Artifact : produces Action ||--o{ Memory : stores
root@kitploit:~
Flow {
    string id PK
    string name "Flow name"
    string description "Flow description"
    string status "active/completed/failed"
    json parameters "Flow parameters"
    timestamp created_at
    timestamp updated_at
}

Task {
    string id PK
    string flow_id FK
    string name "Task name"
    string description "Task description"
    string status "pending/running/done/failed"
    json result "Task results"
    timestamp created_at
    timestamp updated_at
}

SubTask {
    string id PK
    string task_id FK
    string name "Subtask name"
    string description "Subtask description"
    string status "queued/running/completed/failed"
    string agent_type "researcher/developer/executor"
    json context "Agent context"
    timestamp created_at
    timestamp updated_at
}

Action {
    string id PK
    string subtask_id FK
    string type "command/search/analyze/etc"
    string status "success/failure"
    json parameters "Action parameters"
    json result "Action results"
    timestamp created_at
}

Artifact {
    string id PK
    string action_id FK
    string type "file/report/log"
    string path "Storage path"
    json metadata "Additional info"
    timestamp created_at
}

Memory {
    string id PK
    string action_id FK
    string type "observation/conclusion"
    vector embedding "Vector representation"
    text content "Memory content"
    timestamp created_at
}
Sistema de Memória (clique para expandir)```mermaid graph TB subgraph "Long-term Memory" VS[(Vector Store
Embeddings DB)] KB[Knowledge Base
Domain Expertise] Tools[Tools Knowledge
Usage Patterns] end
root@kitploit:~
subgraph "Working Memory"
    Context[Current Context<br/>Task State]
    Goals[Active Goals<br/>Objectives]
    State[System State<br/>Resources]
end

subgraph "Episodic Memory"
    Actions[Past Actions<br/>Commands History]
    Results[Action Results<br/>Outcomes]
    Patterns[Success Patterns<br/>Best Practices]
end

Context --> |Query| VS
VS --> |Retrieve| Context

Goals --> |Consult| KB
KB --> |Guide| Goals

State --> |Record| Actions
Actions --> |Learn| Patterns
Patterns --> |Store| VS

Tools --> |Inform| State
Results --> |Update| Tools

VS --> |Enhance| KB
KB --> |Index| VS

classDef ltm fill:#f9f,stroke:#333,stroke-width:2px,color:#000
classDef wm fill:#bbf,stroke:#333,stroke-width:2px,color:#000
classDef em fill:#bfb,stroke:#333,stroke-width:2px,color:#000

class VS,KB,Tools ltm
class Context,Goals,State wm
class Actions,Results,Patterns em
root@kitploit:~
</details>

<details>
<summary><b>Chain Summarization</b> (clique para expandir)</summary>

O sistema de sumarização em cadeia gerencia o crescimento do contexto da conversa ao resumir seletivamente mensagens mais antigas. Isso é crucial para evitar que os limites de token sejam excedidos, mantendo a coerência da conversa.```mermaid
flowchart TD
    A[Input Chain] --> B{Needs Summarization?}
    B -->|No| C[Return Original Chain]
    B -->|Yes| D[Convert to ChainAST]
    D --> E[Apply Section Summarization]
    E --> F[Process Oversized Pairs]
    F --> G[Manage Last Section Size]
    G --> H[Apply QA Summarization]
    H --> I[Rebuild Chain with Summaries]
    I --> J{Is New Chain Smaller?}
    J -->|Yes| K[Return Optimized Chain]
    J -->|No| C

    classDef process fill:#bbf,stroke:#333,stroke-width:2px,color:#000
    classDef decision fill:#bfb,stroke:#333,stroke-width:2px,color:#000
    classDef output fill:#fbb,stroke:#333,stroke-width:2px,color:#000

    class A,D,E,F,G,H,I process
    class B,J decision
    class C,K output
Baixar ferramenta
  • Solução Auto-hospedada. Controle total sobre sua implantação e dados.
  • Autenticação Flexível. Suporte para mais de 10 provedores LLM (OpenAI, Anthropic, Google AI/Gemini, AWS Bedrock, Ollama, DeepSeek, GLM, Kimi, Qwen, Customizado) além de agregadores (OpenRouter, DeepInfra). Para implantações locais de produção, consulte nosso guia vLLM + Qwen3.5-27B-FP8.
  • Autenticação via Token de API. Sistema seguro de token Bearer para acesso programático às APIs REST e GraphQL.
  • Implantação Rápida. Configuração fácil via Docker Compose com configuração abrangente de ambiente.
  • root@kitploit:~
    </details>
    
    <details>
    <summary><b>Interação com Agentes</b> (clique para expandir)</summary>```mermaid
    sequenceDiagram
        participant O as Orchestrator
        participant R as Researcher
        participant D as Developer
        participant E as Executor
        participant VS as Vector Store
        participant KB as Knowledge Base
    
        Note over O,KB: Flow Initialization
        O->>VS: Query similar tasks
        VS-->>O: Return experiences
        O->>KB: Load relevant knowledge
        KB-->>O: Return context
    
        Note over O,R: Research Phase
        O->>R: Analyze target
        R->>VS: Search similar cases
        VS-->>R: Return patterns
        R->>KB: Query vulnerabilities
        KB-->>R: Return known issues
        R->>VS: Store findings
        R-->>O: Research results
    
        Note over O,D: Planning Phase
        O->>D: Plan attack
        D->>VS: Query exploits
        VS-->>D: Return techniques
        D->>KB: Load tools info
        KB-->>D: Return capabilities
        D-->>O: Attack plan
    
        Note over O,E: Execution Phase
        O->>E: Execute plan
        E->>KB: Load tool guides
        KB-->>E: Return procedures
        E->>VS: Store results
        E-->>O: Execution status
    

    O algoritmo opera sobre uma representação estruturada de cadeias de conversa (ChainAST) que preserva os tipos de mensagens, incluindo chamadas de ferramenta e suas respostas. Todas as operações de sumarização mantêm o fluxo crítico da conversa enquanto reduzem o tamanho do contexto.

    Opções de Configuração do Sumarizador Global

    ParâmetroVariável de AmbientePadrãoDescrição
    Preservar ÚltimoSUMMARIZER_PRESERVE_LASTtrueSe deve manter todas as mensagens da última seção intactas
    Usar Pares QASUMMARIZER_USE_QAtrueSe deve usar a estratégia de sumarização de pares QA
    Sumarizar Humano em QASUMMARIZER_SUM_MSG_HUMAN_IN_QAfalseSe deve sumarizar mensagens humanas em pares QA
    Tamanho da Última SeçãoSUMMARIZER_LAST_SEC_BYTES51200Tamanho máximo em bytes para a última seção (50KB)
    Tamanho Máx. do Par CorpoSUMMARIZER_MAX_BP_BYTES16384Tamanho máximo em bytes para um único par de corpo (16KB)
    Máx. Seções QASUMMARIZER_MAX_QA_SECTIONS10Número máximo de seções de pares QA a preservar
    Tamanho Máx. QASUMMARIZER_MAX_QA_BYTES65536Tamanho máximo em bytes para seções de pares QA (64KB)
    Manter Seções QASUMMARIZER_KEEP_QA_SECTIONS1Número de seções QA recentes a manter sem sumarização

    Opções de Configuração do Sumarizador de Assistente

    Instâncias de assistentes podem usar configurações de sumarização personalizadas para ajustar o comportamento de gerenciamento de contexto:

    ParâmetroVariável de AmbientePadrãoDescrição
    Preservar ÚltimoASSISTANT_SUMMARIZER_PRESERVE_LASTtrueSe deve preservar todas as mensagens na última seção do assistente
    Tamanho da Última SeçãoASSISTANT_SUMMARIZER_LAST_SEC_BYTES76800Tamanho máximo em bytes para a última seção do assistente (75KB)
    Tamanho Máx. do Par CorpoASSISTANT_SUMMARIZER_MAX_BP_BYTES16384Tamanho máximo em bytes para um único par de corpo no contexto do assistente (16KB)
    Máx. Seções QAASSISTANT_SUMMARIZER_MAX_QA_SECTIONS7Número máximo de seções QA a preservar no contexto do assistente
    Tamanho Máx. QAASSISTANT_SUMMARIZER_MAX_QA_BYTES76800Tamanho máximo em bytes para seções QA do assistente (75KB)
    Manter Seções QAASSISTANT_SUMMARIZER_KEEP_QA_SECTIONS3Número de seções QA recentes a preservar sem sumarização

    A configuração do sumarizador de assistente fornece mais memória para retenção de contexto em comparação com as configurações globais, preservando mais histórico de conversa recente enquanto ainda garante uso eficiente de tokens.

    Configuração de Ambiente do Sumarizador```bash

    Default values for global summarizer logic

    SUMMARIZER_PRESERVE_LAST=true SUMMARIZER_USE_QA=true SUMMARIZER_SUM_MSG_HUMAN_IN_QA=false SUMMARIZER_LAST_SEC_BYTES=51200 SUMMARIZER_MAX_BP_BYTES=16384 SUMMARIZER_MAX_QA_SECTIONS=10 SUMMARIZER_MAX_QA_BYTES=65536 SUMMARIZER_KEEP_QA_SECTIONS=1

    Default values for assistant summarizer logic

    ASSISTANT_SUMMARIZER_PRESERVE_LAST=true ASSISTANT_SUMMARIZER_LAST_SEC_BYTES=76800 ASSISTANT_SUMMARIZER_MAX_BP_BYTES=16384 ASSISTANT_SUMMARIZER_MAX_QA_SECTIONS=7 ASSISTANT_SUMMARIZER_MAX_QA_BYTES=76800 ASSISTANT_SUMMARIZER_KEEP_QA_SECTIONS=3

    root@kitploit:~
    </details>
    
    <a id="advanced-agent-supervision"></a>
    <details>
    <summary><b>Supervisão Avançada de Agentes</b> (clique para expandir)</summary>
    
    O PentAGI inclui mecanismos sofisticados de supervisão de agentes em múltiplas camadas para garantir execução eficiente de tarefas, evitar loops infinitos e fornecer recuperação inteligente de estados travados:
    
    ### Monitoramento de Execução (Beta)
    - **Intervenção Automática do Mentor**: O agente conselheiro (mentor) é invocado automaticamente quando padrões de execução indicam possíveis problemas
    - **Detecção de Padrões**: Monitora chamadas de ferramentas idênticas (limiar: 5, configurável) e total de chamadas de ferramentas (limiar: 10, configurável)
    - **Análise de Progresso**: Avalia se o agente avança em direção ao objetivo da subtarefa, detecta loops e ineficiências
    - **Estratégias Alternativas**: Recomenda diferentes abordagens quando a estratégia atual falha
    - **Orientação para Recuperação de Informações**: Sugere buscar soluções estabelecidas em vez de reinventar
    - **Formato de Resposta Aprimorado**: As respostas das ferramentas incluem seções `<original_result>` e `<mentor_analysis>`
    - **Configurável**: Ative via `EXECUTION_MONITOR_ENABLED` (padrão: false), personalize limites com `EXECUTION_MONITOR_SAME_TOOL_LIMIT` e `EXECUTION_MONITOR_TOTAL_TOOL_LIMIT`
    
    **Melhor para**: Modelos menores (< 32B parâmetros), cenários de ataque complexos que exigem orientação contínua, prevenindo que agentes fiquem presos em uma única abordagem
    
    **Impacto no Desempenho**: Aumento de 2-3x no tempo de execução e uso de tokens, mas proporciona **melhoria de 2x na qualidade dos resultados** com base em testes com Qwen3.5-27B-FP8
    
    ### Planejamento Inteligente de Tarefas (Beta)
    - **Decomposição Automatizada**: O planejador (conselheiro em modo de planejamento) gera 3-7 etapas específicas e acionáveis antes de os agentes especialistas começarem o trabalho
    - **Planos Conscientes do Contexto**: Analisa o contexto completo de execução por meio do agente enriquecedor para criar planos informados
    - **Atribuição Estruturada**: A solicitação original é encapsulada em estrutura `<task_assignment>` com plano de execução e instruções
    - **Gerenciamento de Escopo**: Evita aumento de escopo mantendo os agentes focados apenas na subtarefa atual
    - **Instruções Enriquecedoras**: Os planos destacam ações críticas, possíveis armadilhas e pontos de verificação
    - **Configurável**: Ative via `AGENT_PLANNING_STEP_ENABLED` (padrão: false)
    
    **Melhor para**: Modelos < 32B parâmetros, fluxos de trabalho complexos de teste de penetração, melhorando taxas de sucesso em tarefas sofisticadas
    
    **Configuração Aprimorada do Conselheiro**: Funciona excepcionalmente bem quando o agente conselheiro usa um modelo mais forte ou configurações aprimoradas. Exemplo: usar o mesmo modelo base com modo de raciocínio máximo para o conselheiro (veja [`vllm-qwen3.5-27b-fp8.provider.yml`](https://github.com/vxcontrol/pentagi/blob/HEAD/examples/configs/vllm-qwen3.5-27b-fp8.provider.yml)) permite análise abrangente de tarefas e planejamento estratégico a partir da mesma arquitetura de modelo.
    
    **Impacto no Desempenho**: Adiciona overhead de planejamento, mas melhora significativamente as taxas de conclusão e reduz trabalho redundante
    
    ### Limites de Chamadas de Ferramentas (Sempre Ativo)
    - **Limites Rígidos**: Evitam execuções descontroladas independentemente do modo de supervisão
    - **Diferenciado por Tipo de Agente**:
      - Agentes gerais (Assistente, Agente Principal, Pentester, Codificador, Instalador): `MAX_GENERAL_AGENT_TOOL_CALLS` (padrão: 100)
      - Agentes limitados (Pesquisador, Enriquecedor, Memorista, Gerador, Relator, Conselheiro, Refletor, Planejador): `MAX_LIMITED_AGENT_TOOL_CALLS` (padrão: 20)
    - **Término Gracioso**: O refletor guia os agentes para a conclusão adequada quando se aproximam dos limites
    - **Proteção de Recursos**: Garante estabilidade do sistema e evita esgotamento de recursos
    
    ### Integração do Refletor (Sempre Ativo)
    - **Correção Automática**: Invocado quando o LLM falha ao gerar chamadas de ferramentas após 3 tentativas
    - **Orientação Estratégica**: Analisa falhas e guia os agentes para o uso adequado de ferramentas ou ferramentas de barreira (`done`, `ask`)
    - **Mecanismo de Recuperação**: Fornece orientação contextual com base em padrões específicos de falha
    - **Aplicação de Limites**: Coordena o término gracioso quando os limites de chamadas de ferramentas são atingidos
    
    ### Recomendações para Modelos Open Source
    
    **Essencial para Modelos < 32B Parâmetros**:
    Testes com Qwen3.5-27B-FP8 demonstram que ativar tanto o Monitoramento de Execução quanto o Planejamento de Tarefas é **essencial** para modelos open source menores:
    - **Melhoria de Qualidade**: Resultados 2x melhores em comparação com a execução base sem supervisão
    - **Prevenção de Loops**: Reduz significativamente loops infinitos e trabalho redundante
    - **Diversidade de Ataques**: Incentiva a exploração de múltiplos vetores de ataque em vez de fixar-se em uma única abordagem
    - **Implantações Isoladas (Air-Gapped)**: Permite testes de penetração autônomos de nível profissional em ambientes de rede fechados com inferência LLM local
    
    **Compensações**:
    - Consumo de tokens: aumento de 2-3x devido a invocações do mentor/planejador
    - Tempo de execução: 2-3x maior devido a etapas de análise e planejamento
    - Qualidade dos resultados: melhoria de 2x em integridade, precisão e cobertura de ataque
    - Requisitos de modelo: Funciona melhor quando o conselheiro usa configuração aprimorada (parâmetros de raciocínio mais altos, variante de modelo mais forte ou modelo diferente)
    
    **Estratégia de Configuração**:
    Para desempenho ideal com modelos menores, configure o agente conselheiro com configurações aprimoradas:
    - Use o mesmo modelo com modo de raciocínio máximo (exemplo: [`vllm-qwen3.5-27b-fp8.provider.yml`](https://github.com/vxcontrol/pentagi/blob/HEAD/examples/configs/vllm-qwen3.5-27b-fp8.provider.yml))
    - Ou use um modelo mais forte para o conselheiro enquanto mantém o modelo base para outros agentes
    - Ajuste os limites de monitoramento com base na complexidade da tarefa e nas capacidades do modelo
    
    
    
    </details>
    
    A arquitetura do PentAGI é projetada para ser modular, escalável e segura. Aqui estão os componentes principais:
    
    1. **Serviços Principais**
       - Interface do Frontend: Interface web baseada em React com TypeScript para segurança de tipos
       - API de Backend: APIs REST e GraphQL em Go com autenticação por token Bearer para acesso programático
       - Armazenamento de Vetores: PostgreSQL com pgvector para busca semântica e armazenamento de memória
       - Fila de Tarefas: Sistema de processamento assíncrono de tarefas para operação confiável
       - Agente de IA: Sistema multiagente com funções especializadas para testes eficientes
    
    2. **Grafo de Conhecimento**
       - Graphiti: API de grafo de conhecimento para rastreamento de relações semânticas e compreensão contextual
       - Neo4j: Banco de dados de grafos para armazenar e consultar relações entre entidades, ações e resultados
       - Captura automática de respostas de agentes e execuções de ferramentas para construir base de conhecimento abrangente
    
    3. **Pilha de Monitoramento**
       - OpenTelemetry: Coleta e correlação unificada de dados de observabilidade
       - Grafana: Visualização em tempo real e painéis de alerta
       - VictoriaMetrics: Armazenamento de métricas de série temporal de alto desempenho
       - Jaeger: Rastreamento distribuído de ponta a ponta para depuração
       - Loki: Agregação e análise de logs escalável
    
    4. **Plataforma de Analytics**
       - Langfuse: Observabilidade avançada de LLM e análise de desempenho
       - ClickHouse: Data warehouse analítico orientado a colunas
       - Redis: Cache de alta velocidade e limitação de taxa
       - MinIO: Armazenamento de objetos compatível com S3 para artefatos
    
    5. **Ferramentas de Segurança**
       - Raspador Web: Ambiente de navegador isolado para interação web segura
       - Ferramentas de Teste de Penetração: Conjunto abrangente de mais de 20 ferramentas de segurança profissionais
       - Execução em Sandbox: Todas as operações executadas em contêineres isolados
    
    6. **Sistemas de Memória**
       - Memória de Longo Prazo: Armazenamento persistente de conhecimento e experiências
       - Memória de Trabalho: Contexto ativo e objetivos para operações atuais
       - Memória Episódica: Ações históricas e padrões de sucesso
       - Base de Conhecimento: Expertise de domínio estruturada e capacidades de ferramentas
       - Gerenciamento de Contexto: Gerencia inteligentemente o crescimento do contexto do LLM usando sumarização em cadeia
    
    O sistema usa contêineres Docker para isolamento e implantação fácil, com redes separadas para serviços principais, monitoramento e analytics para garantir limites de segurança adequados. Cada componente é projetado para escalar horizontalmente e pode ser configurado para alta disponibilidade em ambientes de produção.
    
    ## Início Rápido
    
    ### Requisitos do Sistema
    
    - Docker e Docker Compose (ou Podman - veja [Configuração do Podman](#executando-pentagi-com-podman))
    - Mínimo de 2 vCPU
    - Mínimo de 4GB de RAM
    - 20GB de espaço livre em disco
    - Acesso à Internet para baixar imagens e atualizações
    
    ### Usando o Instalador (Recomendado)
    
    O PentAGI fornece um instalador interativo com uma interface de usuário baseada em terminal para configuração e implantação simplificadas. O instalador guia você através de verificações do sistema, configuração do provedor LLM, configuração do mecanismo de busca e fortalecimento de segurança.
    
    **Plataformas Suportadas:**
    - **Linux**: amd64 [download](https://pentagi.com/downloads/linux/amd64/installer-latest.zip) | arm64 [download](https://pentagi.com/downloads/linux/arm64/installer-latest.zip)
    - **Windows**: amd64 [download](https://pentagi.com/downloads/windows/amd64/installer-latest.zip)
    - **macOS**: amd64 (Intel) [download](https://pentagi.com/downloads/darwin/amd64/installer-latest.zip) | arm64 (M-series) [download](https://pentagi.com/downloads/darwin/arm64/installer-latest.zip)
    
    **Instalação Rápida (Linux amd64):**```bash
    # Create installation directory
    mkdir -p pentagi && cd pentagi
    
    # Download installer
    wget -O installer.zip https://pentagi.com/downloads/linux/amd64/installer-latest.zip
    
    # Extract
    unzip installer.zip
    
    # Run interactive installer
    ./installer
    

    Pré-requisitos & Permissões:

    O instalador requer privilégios apropriados para interagir com a API do Docker para operação adequada. Por padrão, ele usa o socket Docker (/var/run/docker.sock) que requer um dos seguintes:

    • Opção 1 (Recomendado para produção): Execute o instalador como root: ```bash sudo ./installer

      root@kitploit:~
    • Opção 2 (Ambientes de desenvolvimento): Conceda acesso ao socket Docker ao seu usuário adicionando-o ao grupo docker: ```bash

      Add your user to the docker group

      sudo usermod -aG docker $USER

      Log out and log back in, or activate the group immediately

      newgrp docker

      Verify Docker access (should run without sudo)

      docker ps

      root@kitploit:~

    ⚠️ Nota de Segurança: Adicionar um usuário ao grupo docker concede privilégios equivalentes a root. Faça isso apenas para usuários confiáveis em ambientes controlados. Para implantações em produção, considere usar o modo Docker sem root ou executar o instalador com sudo.

    O instalador irá:

    1. Verificações do Sistema: Verificar Docker, conectividade de rede e requisitos do sistema
    2. Configuração do Ambiente: Criar e configurar o arquivo .env com valores padrão otimizados
    3. Configuração do Provedor: Configurar provedores de LLM (OpenAI, Anthropic, Gemini, Bedrock, Ollama, Custom)
    4. Mecanismos de Busca: Configurar DuckDuckGo, Google, Tavily, Traversaal, Perplexity, Sploitus, Searxng
    5. Endurecimento de Segurança: Gerar credenciais seguras e configurar certificados SSL
    6. Implantação: Iniciar o PentAGI com docker-compose

    Cobertura Atual das Configurações Web

    O console web do PentAGI já gerencia várias áreas de configurações após o servidor estar em execução:

    • Configurações -> Provedores: Criar, editar, excluir e testar perfis de provedores definidos pelo usuário para tipos de provedores suportados. Esses perfis controlam a seleção de modelo por agente, parâmetros de tempo de execução, opções de raciocínio e metadados de preços.
    • Configurações -> Prompts: Gerenciar modelos de prompt do sistema, humano e ferramenta.
    • Configurações -> API PentAGI: Criar e gerenciar tokens Bearer do PentAGI para acesso REST e GraphQL.
    • Outras preferências gerenciadas pela UI: Fluxos favoritos são armazenados como preferências do usuário, e a seleção de tema é tratada pelos controles da barra lateral/perfil principal, em vez das páginas de Configurações.

    Ainda Gerenciado pelo Servidor

    As seguintes áreas de configuração ainda precisam ser definidas no servidor por meio de variáveis de ambiente, arquivos compose ou arquivos de configuração montados:

    • Credenciais LLM e detalhes de conexão: Chaves de API, endpoints, modos de autenticação e configurações de conexão específicas do provedor para OpenAI, Anthropic, Bedrock, Ollama, provedores personalizados e backends similares; as configurações de caminho de configuração se aplicam apenas onde são suportadas, como OLLAMA_SERVER_CONFIG_PATH e LLM_SERVER_CONFIG_PATH.
    • Credenciais e opções do provedor de busca: Configurações como DUCKDUCKGO_*, GOOGLE_*, TAVILY_API_KEY, TRAVERSAAL_API_KEY, PERPLEXITY_*, SEARXNG_* e SPLOITUS_ENABLED.
    • Integrações de terceiros: Langfuse, Graphiti e serviços externos similares permanecem como configuração do lado do servidor.
    • Gerenciamento do servidor MCP: As páginas de configuração do MCP atualmente não são expostas como um recurso ativo do console web.

    Para Produção e Segurança Aprimorada:

    Para implantações em produção ou ambientes sensíveis à segurança, recomendamos fortemente o uso de uma arquitetura distribuída de dois nós, onde as operações do worker são isoladas em um servidor separado. Isso evita problemas de execução de código não confiável e acesso à rede em seu sistema principal.

    Consulte o guia detalhado: Configuração do Nó Worker

    A configuração de dois nós oferece:

    • Execução Isolada: Os contêineres do worker são executados em hardware dedicado
    • Isolamento de Rede: Limites de rede separados para testes de penetração
    • Limites de Segurança: Docker-in-Docker com autenticação TLS
    • Suporte a Ataques OOB: Faixas de portas dedicadas para técnicas fora de banda

    Instalação Manual

    1. Crie um diretório de trabalho ou clone o repositório:```bash mkdir pentagi && cd pentagi
    root@kitploit:~
    2. Copie `.env.example` para `.env` ou faça o download:```bash
    curl -o .env https://raw.githubusercontent.com/vxcontrol/pentagi/master/.env.example
    
    1. Crie arquivos de exemplo (example.custom.provider.yml, example.ollama.provider.yml) ou baixe-os:```bash curl -o example.custom.provider.yml https://raw.githubusercontent.com/vxcontrol/pentagi/master/examples/configs/custom-openai.provider.yml curl -o example.ollama.provider.yml https://raw.githubusercontent.com/vxcontrol/pentagi/master/examples/configs/ollama-llama318b.provider.yml
    root@kitploit:~
    4. Preencha as chaves de API necessárias no arquivo `.env`.```bash
    # Required: At least one of these LLM providers
    OPEN_AI_KEY=your_openai_key
    ANTHROPIC_API_KEY=your_anthropic_key
    GEMINI_API_KEY=your_gemini_key
    
    # Optional: AWS Bedrock provider (enterprise-grade models)
    BEDROCK_REGION=us-east-1
    # Choose one authentication method:
    BEDROCK_DEFAULT_AUTH=true                        # Option 1: Use AWS SDK default credential chain (recommended for EC2/ECS)
    # BEDROCK_BEARER_TOKEN=your_bearer_token         # Option 2: Bearer token authentication
    # BEDROCK_ACCESS_KEY_ID=your_aws_access_key      # Option 3: Static credentials
    # BEDROCK_SECRET_ACCESS_KEY=your_aws_secret_key
    
    # Optional: Ollama provider (local or cloud)
    # OLLAMA_SERVER_URL=http://ollama-server:11434   # Local server
    # OLLAMA_SERVER_URL=https://ollama.com           # Cloud service
    # OLLAMA_SERVER_API_KEY=your_ollama_cloud_key    # Required for cloud, empty for local
    
    # Optional: Chinese AI providers
    # DEEPSEEK_API_KEY=your_deepseek_key             # DeepSeek (strong reasoning)
    # GLM_API_KEY=your_glm_key                       # GLM (Zhipu AI)
    # KIMI_API_KEY=your_kimi_key                     # Kimi (Moonshot AI, ultra-long context)
    # QWEN_API_KEY=your_qwen_key                     # Qwen (Alibaba Cloud, multimodal)
    
    # Optional: Local LLM provider (zero-cost inference)
    OLLAMA_SERVER_URL=http://localhost:11434
    OLLAMA_SERVER_MODEL=your_model_name
    
    # Optional: Additional search capabilities
    DUCKDUCKGO_ENABLED=true
    DUCKDUCKGO_REGION=us-en
    DUCKDUCKGO_SAFESEARCH=
    DUCKDUCKGO_TIME_RANGE=
    SPLOITUS_ENABLED=true
    GOOGLE_API_KEY=your_google_key
    GOOGLE_CX_KEY=your_google_cx
    TAVILY_API_KEY=your_tavily_key
    TRAVERSAAL_API_KEY=your_traversaal_key
    PERPLEXITY_API_KEY=your_perplexity_key
    PERPLEXITY_MODEL=sonar-pro
    PERPLEXITY_CONTEXT_SIZE=medium
    
    # Searxng meta search engine (aggregates results from multiple sources)
    SEARXNG_URL=http://your-searxng-instance:8080
    SEARXNG_CATEGORIES=general
    SEARXNG_LANGUAGE=
    SEARXNG_SAFESEARCH=0
    SEARXNG_TIME_RANGE=
    SEARXNG_TIMEOUT=
    
    ## Graphiti knowledge graph settings
    GRAPHITI_ENABLED=true
    GRAPHITI_TIMEOUT=30
    GRAPHITI_URL=http://graphiti:8000
    GRAPHITI_MODEL_NAME=gpt-5-mini
    
    # Neo4j settings (used by Graphiti stack)
    NEO4J_USER=neo4j
    NEO4J_DATABASE=neo4j
    NEO4J_PASSWORD=devpassword
    NEO4J_URI=bolt://neo4j:7687
    
    # Assistant configuration
    ASSISTANT_USE_AGENTS=false         # Default value for agent usage when creating new assistants
    
    1. Altere todas as variáveis de ambiente relacionadas à segurança no arquivo .env para melhorar a segurança.
    Variáveis de ambiente relacionadas à segurança

    Configurações Principais de Segurança

    • COOKIE_SIGNING_SALT - Sal para assinatura de cookies, altere para um valor aleatório
    • PUBLIC_URL - URL pública do seu servidor (ex.: https://pentagi.example.com)
    • SERVER_SSL_CRT e SERVER_SSL_KEY - Caminhos personalizados para seu certificado SSL e chave existentes para HTTPS (esses caminhos devem ser usados no arquivo docker-compose.yml para montar como volumes)

    Acesso ao Scraper

    • SCRAPER_PUBLIC_URL - URL pública para o scraper se você quiser usar um servidor scraper diferente para URLs públicas
    • SCRAPER_PRIVATE_URL - URL privada para o scraper (servidor scraper local no arquivo docker-compose.yml para acessá-lo a URLs locais)

    Credenciais de Acesso

    • PENTAGI_POSTGRES_USER e PENTAGI_POSTGRES_PASSWORD - Credenciais do PostgreSQL
    • NEO4J_USER e NEO4J_PASSWORD - Credenciais do Neo4j (para o grafo de conhecimento Graphiti)
    1. Remova todos os comentários inline do arquivo .env se você quiser usá-lo no VSCode ou outras IDEs como opção envFile:```bash perl -i -pe 's/\s+#.*$//' .env
    root@kitploit:~
    7. Execute o stack PentAGI:```bash
    curl -O https://raw.githubusercontent.com/vxcontrol/pentagi/master/docker-compose.yml
    docker compose up -d
    

    Visite localhost:8443 para acessar a Interface Web do PentAGI (padrão é [email protected] / admin)

    Contas da Interface Web

    O PentAGI não expõe auto-cadastro público na página de login. Uma instalação nova cria a conta de administrador local padrão:

    • E-mail: [email protected]
    • Senha: admin

    Ao primeiro login, altere a senha padrão antes de usar a instância para trabalho real. Se a senha do administrador for perdida posteriormente, use o menu de manutenção do instalador para redefinir a senha da conta padrão [email protected].

    Para configurações multi-usuário, um administrador autenticado pode gerenciar usuários locais através da API REST de Usuários (/api/v1/users/). A interface OpenAPI está disponível em https://localhost:8443/api/v1/swagger/index.html após a instância estar em execução.

    [!NOTE] Se você encontrou um erro sobre pentagi-network ou observability-network ou langfuse-network, você precisa executar docker-compose.yml primeiro para criar essas redes e depois executar docker-compose-langfuse.yml, docker-compose-graphiti.yml e docker-compose-observability.yml para usar os serviços Langfuse, Graphiti e Observability.

    Você precisa configurar pelo menos um provedor de Modelo de Linguagem (OpenAI, Anthropic, Gemini, AWS Bedrock ou Ollama) para usar o PentAGI. AWS Bedrock fornece acesso de nível empresarial a múltiplos modelos fundacionais de empresas líderes de IA, enquanto o Ollama oferece inferência local sem custo se você tiver recursos computacionais suficientes. Chaves de API adicionais para mecanismos de busca são opcionais, mas recomendadas para melhores resultados.

    Para implantação totalmente local com modelos avançados: Consulte nosso guia completo sobre Executando PentAGI com vLLM e Qwen3.5-27B-FP8 para uma configuração local de LLM de nível de produção. Esta configuração atinge ~13.000 TPS para processamento de prompt e ~650 TPS para conclusão em 4× GPUs RTX 5090, suportando 12+ fluxos concorrentes com independência total de provedores de nuvem.

    As variáveis de ambiente LLM_SERVER_* são um recurso experimental e serão alteradas no futuro. No momento, você pode usá-las para especificar uma URL de servidor LLM personalizada e um modelo para todos os tipos de agente.

    PROXY_URL é uma URL de proxy global para todos os provedores de LLM e sistemas de busca externos. Você pode usá-la para isolamento de redes externas.

    O arquivo docker-compose.yml executa o serviço PentAGI como usuário root porque precisa de acesso ao docker.sock para gerenciamento de contêineres. Se você estiver usando conexão de rede TCP/IP para o Docker em vez do arquivo socket, pode remover os privilégios root e usar o usuário padrão pentagi para melhor segurança.

    Acessando o PentAGI a partir de Redes Externas

    Por padrão, o PentAGI vincula-se a 127.0.0.1 (apenas localhost) por segurança. Para acessar o PentAGI de outras máquinas em sua rede, você precisa configurar o acesso externo.

    Passos de Configuração

    1. Atualize o arquivo .env com o endereço IP do seu servidor:```bash

    Network binding - allow external connections

    PENTAGI_LISTEN_IP=0.0.0.0 PENTAGI_LISTEN_PORT=8443

    Public URL - use your actual server IP or hostname

    Replace 192.168.1.100 with your server's IP address

    PUBLIC_URL=https://192.168.1.100:8443

    CORS origins - list all URLs that will access PentAGI

    Include localhost for local access AND your server IP for external access

    CORS_ORIGINS=https://localhost:8443,https://192.168.1.100:8443

    root@kitploit:~
    > [!IMPORTANT]
    > - Substitua `192.168.1.100` pelo endereço IP real do seu servidor
    > - NÃO use `0.0.0.0` em `PUBLIC_URL` ou `CORS_ORIGINS` - use o endereço IP real
    > - Inclua tanto localhost quanto o IP do seu servidor em `CORS_ORIGINS` para flexibilidade
    
    2. **Recrie os contêineres** para aplicar as alterações:```bash
    docker compose down
    docker compose up -d --force-recreate
    
    1. Verificar vinculação de porta:```bash docker ps | grep pentagi
    root@kitploit:~
    Você deve ver `0.0.0.0:8443->8443/tcp` ou `:::8443->8443/tcp`.
    
    Se você vir `127.0.0.1:8443->8443/tcp`, a variável de ambiente não foi reconhecida. Neste caso, edite diretamente `docker-compose.yml` linha 31:```yaml
    ports:
      - "0.0.0.0:8443:8443"
    

    Depois, recrie os containers novamente.

    1. Configure o firewall para permitir conexões de entrada na porta 8443:```bash

    Ubuntu/Debian with UFW

    sudo ufw allow 8443/tcp sudo ufw reload

    CentOS/RHEL with firewalld

    sudo firewall-cmd --permanent --add-port=8443/tcp sudo firewall-cmd --reload

    root@kitploit:~
    5. **Acessar o PentAGI:**
    
    - **Acesso local:** `https://localhost:8443`
    - **Acesso pela rede:** `https://your-server-ip:8443`
    
    > [!NOTA]
    > Você precisará aceitar o aviso de certificado SSL autoassinado no seu navegador ao acessar via endereço IP.
    
    ---
    
    ### Executando PentAGI com Podman
    
    O PentAGI oferece suporte total ao Podman como alternativa ao Docker. No entanto, ao usar o **Podman em modo rootless**, o serviço scraper requer configuração especial porque contêineres rootless não podem vincular portas privilegiadas (portas abaixo de 1024).
    
    #### Configuração Rootless do Podman
    
    A configuração padrão do scraper usa a porta 443 (HTTPS), que é uma porta privilegiada. Para o Podman rootless, reconfigure o scraper para usar uma porta não privilegiada:
    
    **1. Edite `docker-compose.yml`** - modifique o serviço `scraper` (por volta da linha 199):```yaml
    scraper:
      image: vxcontrol/scraper:latest
      restart: unless-stopped
      container_name: scraper
      hostname: scraper
      expose:
        - 3000/tcp  # Changed from 443 to 3000
      ports:
        - "${SCRAPER_LISTEN_IP:-127.0.0.1}:${SCRAPER_LISTEN_PORT:-9443}:3000"  # Map to port 3000
      environment:
        - MAX_CONCURRENT_SESSIONS=${LOCAL_SCRAPER_MAX_CONCURRENT_SESSIONS:-10}
        - USERNAME=${LOCAL_SCRAPER_USERNAME:-someuser}
        - PASSWORD=${LOCAL_SCRAPER_PASSWORD:-somepass}
      logging:
        options:
          max-size: 50m
          max-file: "7"
      volumes:
        - scraper-ssl:/usr/src/app/ssl
      networks:
        - pentagi-network
      shm_size: 2g
    

    2. Atualize o arquivo .env - altere a URL do scraper para usar HTTP e a porta 3000:```bash

    Scraper configuration for Podman rootless

    SCRAPER_PRIVATE_URL=http://someuser:somepass@scraper:3000/ LOCAL_SCRAPER_USERNAME=someuser LOCAL_SCRAPER_PASSWORD=somepass

    root@kitploit:~
    > [!IMPORTANT]
    > Principais alterações para Podman:
    > - Use **HTTP** em vez de HTTPS para `SCRAPER_PRIVATE_URL`
    > - Use a porta **3000** em vez de 443
    > - Altere o `expose` interno para `3000/tcp`
    > - Atualize o mapeamento de portas para usar `3000` em vez de `443`
    
    **3. Recrie os containers:**```bash
    podman-compose down
    podman-compose up -d --force-recreate
    

    4. Testar conectividade do scraper:```bash

    Test from within the pentagi container

    podman exec -it pentagi wget -O- "http://someuser:somepass@scraper:3000/html?url=http://example.com"

    root@kitploit:~
    Se você vir saída HTML, o scraper está funcionando corretamente.
    
    #### Modo Rootful do Podman
    
    Se você estiver executando o Podman em modo rootful (com sudo), pode usar a configuração padrão sem modificações. O scraper funcionará na porta 443 conforme pretendido.
    
    #### Compatibilidade com Docker
    
    Todas as configurações do Podman permanecem totalmente compatíveis com Docker. A abordagem de porta não privilegiada funciona de forma idêntica em ambos os runtimes de contêiner.
    
    ### Configuração do Assistente
    
    O PentAGI permite configurar o comportamento padrão para assistentes:
    
    | Variável             | Padrão  | Descrição                                                          |
    | -------------------- | ------- | ------------------------------------------------------------------ |
    | `ASSISTANT_USE_AGENTS` | `false` | Controla o valor padrão para uso de agentes ao criar novos assistentes |
    
    A configuração `ASSISTANT_USE_AGENTS` afeta o estado inicial da opção "Usar Agentes" ao criar um novo assistente na interface:
    - `false` (padrão): Novos assistentes são criados com delegação de agentes desativada por padrão
    - `true`: Novos assistentes são criados com delegação de agentes ativada por padrão
    
    Note que os usuários podem sempre sobrescrever essa configuração alternando o botão "Usar Agentes" na interface ao criar ou editar um assistente. Esta variável de ambiente controla apenas o estado padrão inicial.
    
    ## Como Usar o PentAGI Após o Login
    
    Assim que o stack estiver em execução e você puder fazer login na interface web, a maneira mais rápida de começar é através do fluxo de trabalho Flows.
    
    ### 1. Crie seu primeiro fluxo
    
    1. Abra **Flows** na barra lateral.
    2. Clique em **Novo Fluxo**.
    3. Escolha o modo que se adequa ao seu objetivo:
       - **Automação**: execução totalmente autônoma para um objetivo de teste que você deseja que o PentAGI realize do início ao fim
       - **Assistente**: ajuda interativa de ida e volta quando você deseja conduzir a investigação passo a passo. Neste modo, você também pode ativar a opção **Usar Agentes** para permitir que o PentAGI delegue subtarefas a subagentes especializados para investigações mais complexas.
    4. Selecione o provedor LLM que deseja usar para este fluxo.
    5. Descreva o alvo e o objetivo em linguagem natural na caixa de mensagem.
    
    Bons prompts iniciais geralmente incluem:
    
    - o sistema alvo ou URL
    - o tipo de avaliação que você deseja
    - quaisquer limitações de escopo ou regras de engajamento
    - o resultado que você espera, como um relatório de vulnerabilidade ou validação de uma hipótese
    
    Exemplo:```text
    Assess https://target.example for common web application vulnerabilities. Focus on authentication, file handling, and injection issues. Stay within the provided target only and summarize confirmed findings with reproduction steps.
    

    Apenas teste sistemas que você possui ou que estão explicitamente autorizados a avaliar. Consulte EULA.md para os requisitos de uso aceitável.

    2. Use modelos para fluxos de trabalho repetíveis

    O novo formulário de fluxo inclui um selecionador de modelos, que pode preencher previamente a caixa de mensagem com um modelo de fluxo salvo. Isso é útil quando você realiza avaliações semelhantes repetidamente.

    • Use um modelo existente se você já tiver um salvo em Modelos
    • Comece pelo prompt de exemplo em examples/prompts/base_web_pentest.md se precisar de uma base prática para testes web
    • Ajuste o alvo, o escopo e as restrições antes de iniciar o fluxo

    Modelos são pontos de partida. Você não precisa de sintaxe especial para usar o PentAGI: instruções simples em linguagem natural funcionam bem, desde que o alvo e o objetivo estejam claros.

    3. Monitore a execução e revise a saída

    Após enviar o fluxo, o PentAGI abre a página do fluxo automaticamente.

    • Use a visualização principal do fluxo para acompanhar mensagens, atividade dos agentes e progresso das tarefas
    • Inspecione a atividade das ferramentas e a saída do terminal conforme o fluxo é executado
    • Revise as tarefas e subtarefas geradas para entender o que o PentAGI está fazendo

    Assim que o fluxo tiver resultados suficientes, use o menu Relatório na página do fluxo para:

    • abrir o relatório em uma visualização web
    • copiar o relatório gerado para a área de transferência
    • baixar o relatório como Markdown
    • baixar o relatório como PDF

    4. Use a visualização do Assistente para direcionar um fluxo ativo

    Cada fluxo também inclui uma visualização Assistente para orientação interativa. Isso é útil quando a execução autônoma descobre algo que precisa de direcionamento humano em vez de uma reinicialização forçada.

    • Abra a visualização Assistente para o mesmo fluxo quando quiser inspecionar o estado atual antes de alterar qualquer coisa.
    • Use o assistente para verificar o status do fluxo, interromper a tarefa atual, enviar instruções complementares ou corrigir as subtarefas planejadas restantes antes da próxima etapa ser executada.
    • Trate isso como um caminho de controle explícito para o fluxo atual, não como uma fila em segundo plano invisível. Se quiser mudar de direção, diga claramente e mantenha a nova instrução vinculada ao escopo atual do engajamento.
    • Isso funciona melhor para esclarecer o escopo, redirecionar prioridades após descobertas intermediárias ou responder a um ponto de verificação de automação sem perder o restante do contexto do fluxo.

    5. Gerencie arquivos com escopo de fluxo

    Cada fluxo tem sua própria guia Arquivos na página do fluxo. Os arquivos têm escopo definido pelo fluxo pai: eles residem em {dataDir}/flow-{id}-data/ no host e nunca vazam para outros fluxos.

    A guia expõe três fontes de arquivos:

    • Uploads (uploads/): arquivos que você fornece pela interface web. Use a ação Fazer upload de arquivos ou arraste e solte diretamente na guia Arquivos. Enquanto o contêiner do agente estiver em execução, os arquivos enviados também são copiados para dentro dele em /work/uploads/ para que o agente possa lê-los com ferramentas normais do shell.
    • Recursos (resources/): arquivos anexados da sua biblioteca de recursos de usuário salva por meio de Anexar recursos da biblioteca. Os recursos anexados são copiados para o fluxo e copiados para o contêiner em execução em /work/resources/.
    • Contêiner (container/): snapshots extraídos do contêiner do agente em execução por meio de Extrair arquivo ou diretório do contêiner. Eles são somente leitura no lado do fluxo e nunca são enviados de volta ao contêiner.

    As ações por arquivo na guia Arquivos incluem Baixar, Copiar caminho, Salvar como recurso (promover um arquivo de fluxo para sua biblioteca de recursos reutilizáveis) e Excluir. A ação Extrair está desabilitada quando o contêiner não está em execução, com a dica "Contêiner não está em execução".

    Os arquivos enviados e os recursos anexados são listados automaticamente nos prompts do sistema do agente por meio da variável de template {{.UserFiles}}, que renderiza um bloco XML compacto <task_files> (com seções aninhadas <uploads> e <resources>), para que o assistente e os agentes de automação possam referenciá-los pelo caminho sem que você cole o conteúdo no chat. Os snapshots do contêiner são visíveis apenas na interface e não são injetados automaticamente de volta no prompt.

    Limites e limitações atuais a serem considerados:

    • O tamanho máximo de upload de arquivo é de 300 MB; por solicitação de upload, até 1000 arquivos e 2 GB no total. Os nomes de arquivo são limitados a 255 bytes (aproximadamente 255 caracteres ASCII; nomes não ASCII usam vários bytes por caractere).
    • Uploads e recursos são espelhados no contêiner em execução nos caminhos fixos /work/uploads/ e /work/resources/; arquivos gravados em outros caminhos do contêiner não são espelhados automaticamente de volta ao modelo de arquivo do fluxo. Snapshots do contêiner podem originar-se de qualquer caminho do contêiner que você extrair (por exemplo, /etc/...) e são armazenados em cache no lado do fluxo em container/; eles não são copiados de volta para o contêiner.
    • Os snapshots do contêiner são extrações pontuais. Editar um snapshot na interface não grava de volta no contêiner em execução.
    • Excluir um fluxo atualmente remove o registro do fluxo e suas entradas de memória de longo prazo, mas ainda não arquiva nem remove o diretório flow-{id}-data/ do fluxo no disco. Os operadores ainda devem limpar manualmente o diretório de dados se quiserem recuperar espaço.

    Para testes iniciais, comece com um alvo restrito e um objetivo claro. Isso torna a saída mais fácil de revisar e ajuda a refinar seus prompts antes de executar avaliações maiores.

    Acesso à API

    O PentAGI fornece acesso programático abrangente por meio de APIs REST e GraphQL, permitindo que você integre fluxos de trabalho de teste de penetração em suas automações, processos de CI/CD e aplicativos personalizados.

    Gerando Tokens de API

    Os tokens de API são gerenciados por meio da interface web do PentAGI:

    1. Navegue até Configurações → Tokens de API na interface web
    2. Clique em Criar Token para gerar um novo token de API
    3. Configure as propriedades do token:
      • Nome (opcional): Um nome descritivo para o token
      • Data de Expiração: Quando o token irá expirar (mínimo 1 minuto, máximo 3 anos)
    4. Clique em Criar e copie o token imediatamente – ele será exibido apenas uma vez por motivos de segurança
    5. Use o token como um token Bearer nas suas requisições à API

    Cada token está associado à sua conta de usuário e herda as permissões da sua função.

    Usando Tokens de API

    Inclua o token de API no cabeçalho Authorization das suas requisições HTTP:```bash

    GraphQL API example

    curl -X POST https://your-pentagi-instance:8443/api/v1/graphql
    -H "Authorization: Bearer YOUR_API_TOKEN"
    -H "Content-Type: application/json"
    -d '{"query": "{ flows { id title status } }"}'

    REST API example

    curl https://your-pentagi-instance:8443/api/v1/flows
    -H "Authorization: Bearer YOUR_API_TOKEN"

    root@kitploit:~
    ### Exploração e Teste de API
    
    PentAGI fornece documentação interativa para explorar e testar endpoints de API:
    
    #### GraphQL Playground
    
    Acesse o GraphQL Playground em `https://your-pentagi-instance:8443/api/v1/graphql/playground`
    
    1. Clique na aba **HTTP Headers** na parte inferior
    2. Adicione seu cabeçalho de autorização:   ```json
       {
         "Authorization": "Bearer YOUR_API_TOKEN"
       }
    
    1. Explore o esquema, execute consultas e teste mutações interativamente

    Swagger UI

    Acesse a documentação da API REST em https://your-pentagi-instance:8443/api/v1/swagger/index.html

    1. Clique no botão Authorize
    2. Insira seu token no formato: Bearer YOUR_API_TOKEN
    3. Clique em Authorize para aplicar
    4. Teste endpoints diretamente da Swagger UI

    Gerando Clientes de API

    Você pode gerar clientes de API com segurança de tipos para sua linguagem de programação preferida usando os arquivos de esquema incluídos no PentAGI:

    Clientes GraphQL

    O esquema GraphQL está disponível em:

    • Web UI: Navegue até Settings para baixar schema.graphqls
    • Arquivo direto: backend/pkg/graph/schema.graphqls no repositório

    Gere clientes usando ferramentas como:

    • GraphQL Code Generator (JavaScript/TypeScript): https://the-guild.dev/graphql/codegen
    • genqlient (Go): https://github.com/Khan/genqlient
    • Apollo iOS (Swift): https://www.apollographql.com/docs/ios

    Clientes da API REST

    A especificação OpenAPI está disponível em:

    • Swagger JSON: https://your-pentagi-instance:8443/api/v1/swagger/doc.json
    • Swagger YAML: Disponível em backend/pkg/server/docs/swagger.yaml

    Gere clientes usando:

    • OpenAPI Generator: https://openapi-generator.tech ```bash openapi-generator-cli generate
      -i https://your-pentagi-instance:8443/api/v1/swagger/doc.json
      -g python
      -o ./pentagi-client
      root@kitploit:~
    • Swagger Codegen: https://github.com/swagger-api/swagger-codegen ```bash swagger-codegen generate
      -i https://your-pentagi-instance:8443/api/v1/swagger/doc.json
      -l typescript-axios
      -o ./pentagi-client
      root@kitploit:~
    • swagger-typescript-api (TypeScript): https://github.com/acacode/swagger-typescript-api ```bash npx swagger-typescript-api
      -p https://your-pentagi-instance:8443/api/v1/swagger/doc.json
      -o ./src/api
      -n pentagi-api.ts
      root@kitploit:~

    Exemplos de Uso da API

    Criando um Novo Fluxo (GraphQL)```graphql mutation CreateFlow { createFlow( modelProvider: "openai" input: "Test the security of https://example.com" ) { id title status createdAt } } ```
    Listando Fluxos (API REST)```bash curl https://your-pentagi-instance:8443/api/v1/flows \ -H "Authorization: Bearer YOUR_API_TOKEN" \ | jq '.flows[] | {id, title, status}' ```
    Exemplo de Cliente Python```python import requests

    class PentAGIClient: def init(self, base_url, api_token): self.base_url = base_url self.headers = { "Authorization": f"Bearer {api_token}", "Content-Type": "application/json" }

    root@kitploit:~
    def create_flow(self, provider, target):
        query = """
        mutation CreateFlow($provider: String!, $input: String!) {
          createFlow(modelProvider: $provider, input: $input) {
            id
            title
            status
          }
        }
        """
        response = requests.post(
            f"{self.base_url}/api/v1/graphql",
            json={
                "query": query,
                "variables": {
                    "provider": provider,
                    "input": target
                }
            },
            headers=self.headers
        )
        return response.json()
    
    def get_flows(self):
        response = requests.get(
            f"{self.base_url}/api/v1/flows",
            headers=self.headers
        )
        return response.json()
    

    Usage

    client = PentAGIClient( "https://your-pentagi-instance:8443", "your_api_token_here" )

    Create a new flow

    flow = client.create_flow("openai", "Scan https://example.com for vulnerabilities") print(f"Created flow: {flow}")

    List all flows

    flows = client.get_flows() print(f"Total flows: {len(flows['flows'])}")

    root@kitploit:~
    </details>
    
    <details>
    <summary><b>Exemplo de Cliente TypeScript</b></summary>```typescript
    import axios, { AxiosInstance } from 'axios';
    
    interface Flow {
      id: string;
      title: string;
      status: string;
      createdAt: string;
    }
    
    class PentAGIClient {
      private client: AxiosInstance;
    
      constructor(baseURL: string, apiToken: string) {
        this.client = axios.create({
          baseURL: `${baseURL}/api/v1`,
          headers: {
            'Authorization': `Bearer ${apiToken}`,
            'Content-Type': 'application/json',
          },
        });
      }
    
      async createFlow(provider: string, input: string): Promise<Flow> {
        const query = `
          mutation CreateFlow($provider: String!, $input: String!) {
            createFlow(modelProvider: $provider, input: $input) {
              id
              title
              status
              createdAt
            }
          }
        `;
    
        const response = await this.client.post('/graphql', {
          query,
          variables: { provider, input },
        });
    
        return response.data.data.createFlow;
      }
    
      async getFlows(): Promise<Flow[]> {
        const response = await this.client.get('/flows');
        return response.data.flows;
      }
    
      async getFlow(flowId: string): Promise<Flow> {
        const response = await this.client.get(`/flows/${flowId}`);
        return response.data;
      }
    }
    
    // Usage
    const client = new PentAGIClient(
      'https://your-pentagi-instance:8443',
      'your_api_token_here'
    );
    
    // Create a new flow
    const flow = await client.createFlow(
      'openai',
      'Perform penetration test on https://example.com'
    );
    console.log('Created flow:', flow);
    
    // List all flows
    const flows = await client.getFlows();
    console.log(`Total flows: ${flows.length}`);
    

    Melhores Práticas de Segurança

    Ao trabalhar com tokens de API:

    • Nunca envie tokens para o controle de versão - use variáveis de ambiente ou gerenciamento de segredos
    • Rotacione tokens regularmente - defina datas de expiração apropriadas e crie novos tokens periodicamente
    • Use tokens separados para diferentes aplicações - facilita a revogação de acesso se necessário
    • Monitore o uso de tokens - revise a atividade dos tokens de API na página de Configurações
    • Revogue tokens não utilizados - desative ou exclua tokens que não são mais necessários
    • Use apenas HTTPS - nunca envie tokens de API por conexões não criptografadas

    Gerenciamento de Tokens

    • Visualizar tokens: Veja todos os seus tokens ativos em Configurações → Tokens de API
    • Editar tokens: Atualize nomes de tokens ou revogue tokens
    • Excluir tokens: Remova tokens permanentemente (esta ação não pode ser desfeita)
    • ID do token: Cada token possui um ID único que pode ser copiado para referência

    A lista de tokens mostra:

    • Nome do token (se fornecido)
    • ID do token (identificador único)
    • Status (ativo/revogado/expirado)
    • Data de criação
    • Data de expiração

    Configuração Personalizada do Provedor de LLM

    Ao usar provedores de LLM personalizados com as variáveis LLM_SERVER_*, você pode ajustar o formato de raciocínio usado nas requisições.

    [!TIP] Para implantações locais de nível de produção, considere usar vLLM com Qwen3.5-27B-FP8 para desempenho ideal. Veja nosso guia completo de implantação que inclui requisitos de hardware, modelos de configuração (modo de pensamento e modo sem pensamento) e benchmarks de desempenho mostrando 13K TPS de processamento de prompt em 4× RTX 5090 GPUs.

    VariávelPadrãoDescrição
    LLM_SERVER_URLURL base para o endpoint da API de LLM personalizada
    LLM_SERVER_KEYChave de API para o provedor de LLM personalizado
    LLM_SERVER_MODELModelo padrão a ser usado (pode ser sobrescrito na configuração do provedor)
    LLM_SERVER_CONFIG_PATHCaminho para o arquivo de configuração YAML para modelos específicos de agente
    LLM_SERVER_PROVIDERPrefixo do nome do provedor para nomes de modelos (ex.: openrouter, deepseek para proxy LiteLLM)
    LLM_SERVER_LEGACY_REASONINGfalseControla o formato de raciocínio nas requisições da API
    LLM_SERVER_PRESERVE_REASONINGfalsePreserva o conteúdo de raciocínio em conversas de múltiplas rodadas (exigido por alguns provedores)

    A configuração LLM_SERVER_PROVIDER é particularmente útil ao usar proxy LiteLLM, que adiciona um prefixo de provedor aos nomes dos modelos. Por exemplo, ao conectar-se à API Moonshot através do LiteLLM, modelos como kimi-2.5 tornam-se moonshot/kimi-2.5. Ao definir LLM_SERVER_PROVIDER=moonshot, você pode usar o mesmo arquivo de configuração do provedor tanto para acesso direto à API quanto para acesso via proxy LiteLLM sem modificações.

    A configuração LLM_SERVER_LEGACY_REASONING afeta como os parâmetros de raciocínio são enviados ao LLM:

    • false (padrão): Usa formato moderno onde o raciocínio é enviado como um objeto estruturado com parâmetro max_tokens
    • true: Usa formato legado com parâmetro reasoning_effort baseado em string

    Essa configuração é importante ao trabalhar com diferentes provedores de LLM, pois eles podem esperar formatos de raciocínio diferentes em suas requisições de API. Se você encontrar erros relacionados a raciocínio com provedores personalizados, tente alterar esta configuração.

    A configuração LLM_SERVER_PRESERVE_REASONING controla se o conteúdo de raciocínio é preservado em conversas de múltiplas rodadas:

    • false (padrão): O conteúdo de raciocínio não é preservado no histórico da conversa
    • true: O conteúdo de raciocínio é preservado e enviado em chamadas subsequentes da API

    Esta configuração é exigida por alguns provedores de LLM (ex.: Moonshot) que retornam erros como "thinking is enabled but reasoning_content is missing in assistant tool call message" quando o conteúdo de raciocínio não é incluído em conversas de múltiplas rodadas. Ative esta configuração se seu provedor exigir que o conteúdo de raciocínio seja preservado.

    Configuração do Provedor Ollama

    O PentAGI suporta Ollama tanto para inferência LLM local (custo zero, privacidade aprimorada) quanto para Ollama Cloud (serviço gerenciado com nível gratuito).

    Variáveis de Configuração

    VariávelPadrãoDescrição
    OLLAMA_SERVER_URLURL do seu servidor Ollama ou Ollama Cloud
    OLLAMA_SERVER_API_KEYChave de API para autenticação no Ollama Cloud
    OLLAMA_SERVER_MODELModelo padrão para inferência
    OLLAMA_SERVER_CONFIG_PATHCaminho para o arquivo de configuração do agente personalizado
    OLLAMA_SERVER_PULL_MODELS_TIMEOUT600Tempo limite para download de modelos (segundos)
    OLLAMA_SERVER_PULL_MODELS_ENABLEDfalseBaixar modelos automaticamente na inicialização
    OLLAMA_SERVER_LOAD_MODELS_ENABLEDfalseConsultar o servidor por modelos disponíveis

    Configuração do Ollama Cloud

    Ollama Cloud fornece inferência gerenciada com um generoso nível gratuito e planos pagos escaláveis.

    Configuração do Nível Gratuito (Modelo Único)```bash

    Free tier allows one model at a time

    OLLAMA_SERVER_URL=https://ollama.com OLLAMA_SERVER_API_KEY=your_ollama_cloud_api_key OLLAMA_SERVER_MODEL=gpt-oss:120b # Example: OpenAI OSS 120B model

    root@kitploit:~
    **Configuração de Nível Pago (Multi-Model com Configuração Pré-construída)**
    
    Para níveis pagos que suportam múltiplos modelos simultâneos, use a configuração pré-construída do Ollama Cloud:```bash
    # Using pre-built Ollama Cloud configuration (included in Docker image)
    OLLAMA_SERVER_URL=https://ollama.com
    OLLAMA_SERVER_API_KEY=your_ollama_cloud_api_key
    OLLAMA_SERVER_CONFIG_PATH=/opt/pentagi/conf/ollama-cloud.provider.yml
    

    A configuração pré-construída ollama-cloud.provider.yml inclui atribuições de modelo otimizadas para todos os tipos de agente:

    • Simple/Assistant: nemotron-3-super:cloud - Modelo rápido de uso geral
    • Primary Agent: qwen3-coder-next:cloud - Raciocínio avançado com modo de alto esforço
    • Coder/Pentester: qwen3-coder-next:cloud - Modelos de codificação especializados
    • Searcher: qwen3.5:397b-cloud - Grande contexto para coleta de informações
    • Refiner/Refactor: glm-5:cloud - Refinamento de texto de alta qualidade
    • Adviser/Enricher: minimax-m2.7:cloud - Tarefas consultivas eficientes
    • Installer: devstral-2:123b-cloud - Tarefas de instalação e configuração

    Configuração Personalizada (Avançada)

    Para criar sua própria configuração de agente, monte um arquivo personalizado do sistema de arquivos do host:```bash

    Using custom provider configuration

    OLLAMA_SERVER_URL=https://ollama.com OLLAMA_SERVER_API_KEY=your_ollama_cloud_api_key OLLAMA_SERVER_CONFIG_PATH=/opt/pentagi/conf/ollama.provider.yml

    Mount custom configuration from host filesystem (in .env or docker-compose override)

    PENTAGI_OLLAMA_SERVER_CONFIG_PATH=/path/on/host/my-ollama-config.yml

    root@kitploit:~
    A variável de ambiente `PENTAGI_OLLAMA_SERVER_CONFIG_PATH` mapeia o arquivo de configuração do seu host para `/opt/pentagi/conf/ollama.provider.yml` dentro do contêiner.
    
    **Exemplo de configuração personalizada** (`my-ollama-config.yml`):```yaml
    primary_agent:
      model: "qwen3-coder-next:cloud"
      temperature: 1.0
      top_p: 0.9
      max_tokens: 32768
      reasoning:
        effort: high
    
    coder:
      model: "qwen3-coder:32b"
      temperature: 1.0
      max_tokens: 20480
    

    Configuração Local do Ollama

    Para instâncias auto-hospedadas do Ollama:```bash

    Basic local Ollama setup

    OLLAMA_SERVER_URL=http://localhost:11434 OLLAMA_SERVER_MODEL=llama3.1:8b-instruct-q8_0

    Production setup with auto-pull and model discovery

    OLLAMA_SERVER_URL=http://ollama-server:11434 OLLAMA_SERVER_PULL_MODELS_ENABLED=true OLLAMA_SERVER_PULL_MODELS_TIMEOUT=900 OLLAMA_SERVER_LOAD_MODELS_ENABLED=true

    Using pre-built configurations from Docker image

    OLLAMA_SERVER_CONFIG_PATH=/opt/pentagi/conf/ollama-llama318b.provider.yml

    or

    OLLAMA_SERVER_CONFIG_PATH=/opt/pentagi/conf/ollama-qwen332b-fp16-tc.provider.yml

    or

    OLLAMA_SERVER_CONFIG_PATH=/opt/pentagi/conf/ollama-qwq32b-fp16-tc.provider.yml

    root@kitploit:~
    **Considerações de Desempenho:**
    
    - **Model Discovery** (`OLLAMA_SERVER_LOAD_MODELS_ENABLED=true`): Adiciona 1-2s de latência na inicialização consultando a API Ollama
    - **Auto-pull** (`OLLAMA_SERVER_PULL_MODELS_ENABLED=true`): Primeira inicialização pode levar vários minutos baixando modelos
    - **Pull timeout** (`OLLAMA_SERVER_PULL_MODELS_TIMEOUT=900`): 15 minutos em segundos
    - **Static Config**: Desabilite ambas as flags e especifique modelos no arquivo de configuração para inicialização mais rápida
    
    #### Criando Modelos Ollama Personalizados com Contexto Estendido
    
    O PentAGI requer modelos com janelas de contexto maiores que as configurações padrão do Ollama. Você precisa criar modelos personalizados com o parâmetro `num_ctx` aumentado através de Modelfiles. Enquanto fluxos de trabalho típicos de agentes consomem cerca de 64K tokens, o PentAGI usa tamanho de contexto de 110K para margem de segurança e tratamento de cenários complexos de teste de penetração.
    
    **Importante**: O parâmetro `num_ctx` só pode ser definido durante a criação do modelo via Modelfile - ele não pode ser alterado após a criação do modelo ou substituído em tempo de execução.
    
    ##### Exemplo: Qwen3 32B FP16 com Contexto Estendido
    
    Crie um Modelfile chamado `Modelfile_qwen3_32b_fp16_tc`:```dockerfile
    FROM qwen3:32b-fp16
    PARAMETER num_ctx 110000
    PARAMETER temperature 0.3
    PARAMETER top_p 0.8
    PARAMETER min_p 0.0
    PARAMETER top_k 20
    PARAMETER repeat_penalty 1.1
    

    Construir o modelo personalizado:```bash ollama create qwen3:32b-fp16-tc -f Modelfile_qwen3_32b_fp16_tc

    root@kitploit:~
    ##### Exemplo: QwQ 32B FP16 com Contexto Estendido
    
    Crie um Modelfile chamado `Modelfile_qwq_32b_fp16_tc`:```dockerfile
    FROM qwq:32b-fp16
    PARAMETER num_ctx 110000
    PARAMETER temperature 0.2
    PARAMETER top_p 0.7
    PARAMETER min_p 0.0
    PARAMETER top_k 40
    PARAMETER repeat_penalty 1.2
    

    Construa o modelo personalizado:```bash ollama create qwq:32b-fp16-tc -f Modelfile_qwq_32b_fp16_tc

    root@kitploit:~
    > **Nota**: O modelo QwQ 32B FP16 requer aproximadamente **71.3 GB de VRAM** para inferência. Certifique-se de que seu sistema possui memória GPU suficiente antes de tentar usar este modelo.
    
    Esses modelos personalizados são referenciados nos arquivos de configuração do provedor pré-construídos (`ollama-qwen332b-fp16-tc.provider.yml` e `ollama-qwq32b-fp16-tc.provider.yml`) que estão incluídos na imagem Docker em `/opt/pentagi/conf/`.
    
    ### Configuração do Provedor OpenAI
    
    PentAGI integra-se com a linha abrangente de modelos da OpenAI, apresentando capacidades avançadas de raciocínio com cadeia de pensamento estendida, modelos agentes com integração aprimorada de ferramentas e modelos de código especializados para engenharia de segurança.
    
    #### Variáveis de Configuração
    
    | Variável                  | Padrão                      | Descrição                        |
    | ------------------------- | --------------------------- | -------------------------------- |
    | `OPEN_AI_KEY`             |                             | Chave API para serviços OpenAI   |
    | `OPEN_AI_SERVER_URL`      | `https://api.openai.com/v1` | Endpoint da API OpenAI           |
    
    #### Exemplos de Configuração```bash
    # Basic OpenAI setup
    OPEN_AI_KEY=your_openai_api_key
    OPEN_AI_SERVER_URL=https://api.openai.com/v1
    
    # Using with proxy for enhanced security
    OPEN_AI_KEY=your_openai_api_key
    PROXY_URL=http://your-proxy:8080
    

    Modelos Suportados

    O PentAGI suporta 31 modelos OpenAI com chamada de ferramentas, streaming, modos de raciocínio e cache de prompt. Modelos marcados com * são usados na configuração padrão.

    Série GPT-5.2 – Principal Agente Mais Recente (Dezembro 2025)

    ID do ModeloRaciocínioPreço (Entrada/Saída/Cache)Caso de Uso
    gpt-5.2*✅$1.75/$14.00/$0.18Principal mais recente com raciocínio aprimorado e integração de ferramentas, pesquisa autônoma de segurança
    gpt-5.2-pro✅$21.00/$168.00/$0.00Versão premium com programação agente superior, pesquisa de segurança de missão crítica, descoberta de dia zero
    gpt-5.2-codex✅$1.75/$14.00/$0.18Mais avançado especializado em código, compactação de contexto, fortes capacidades de cibersegurança

    Série GPT-5/5.1 – Modelos Agentes Avançados

    ID do ModeloRaciocínioPreço (Entrada/Saída/Cache)Caso de Uso
    gpt-5✅$1.25/$10.00/$0.13Principal agente com raciocínio avançado, pesquisa autônoma de segurança, desenvolvimento de cadeias de exploit
    gpt-5.1✅$1.25/$10.00/$0.13Agente aprimorado com raciocínio adaptativo, testes de penetração equilibrados com forte coordenação de ferramentas
    gpt-5-pro✅$15.00/$120.00/$0.00Versão premium com grandes melhorias de raciocínio, redução de alucinações, operações críticas de segurança
    gpt-5-mini✅$0.25/$2.00/$0.03Eficiente equilibrando velocidade e inteligência, análise automatizada de vulnerabilidades, geração de exploits
    gpt-5-nano✅$0.05/$0.40/$0.01Mais rápido para varreduras de alto rendimento, reconhecimento, detecção em massa de vulnerabilidades

    Série GPT-5/5.1 Codex – Especializados em Código

    ID do ModeloRaciocínioPreço (Entrada/Saída/Cache)Caso de Uso
    gpt-5.1-codex-max✅$1.25/$10.00/$0.13Raciocínio aprimorado para programação sofisticada, descobertas comprovadas de CVE, desenvolvimento sistemático de exploits
    gpt-5.1-codex✅$1.25/$10.00/$0.13Otimizado para código padrão com forte raciocínio, geração de exploits, análise de vulnerabilidades
    gpt-5-codex✅$1.25/$10.00/$0.13Especializado em código fundamental, varredura de vulnerabilidades, geração básica de exploits
    gpt-5.1-codex-mini✅$0.25/$2.00/$0.03Compacto de alto desempenho, capacidade 4x maior, detecção rápida de vulnerabilidades
    codex-mini-latest✅$1.50/$6.00/$0.38Modelo de código compacto mais recente, revisão automática de código, análise básica de vulnerabilidades

    Série GPT-4.1 – Inteligência Aprimorada

    ID do ModeloRaciocínioPreço (Entrada/Saída/Cache)Caso de Uso
    gpt-4.1❌$2.00/$8.00/$0.50Principal aprimorado com chamada de função superior, análise complexa de ameaças, desenvolvimento sofisticado de exploits
    gpt-4.1-mini*❌$0.40/$1.60/$0.10Desempenho equilibrado com eficiência melhorada, avaliações de segurança de rotina, análise automática de código
    gpt-4.1-nano❌$0.10/$0.40/$0.03Leve ultrarrápido, varredura de segurança em massa, reconhecimento rápido, monitoramento contínuo

    Série GPT-4o – Principal Multimodal

    ID do ModeloRaciocínioPreço (Entrada/Saída/Cache)Caso de Uso
    gpt-4o❌$2.50/$10.00/$1.25Principal multimodal com visão, análise de imagens, avaliação de interface web, orquestração de múltiplas ferramentas
    gpt-4o-mini❌$0.15/$0.60/$0.08Multimodal compacto com forte chamada de função, varredura de alta frequência, operações em massa econômicas

    Série o – Modelos de Raciocínio Avançado

    ID do ModeloRaciocínioPreço (Entrada/Saída/Cache)Caso de Uso
    o4-mini*✅$1.10/$4.40/$0.28Raciocínio de próxima geração com velocidade aprimorada, avaliações metódicas de segurança, desenvolvimento sistemático de exploits
    o3*✅$2.00/$8.00/$0.50Potência de raciocínio avançado, cadeias de ataque em múltiplos estágios, análise profunda de vulnerabilidades
    o3-mini✅$1.10/$4.40/$0.55Raciocínio compacto com pensamento estendido, planejamento passo a passo de ataques, encadeamento lógico de vulnerabilidades
    o1✅$15.00/$60.00/$7.50Raciocínio principal com profundidade máxima, testes avançados de penetração, pesquisa de exploits inovadores
    o3-pro✅$20.00/$80.00/$0.00Raciocínio mais avançado, 80% mais barato que o1-pro, pesquisa de dia zero, investigações críticas de segurança
    o1-pro✅$150.00/$600.00/$0.00Raciocínio premium de geração anterior, análise exaustiva de segurança, desafios críticos de missão

    Preços: Por 1M de tokens. Modelos de raciocínio incluem tokens de pensamento no preço de saída.

    [!WARNING] Modelos GPT-5 – Acesso Confiável Necessário*

    Todos os modelos da série GPT-5 (gpt-5, gpt-5.1, gpt-5.2, gpt-5-pro, gpt-5.2-pro e todas as variantes Codex) funcionam de forma instável com o PentAGI e podem acionar os mecanismos de segurança cibernética da OpenAI sem acesso verificado.

    Para usar modelos GPT-5 de forma confiável:*

    1. Usuários individuais: Verifique sua identidade em chatgpt.com/cyber
    2. Equipes empresariais: Solicite acesso confiável através do seu representante OpenAI
    3. Pesquisadores de segurança: Candidate-se ao Programa de Bolsas de Cibersegurança (inclui $10M em créditos API)

    Alternativas recomendadas sem verificação:

    • Use modelos da série o (o3, o4-mini, o1) para tarefas de raciocínio
    • Use a série gpt-4.1 para inteligência geral e chamada de funções
    • Todos os modelos da série o e gpt-4.x funcionam de forma confiável sem acesso especial

    Níveis de Esforço de Raciocínio:

    • Alto: Profundidade máxima de raciocínio (refiner - o3 com esforço alto)
    • Médio: Raciocínio equilibrado (primary_agent, assistant, reflector - o4-mini/o3 com esforço médio)
    • Baixo: Raciocínio direcionado eficiente (coder, installer, pentester - o3/o4-mini com esforço baixo; adviser - gpt-5.2 com esforço baixo)

    Principais Recursos:

    • Raciocínio Estendido: Modelos da série o com cadeia de pensamento para análise complexa de segurança
    • Inteligência Agente: Séries GPT-5/5.1/5.2 com integração aprimorada de ferramentas e capacidades autônomas
    • Cache de Prompt: Redução de custos em contexto repetido (10-50% do preço de entrada)
    • Especialização em Código: Modelos Codex dedicados para descoberta de vulnerabilidades e desenvolvimento de exploits
    • Suporte Multimodal: Série GPT-4o para avaliações de segurança baseadas em visão
    • Chamada de Ferramentas: Chamada robusta de funções em todos os modelos para orquestração de ferramentas de pentest
    • Streaming: Streaming de respostas em tempo real para fluxos de trabalho interativos
    • Histórico Comprovado: Modelos líderes do setor com descobertas de CVE e aplicações de segurança do mundo real

    Configuração do Provedor Anthropic

    O PentAGI integra-se aos modelos Claude da Anthropic, apresentando capacidades avançadas de pensamento estendido, mecanismos excepcionais de segurança e compreensão sofisticada de contextos complexos de segurança com cache de prompt.

    Variáveis de Configuração

    VariávelPadrãoDescrição
    ANTHROPIC_API_KEYChave da API para serviços Anthropic
    ANTHROPIC_SERVER_URLhttps://api.anthropic.com/v1Endpoint da API Anthropic

    Exemplos de Configuração```bash

    Basic Anthropic setup

    ANTHROPIC_API_KEY=your_anthropic_api_key ANTHROPIC_SERVER_URL=https://api.anthropic.com/v1

    Using with proxy for secure environments

    ANTHROPIC_API_KEY=your_anthropic_api_key PROXY_URL=http://your-proxy:8080

    root@kitploit:~
    > [!NOTE]
    > **Google Vertex AI para modelos Claude**
    >
    > O PentAGI atualmente não expõe um caminho de configuração dedicado do Google Vertex AI para Anthropic Claude no `.env`. Não há um campo de chave de API Vertex AI separado neste momento, e as variáveis Anthropic existentes (`ANTHROPIC_API_KEY`, `ANTHROPIC_SERVER_URL`) visam a API Anthropic direta. As rotas suportadas para Claude são:
    >
    > - **API Anthropic Direta**: `ANTHROPIC_API_KEY` e `ANTHROPIC_SERVER_URL` (veja acima).
    > - **AWS Bedrock**: Variáveis `BEDROCK_*` (veja [Configuração do Provedor AWS Bedrock](#aws-bedrock-provider-configuration)).
    >
    > Se você precisar usar o Vertex AI hoje, a solução alternativa suportada mais segura é expor o Vertex AI através de um proxy ou gateway compatível com OpenAI que traduza as chamadas do Vertex AI para o formato Chat Completions, preservando o comportamento de chat e chamada de ferramentas do qual o PentAGI depende, e então aponte o provedor LLM Personalizado para esse gateway via `LLM_SERVER_URL`, `LLM_SERVER_KEY` e `LLM_SERVER_MODEL`. Este caminho é tão confiável quanto o gateway que você escolher.
    
    #### Modelos Suportados
    
    O PentAGI suporta 10 modelos Claude com chamada de ferramentas, streaming, pensamento estendido, pensamento adaptativo e cache de prompt. Os modelos marcados com `*` são usados na configuração padrão.
    
    **Série Claude 4 - Modelos Mais Recentes (2025-2026)**
    
    | ID do Modelo             | Pensamento | Data de Lançamento | Preço (Entrada/Saída/Cache R/W) | Caso de Uso                                     |
    | ------------------------ | ---------- | ------------------ | ------------------------------- | ----------------------------------------------- |
    | `claude-opus-4-6`*       | ✅          | Maio 2025          | $5,00/$25,00/$0,50/$6,25        | Modelo mais inteligente para agentes autônomos e codificação. Pensamento estendido + adaptativo para desenvolvimento complexo de exploits, simulação de ataque em múltiplos estágios |
    | `claude-sonnet-4-6`*     | ✅          | Agosto 2025        | $3,00/$15,00/$0,30/$3,75        | Melhor equilíbrio velocidade/inteligência com pensamento adaptativo. Avaliações de segurança em várias fases, análise inteligente de vulnerabilidades, caça a ameaças em tempo real |
    | `claude-haiku-4-5`*      | ✅          | Outubro 2025       | $1,00/$5,00/$0,10/$1,25         | Modelo mais rápido com inteligência quase de ponta. Varredura de alta frequência, monitoramento em tempo real, testes automatizados em lote |
    
    **Modelos Legados - Ainda Suportados**
    
    | ID do Modelo             | Pensamento | Data de Lançamento | Preço (Entrada/Saída/Cache R/W) | Caso de Uso                                     |
    | ------------------------ | ---------- | ------------------ | ------------------------------- | ----------------------------------------------- |
    | `claude-sonnet-4-5`      | ✅          | Setembro 2025      | $3,00/$15,00/$0,30/$3,75        | Raciocínio de ponta (substituído pela série 4-6). Testes de penetração sofisticados, análise avançada de ameaças |
    | `claude-opus-4-5`        | ✅          | Novembro 2025      | $5,00/$25,00/$0,50/$6,25        | Raciocínio definitivo (substituído por opus-4-6). Pesquisa crítica de segurança, descoberta de zero-day, operações de red team |
    | `claude-opus-4-1`        | ✅          | Agosto 2025        | $15,00/$75,00/$1,50/$18,75      | Raciocínio avançado (substituído). Testes de penetração complexos, modelagem sofisticada de ameaças |
    | `claude-sonnet-4-0`      | ✅          | Maio 2025          | $3,00/$15,00/$0,30/$3,75        | Raciocínio de alto desempenho (substituído). Modelagem complexa de ameaças, coordenação de múltiplas ferramentas |
    | `claude-opus-4-0`        | ✅          | Maio 2025          | $15,00/$75,00/$1,50/$18,75      | Primeira geração Opus (substituído). Desenvolvimento de exploits em várias etapas, fluxos de trabalho autônomos de pentest |
    
    **Modelos Descontinuados - Migre para Modelos Atuais**
    
    | ID do Modelo                 | Pensamento | Data de Lançamento | Preço (Entrada/Saída/Cache R/W) | Notas                                        |
    | ---------------------------- | ---------- | ------------------ | ------------------------------- | -------------------------------------------- |
    | `claude-3-haiku-20240307`    | ❌          | Março 2024         | $0,25/$1,25/$0,03/$0,30         | Será desativado em 19 de abril de 2026. Migre para claude-haiku-4-5 |
    
    **Preços**: Por 1M de tokens. O preço do cache inclui custos de Leitura e Escrita.
    
    **Configuração de Pensamento Estendido**:
    - **Max Tokens 4096**: Gerador (claude-opus-4-6) para profundidade máxima de raciocínio em desenvolvimento complexo de exploits
    - **Max Tokens 2048**: Codificador (claude-sonnet-4-6) para análise equilibrada de código e pesquisa de vulnerabilidades
    - **Max Tokens 1024**: Agente primário, assistente, refinador, conselheiro, refletor, pesquisador, instalador, testador de penetração para raciocínio focado em tarefas específicas
    - **Pensamento Estendido**: Todos os modelos Claude 4.5+ e 4.6 suportam pensamento estendido configurável para tarefas de raciocínio profundo
    
    **Principais Recursos**:
    - **Pensamento Estendido**: Todos os modelos Claude 4.5+ e 4.6 com profundidades configuráveis de raciocínio em cadeia de pensamento para análise de segurança complexa
    - **Pensamento Adaptativo**: A série Claude 4.6 (Opus/Sonnet) ajusta dinamicamente a profundidade do raciocínio com base na complexidade da tarefa para desempenho ideal
    - **Cache de Prompt**: Redução significativa de custos com preços separados de leitura/escrita (10% leitura, 125% escrita do valor de entrada)
    - **Janela de Contexto Estendida**: 200 mil tokens padrão, até 1 milhão de tokens (beta) para Claude Opus/Sonnet 4.6 para análise abrangente de base de código
    - **Chamada de Ferramentas**: Chamada de função robusta com exatidão excepcional para orquestração de ferramentas de segurança
    - **Streaming**: Streaming de resposta em tempo real para fluxos de trabalho interativos de teste de penetração
    - **Design Focado em Segurança**: Mecanismos de segurança integrados garantindo práticas responsáveis de teste de segurança
    - **Suporte Multimodal**: Capacidades de visão nos modelos mais recentes para análise de capturas de tela e avaliação de segurança de interface do usuário
    - **IA Constitucional**: Treinamento avançado de segurança fornecendo orientação de segurança confiável e ética
    
    ### Configuração do Provedor Google AI (Gemini)
    
    O PentAGI integra-se com os modelos Gemini do Google através da API Google AI, oferecendo capacidades multimodais de raciocínio de ponta com pensamento estendido e cache de contexto.
    
    #### Variáveis de Configuração
    
    | Variável           | Padrão                                       | Descrição                      |
    | ------------------ | -------------------------------------------- | ------------------------------ |
    | `GEMINI_API_KEY`   |                                              | Chave de API para serviços Google AI |
    | `GEMINI_SERVER_URL`| `https://generativelanguage.googleapis.com`  | Endpoint da API Google AI      |
    
    #### Exemplos de Configuração```bash
    # Basic Gemini setup
    GEMINI_API_KEY=your_gemini_api_key
    GEMINI_SERVER_URL=https://generativelanguage.googleapis.com
    
    # Using with proxy
    GEMINI_API_KEY=your_gemini_api_key
    PROXY_URL=http://your-proxy:8080
    

    Modelos Suportados

    O PentAGI suporta 9 modelos Gemini com chamada de ferramentas, streaming, modos de pensamento e cache de contexto. Modelos marcados com * são usados na configuração padrão.

    Série Gemini 3.5 - Flash Estável Mais Recente (Maio de 2026)

    ID do ModeloPensamentoContextoPreço (Entrada/Saída/Cache)Caso de Uso
    gemini-3.5-flash*✅1M$1,50/$9,00/$0,15Modelo Flash mais inteligente com desempenho de fronteira sustentado em tarefas agênticas e de codificação, busca e fundamentação superiores

    Série Gemini 3.1 - Flash-Lite Estável + Pré-visualização Pro (Fev-Maio 2026)

    ID do ModeloPensamentoContextoPreço (Entrada/Saída/Cache)Caso de Uso
    gemini-3.1-pro-preview*✅1M$2,00/$12,00/$0,20Último carro-chefe com pensamento refinado, eficiência de token aprimorada, otimizado para engenharia de software e fluxos de trabalho agênticos
    gemini-3.1-pro-preview-customtools✅1M$2,00/$12,00/$0,20Endpoint de ferramentas personalizadas otimizado para bash e priorização de ferramentas personalizadas (view_file, search_code)
    gemini-3.1-flash-lite*✅1M$0,25/$1,50/$0,025Modelo multimodal estável mais econômico, desempenho de classe fronteiriça para tarefas agênticas de alto volume e aplicações de baixa latência

    Série Gemini 2.5 - Modelos de Pensamento Avançado (ativos até 16 de outubro de 2026)

    ID do ModeloPensamentoContextoPreço (Entrada/Saída/Cache)Caso de Uso
    gemini-2.5-pro✅1M$1,25/$10,00/$0,125Estado da arte para codificação e raciocínio complexos, modelagem de ameaças sofisticada
    gemini-2.5-flash✅1M$0,30/$2,50/$0,03Primeiro modelo de raciocínio híbrido com orçamentos de pensamento, melhor relação custo-desempenho para avaliações em larga escala
    gemini-2.5-flash-lite✅1M$0,10/$0,40/$0,01Menor e mais econômico para uso em escala, varredura de alto rendimento

    Modelos Open-Source Gemma 4 (Apache 2.0, Camada Gratuita)

    ID do ModeloPensamentoContextoPreço (Entrada/Saída/Cache)Caso de Uso
    gemma-4-31b-it✅256KGratuito/Gratuito/GratuitoMaior modelo denso open-source Gemma 4 (~31B parâmetros), multimodal texto+imagem, 140+ idiomas, operações de segurança on-premises
    gemma-4-26b-a4b-it✅256KGratuito/Gratuito/GratuitoArquitetura MoE (~26B total / ~3.8B parâmetros ativos), inferência altamente eficiente em GPUs de consumo para varredura local de alto rendimento

    Preços: Por 1M de tokens (Camada Padrão Paga). A janela de contexto é o limite de tokens de entrada.

    [!NOTE] Encerramento da Série Gemini 2.5

    gemini-2.5-pro, gemini-2.5-flash e gemini-2.5-flash-lite serão encerrados em 16 de outubro de 2026. Migrações recomendadas:

    • gemini-2.5-pro → gemini-3.1-pro-preview (mesmo nível de preço de entrada de $2,00)
    • gemini-2.5-flash → gemini-3.5-flash (capacidades de fronteira aprimoradas)
    • gemini-2.5-flash-lite → gemini-3.1-flash-lite (mesmo preço de entrada de $0,25)

    Atribuições de Modelo Padrão (config.yml):

    • gemini-3.1-pro-preview - primary_agent, assistant, generator, refiner, adviser, coder, pentester
    • gemini-3.5-flash - reflector, searcher, enricher, installer
    • gemini-3.1-flash-lite - simple, simple_json

    Recursos Principais:

    • Pensamento Estendido: Raciocínio passo a passo para análise de segurança complexa (todos os modelos Gemini 3.x, série 2.5 e Gemma 4 com pensamento alternável)
    • Cache de Contexto: Redução significativa de custo em contexto repetido (10% do preço de entrada para a maioria dos modelos)
    • Contexto Ultra Longo: 1M de tokens para modelos de chat Gemini, 256K de tokens para modelos open-source Gemma 4
    • Suporte Multimodal: Processamento de texto, imagem, vídeo, áudio e PDF para avaliações abrangentes
    • Chamada de Ferramentas: Integração perfeita com mais de 20 ferramentas de pentest via chamada de função
    • Streaming: Streaming de resposta em tempo real para fluxos de trabalho de segurança interativos
    • Execução de Código: Execução de código incorporada para teste de ferramentas ofensivas e validação de exploits
    • Fundamentação de Pesquisa: Integração com Google Pesquisa para inteligência de ameaças e pesquisa de CVEs
    • Pesquisa de Arquivos: Recuperação de documentos e capacidades de RAG para avaliações baseadas em conhecimento
    • API em Lote: Redução de 50% no custo para processamento em lote não em tempo real
    • Endpoint de Ferramentas Personalizadas: Rota dedicada gemini-3.1-pro-preview-customtools para fluxos de trabalho agênticos pesados em ferramentas que preferem ferramentas registradas em vez de bash

    Níveis de Esforço de Raciocínio:

    • Alto: Profundidade máxima de pensamento para análise complexa de várias etapas (gerador)
    • Médio: Raciocínio equilibrado para tarefas agênticas gerais (primary_agent, assistant, refiner, adviser)
    • Baixo: Pensamento eficiente para tarefas focadas (coder, installer, pentester)

    Configuração do Provedor AWS Bedrock

    O PentAGI integra-se com o Amazon Bedrock, oferecendo acesso a mais de 20 modelos de base de empresas líderes de IA, incluindo Anthropic, Amazon, Cohere, DeepSeek, OpenAI, Qwen, Mistral e Moonshot.

    Variáveis de Configuração

    VariávelPadrãoDescrição
    BEDROCK_REGIONus-east-1Região AWS para o serviço Bedrock
    BEDROCK_DEFAULT_AUTHfalseUsar cadeia de credenciais padrão do AWS SDK (ambiente, função EC2, ~/.aws/credentials) - prioridade máxima
    BEDROCK_BEARER_TOKENAutenticação via token Bearer - prioridade sobre credenciais estáticas
    BEDROCK_ACCESS_KEY_IDID da chave de acesso AWS para credenciais estáticas
    BEDROCK_SECRET_ACCESS_KEYChave de acesso secreta AWS para credenciais estáticas
    BEDROCK_SESSION_TOKENToken de sessão AWS para credenciais temporárias (opcional, usado com credenciais estáticas)
    BEDROCK_SERVER_URLEndpoint Bedrock personalizado (endpoints VPC, testes locais)

    Prioridade de Autenticação: BEDROCK_DEFAULT_AUTH → BEDROCK_BEARER_TOKEN → BEDROCK_ACCESS_KEY_ID+BEDROCK_SECRET_ACCESS_KEY

    Exemplos de Configuração```bash

    Recommended: Default AWS SDK authentication (EC2/ECS/Lambda roles)

    BEDROCK_REGION=us-east-1 BEDROCK_DEFAULT_AUTH=true

    Bearer token authentication (AWS STS, custom auth)

    BEDROCK_REGION=us-east-1 BEDROCK_BEARER_TOKEN=your_bearer_token

    Static credentials (development, testing)

    BEDROCK_REGION=us-east-1 BEDROCK_ACCESS_KEY_ID=your_aws_access_key BEDROCK_SECRET_ACCESS_KEY=your_aws_secret_key

    With proxy and custom endpoint

    BEDROCK_REGION=us-east-1 BEDROCK_DEFAULT_AUTH=true BEDROCK_SERVER_URL=https://bedrock-runtime.us-east-1.vpce-xxx.amazonaws.com PROXY_URL=http://your-proxy:8080

    root@kitploit:~
    #### Modelos Suportados
    
    PentAGI suporta 21 modelos AWS Bedrock com capacidades de chamada de ferramenta, streaming e multimodal. Modelos marcados com `*` são usados na configuração padrão.
    
    | Model ID                                         | Provedor        | Pensamento | Multimodal | Preço (Entrada/Saída) | Caso de Uso                                |
    | ------------------------------------------------ | --------------- | ---------- | ---------- | --------------------- | ------------------------------------------ |
    | `us.amazon.nova-2-lite-v1:0`                     | Amazon Nova     | ❌          | ✅          | $0.33/$2.75           | Raciocínio adaptativo, pensamento eficiente  |
    | `us.amazon.nova-premier-v1:0`                    | Amazon Nova     | ❌          | ✅          | $2.50/$12.50          | Raciocínio complexo, análise avançada    |
    | `us.amazon.nova-pro-v1:0`                        | Amazon Nova     | ❌          | ✅          | $0.80/$3.20           | Precisão balanceada, velocidade, custo          |
    | `us.amazon.nova-lite-v1:0`                       | Amazon Nova     | ❌          | ✅          | $0.06/$0.24           | Processamento rápido, operações de alto volume |
    | `us.amazon.nova-micro-v1:0`                      | Amazon Nova     | ❌          | ❌          | $0.035/$0.14          | Latência ultrabaixa, monitoramento em tempo real |
    | `us.anthropic.claude-opus-4-6-v1`*               | Anthropic       | ✅          | ✅          | $5.00/$25.00          | Codificação de classe mundial, agentes empresariais   |
    | `us.anthropic.claude-sonnet-4-6`                 | Anthropic       | ✅          | ✅          | $3.00/$15.00          | Inteligência de fronteira, escala empresarial |
    | `us.anthropic.claude-opus-4-5-20251101-v1:0`     | Anthropic       | ✅          | ✅          | $5.00/$25.00          | Desenvolvimento de software de vários dias          |
    | `us.anthropic.claude-haiku-4-5-20251001-v1:0`*   | Anthropic       | ✅          | ✅          | $1.00/$5.00           | Desempenho próximo da fronteira, alta velocidade   |
    | `us.anthropic.claude-sonnet-4-5-20250929-v1:0`*  | Anthropic       | ✅          | ✅          | $3.00/$15.00          | Agentes do mundo real, excelência em codificação    |
    | `us.anthropic.claude-sonnet-4-20250514-v1:0`     | Anthropic       | ✅          | ✅          | $3.00/$15.00          | Desempenho balanceado, pronto para produção  |
    | `us.anthropic.claude-3-5-haiku-20241022-v1:0`    | Anthropic       | ❌          | ❌          | $0.80/$4.00           | Modelo mais rápido, varredura econômica  |
    | `cohere.command-r-plus-v1:0`                     | Cohere          | ❌          | ❌          | $3.00/$15.00          | Operações em larga escala, RAG superior    |
    | `deepseek.v3.2`                                  | DeepSeek        | ❌          | ❌          | $0.58/$1.68           | Raciocínio de contexto longo, eficiência      |
    | `openai.gpt-oss-120b-1:0`*                       | OpenAI (OSS)    | ✅          | ❌          | $0.15/$0.60           | Raciocínio forte, análise científica   |
    | `openai.gpt-oss-20b-1:0`                         | OpenAI (OSS)    | ✅          | ❌          | $0.07/$0.30           | Codificação eficiente, desenvolvimento de software  |
    | `qwen.qwen3-next-80b-a3b`                        | Qwen            | ❌          | ❌          | $0.15/$1.20           | Contexto ultra longo, raciocínio de ponta  |
    | `qwen.qwen3-32b-v1:0`                            | Qwen            | ❌          | ❌          | $0.15/$0.60           | Raciocínio balanceado, casos de uso de pesquisa  |
    | `qwen.qwen3-coder-30b-a3b-v1:0`                  | Qwen            | ❌          | ❌          | $0.15/$0.60           | Codificação por vibração, primeiramente em linguagem natural     |
    | `qwen.qwen3-coder-next`                          | Qwen            | ❌          | ❌          | $0.45/$1.80           | Uso de ferramentas, chamada de função otimizada    |
    | `mistral.mistral-large-3-675b-instruct`          | Mistral         | ❌          | ✅          | $4.00/$12.00          | Multimodal avançado, contexto longo       |
    | `moonshotai.kimi-k2.5`                           | Moonshot        | ❌          | ✅          | $0.60/$3.00           | Visão, linguagem, código em um modelo     |
    
    **Preços**: Por 1M tokens. Modelos com suporte a pensamento/raciocínio incorrem em custos de computação adicionais durante a fase de raciocínio.
    
    #### Modelos Testados mas Incompatíveis
    
    Alguns modelos AWS Bedrock foram testados, mas **não são suportados** devido a limitações técnicas:
    
    | Família do Modelo        | Motivo da Incompatibilidade                                                                  |
    | ------------------------ | -------------------------------------------------------------------------------------------- |
    | **GLM (Z.AI)**           | Formato de chamada de ferramenta incompatível com a API Converse (espera string em vez de JSON) |
    | **AI21 Jamba**           | Limites de taxa severos (1-2 req/min) impedem testes confiáveis e uso em produção              |
    | **Meta Llama 3.3/3.1**   | Processamento instável de resultados de chamada de ferramenta, causando falhas inesperadas em fluxos de trabalho de múltiplas rodadas |
    | **Mistral Magistral**    | Chamada de ferramenta não suportada pelo modelo                                                |
    | **Moonshot K2-Thinking** | Comportamento de streaming instável com chamadas de ferramenta, não confiável em produção      |
    | **Qwen3-VL**             | Streaming instável com chamada de ferramenta, combinação multimodal + ferramentas falha intermitentemente |
    
    > [!IMPORTANT]
    > **Gerenciamento de Limites de Taxa e Cotas**
    >
    > As cotas padrão do AWS Bedrock para modelos Claude são **extremamente restritivas** (2-20 solicitações/minuto para novas contas). Para testes de penetração em produção:
    >
    > 1. **Solicite aumentos de cota** através do console AWS Service Quotas para os modelos que você planeja usar
    > 2. **Use modelos Amazon Nova** - cotas padrão mais altas e excelente desempenho
    > 3. **Habilite throughput provisionado** para testes consistentes de alto volume
    > 4. **Monitore o uso** - a AWS limita agressivamente nos limites de cota
    >
    > Sem aumentos de cota, espere atrasos frequentes e interrupções no fluxo de trabalho.
    
    > [!WARNING]
    > **Requisitos da API Converse**
    >
    > PentAGI usa a **API Converse** do Amazon Bedrock para acesso unificado ao modelo. Todos os modelos suportados requerem:
    >
    > - ✅ Suporte à API Converse/ConverseStream
    > - ✅ Uso de ferramentas (chamada de função) para fluxos de trabalho de teste de penetração
    > - ✅ Uso de ferramentas em streaming para feedback em tempo real
    >
    > Verifique as capacidades do modelo em: [AWS Bedrock Model Features](https://docs.aws.amazon.com/bedrock/latest/userguide/conversation-inference-supported-models-features.html)
    
    **Principais Recursos**:
    - **Cache Automático de Prompt**: redução de 40-70% nos custos em contexto repetido (modelos Claude 4.x)
    - **Pensamento Estendido**: raciocínio passo a passo para análise de segurança complexa (Claude, DeepSeek R1, OpenAI GPT)
    - **Análise Multimodal**: Processar capturas de tela, diagramas, vídeo para testes abrangentes (Nova, Claude, Mistral, Kimi)
    - **Chamada de Ferramenta**: Integração perfeita com mais de 20 ferramentas de pentest via chamada de função
    - **Streaming**: Fluxo de resposta em tempo real para fluxos de trabalho interativos de avaliação de segurança
    
    ### Configuração do Provedor DeepSeek
    
    PentAGI se integra ao DeepSeek, fornecendo acesso a modelos avançados de IA com forte raciocínio, capacidades de codificação e cache de contexto a preços competitivos.
    
    #### Variáveis de Configuração
    
    | Variável              | Valor Padrão                   | Descrição                                        |
    | --------------------- | ------------------------------ | ------------------------------------------------ |
    | `DEEPSEEK_API_KEY`    |                                | Chave da API DeepSeek para autenticação          |
    | `DEEPSEEK_SERVER_URL` | `https://api.deepseek.com`    | URL do endpoint da API DeepSeek                  |
    | `DEEPSEEK_PROVIDER`   |                                | Prefixo do provedor para integração com LiteLLM (opcional) |
    
    #### Exemplos de Configuração```bash
    # Direct API usage
    DEEPSEEK_API_KEY=your_deepseek_api_key
    DEEPSEEK_SERVER_URL=https://api.deepseek.com
    
    # With LiteLLM proxy
    DEEPSEEK_API_KEY=your_litellm_key
    DEEPSEEK_SERVER_URL=http://litellm-proxy:4000
    DEEPSEEK_PROVIDER=deepseek  # Adds prefix to model names (deepseek/deepseek-v4-flash) for LiteLLM
    

    Modelos Suportados

    PentAGI suporta 2 modelos DeepSeek V4 com chamada de ferramentas, streaming, modos híbridos de pensamento/não-pensamento e cache de contexto. Ambos os modelos suportam o modo de pensamento por padrão e podem ser alternados para o modo de não-pensamento via extra_body. Modelos marcados com * são usados na configuração padrão.

    Model IDPensamentoSaída MáximaContextoPreço (Entrada/Saída/Cache)Caso de Uso
    deepseek-v4-flash*✅ híbrido384K1M$0.14/$0.28/$0.0028Agentes utilitários, diálogo geral, chamada rápida de ferramentas
    deepseek-v4-pro*✅ híbrido384K1M$1.74/$3.48/$0.0145Raciocínio avançado, lógica complexa, análise de segurança

    Preços: Por 1M de tokens. O preço de cache aplica-se a tokens de prompt servidos do cache (acerto de cache de entrada, reduzido a 1/10 do preço de lançamento desde 2026-04-26). Ambos os modelos suportam pensamento híbrido — o modo thinking está ativado por padrão; passe extra_body.thinking.type: disabled para mudar para o modo de não-pensamento para respostas mais rápidas/baratas.

    Nota de Preço (deepseek-v4-pro): O desconto promocional de 75% no deepseek-v4-pro terminou oficialmente em 2026-05-31 às 15:59 UTC. Os preços acima refletem os preços pós-promocionais padrão. Se você tiver configurações legadas usando os preços com desconto ($0.435/$0.87/$0.003625), atualize-as para as taxas atuais para um acompanhamento preciso dos custos.

    Os nomes legados dos modelos deepseek-chat e deepseek-reasoner estão programados para serem descontinuados pela DeepSeek em 2026-07-24. As configurações de usuário existentes que referenciam os nomes legados continuam funcionando até essa data; os padrões acima usam os nomes atuais da V4. deepseek-chat mapeia para deepseek-v4-flash modo de não-pensamento; deepseek-reasoner mapeia para deepseek-v4-flash modo de pensamento.

    Configuração Padrão do Agente:

    Estratégia: prefira deepseek-v4-flash (12x mais barato na entrada, 12x mais barato na saída) como o burro de carga para agentes utilitários/leves; reserve deepseek-v4-pro para raciocínio complexo de múltiplas etapas. O agente installer executa no Flash com pensamento ativado porque tarefas de configuração de ambiente (comandos de shell, edições de configuração) raramente exigem raciocínio de nível Pro. Execute testes A/B em suas próprias cargas de trabalho antes de promover mais agentes para Pro.

    Função do AgenteModelo PadrãoPensamentoEsforço de RaciocínioSaída MáximaTemperaturaTop P
    Gerador / Refinadordeepseek-v4-proAtivadoAlto32768(auto)(auto)
    Codificadordeepseek-v4-proAtivadoAlto20480(auto)(auto)
    Agente Principal / Assistente / Pentesterdeepseek-v4-proAtivadoAlto16384(auto)(auto)
    Conselheiro (mentor/planejador)deepseek-v4-proAtivadoAlto8192(auto)(auto)
    Instaladordeepseek-v4-flashAtivadoAlto12288(auto)(auto)
    Refletor / Pesquisador / Enriquecedordeepseek-v4-flashDesativado—40960.50.9
    Simples / JSON Simplesdeepseek-v4-flashDesativado—20480.30.9

    Nota: Quando o modo de pensamento está ativado, o DeepSeek ignora silenciosamente temperature, top_p, presence_penalty e frequency_penalty. O cliente langchaingo anula automaticamente temperature/top_p quando reasoning_effort está definido, então eles aparecem como "(auto)" na tabela acima. Todos os agentes com pensamento ativado também passam explicitamente extra_body.thinking.type: enabled como codificação defensiva contra futuras mudanças padrão do provedor.

    Principais Recursos:

    • Modos de Pensamento Híbrido: Alterne entre modos de pensamento (raciocínio profundo) e não-pensamento (rápido) via extra_body.thinking.type
    • Cache Automático de Prompts: Redução significativa de custos em contexto repetido via preço de cache (1/10 do preço de lançamento)
    • Pensamento Estendido: CoT com aprendizado por reforço para análise de segurança complexa (ambos os modelos V4)
    • Codificação Forte: Otimizado para geração de código e desenvolvimento de exploits
    • Contexto Longo: Janela de contexto de 1M tokens com até 384K tokens de saída
    • Chamada de Ferramentas: Integração perfeita com mais de 20 ferramentas de pentest via chamada de função
    • Streaming: Fluxo de resposta em tempo real para fluxos de trabalho interativos
    • Multilíngue: Suporte forte para Chinês e Inglês
    • Recursos Adicionais: Saída JSON, Conclusão de Prefixo de Chat (beta), Conclusão FIM/Preenchimento no Meio (apenas modo de não-pensamento)

    Limites de Concorrência: deepseek-v4-flash: 2500 requisições concorrentes; deepseek-v4-pro: 500 requisições concorrentes.

    Integração LiteLLM: Defina DEEPSEEK_PROVIDER=deepseek para ativar a prefixação do nome do modelo ao usar configurações padrão do PentAGI com proxy LiteLLM. Deixe vazio para uso direto da API.

    Configuração do Provedor GLM

    PentAGI integra-se com GLM da Zhipu AI (Z.AI), fornecendo modelos de linguagem avançados com arquitetura MoE, raciocínio forte e capacidades agentivas desenvolvidas pela Universidade Tsinghua.

    Variáveis de Configuração

    VariávelValor PadrãoDescrição
    GLM_API_KEYChave da API GLM para autenticação
    GLM_SERVER_URLhttps://api.z.ai/api/paas/v4URL do endpoint da API GLM (internacional)
    GLM_PROVIDERPrefixo do provedor para integração LiteLLM (opcional)

    Exemplos de Configuração```bash

    Direct API usage (international endpoint)

    GLM_API_KEY=your_glm_api_key GLM_SERVER_URL=https://api.z.ai/api/paas/v4

    Alternative endpoints

    GLM_SERVER_URL=https://open.bigmodel.cn/api/paas/v4 # China GLM_SERVER_URL=https://api.z.ai/api/coding/paas/v4 # Coding-specific

    With LiteLLM proxy

    GLM_API_KEY=your_litellm_key GLM_SERVER_URL=http://litellm-proxy:4000 GLM_PROVIDER=zai # Adds prefix to model names (zai/glm-4) for LiteLLM

    root@kitploit:~
    #### Modelos Suportados
    
    O PentAGI suporta 13 modelos GLM com chamada de ferramentas, streaming, modos de pensamento híbridos e cache de prompt. Modelos marcados com `*` são usados na configuração padrão. O pensamento é controlado via `extra_body.thinking.type` ("enabled"/"disabled"); diferente do Kimi, o GLM é permissivo quanto à temperatura em ambos os modos.
    
    **Série GLM-5.x - Última Geração (contexto de 200K, saída máxima de 128K)**
    
    | ID do Modelo    | Pensamento | Contexto | Saída Máx. | Preço (Entrada/Saída/Cache) | Caso de Uso                                                                                                                              |
    | --------------- | ---------- | -------- | ---------- | ---------------------------- | ---------------------------------------------------------------------------------------------------------------------------------------- |
    | `glm-5.1`*      | ✅ Híbrido | 200K     | 128K       | $1,40/$4,40/$0,26            | Principal mais recente: execução autônoma sustentada por 8h, alinhado ao Claude Opus 4.6 (padrão para gerador/refinador/conselheiro/pentester) |
    | `glm-5`         | ✅ Híbrido | 200K     | 128K       | $1,00/$3,20/$0,20            | Fundação para Engenharia de Agentes, MoE 744B/40B ativos, codificação no nível Claude Opus 4.5                                          |
    | `glm-5-turbo`*  | ✅ Híbrido | 200K     | 128K       | $1,20/$4,00/$0,24            | Nativo OpenClaw: otimizado para invocação de ferramentas, tarefas persistentes, execução de longa cadeia (padrão para agente_principal/assistente) |
    
    **Série GLM-4.7 - Premium com Pensamento Intercalado**
    
    | ID do Modelo     | Pensamento | Contexto | Saída Máx. | Preço (Entrada/Saída/Cache) | Caso de Uso                                                               |
    | ---------------- | ---------- | -------- | ---------- | ---------------------------- | ------------------------------------------------------------------------- |
    | `glm-4.7`        | ✅ Híbrido | 200K     | 128K       | $0,60/$2,20/$0,11            | Programação aprimorada, raciocínio multi-etapas estável                    |
    | `glm-4.7-flashx` | ✅ Híbrido | 200K     | 128K       | $0,07/$0,40/$0,01            | Ultra barato com GPU prioritária, mas limites RPM mais baixos (evite para uso de alta frequência) |
    | `glm-4.7-flash`  | ✅ Híbrido | 200K     | 128K       | Grátis/Grátis/Grátis         | Modelo SOTA ~30B gratuito, 1 requisição concorrente                       |
    
    **Série GLM-4.6 - Equilibrado com Pensamento Automático**
    
    | ID do Modelo | Pensamento | Contexto | Saída Máx. | Preço (Entrada/Saída/Cache) | Caso de Uso                                           |
    | ------------ | ---------- | -------- | ---------- | ---------------------------- | ----------------------------------------------------- |
    | `glm-4.6`    | ✅ Auto    | 200K     | 128K       | $0,60/$2,20/$0,11            | Equilibrado, chamadas de ferramentas em streaming, eficiente em tokens |
    
    **Série GLM-4.5 - Raciocínio/Codificação/Agentes Unificados**
    
    | ID do Modelo        | Pensamento | Contexto | Saída Máx. | Preço (Entrada/Saída/Cache) | Caso de Uso                                          |
    | ------------------- | ---------- | -------- | ---------- | ---------------------------- | ---------------------------------------------------- |
    | `glm-4.5`           | ✅ Auto    | 128K     | 96K        | $0,60/$2,20/$0,11            | Unificado, MoE 355B/32B ativos                       |
    | `glm-4.5-x`         | ✅ Auto    | 128K     | 96K        | $2,20/$8,90/$0,45            | Premium ultra-rápido, menor latência                 |
    | `glm-4.5-air`*      | ✅ Auto    | 128K     | 96K        | $0,20/$1,10/$0,03            | MoE 106B/12B econômico (padrão para simple/simple_json/reflector/searcher/enricher/installer) |
    | `glm-4.5-airx`      | ✅ Auto    | 128K     | 96K        | $1,10/$4,50/$0,22            | Air acelerado com GPU prioritária                    |
    | `glm-4.5-flash`     | ✅ Auto    | 128K     | 96K        | Grátis/Grátis/Grátis         | Gratuito com suporte a raciocínio/codificação/agentes |
    
    **GLM-4 Legado - Arquitetura Densa**
    
    | ID do Modelo               | Pensamento | Contexto | Saída Máx. | Preço (Entrada/Saída) | Caso de Uso                                        |
    | -------------------------- | ---------- | -------- | ---------- | --------------------- | -------------------------------------------------- |
    | `glm-4-32b-0414-128k`      | ❌          | 128K     | 16K        | $0,10/$0,10           | Denso 32B ultra-econômico, análise sem raciocínio |
    
    **Preços**: Por 1 milhão de tokens. O preço de cache é para acerto de cache do prompt; o armazenamento de cache é atualmente gratuito conforme promoção do Z.AI. GLM-4-32B não possui suporte a cache.
    
    **Configuração Padrão de Agentes**:
    
    Estratégia: `glm-5.1` (principal mais recente, $1,40 de entrada) para raciocínio crítico, `glm-5-turbo` (nativo OpenClaw, otimizado para agentes) para orquestração, `glm-4.5-air` (MoE barato com pensamento híbrido e RPM confiável) para todos os agentes utilitários/instaladores. `glm-4.7-flashx` é evitado como padrão devido aos limites RPM mais baixos que causam erros 429 frequentes em alta frequência.
    
    | Função do Agente                  | Modelo Padrão | Pensamento | Temperatura | Top P | Saída Máx. |
    | --------------------------------- | ------------- | ---------- | ----------- | ----- | ---------- |
    | Gerador / Refinador               | `glm-5.1`     | Ativado    | 1,0         | 0,95  | 32768      |
    | Codificador                       | `glm-5.1`     | Ativado    | 1,0         | 0,95  | 20480      |
    | Conselheiro / Pentester           | `glm-5.1`     | Ativado    | 1,0         | 0,95  | 16384      |
    | Agente Principal / Assistente     | `glm-5-turbo` | Ativado    | 1,0         | 0,95  | 16384      |
    | Instalador                        | `glm-4.5-air` | Ativado    | 1,0         | 0,95  | 16384      |
    | Simples / Refletor                | `glm-4.5-air` | Desativado | 0,6         | 0,9   | 8192       |
    | Pesquisador / Enriquecedor / JSON Simples | `glm-4.5-air` | Desativado | 0,6         | 0,9   | 4096       |
    
    > **Nota sobre temperatura**: GLM aceita tanto `1.0` quanto `0.6` em ambos os modos de pensamento/não pensamento (conforme docs do Z.AI). O `IsReasoningModel` do langchaingo corresponde aos prefixos `glm-4.5*`/`glm-4.6*`/`glm-4.7*` e força a substituição da temperatura para 1.0 em `createChatRequest` — isso é inofensivo para GLM (diferente do Kimi), mas significa que os valores de temperatura para esses modelos no YAML são meramente informativos. `glm-5`/`glm-5.1`/`glm-5-turbo` não são correspondidos, portanto os valores explícitos passam sem alteração.
    
    **Modos de Pensamento**:
    - **Híbrido** (GLM-5.x, GLM-4.7): Alternância explícita via `extra_body.thinking.type`
    - **Automático** (séries GLM-4.6, GLM-4.5): O modelo determina automaticamente quando o raciocínio é necessário
    - **Pensamento Preservado** (capacidade de Codificação Z.AI): todos os agentes com pensamento ativado no PentAGI também passam `extra_body.thinking.clear_thinking: false` para que o `reasoning_content` de turnos anteriores do assistente seja mantido ao longo da conversa. Isso é necessário no endpoint padrão da API (`/api/paas/v4`) — no endpoint do Plano de Codificação estaria ativado por padrão. Melhora a continuidade do raciocínio e as taxas de acerto de cache em cadeias de chamadas de ferramentas com múltiplos turnos.
    - Todos os agentes com pensamento ativado também passam `extra_body.tool_choice: auto` defensivamente
    
    **Principais Características**:
    - **Tarefas de Longo Horizonte**: GLM-5.1 suporta execução autônoma sustentada por 8 horas, ideal para workflows agentivos complexos de múltiplas etapas
    - **Orquestração Nativa OpenClaw**: GLM-5-Turbo é especificamente otimizado para invocação de ferramentas, seguimento de instruções e execução de longa cadeia
    - **Cache de Prompt**: Redução significativa de custos em contexto repetido (preço de entrada em cache mostrado)
    - **Contexto Ultra Longo**: 200K tokens para as séries GLM-5.x/4.7/4.6
    - **Arquitetura MoE**: Eficiente 744B/40B ativos (GLM-5/5.1), 355B/32B (GLM-4.5), 106B/12B (GLM-4.5-Air)
    - **Chamada de Ferramentas**: Integração perfeita com mais de 20 ferramentas de pentest via chamada de funções
    - **Streaming**: Streaming em tempo real com suporte a chamadas de ferramentas em streaming (GLM-4.6+)
    - **Multilíngue**: Capacidades excepcionais de PNL em Chinês e Inglês
    - **Opções Gratuitas**: GLM-4.7-Flash e GLM-4.5-Flash para prototipagem e experimentação
    
    **Integração LiteLLM**: Defina `GLM_PROVIDER=zai` para ativar o prefixo do nome do modelo ao usar configurações padrão do PentAGI com proxy LiteLLM. Deixe vazio para uso direto da API.
    
    ### Configuração do Provedor Kimi
    
    O PentAGI integra-se com o Kimi da Moonshot AI, fornecendo modelos de contexto ultra longo com capacidades multimodais perfeitas para analisar bases de código e documentação extensas.
    
    #### Variáveis de Configuração
    
    | Variável           | Valor Padrão                   | Descrição                                          |
    | ------------------ | ------------------------------ | -------------------------------------------------- |
    | `KIMI_API_KEY`     |                                | Chave da API Kimi para autenticação                |
    | `KIMI_SERVER_URL`  | `https://api.moonshot.ai/v1`   | URL do endpoint da API Kimi (internacional)        |
    | `KIMI_PROVIDER`    |                                | Prefixo do provedor para integração LiteLLM (opcional) |
    
    #### Exemplos de Configuração```bash
    # Direct API usage (international endpoint)
    KIMI_API_KEY=your_kimi_api_key
    KIMI_SERVER_URL=https://api.moonshot.ai/v1
    
    # Alternative endpoint
    KIMI_SERVER_URL=https://api.moonshot.cn/v1  # China
    
    # With LiteLLM proxy
    KIMI_API_KEY=your_litellm_key
    KIMI_SERVER_URL=http://litellm-proxy:4000
    KIMI_PROVIDER=moonshot  # Adds prefix to model names (moonshot/kimi-k2.5) for LiteLLM
    

    Modelos Suportados

    O PentAGI suporta 8 modelos Kimi/Moonshot com chamada de ferramentas, streaming, modos de pensamento híbrido e capacidades multimodais (texto/imagem/vídeo para K2.x). Todos os modelos legados kimi-k2-* (turbo-preview, 0905-preview, 0711-preview, thinking, thinking-turbo) foram descontinuados pela Moonshot em 2026-05-25 e NÃO estão incluídos. Modelos marcados com * são usados na configuração padrão.

    Série Kimi K2.x - Flagship Multimodal

    ID do ModeloPensamentoMultimodalContextoPreço (Input Miss / Output / Cache Hit)Caso de Uso
    kimi-k2.6*✅ híbrido✅256K$0,95 / $4,00 / $0,16Flagship mais recente: multimodal nativo, código mais forte, conformidade de instruções aprimorada (padrão para generator/refiner/adviser/coder/pentester)
    root@kitploit:~
    
    ---
    
    [Read more](https://github.com/vxcontrol/pentagi)