
Sistema de Agentes de IA totalmente autônomos capaz de realizar tarefas complexas de teste de penetração
Junte-se à Comunidade! Conecte-se com pesquisadores de segurança, entusiastas de IA e hackers éticos. Obtenha suporte, compartilhe ideias e fique atualizado com os últimos desenvolvimentos do PentAGI.
PentAGI é uma ferramenta inovadora para testes de segurança automatizados que utiliza tecnologias de inteligência artificial de ponta. O projeto é projetado para profissionais de segurança da informação, pesquisadores e entusiastas que precisam de uma solução poderosa e flexível para realizar testes de penetração.
Você pode assistir ao vídeo Visão geral do PentAGI:

flowchart TB classDef person fill:#08427B,stroke:#073B6F,color:#fff classDef system fill:#1168BD,stroke:#0B4884,color:#fff classDef external fill:#666666,stroke:#0B4884,color:#fff
pentester["👤 Security Engineer
(User of the system)"]
pentagi["✨ PentAGI
(Autonomous penetration testing system)"]
target["🎯 target-system
(System under test)"]
llm["🧠 llm-provider
(OpenAI/Anthropic/Ollama/Bedrock/Gemini/Custom)"]
search["🔍 search-systems
(Google/DuckDuckGo/Tavily/Traversaal/Perplexity/Sploitus/Searxng)"]
langfuse["📊 langfuse-ui
(LLM Observability Dashboard)"]
grafana["📈 grafana
(System Monitoring Dashboard)"]
pentester --> |Uses HTTPS| pentagi
pentester --> |Monitors AI HTTPS| langfuse
pentester --> |Monitors System HTTPS| grafana
pentagi --> |Tests Various protocols| target
pentagi --> |Queries HTTPS| llm
pentagi --> |Searches HTTPS| search
pentagi --> |Reports HTTPS| langfuse
pentagi --> |Reports HTTPS| grafana
class pentester person
class pentagi system
class target,llm,search,langfuse,grafana external
linkStyle default stroke:#ffffff,color:#ffffff
<details>
<summary><b>Arquitetura do Contêiner</b> (clique para expandir)</summary>```mermaid
graph TB
subgraph Core Services
UI[Frontend UI<br/>React + TypeScript]
API[Backend API<br/>Go + GraphQL]
DB[(Vector Store<br/>PostgreSQL + pgvector)]
MQ[Task Queue<br/>Async Processing]
Agent[AI Agents<br/>Multi-Agent System]
end
subgraph Knowledge Graph
Graphiti[Graphiti<br/>Knowledge Graph API]
Neo4j[(Neo4j<br/>Graph Database)]
end
subgraph Monitoring
Grafana[Grafana<br/>Dashboards]
VictoriaMetrics[VictoriaMetrics<br/>Time-series DB]
Jaeger[Jaeger<br/>Distributed Tracing]
Loki[Loki<br/>Log Aggregation]
OTEL[OpenTelemetry<br/>Data Collection]
end
subgraph Analytics
Langfuse[Langfuse<br/>LLM Analytics]
ClickHouse[ClickHouse<br/>Analytics DB]
Redis[Redis<br/>Cache + Rate Limiter]
MinIO[MinIO<br/>S3 Storage]
end
subgraph Security Tools
Scraper[Web Scraper<br/>Isolated Browser]
PenTest[Security Tools<br/>20+ Pro Tools<br/>Sandboxed Execution]
end
UI --> |HTTP/WS| API
API --> |SQL| DB
API --> |Events| MQ
MQ --> |Tasks| Agent
Agent --> |Commands| PenTest
Agent --> |Queries| DB
Agent --> |Knowledge| Graphiti
Graphiti --> |Graph| Neo4j
API --> |Telemetry| OTEL
OTEL --> |Metrics| VictoriaMetrics
OTEL --> |Traces| Jaeger
OTEL --> |Logs| Loki
Grafana --> |Query| VictoriaMetrics
Grafana --> |Query| Jaeger
Grafana --> |Query| Loki
API --> |Analytics| Langfuse
Langfuse --> |Store| ClickHouse
Langfuse --> |Cache| Redis
Langfuse --> |Files| MinIO
classDef core fill:#f9f,stroke:#333,stroke-width:2px,color:#000
classDef knowledge fill:#ffa,stroke:#333,stroke-width:2px,color:#000
classDef monitoring fill:#bbf,stroke:#333,stroke-width:2px,color:#000
classDef analytics fill:#bfb,stroke:#333,stroke-width:2px,color:#000
classDef tools fill:#fbb,stroke:#333,stroke-width:2px,color:#000
class UI,API,DB,MQ,Agent core
class Graphiti,Neo4j knowledge
class Grafana,VictoriaMetrics,Jaeger,Loki,OTEL monitoring
class Langfuse,ClickHouse,Redis,MinIO analytics
class Scraper,PenTest tools
Flow {
string id PK
string name "Flow name"
string description "Flow description"
string status "active/completed/failed"
json parameters "Flow parameters"
timestamp created_at
timestamp updated_at
}
Task {
string id PK
string flow_id FK
string name "Task name"
string description "Task description"
string status "pending/running/done/failed"
json result "Task results"
timestamp created_at
timestamp updated_at
}
SubTask {
string id PK
string task_id FK
string name "Subtask name"
string description "Subtask description"
string status "queued/running/completed/failed"
string agent_type "researcher/developer/executor"
json context "Agent context"
timestamp created_at
timestamp updated_at
}
Action {
string id PK
string subtask_id FK
string type "command/search/analyze/etc"
string status "success/failure"
json parameters "Action parameters"
json result "Action results"
timestamp created_at
}
Artifact {
string id PK
string action_id FK
string type "file/report/log"
string path "Storage path"
json metadata "Additional info"
timestamp created_at
}
Memory {
string id PK
string action_id FK
string type "observation/conclusion"
vector embedding "Vector representation"
text content "Memory content"
timestamp created_at
}
subgraph "Working Memory"
Context[Current Context<br/>Task State]
Goals[Active Goals<br/>Objectives]
State[System State<br/>Resources]
end
subgraph "Episodic Memory"
Actions[Past Actions<br/>Commands History]
Results[Action Results<br/>Outcomes]
Patterns[Success Patterns<br/>Best Practices]
end
Context --> |Query| VS
VS --> |Retrieve| Context
Goals --> |Consult| KB
KB --> |Guide| Goals
State --> |Record| Actions
Actions --> |Learn| Patterns
Patterns --> |Store| VS
Tools --> |Inform| State
Results --> |Update| Tools
VS --> |Enhance| KB
KB --> |Index| VS
classDef ltm fill:#f9f,stroke:#333,stroke-width:2px,color:#000
classDef wm fill:#bbf,stroke:#333,stroke-width:2px,color:#000
classDef em fill:#bfb,stroke:#333,stroke-width:2px,color:#000
class VS,KB,Tools ltm
class Context,Goals,State wm
class Actions,Results,Patterns em
</details>
<details>
<summary><b>Chain Summarization</b> (clique para expandir)</summary>
O sistema de sumarização em cadeia gerencia o crescimento do contexto da conversa ao resumir seletivamente mensagens mais antigas. Isso é crucial para evitar que os limites de token sejam excedidos, mantendo a coerência da conversa.```mermaid
flowchart TD
A[Input Chain] --> B{Needs Summarization?}
B -->|No| C[Return Original Chain]
B -->|Yes| D[Convert to ChainAST]
D --> E[Apply Section Summarization]
E --> F[Process Oversized Pairs]
F --> G[Manage Last Section Size]
G --> H[Apply QA Summarization]
H --> I[Rebuild Chain with Summaries]
I --> J{Is New Chain Smaller?}
J -->|Yes| K[Return Optimized Chain]
J -->|No| C
classDef process fill:#bbf,stroke:#333,stroke-width:2px,color:#000
classDef decision fill:#bfb,stroke:#333,stroke-width:2px,color:#000
classDef output fill:#fbb,stroke:#333,stroke-width:2px,color:#000
class A,D,E,F,G,H,I process
class B,J decision
class C,K output
</details>
<details>
<summary><b>Interação com Agentes</b> (clique para expandir)</summary>```mermaid
sequenceDiagram
participant O as Orchestrator
participant R as Researcher
participant D as Developer
participant E as Executor
participant VS as Vector Store
participant KB as Knowledge Base
Note over O,KB: Flow Initialization
O->>VS: Query similar tasks
VS-->>O: Return experiences
O->>KB: Load relevant knowledge
KB-->>O: Return context
Note over O,R: Research Phase
O->>R: Analyze target
R->>VS: Search similar cases
VS-->>R: Return patterns
R->>KB: Query vulnerabilities
KB-->>R: Return known issues
R->>VS: Store findings
R-->>O: Research results
Note over O,D: Planning Phase
O->>D: Plan attack
D->>VS: Query exploits
VS-->>D: Return techniques
D->>KB: Load tools info
KB-->>D: Return capabilities
D-->>O: Attack plan
Note over O,E: Execution Phase
O->>E: Execute plan
E->>KB: Load tool guides
KB-->>E: Return procedures
E->>VS: Store results
E-->>O: Execution status
O algoritmo opera sobre uma representação estruturada de cadeias de conversa (ChainAST) que preserva os tipos de mensagens, incluindo chamadas de ferramenta e suas respostas. Todas as operações de sumarização mantêm o fluxo crítico da conversa enquanto reduzem o tamanho do contexto.
| Parâmetro | Variável de Ambiente | Padrão | Descrição |
|---|---|---|---|
| Preservar Último | SUMMARIZER_PRESERVE_LAST | true | Se deve manter todas as mensagens da última seção intactas |
| Usar Pares QA | SUMMARIZER_USE_QA | true | Se deve usar a estratégia de sumarização de pares QA |
| Sumarizar Humano em QA | SUMMARIZER_SUM_MSG_HUMAN_IN_QA | false | Se deve sumarizar mensagens humanas em pares QA |
| Tamanho da Última Seção | SUMMARIZER_LAST_SEC_BYTES | 51200 | Tamanho máximo em bytes para a última seção (50KB) |
| Tamanho Máx. do Par Corpo | SUMMARIZER_MAX_BP_BYTES | 16384 | Tamanho máximo em bytes para um único par de corpo (16KB) |
| Máx. Seções QA | SUMMARIZER_MAX_QA_SECTIONS | 10 | Número máximo de seções de pares QA a preservar |
| Tamanho Máx. QA | SUMMARIZER_MAX_QA_BYTES | 65536 | Tamanho máximo em bytes para seções de pares QA (64KB) |
| Manter Seções QA | SUMMARIZER_KEEP_QA_SECTIONS | 1 | Número de seções QA recentes a manter sem sumarização |
Instâncias de assistentes podem usar configurações de sumarização personalizadas para ajustar o comportamento de gerenciamento de contexto:
| Parâmetro | Variável de Ambiente | Padrão | Descrição |
|---|---|---|---|
| Preservar Último | ASSISTANT_SUMMARIZER_PRESERVE_LAST | true | Se deve preservar todas as mensagens na última seção do assistente |
| Tamanho da Última Seção | ASSISTANT_SUMMARIZER_LAST_SEC_BYTES | 76800 | Tamanho máximo em bytes para a última seção do assistente (75KB) |
| Tamanho Máx. do Par Corpo | ASSISTANT_SUMMARIZER_MAX_BP_BYTES | 16384 | Tamanho máximo em bytes para um único par de corpo no contexto do assistente (16KB) |
| Máx. Seções QA | ASSISTANT_SUMMARIZER_MAX_QA_SECTIONS | 7 | Número máximo de seções QA a preservar no contexto do assistente |
| Tamanho Máx. QA | ASSISTANT_SUMMARIZER_MAX_QA_BYTES | 76800 | Tamanho máximo em bytes para seções QA do assistente (75KB) |
| Manter Seções QA | ASSISTANT_SUMMARIZER_KEEP_QA_SECTIONS | 3 | Número de seções QA recentes a preservar sem sumarização |
A configuração do sumarizador de assistente fornece mais memória para retenção de contexto em comparação com as configurações globais, preservando mais histórico de conversa recente enquanto ainda garante uso eficiente de tokens.
SUMMARIZER_PRESERVE_LAST=true SUMMARIZER_USE_QA=true SUMMARIZER_SUM_MSG_HUMAN_IN_QA=false SUMMARIZER_LAST_SEC_BYTES=51200 SUMMARIZER_MAX_BP_BYTES=16384 SUMMARIZER_MAX_QA_SECTIONS=10 SUMMARIZER_MAX_QA_BYTES=65536 SUMMARIZER_KEEP_QA_SECTIONS=1
ASSISTANT_SUMMARIZER_PRESERVE_LAST=true ASSISTANT_SUMMARIZER_LAST_SEC_BYTES=76800 ASSISTANT_SUMMARIZER_MAX_BP_BYTES=16384 ASSISTANT_SUMMARIZER_MAX_QA_SECTIONS=7 ASSISTANT_SUMMARIZER_MAX_QA_BYTES=76800 ASSISTANT_SUMMARIZER_KEEP_QA_SECTIONS=3
</details>
<a id="advanced-agent-supervision"></a>
<details>
<summary><b>Supervisão Avançada de Agentes</b> (clique para expandir)</summary>
O PentAGI inclui mecanismos sofisticados de supervisão de agentes em múltiplas camadas para garantir execução eficiente de tarefas, evitar loops infinitos e fornecer recuperação inteligente de estados travados:
### Monitoramento de Execução (Beta)
- **Intervenção Automática do Mentor**: O agente conselheiro (mentor) é invocado automaticamente quando padrões de execução indicam possíveis problemas
- **Detecção de Padrões**: Monitora chamadas de ferramentas idênticas (limiar: 5, configurável) e total de chamadas de ferramentas (limiar: 10, configurável)
- **Análise de Progresso**: Avalia se o agente avança em direção ao objetivo da subtarefa, detecta loops e ineficiências
- **Estratégias Alternativas**: Recomenda diferentes abordagens quando a estratégia atual falha
- **Orientação para Recuperação de Informações**: Sugere buscar soluções estabelecidas em vez de reinventar
- **Formato de Resposta Aprimorado**: As respostas das ferramentas incluem seções `<original_result>` e `<mentor_analysis>`
- **Configurável**: Ative via `EXECUTION_MONITOR_ENABLED` (padrão: false), personalize limites com `EXECUTION_MONITOR_SAME_TOOL_LIMIT` e `EXECUTION_MONITOR_TOTAL_TOOL_LIMIT`
**Melhor para**: Modelos menores (< 32B parâmetros), cenários de ataque complexos que exigem orientação contínua, prevenindo que agentes fiquem presos em uma única abordagem
**Impacto no Desempenho**: Aumento de 2-3x no tempo de execução e uso de tokens, mas proporciona **melhoria de 2x na qualidade dos resultados** com base em testes com Qwen3.5-27B-FP8
### Planejamento Inteligente de Tarefas (Beta)
- **Decomposição Automatizada**: O planejador (conselheiro em modo de planejamento) gera 3-7 etapas específicas e acionáveis antes de os agentes especialistas começarem o trabalho
- **Planos Conscientes do Contexto**: Analisa o contexto completo de execução por meio do agente enriquecedor para criar planos informados
- **Atribuição Estruturada**: A solicitação original é encapsulada em estrutura `<task_assignment>` com plano de execução e instruções
- **Gerenciamento de Escopo**: Evita aumento de escopo mantendo os agentes focados apenas na subtarefa atual
- **Instruções Enriquecedoras**: Os planos destacam ações críticas, possíveis armadilhas e pontos de verificação
- **Configurável**: Ative via `AGENT_PLANNING_STEP_ENABLED` (padrão: false)
**Melhor para**: Modelos < 32B parâmetros, fluxos de trabalho complexos de teste de penetração, melhorando taxas de sucesso em tarefas sofisticadas
**Configuração Aprimorada do Conselheiro**: Funciona excepcionalmente bem quando o agente conselheiro usa um modelo mais forte ou configurações aprimoradas. Exemplo: usar o mesmo modelo base com modo de raciocínio máximo para o conselheiro (veja [`vllm-qwen3.5-27b-fp8.provider.yml`](https://github.com/vxcontrol/pentagi/blob/HEAD/examples/configs/vllm-qwen3.5-27b-fp8.provider.yml)) permite análise abrangente de tarefas e planejamento estratégico a partir da mesma arquitetura de modelo.
**Impacto no Desempenho**: Adiciona overhead de planejamento, mas melhora significativamente as taxas de conclusão e reduz trabalho redundante
### Limites de Chamadas de Ferramentas (Sempre Ativo)
- **Limites Rígidos**: Evitam execuções descontroladas independentemente do modo de supervisão
- **Diferenciado por Tipo de Agente**:
- Agentes gerais (Assistente, Agente Principal, Pentester, Codificador, Instalador): `MAX_GENERAL_AGENT_TOOL_CALLS` (padrão: 100)
- Agentes limitados (Pesquisador, Enriquecedor, Memorista, Gerador, Relator, Conselheiro, Refletor, Planejador): `MAX_LIMITED_AGENT_TOOL_CALLS` (padrão: 20)
- **Término Gracioso**: O refletor guia os agentes para a conclusão adequada quando se aproximam dos limites
- **Proteção de Recursos**: Garante estabilidade do sistema e evita esgotamento de recursos
### Integração do Refletor (Sempre Ativo)
- **Correção Automática**: Invocado quando o LLM falha ao gerar chamadas de ferramentas após 3 tentativas
- **Orientação Estratégica**: Analisa falhas e guia os agentes para o uso adequado de ferramentas ou ferramentas de barreira (`done`, `ask`)
- **Mecanismo de Recuperação**: Fornece orientação contextual com base em padrões específicos de falha
- **Aplicação de Limites**: Coordena o término gracioso quando os limites de chamadas de ferramentas são atingidos
### Recomendações para Modelos Open Source
**Essencial para Modelos < 32B Parâmetros**:
Testes com Qwen3.5-27B-FP8 demonstram que ativar tanto o Monitoramento de Execução quanto o Planejamento de Tarefas é **essencial** para modelos open source menores:
- **Melhoria de Qualidade**: Resultados 2x melhores em comparação com a execução base sem supervisão
- **Prevenção de Loops**: Reduz significativamente loops infinitos e trabalho redundante
- **Diversidade de Ataques**: Incentiva a exploração de múltiplos vetores de ataque em vez de fixar-se em uma única abordagem
- **Implantações Isoladas (Air-Gapped)**: Permite testes de penetração autônomos de nível profissional em ambientes de rede fechados com inferência LLM local
**Compensações**:
- Consumo de tokens: aumento de 2-3x devido a invocações do mentor/planejador
- Tempo de execução: 2-3x maior devido a etapas de análise e planejamento
- Qualidade dos resultados: melhoria de 2x em integridade, precisão e cobertura de ataque
- Requisitos de modelo: Funciona melhor quando o conselheiro usa configuração aprimorada (parâmetros de raciocínio mais altos, variante de modelo mais forte ou modelo diferente)
**Estratégia de Configuração**:
Para desempenho ideal com modelos menores, configure o agente conselheiro com configurações aprimoradas:
- Use o mesmo modelo com modo de raciocínio máximo (exemplo: [`vllm-qwen3.5-27b-fp8.provider.yml`](https://github.com/vxcontrol/pentagi/blob/HEAD/examples/configs/vllm-qwen3.5-27b-fp8.provider.yml))
- Ou use um modelo mais forte para o conselheiro enquanto mantém o modelo base para outros agentes
- Ajuste os limites de monitoramento com base na complexidade da tarefa e nas capacidades do modelo
</details>
A arquitetura do PentAGI é projetada para ser modular, escalável e segura. Aqui estão os componentes principais:
1. **Serviços Principais**
- Interface do Frontend: Interface web baseada em React com TypeScript para segurança de tipos
- API de Backend: APIs REST e GraphQL em Go com autenticação por token Bearer para acesso programático
- Armazenamento de Vetores: PostgreSQL com pgvector para busca semântica e armazenamento de memória
- Fila de Tarefas: Sistema de processamento assíncrono de tarefas para operação confiável
- Agente de IA: Sistema multiagente com funções especializadas para testes eficientes
2. **Grafo de Conhecimento**
- Graphiti: API de grafo de conhecimento para rastreamento de relações semânticas e compreensão contextual
- Neo4j: Banco de dados de grafos para armazenar e consultar relações entre entidades, ações e resultados
- Captura automática de respostas de agentes e execuções de ferramentas para construir base de conhecimento abrangente
3. **Pilha de Monitoramento**
- OpenTelemetry: Coleta e correlação unificada de dados de observabilidade
- Grafana: Visualização em tempo real e painéis de alerta
- VictoriaMetrics: Armazenamento de métricas de série temporal de alto desempenho
- Jaeger: Rastreamento distribuído de ponta a ponta para depuração
- Loki: Agregação e análise de logs escalável
4. **Plataforma de Analytics**
- Langfuse: Observabilidade avançada de LLM e análise de desempenho
- ClickHouse: Data warehouse analítico orientado a colunas
- Redis: Cache de alta velocidade e limitação de taxa
- MinIO: Armazenamento de objetos compatível com S3 para artefatos
5. **Ferramentas de Segurança**
- Raspador Web: Ambiente de navegador isolado para interação web segura
- Ferramentas de Teste de Penetração: Conjunto abrangente de mais de 20 ferramentas de segurança profissionais
- Execução em Sandbox: Todas as operações executadas em contêineres isolados
6. **Sistemas de Memória**
- Memória de Longo Prazo: Armazenamento persistente de conhecimento e experiências
- Memória de Trabalho: Contexto ativo e objetivos para operações atuais
- Memória Episódica: Ações históricas e padrões de sucesso
- Base de Conhecimento: Expertise de domínio estruturada e capacidades de ferramentas
- Gerenciamento de Contexto: Gerencia inteligentemente o crescimento do contexto do LLM usando sumarização em cadeia
O sistema usa contêineres Docker para isolamento e implantação fácil, com redes separadas para serviços principais, monitoramento e analytics para garantir limites de segurança adequados. Cada componente é projetado para escalar horizontalmente e pode ser configurado para alta disponibilidade em ambientes de produção.
## Início Rápido
### Requisitos do Sistema
- Docker e Docker Compose (ou Podman - veja [Configuração do Podman](#executando-pentagi-com-podman))
- Mínimo de 2 vCPU
- Mínimo de 4GB de RAM
- 20GB de espaço livre em disco
- Acesso à Internet para baixar imagens e atualizações
### Usando o Instalador (Recomendado)
O PentAGI fornece um instalador interativo com uma interface de usuário baseada em terminal para configuração e implantação simplificadas. O instalador guia você através de verificações do sistema, configuração do provedor LLM, configuração do mecanismo de busca e fortalecimento de segurança.
**Plataformas Suportadas:**
- **Linux**: amd64 [download](https://pentagi.com/downloads/linux/amd64/installer-latest.zip) | arm64 [download](https://pentagi.com/downloads/linux/arm64/installer-latest.zip)
- **Windows**: amd64 [download](https://pentagi.com/downloads/windows/amd64/installer-latest.zip)
- **macOS**: amd64 (Intel) [download](https://pentagi.com/downloads/darwin/amd64/installer-latest.zip) | arm64 (M-series) [download](https://pentagi.com/downloads/darwin/arm64/installer-latest.zip)
**Instalação Rápida (Linux amd64):**```bash
# Create installation directory
mkdir -p pentagi && cd pentagi
# Download installer
wget -O installer.zip https://pentagi.com/downloads/linux/amd64/installer-latest.zip
# Extract
unzip installer.zip
# Run interactive installer
./installer
Pré-requisitos & Permissões:
O instalador requer privilégios apropriados para interagir com a API do Docker para operação adequada. Por padrão, ele usa o socket Docker (/var/run/docker.sock) que requer um dos seguintes:
Opção 1 (Recomendado para produção): Execute o instalador como root: ```bash sudo ./installer
Opção 2 (Ambientes de desenvolvimento): Conceda acesso ao socket Docker ao seu usuário adicionando-o ao grupo docker: ```bash
sudo usermod -aG docker $USER
newgrp docker
docker ps
⚠️ Nota de Segurança: Adicionar um usuário ao grupo docker concede privilégios equivalentes a root. Faça isso apenas para usuários confiáveis em ambientes controlados. Para implantações em produção, considere usar o modo Docker sem root ou executar o instalador com sudo.
O instalador irá:
.env com valores padrão otimizadosO console web do PentAGI já gerencia várias áreas de configurações após o servidor estar em execução:
As seguintes áreas de configuração ainda precisam ser definidas no servidor por meio de variáveis de ambiente, arquivos compose ou arquivos de configuração montados:
OLLAMA_SERVER_CONFIG_PATH e LLM_SERVER_CONFIG_PATH.DUCKDUCKGO_*, GOOGLE_*, TAVILY_API_KEY, TRAVERSAAL_API_KEY, PERPLEXITY_*, SEARXNG_* e SPLOITUS_ENABLED.Para Produção e Segurança Aprimorada:
Para implantações em produção ou ambientes sensíveis à segurança, recomendamos fortemente o uso de uma arquitetura distribuída de dois nós, onde as operações do worker são isoladas em um servidor separado. Isso evita problemas de execução de código não confiável e acesso à rede em seu sistema principal.
Consulte o guia detalhado: Configuração do Nó Worker
A configuração de dois nós oferece:
2. Copie `.env.example` para `.env` ou faça o download:```bash
curl -o .env https://raw.githubusercontent.com/vxcontrol/pentagi/master/.env.example
example.custom.provider.yml, example.ollama.provider.yml) ou baixe-os:```bash
curl -o example.custom.provider.yml https://raw.githubusercontent.com/vxcontrol/pentagi/master/examples/configs/custom-openai.provider.yml
curl -o example.ollama.provider.yml https://raw.githubusercontent.com/vxcontrol/pentagi/master/examples/configs/ollama-llama318b.provider.yml4. Preencha as chaves de API necessárias no arquivo `.env`.```bash
# Required: At least one of these LLM providers
OPEN_AI_KEY=your_openai_key
ANTHROPIC_API_KEY=your_anthropic_key
GEMINI_API_KEY=your_gemini_key
# Optional: AWS Bedrock provider (enterprise-grade models)
BEDROCK_REGION=us-east-1
# Choose one authentication method:
BEDROCK_DEFAULT_AUTH=true # Option 1: Use AWS SDK default credential chain (recommended for EC2/ECS)
# BEDROCK_BEARER_TOKEN=your_bearer_token # Option 2: Bearer token authentication
# BEDROCK_ACCESS_KEY_ID=your_aws_access_key # Option 3: Static credentials
# BEDROCK_SECRET_ACCESS_KEY=your_aws_secret_key
# Optional: Ollama provider (local or cloud)
# OLLAMA_SERVER_URL=http://ollama-server:11434 # Local server
# OLLAMA_SERVER_URL=https://ollama.com # Cloud service
# OLLAMA_SERVER_API_KEY=your_ollama_cloud_key # Required for cloud, empty for local
# Optional: Chinese AI providers
# DEEPSEEK_API_KEY=your_deepseek_key # DeepSeek (strong reasoning)
# GLM_API_KEY=your_glm_key # GLM (Zhipu AI)
# KIMI_API_KEY=your_kimi_key # Kimi (Moonshot AI, ultra-long context)
# QWEN_API_KEY=your_qwen_key # Qwen (Alibaba Cloud, multimodal)
# Optional: Local LLM provider (zero-cost inference)
OLLAMA_SERVER_URL=http://localhost:11434
OLLAMA_SERVER_MODEL=your_model_name
# Optional: Additional search capabilities
DUCKDUCKGO_ENABLED=true
DUCKDUCKGO_REGION=us-en
DUCKDUCKGO_SAFESEARCH=
DUCKDUCKGO_TIME_RANGE=
SPLOITUS_ENABLED=true
GOOGLE_API_KEY=your_google_key
GOOGLE_CX_KEY=your_google_cx
TAVILY_API_KEY=your_tavily_key
TRAVERSAAL_API_KEY=your_traversaal_key
PERPLEXITY_API_KEY=your_perplexity_key
PERPLEXITY_MODEL=sonar-pro
PERPLEXITY_CONTEXT_SIZE=medium
# Searxng meta search engine (aggregates results from multiple sources)
SEARXNG_URL=http://your-searxng-instance:8080
SEARXNG_CATEGORIES=general
SEARXNG_LANGUAGE=
SEARXNG_SAFESEARCH=0
SEARXNG_TIME_RANGE=
SEARXNG_TIMEOUT=
## Graphiti knowledge graph settings
GRAPHITI_ENABLED=true
GRAPHITI_TIMEOUT=30
GRAPHITI_URL=http://graphiti:8000
GRAPHITI_MODEL_NAME=gpt-5-mini
# Neo4j settings (used by Graphiti stack)
NEO4J_USER=neo4j
NEO4J_DATABASE=neo4j
NEO4J_PASSWORD=devpassword
NEO4J_URI=bolt://neo4j:7687
# Assistant configuration
ASSISTANT_USE_AGENTS=false # Default value for agent usage when creating new assistants
.env para melhorar a segurança.COOKIE_SIGNING_SALT - Sal para assinatura de cookies, altere para um valor aleatórioPUBLIC_URL - URL pública do seu servidor (ex.: https://pentagi.example.com)SERVER_SSL_CRT e SERVER_SSL_KEY - Caminhos personalizados para seu certificado SSL e chave existentes para HTTPS (esses caminhos devem ser usados no arquivo docker-compose.yml para montar como volumes)SCRAPER_PUBLIC_URL - URL pública para o scraper se você quiser usar um servidor scraper diferente para URLs públicasSCRAPER_PRIVATE_URL - URL privada para o scraper (servidor scraper local no arquivo docker-compose.yml para acessá-lo a URLs locais)PENTAGI_POSTGRES_USER e PENTAGI_POSTGRES_PASSWORD - Credenciais do PostgreSQLNEO4J_USER e NEO4J_PASSWORD - Credenciais do Neo4j (para o grafo de conhecimento Graphiti).env se você quiser usá-lo no VSCode ou outras IDEs como opção envFile:```bash
perl -i -pe 's/\s+#.*$//' .env7. Execute o stack PentAGI:```bash
curl -O https://raw.githubusercontent.com/vxcontrol/pentagi/master/docker-compose.yml
docker compose up -d
Visite localhost:8443 para acessar a Interface Web do PentAGI (padrão é [email protected] / admin)
O PentAGI não expõe auto-cadastro público na página de login. Uma instalação nova cria a conta de administrador local padrão:
[email protected]adminAo primeiro login, altere a senha padrão antes de usar a instância para trabalho real. Se a senha do administrador for perdida posteriormente, use o menu de manutenção do instalador para redefinir a senha da conta padrão [email protected].
Para configurações multi-usuário, um administrador autenticado pode gerenciar usuários locais através da API REST de Usuários (/api/v1/users/). A interface OpenAPI está disponível em https://localhost:8443/api/v1/swagger/index.html após a instância estar em execução.
[!NOTE] Se você encontrou um erro sobre
pentagi-networkouobservability-networkoulangfuse-network, você precisa executardocker-compose.ymlprimeiro para criar essas redes e depois executardocker-compose-langfuse.yml,docker-compose-graphiti.ymledocker-compose-observability.ymlpara usar os serviços Langfuse, Graphiti e Observability.Você precisa configurar pelo menos um provedor de Modelo de Linguagem (OpenAI, Anthropic, Gemini, AWS Bedrock ou Ollama) para usar o PentAGI. AWS Bedrock fornece acesso de nível empresarial a múltiplos modelos fundacionais de empresas líderes de IA, enquanto o Ollama oferece inferência local sem custo se você tiver recursos computacionais suficientes. Chaves de API adicionais para mecanismos de busca são opcionais, mas recomendadas para melhores resultados.
Para implantação totalmente local com modelos avançados: Consulte nosso guia completo sobre Executando PentAGI com vLLM e Qwen3.5-27B-FP8 para uma configuração local de LLM de nível de produção. Esta configuração atinge ~13.000 TPS para processamento de prompt e ~650 TPS para conclusão em 4× GPUs RTX 5090, suportando 12+ fluxos concorrentes com independência total de provedores de nuvem.
As variáveis de ambiente
LLM_SERVER_*são um recurso experimental e serão alteradas no futuro. No momento, você pode usá-las para especificar uma URL de servidor LLM personalizada e um modelo para todos os tipos de agente.
PROXY_URLé uma URL de proxy global para todos os provedores de LLM e sistemas de busca externos. Você pode usá-la para isolamento de redes externas.O arquivo
docker-compose.ymlexecuta o serviço PentAGI como usuário root porque precisa de acesso ao docker.sock para gerenciamento de contêineres. Se você estiver usando conexão de rede TCP/IP para o Docker em vez do arquivo socket, pode remover os privilégios root e usar o usuário padrãopentagipara melhor segurança.
Por padrão, o PentAGI vincula-se a 127.0.0.1 (apenas localhost) por segurança. Para acessar o PentAGI de outras máquinas em sua rede, você precisa configurar o acesso externo.
.env com o endereço IP do seu servidor:```bashPENTAGI_LISTEN_IP=0.0.0.0 PENTAGI_LISTEN_PORT=8443
PUBLIC_URL=https://192.168.1.100:8443
CORS_ORIGINS=https://localhost:8443,https://192.168.1.100:8443
> [!IMPORTANT]
> - Substitua `192.168.1.100` pelo endereço IP real do seu servidor
> - NÃO use `0.0.0.0` em `PUBLIC_URL` ou `CORS_ORIGINS` - use o endereço IP real
> - Inclua tanto localhost quanto o IP do seu servidor em `CORS_ORIGINS` para flexibilidade
2. **Recrie os contêineres** para aplicar as alterações:```bash
docker compose down
docker compose up -d --force-recreate
Você deve ver `0.0.0.0:8443->8443/tcp` ou `:::8443->8443/tcp`.
Se você vir `127.0.0.1:8443->8443/tcp`, a variável de ambiente não foi reconhecida. Neste caso, edite diretamente `docker-compose.yml` linha 31:```yaml
ports:
- "0.0.0.0:8443:8443"
Depois, recrie os containers novamente.
sudo ufw allow 8443/tcp sudo ufw reload
sudo firewall-cmd --permanent --add-port=8443/tcp sudo firewall-cmd --reload
5. **Acessar o PentAGI:**
- **Acesso local:** `https://localhost:8443`
- **Acesso pela rede:** `https://your-server-ip:8443`
> [!NOTA]
> Você precisará aceitar o aviso de certificado SSL autoassinado no seu navegador ao acessar via endereço IP.
---
### Executando PentAGI com Podman
O PentAGI oferece suporte total ao Podman como alternativa ao Docker. No entanto, ao usar o **Podman em modo rootless**, o serviço scraper requer configuração especial porque contêineres rootless não podem vincular portas privilegiadas (portas abaixo de 1024).
#### Configuração Rootless do Podman
A configuração padrão do scraper usa a porta 443 (HTTPS), que é uma porta privilegiada. Para o Podman rootless, reconfigure o scraper para usar uma porta não privilegiada:
**1. Edite `docker-compose.yml`** - modifique o serviço `scraper` (por volta da linha 199):```yaml
scraper:
image: vxcontrol/scraper:latest
restart: unless-stopped
container_name: scraper
hostname: scraper
expose:
- 3000/tcp # Changed from 443 to 3000
ports:
- "${SCRAPER_LISTEN_IP:-127.0.0.1}:${SCRAPER_LISTEN_PORT:-9443}:3000" # Map to port 3000
environment:
- MAX_CONCURRENT_SESSIONS=${LOCAL_SCRAPER_MAX_CONCURRENT_SESSIONS:-10}
- USERNAME=${LOCAL_SCRAPER_USERNAME:-someuser}
- PASSWORD=${LOCAL_SCRAPER_PASSWORD:-somepass}
logging:
options:
max-size: 50m
max-file: "7"
volumes:
- scraper-ssl:/usr/src/app/ssl
networks:
- pentagi-network
shm_size: 2g
2. Atualize o arquivo .env - altere a URL do scraper para usar HTTP e a porta 3000:```bash
SCRAPER_PRIVATE_URL=http://someuser:somepass@scraper:3000/ LOCAL_SCRAPER_USERNAME=someuser LOCAL_SCRAPER_PASSWORD=somepass
> [!IMPORTANT]
> Principais alterações para Podman:
> - Use **HTTP** em vez de HTTPS para `SCRAPER_PRIVATE_URL`
> - Use a porta **3000** em vez de 443
> - Altere o `expose` interno para `3000/tcp`
> - Atualize o mapeamento de portas para usar `3000` em vez de `443`
**3. Recrie os containers:**```bash
podman-compose down
podman-compose up -d --force-recreate
4. Testar conectividade do scraper:```bash
podman exec -it pentagi wget -O- "http://someuser:somepass@scraper:3000/html?url=http://example.com"
Se você vir saída HTML, o scraper está funcionando corretamente.
#### Modo Rootful do Podman
Se você estiver executando o Podman em modo rootful (com sudo), pode usar a configuração padrão sem modificações. O scraper funcionará na porta 443 conforme pretendido.
#### Compatibilidade com Docker
Todas as configurações do Podman permanecem totalmente compatíveis com Docker. A abordagem de porta não privilegiada funciona de forma idêntica em ambos os runtimes de contêiner.
### Configuração do Assistente
O PentAGI permite configurar o comportamento padrão para assistentes:
| Variável | Padrão | Descrição |
| -------------------- | ------- | ------------------------------------------------------------------ |
| `ASSISTANT_USE_AGENTS` | `false` | Controla o valor padrão para uso de agentes ao criar novos assistentes |
A configuração `ASSISTANT_USE_AGENTS` afeta o estado inicial da opção "Usar Agentes" ao criar um novo assistente na interface:
- `false` (padrão): Novos assistentes são criados com delegação de agentes desativada por padrão
- `true`: Novos assistentes são criados com delegação de agentes ativada por padrão
Note que os usuários podem sempre sobrescrever essa configuração alternando o botão "Usar Agentes" na interface ao criar ou editar um assistente. Esta variável de ambiente controla apenas o estado padrão inicial.
## Como Usar o PentAGI Após o Login
Assim que o stack estiver em execução e você puder fazer login na interface web, a maneira mais rápida de começar é através do fluxo de trabalho Flows.
### 1. Crie seu primeiro fluxo
1. Abra **Flows** na barra lateral.
2. Clique em **Novo Fluxo**.
3. Escolha o modo que se adequa ao seu objetivo:
- **Automação**: execução totalmente autônoma para um objetivo de teste que você deseja que o PentAGI realize do início ao fim
- **Assistente**: ajuda interativa de ida e volta quando você deseja conduzir a investigação passo a passo. Neste modo, você também pode ativar a opção **Usar Agentes** para permitir que o PentAGI delegue subtarefas a subagentes especializados para investigações mais complexas.
4. Selecione o provedor LLM que deseja usar para este fluxo.
5. Descreva o alvo e o objetivo em linguagem natural na caixa de mensagem.
Bons prompts iniciais geralmente incluem:
- o sistema alvo ou URL
- o tipo de avaliação que você deseja
- quaisquer limitações de escopo ou regras de engajamento
- o resultado que você espera, como um relatório de vulnerabilidade ou validação de uma hipótese
Exemplo:```text
Assess https://target.example for common web application vulnerabilities. Focus on authentication, file handling, and injection issues. Stay within the provided target only and summarize confirmed findings with reproduction steps.
Apenas teste sistemas que você possui ou que estão explicitamente autorizados a avaliar. Consulte EULA.md para os requisitos de uso aceitável.
O novo formulário de fluxo inclui um selecionador de modelos, que pode preencher previamente a caixa de mensagem com um modelo de fluxo salvo. Isso é útil quando você realiza avaliações semelhantes repetidamente.
examples/prompts/base_web_pentest.md se precisar de uma base prática para testes webModelos são pontos de partida. Você não precisa de sintaxe especial para usar o PentAGI: instruções simples em linguagem natural funcionam bem, desde que o alvo e o objetivo estejam claros.
Após enviar o fluxo, o PentAGI abre a página do fluxo automaticamente.
Assim que o fluxo tiver resultados suficientes, use o menu Relatório na página do fluxo para:
Cada fluxo também inclui uma visualização Assistente para orientação interativa. Isso é útil quando a execução autônoma descobre algo que precisa de direcionamento humano em vez de uma reinicialização forçada.
Cada fluxo tem sua própria guia Arquivos na página do fluxo. Os arquivos têm escopo definido pelo fluxo pai: eles residem em {dataDir}/flow-{id}-data/ no host e nunca vazam para outros fluxos.
A guia expõe três fontes de arquivos:
uploads/): arquivos que você fornece pela interface web. Use a ação Fazer upload de arquivos ou arraste e solte diretamente na guia Arquivos. Enquanto o contêiner do agente estiver em execução, os arquivos enviados também são copiados para dentro dele em /work/uploads/ para que o agente possa lê-los com ferramentas normais do shell.resources/): arquivos anexados da sua biblioteca de recursos de usuário salva por meio de Anexar recursos da biblioteca. Os recursos anexados são copiados para o fluxo e copiados para o contêiner em execução em /work/resources/.container/): snapshots extraídos do contêiner do agente em execução por meio de Extrair arquivo ou diretório do contêiner. Eles são somente leitura no lado do fluxo e nunca são enviados de volta ao contêiner.As ações por arquivo na guia Arquivos incluem Baixar, Copiar caminho, Salvar como recurso (promover um arquivo de fluxo para sua biblioteca de recursos reutilizáveis) e Excluir. A ação Extrair está desabilitada quando o contêiner não está em execução, com a dica "Contêiner não está em execução".
Os arquivos enviados e os recursos anexados são listados automaticamente nos prompts do sistema do agente por meio da variável de template {{.UserFiles}}, que renderiza um bloco XML compacto <task_files> (com seções aninhadas <uploads> e <resources>), para que o assistente e os agentes de automação possam referenciá-los pelo caminho sem que você cole o conteúdo no chat. Os snapshots do contêiner são visíveis apenas na interface e não são injetados automaticamente de volta no prompt.
Limites e limitações atuais a serem considerados:
/work/uploads/ e /work/resources/; arquivos gravados em outros caminhos do contêiner não são espelhados automaticamente de volta ao modelo de arquivo do fluxo. Snapshots do contêiner podem originar-se de qualquer caminho do contêiner que você extrair (por exemplo, /etc/...) e são armazenados em cache no lado do fluxo em container/; eles não são copiados de volta para o contêiner.flow-{id}-data/ do fluxo no disco. Os operadores ainda devem limpar manualmente o diretório de dados se quiserem recuperar espaço.Para testes iniciais, comece com um alvo restrito e um objetivo claro. Isso torna a saída mais fácil de revisar e ajuda a refinar seus prompts antes de executar avaliações maiores.
O PentAGI fornece acesso programático abrangente por meio de APIs REST e GraphQL, permitindo que você integre fluxos de trabalho de teste de penetração em suas automações, processos de CI/CD e aplicativos personalizados.
Os tokens de API são gerenciados por meio da interface web do PentAGI:
Cada token está associado à sua conta de usuário e herda as permissões da sua função.
Inclua o token de API no cabeçalho Authorization das suas requisições HTTP:```bash
curl -X POST https://your-pentagi-instance:8443/api/v1/graphql
-H "Authorization: Bearer YOUR_API_TOKEN"
-H "Content-Type: application/json"
-d '{"query": "{ flows { id title status } }"}'
curl https://your-pentagi-instance:8443/api/v1/flows
-H "Authorization: Bearer YOUR_API_TOKEN"
### Exploração e Teste de API
PentAGI fornece documentação interativa para explorar e testar endpoints de API:
#### GraphQL Playground
Acesse o GraphQL Playground em `https://your-pentagi-instance:8443/api/v1/graphql/playground`
1. Clique na aba **HTTP Headers** na parte inferior
2. Adicione seu cabeçalho de autorização: ```json
{
"Authorization": "Bearer YOUR_API_TOKEN"
}
Acesse a documentação da API REST em https://your-pentagi-instance:8443/api/v1/swagger/index.html
Bearer YOUR_API_TOKENVocê pode gerar clientes de API com segurança de tipos para sua linguagem de programação preferida usando os arquivos de esquema incluídos no PentAGI:
O esquema GraphQL está disponível em:
schema.graphqlsbackend/pkg/graph/schema.graphqls no repositórioGere clientes usando ferramentas como:
A especificação OpenAPI está disponível em:
https://your-pentagi-instance:8443/api/v1/swagger/doc.jsonbackend/pkg/server/docs/swagger.yamlGere clientes usando:
class PentAGIClient: def init(self, base_url, api_token): self.base_url = base_url self.headers = { "Authorization": f"Bearer {api_token}", "Content-Type": "application/json" }
def create_flow(self, provider, target):
query = """
mutation CreateFlow($provider: String!, $input: String!) {
createFlow(modelProvider: $provider, input: $input) {
id
title
status
}
}
"""
response = requests.post(
f"{self.base_url}/api/v1/graphql",
json={
"query": query,
"variables": {
"provider": provider,
"input": target
}
},
headers=self.headers
)
return response.json()
def get_flows(self):
response = requests.get(
f"{self.base_url}/api/v1/flows",
headers=self.headers
)
return response.json()
client = PentAGIClient( "https://your-pentagi-instance:8443", "your_api_token_here" )
flow = client.create_flow("openai", "Scan https://example.com for vulnerabilities") print(f"Created flow: {flow}")
flows = client.get_flows() print(f"Total flows: {len(flows['flows'])}")
</details>
<details>
<summary><b>Exemplo de Cliente TypeScript</b></summary>```typescript
import axios, { AxiosInstance } from 'axios';
interface Flow {
id: string;
title: string;
status: string;
createdAt: string;
}
class PentAGIClient {
private client: AxiosInstance;
constructor(baseURL: string, apiToken: string) {
this.client = axios.create({
baseURL: `${baseURL}/api/v1`,
headers: {
'Authorization': `Bearer ${apiToken}`,
'Content-Type': 'application/json',
},
});
}
async createFlow(provider: string, input: string): Promise<Flow> {
const query = `
mutation CreateFlow($provider: String!, $input: String!) {
createFlow(modelProvider: $provider, input: $input) {
id
title
status
createdAt
}
}
`;
const response = await this.client.post('/graphql', {
query,
variables: { provider, input },
});
return response.data.data.createFlow;
}
async getFlows(): Promise<Flow[]> {
const response = await this.client.get('/flows');
return response.data.flows;
}
async getFlow(flowId: string): Promise<Flow> {
const response = await this.client.get(`/flows/${flowId}`);
return response.data;
}
}
// Usage
const client = new PentAGIClient(
'https://your-pentagi-instance:8443',
'your_api_token_here'
);
// Create a new flow
const flow = await client.createFlow(
'openai',
'Perform penetration test on https://example.com'
);
console.log('Created flow:', flow);
// List all flows
const flows = await client.getFlows();
console.log(`Total flows: ${flows.length}`);
Ao trabalhar com tokens de API:
A lista de tokens mostra:
Ao usar provedores de LLM personalizados com as variáveis LLM_SERVER_*, você pode ajustar o formato de raciocínio usado nas requisições.
[!TIP] Para implantações locais de nível de produção, considere usar vLLM com Qwen3.5-27B-FP8 para desempenho ideal. Veja nosso guia completo de implantação que inclui requisitos de hardware, modelos de configuração (modo de pensamento e modo sem pensamento) e benchmarks de desempenho mostrando 13K TPS de processamento de prompt em 4× RTX 5090 GPUs.
| Variável | Padrão | Descrição |
|---|---|---|
LLM_SERVER_URL | URL base para o endpoint da API de LLM personalizada | |
LLM_SERVER_KEY | Chave de API para o provedor de LLM personalizado | |
LLM_SERVER_MODEL | Modelo padrão a ser usado (pode ser sobrescrito na configuração do provedor) | |
LLM_SERVER_CONFIG_PATH | Caminho para o arquivo de configuração YAML para modelos específicos de agente | |
LLM_SERVER_PROVIDER | Prefixo do nome do provedor para nomes de modelos (ex.: openrouter, deepseek para proxy LiteLLM) | |
LLM_SERVER_LEGACY_REASONING | false | Controla o formato de raciocínio nas requisições da API |
LLM_SERVER_PRESERVE_REASONING | false | Preserva o conteúdo de raciocínio em conversas de múltiplas rodadas (exigido por alguns provedores) |
A configuração LLM_SERVER_PROVIDER é particularmente útil ao usar proxy LiteLLM, que adiciona um prefixo de provedor aos nomes dos modelos. Por exemplo, ao conectar-se à API Moonshot através do LiteLLM, modelos como kimi-2.5 tornam-se moonshot/kimi-2.5. Ao definir LLM_SERVER_PROVIDER=moonshot, você pode usar o mesmo arquivo de configuração do provedor tanto para acesso direto à API quanto para acesso via proxy LiteLLM sem modificações.
A configuração LLM_SERVER_LEGACY_REASONING afeta como os parâmetros de raciocínio são enviados ao LLM:
false (padrão): Usa formato moderno onde o raciocínio é enviado como um objeto estruturado com parâmetro max_tokenstrue: Usa formato legado com parâmetro reasoning_effort baseado em stringEssa configuração é importante ao trabalhar com diferentes provedores de LLM, pois eles podem esperar formatos de raciocínio diferentes em suas requisições de API. Se você encontrar erros relacionados a raciocínio com provedores personalizados, tente alterar esta configuração.
A configuração LLM_SERVER_PRESERVE_REASONING controla se o conteúdo de raciocínio é preservado em conversas de múltiplas rodadas:
false (padrão): O conteúdo de raciocínio não é preservado no histórico da conversatrue: O conteúdo de raciocínio é preservado e enviado em chamadas subsequentes da APIEsta configuração é exigida por alguns provedores de LLM (ex.: Moonshot) que retornam erros como "thinking is enabled but reasoning_content is missing in assistant tool call message" quando o conteúdo de raciocínio não é incluído em conversas de múltiplas rodadas. Ative esta configuração se seu provedor exigir que o conteúdo de raciocínio seja preservado.
O PentAGI suporta Ollama tanto para inferência LLM local (custo zero, privacidade aprimorada) quanto para Ollama Cloud (serviço gerenciado com nível gratuito).
| Variável | Padrão | Descrição |
|---|---|---|
OLLAMA_SERVER_URL | URL do seu servidor Ollama ou Ollama Cloud | |
OLLAMA_SERVER_API_KEY | Chave de API para autenticação no Ollama Cloud | |
OLLAMA_SERVER_MODEL | Modelo padrão para inferência | |
OLLAMA_SERVER_CONFIG_PATH | Caminho para o arquivo de configuração do agente personalizado | |
OLLAMA_SERVER_PULL_MODELS_TIMEOUT | 600 | Tempo limite para download de modelos (segundos) |
OLLAMA_SERVER_PULL_MODELS_ENABLED | false | Baixar modelos automaticamente na inicialização |
OLLAMA_SERVER_LOAD_MODELS_ENABLED | false | Consultar o servidor por modelos disponíveis |
Ollama Cloud fornece inferência gerenciada com um generoso nível gratuito e planos pagos escaláveis.
Configuração do Nível Gratuito (Modelo Único)```bash
OLLAMA_SERVER_URL=https://ollama.com OLLAMA_SERVER_API_KEY=your_ollama_cloud_api_key OLLAMA_SERVER_MODEL=gpt-oss:120b # Example: OpenAI OSS 120B model
**Configuração de Nível Pago (Multi-Model com Configuração Pré-construída)**
Para níveis pagos que suportam múltiplos modelos simultâneos, use a configuração pré-construída do Ollama Cloud:```bash
# Using pre-built Ollama Cloud configuration (included in Docker image)
OLLAMA_SERVER_URL=https://ollama.com
OLLAMA_SERVER_API_KEY=your_ollama_cloud_api_key
OLLAMA_SERVER_CONFIG_PATH=/opt/pentagi/conf/ollama-cloud.provider.yml
A configuração pré-construída ollama-cloud.provider.yml inclui atribuições de modelo otimizadas para todos os tipos de agente:
nemotron-3-super:cloud - Modelo rápido de uso geralqwen3-coder-next:cloud - Raciocínio avançado com modo de alto esforçoqwen3-coder-next:cloud - Modelos de codificação especializadosqwen3.5:397b-cloud - Grande contexto para coleta de informaçõesglm-5:cloud - Refinamento de texto de alta qualidademinimax-m2.7:cloud - Tarefas consultivas eficientesdevstral-2:123b-cloud - Tarefas de instalação e configuraçãoConfiguração Personalizada (Avançada)
Para criar sua própria configuração de agente, monte um arquivo personalizado do sistema de arquivos do host:```bash
OLLAMA_SERVER_URL=https://ollama.com OLLAMA_SERVER_API_KEY=your_ollama_cloud_api_key OLLAMA_SERVER_CONFIG_PATH=/opt/pentagi/conf/ollama.provider.yml
PENTAGI_OLLAMA_SERVER_CONFIG_PATH=/path/on/host/my-ollama-config.yml
A variável de ambiente `PENTAGI_OLLAMA_SERVER_CONFIG_PATH` mapeia o arquivo de configuração do seu host para `/opt/pentagi/conf/ollama.provider.yml` dentro do contêiner.
**Exemplo de configuração personalizada** (`my-ollama-config.yml`):```yaml
primary_agent:
model: "qwen3-coder-next:cloud"
temperature: 1.0
top_p: 0.9
max_tokens: 32768
reasoning:
effort: high
coder:
model: "qwen3-coder:32b"
temperature: 1.0
max_tokens: 20480
Para instâncias auto-hospedadas do Ollama:```bash
OLLAMA_SERVER_URL=http://localhost:11434 OLLAMA_SERVER_MODEL=llama3.1:8b-instruct-q8_0
OLLAMA_SERVER_URL=http://ollama-server:11434 OLLAMA_SERVER_PULL_MODELS_ENABLED=true OLLAMA_SERVER_PULL_MODELS_TIMEOUT=900 OLLAMA_SERVER_LOAD_MODELS_ENABLED=true
OLLAMA_SERVER_CONFIG_PATH=/opt/pentagi/conf/ollama-llama318b.provider.yml
OLLAMA_SERVER_CONFIG_PATH=/opt/pentagi/conf/ollama-qwen332b-fp16-tc.provider.yml
OLLAMA_SERVER_CONFIG_PATH=/opt/pentagi/conf/ollama-qwq32b-fp16-tc.provider.yml
**Considerações de Desempenho:**
- **Model Discovery** (`OLLAMA_SERVER_LOAD_MODELS_ENABLED=true`): Adiciona 1-2s de latência na inicialização consultando a API Ollama
- **Auto-pull** (`OLLAMA_SERVER_PULL_MODELS_ENABLED=true`): Primeira inicialização pode levar vários minutos baixando modelos
- **Pull timeout** (`OLLAMA_SERVER_PULL_MODELS_TIMEOUT=900`): 15 minutos em segundos
- **Static Config**: Desabilite ambas as flags e especifique modelos no arquivo de configuração para inicialização mais rápida
#### Criando Modelos Ollama Personalizados com Contexto Estendido
O PentAGI requer modelos com janelas de contexto maiores que as configurações padrão do Ollama. Você precisa criar modelos personalizados com o parâmetro `num_ctx` aumentado através de Modelfiles. Enquanto fluxos de trabalho típicos de agentes consomem cerca de 64K tokens, o PentAGI usa tamanho de contexto de 110K para margem de segurança e tratamento de cenários complexos de teste de penetração.
**Importante**: O parâmetro `num_ctx` só pode ser definido durante a criação do modelo via Modelfile - ele não pode ser alterado após a criação do modelo ou substituído em tempo de execução.
##### Exemplo: Qwen3 32B FP16 com Contexto Estendido
Crie um Modelfile chamado `Modelfile_qwen3_32b_fp16_tc`:```dockerfile
FROM qwen3:32b-fp16
PARAMETER num_ctx 110000
PARAMETER temperature 0.3
PARAMETER top_p 0.8
PARAMETER min_p 0.0
PARAMETER top_k 20
PARAMETER repeat_penalty 1.1
Construir o modelo personalizado:```bash ollama create qwen3:32b-fp16-tc -f Modelfile_qwen3_32b_fp16_tc
##### Exemplo: QwQ 32B FP16 com Contexto Estendido
Crie um Modelfile chamado `Modelfile_qwq_32b_fp16_tc`:```dockerfile
FROM qwq:32b-fp16
PARAMETER num_ctx 110000
PARAMETER temperature 0.2
PARAMETER top_p 0.7
PARAMETER min_p 0.0
PARAMETER top_k 40
PARAMETER repeat_penalty 1.2
Construa o modelo personalizado:```bash ollama create qwq:32b-fp16-tc -f Modelfile_qwq_32b_fp16_tc
> **Nota**: O modelo QwQ 32B FP16 requer aproximadamente **71.3 GB de VRAM** para inferência. Certifique-se de que seu sistema possui memória GPU suficiente antes de tentar usar este modelo.
Esses modelos personalizados são referenciados nos arquivos de configuração do provedor pré-construídos (`ollama-qwen332b-fp16-tc.provider.yml` e `ollama-qwq32b-fp16-tc.provider.yml`) que estão incluídos na imagem Docker em `/opt/pentagi/conf/`.
### Configuração do Provedor OpenAI
PentAGI integra-se com a linha abrangente de modelos da OpenAI, apresentando capacidades avançadas de raciocínio com cadeia de pensamento estendida, modelos agentes com integração aprimorada de ferramentas e modelos de código especializados para engenharia de segurança.
#### Variáveis de Configuração
| Variável | Padrão | Descrição |
| ------------------------- | --------------------------- | -------------------------------- |
| `OPEN_AI_KEY` | | Chave API para serviços OpenAI |
| `OPEN_AI_SERVER_URL` | `https://api.openai.com/v1` | Endpoint da API OpenAI |
#### Exemplos de Configuração```bash
# Basic OpenAI setup
OPEN_AI_KEY=your_openai_api_key
OPEN_AI_SERVER_URL=https://api.openai.com/v1
# Using with proxy for enhanced security
OPEN_AI_KEY=your_openai_api_key
PROXY_URL=http://your-proxy:8080
O PentAGI suporta 31 modelos OpenAI com chamada de ferramentas, streaming, modos de raciocínio e cache de prompt. Modelos marcados com * são usados na configuração padrão.
Série GPT-5.2 – Principal Agente Mais Recente (Dezembro 2025)
| ID do Modelo | Raciocínio | Preço (Entrada/Saída/Cache) | Caso de Uso |
|---|---|---|---|
gpt-5.2* | ✅ | $1.75/$14.00/$0.18 | Principal mais recente com raciocínio aprimorado e integração de ferramentas, pesquisa autônoma de segurança |
gpt-5.2-pro | ✅ | $21.00/$168.00/$0.00 | Versão premium com programação agente superior, pesquisa de segurança de missão crítica, descoberta de dia zero |
gpt-5.2-codex | ✅ | $1.75/$14.00/$0.18 | Mais avançado especializado em código, compactação de contexto, fortes capacidades de cibersegurança |
Série GPT-5/5.1 – Modelos Agentes Avançados
| ID do Modelo | Raciocínio | Preço (Entrada/Saída/Cache) | Caso de Uso |
|---|---|---|---|
gpt-5 | ✅ | $1.25/$10.00/$0.13 | Principal agente com raciocínio avançado, pesquisa autônoma de segurança, desenvolvimento de cadeias de exploit |
gpt-5.1 | ✅ | $1.25/$10.00/$0.13 | Agente aprimorado com raciocínio adaptativo, testes de penetração equilibrados com forte coordenação de ferramentas |
gpt-5-pro | ✅ | $15.00/$120.00/$0.00 | Versão premium com grandes melhorias de raciocínio, redução de alucinações, operações críticas de segurança |
gpt-5-mini | ✅ | $0.25/$2.00/$0.03 | Eficiente equilibrando velocidade e inteligência, análise automatizada de vulnerabilidades, geração de exploits |
gpt-5-nano | ✅ | $0.05/$0.40/$0.01 | Mais rápido para varreduras de alto rendimento, reconhecimento, detecção em massa de vulnerabilidades |
Série GPT-5/5.1 Codex – Especializados em Código
| ID do Modelo | Raciocínio | Preço (Entrada/Saída/Cache) | Caso de Uso |
|---|---|---|---|
gpt-5.1-codex-max | ✅ | $1.25/$10.00/$0.13 | Raciocínio aprimorado para programação sofisticada, descobertas comprovadas de CVE, desenvolvimento sistemático de exploits |
gpt-5.1-codex | ✅ | $1.25/$10.00/$0.13 | Otimizado para código padrão com forte raciocínio, geração de exploits, análise de vulnerabilidades |
gpt-5-codex | ✅ | $1.25/$10.00/$0.13 | Especializado em código fundamental, varredura de vulnerabilidades, geração básica de exploits |
gpt-5.1-codex-mini | ✅ | $0.25/$2.00/$0.03 | Compacto de alto desempenho, capacidade 4x maior, detecção rápida de vulnerabilidades |
codex-mini-latest | ✅ | $1.50/$6.00/$0.38 | Modelo de código compacto mais recente, revisão automática de código, análise básica de vulnerabilidades |
Série GPT-4.1 – Inteligência Aprimorada
| ID do Modelo | Raciocínio | Preço (Entrada/Saída/Cache) | Caso de Uso |
|---|---|---|---|
gpt-4.1 | ❌ | $2.00/$8.00/$0.50 | Principal aprimorado com chamada de função superior, análise complexa de ameaças, desenvolvimento sofisticado de exploits |
gpt-4.1-mini* | ❌ | $0.40/$1.60/$0.10 | Desempenho equilibrado com eficiência melhorada, avaliações de segurança de rotina, análise automática de código |
gpt-4.1-nano | ❌ | $0.10/$0.40/$0.03 | Leve ultrarrápido, varredura de segurança em massa, reconhecimento rápido, monitoramento contínuo |
Série GPT-4o – Principal Multimodal
| ID do Modelo | Raciocínio | Preço (Entrada/Saída/Cache) | Caso de Uso |
|---|---|---|---|
gpt-4o | ❌ | $2.50/$10.00/$1.25 | Principal multimodal com visão, análise de imagens, avaliação de interface web, orquestração de múltiplas ferramentas |
gpt-4o-mini | ❌ | $0.15/$0.60/$0.08 | Multimodal compacto com forte chamada de função, varredura de alta frequência, operações em massa econômicas |
Série o – Modelos de Raciocínio Avançado
| ID do Modelo | Raciocínio | Preço (Entrada/Saída/Cache) | Caso de Uso |
|---|---|---|---|
o4-mini* | ✅ | $1.10/$4.40/$0.28 | Raciocínio de próxima geração com velocidade aprimorada, avaliações metódicas de segurança, desenvolvimento sistemático de exploits |
o3* | ✅ | $2.00/$8.00/$0.50 | Potência de raciocínio avançado, cadeias de ataque em múltiplos estágios, análise profunda de vulnerabilidades |
o3-mini | ✅ | $1.10/$4.40/$0.55 | Raciocínio compacto com pensamento estendido, planejamento passo a passo de ataques, encadeamento lógico de vulnerabilidades |
o1 | ✅ | $15.00/$60.00/$7.50 | Raciocínio principal com profundidade máxima, testes avançados de penetração, pesquisa de exploits inovadores |
o3-pro | ✅ | $20.00/$80.00/$0.00 | Raciocínio mais avançado, 80% mais barato que o1-pro, pesquisa de dia zero, investigações críticas de segurança |
o1-pro | ✅ | $150.00/$600.00/$0.00 | Raciocínio premium de geração anterior, análise exaustiva de segurança, desafios críticos de missão |
Preços: Por 1M de tokens. Modelos de raciocínio incluem tokens de pensamento no preço de saída.
[!WARNING] Modelos GPT-5 – Acesso Confiável Necessário*
Todos os modelos da série GPT-5 (
gpt-5,gpt-5.1,gpt-5.2,gpt-5-pro,gpt-5.2-proe todas as variantes Codex) funcionam de forma instável com o PentAGI e podem acionar os mecanismos de segurança cibernética da OpenAI sem acesso verificado.Para usar modelos GPT-5 de forma confiável:*
- Usuários individuais: Verifique sua identidade em chatgpt.com/cyber
- Equipes empresariais: Solicite acesso confiável através do seu representante OpenAI
- Pesquisadores de segurança: Candidate-se ao Programa de Bolsas de Cibersegurança (inclui $10M em créditos API)
Alternativas recomendadas sem verificação:
- Use modelos da série
o(o3, o4-mini, o1) para tarefas de raciocínio- Use a série
gpt-4.1para inteligência geral e chamada de funções- Todos os modelos da série o e gpt-4.x funcionam de forma confiável sem acesso especial
Níveis de Esforço de Raciocínio:
Principais Recursos:
O PentAGI integra-se aos modelos Claude da Anthropic, apresentando capacidades avançadas de pensamento estendido, mecanismos excepcionais de segurança e compreensão sofisticada de contextos complexos de segurança com cache de prompt.
| Variável | Padrão | Descrição |
|---|---|---|
ANTHROPIC_API_KEY | Chave da API para serviços Anthropic | |
ANTHROPIC_SERVER_URL | https://api.anthropic.com/v1 | Endpoint da API Anthropic |
ANTHROPIC_API_KEY=your_anthropic_api_key ANTHROPIC_SERVER_URL=https://api.anthropic.com/v1
ANTHROPIC_API_KEY=your_anthropic_api_key PROXY_URL=http://your-proxy:8080
> [!NOTE]
> **Google Vertex AI para modelos Claude**
>
> O PentAGI atualmente não expõe um caminho de configuração dedicado do Google Vertex AI para Anthropic Claude no `.env`. Não há um campo de chave de API Vertex AI separado neste momento, e as variáveis Anthropic existentes (`ANTHROPIC_API_KEY`, `ANTHROPIC_SERVER_URL`) visam a API Anthropic direta. As rotas suportadas para Claude são:
>
> - **API Anthropic Direta**: `ANTHROPIC_API_KEY` e `ANTHROPIC_SERVER_URL` (veja acima).
> - **AWS Bedrock**: Variáveis `BEDROCK_*` (veja [Configuração do Provedor AWS Bedrock](#aws-bedrock-provider-configuration)).
>
> Se você precisar usar o Vertex AI hoje, a solução alternativa suportada mais segura é expor o Vertex AI através de um proxy ou gateway compatível com OpenAI que traduza as chamadas do Vertex AI para o formato Chat Completions, preservando o comportamento de chat e chamada de ferramentas do qual o PentAGI depende, e então aponte o provedor LLM Personalizado para esse gateway via `LLM_SERVER_URL`, `LLM_SERVER_KEY` e `LLM_SERVER_MODEL`. Este caminho é tão confiável quanto o gateway que você escolher.
#### Modelos Suportados
O PentAGI suporta 10 modelos Claude com chamada de ferramentas, streaming, pensamento estendido, pensamento adaptativo e cache de prompt. Os modelos marcados com `*` são usados na configuração padrão.
**Série Claude 4 - Modelos Mais Recentes (2025-2026)**
| ID do Modelo | Pensamento | Data de Lançamento | Preço (Entrada/Saída/Cache R/W) | Caso de Uso |
| ------------------------ | ---------- | ------------------ | ------------------------------- | ----------------------------------------------- |
| `claude-opus-4-6`* | ✅ | Maio 2025 | $5,00/$25,00/$0,50/$6,25 | Modelo mais inteligente para agentes autônomos e codificação. Pensamento estendido + adaptativo para desenvolvimento complexo de exploits, simulação de ataque em múltiplos estágios |
| `claude-sonnet-4-6`* | ✅ | Agosto 2025 | $3,00/$15,00/$0,30/$3,75 | Melhor equilíbrio velocidade/inteligência com pensamento adaptativo. Avaliações de segurança em várias fases, análise inteligente de vulnerabilidades, caça a ameaças em tempo real |
| `claude-haiku-4-5`* | ✅ | Outubro 2025 | $1,00/$5,00/$0,10/$1,25 | Modelo mais rápido com inteligência quase de ponta. Varredura de alta frequência, monitoramento em tempo real, testes automatizados em lote |
**Modelos Legados - Ainda Suportados**
| ID do Modelo | Pensamento | Data de Lançamento | Preço (Entrada/Saída/Cache R/W) | Caso de Uso |
| ------------------------ | ---------- | ------------------ | ------------------------------- | ----------------------------------------------- |
| `claude-sonnet-4-5` | ✅ | Setembro 2025 | $3,00/$15,00/$0,30/$3,75 | Raciocínio de ponta (substituído pela série 4-6). Testes de penetração sofisticados, análise avançada de ameaças |
| `claude-opus-4-5` | ✅ | Novembro 2025 | $5,00/$25,00/$0,50/$6,25 | Raciocínio definitivo (substituído por opus-4-6). Pesquisa crítica de segurança, descoberta de zero-day, operações de red team |
| `claude-opus-4-1` | ✅ | Agosto 2025 | $15,00/$75,00/$1,50/$18,75 | Raciocínio avançado (substituído). Testes de penetração complexos, modelagem sofisticada de ameaças |
| `claude-sonnet-4-0` | ✅ | Maio 2025 | $3,00/$15,00/$0,30/$3,75 | Raciocínio de alto desempenho (substituído). Modelagem complexa de ameaças, coordenação de múltiplas ferramentas |
| `claude-opus-4-0` | ✅ | Maio 2025 | $15,00/$75,00/$1,50/$18,75 | Primeira geração Opus (substituído). Desenvolvimento de exploits em várias etapas, fluxos de trabalho autônomos de pentest |
**Modelos Descontinuados - Migre para Modelos Atuais**
| ID do Modelo | Pensamento | Data de Lançamento | Preço (Entrada/Saída/Cache R/W) | Notas |
| ---------------------------- | ---------- | ------------------ | ------------------------------- | -------------------------------------------- |
| `claude-3-haiku-20240307` | ❌ | Março 2024 | $0,25/$1,25/$0,03/$0,30 | Será desativado em 19 de abril de 2026. Migre para claude-haiku-4-5 |
**Preços**: Por 1M de tokens. O preço do cache inclui custos de Leitura e Escrita.
**Configuração de Pensamento Estendido**:
- **Max Tokens 4096**: Gerador (claude-opus-4-6) para profundidade máxima de raciocínio em desenvolvimento complexo de exploits
- **Max Tokens 2048**: Codificador (claude-sonnet-4-6) para análise equilibrada de código e pesquisa de vulnerabilidades
- **Max Tokens 1024**: Agente primário, assistente, refinador, conselheiro, refletor, pesquisador, instalador, testador de penetração para raciocínio focado em tarefas específicas
- **Pensamento Estendido**: Todos os modelos Claude 4.5+ e 4.6 suportam pensamento estendido configurável para tarefas de raciocínio profundo
**Principais Recursos**:
- **Pensamento Estendido**: Todos os modelos Claude 4.5+ e 4.6 com profundidades configuráveis de raciocínio em cadeia de pensamento para análise de segurança complexa
- **Pensamento Adaptativo**: A série Claude 4.6 (Opus/Sonnet) ajusta dinamicamente a profundidade do raciocínio com base na complexidade da tarefa para desempenho ideal
- **Cache de Prompt**: Redução significativa de custos com preços separados de leitura/escrita (10% leitura, 125% escrita do valor de entrada)
- **Janela de Contexto Estendida**: 200 mil tokens padrão, até 1 milhão de tokens (beta) para Claude Opus/Sonnet 4.6 para análise abrangente de base de código
- **Chamada de Ferramentas**: Chamada de função robusta com exatidão excepcional para orquestração de ferramentas de segurança
- **Streaming**: Streaming de resposta em tempo real para fluxos de trabalho interativos de teste de penetração
- **Design Focado em Segurança**: Mecanismos de segurança integrados garantindo práticas responsáveis de teste de segurança
- **Suporte Multimodal**: Capacidades de visão nos modelos mais recentes para análise de capturas de tela e avaliação de segurança de interface do usuário
- **IA Constitucional**: Treinamento avançado de segurança fornecendo orientação de segurança confiável e ética
### Configuração do Provedor Google AI (Gemini)
O PentAGI integra-se com os modelos Gemini do Google através da API Google AI, oferecendo capacidades multimodais de raciocínio de ponta com pensamento estendido e cache de contexto.
#### Variáveis de Configuração
| Variável | Padrão | Descrição |
| ------------------ | -------------------------------------------- | ------------------------------ |
| `GEMINI_API_KEY` | | Chave de API para serviços Google AI |
| `GEMINI_SERVER_URL`| `https://generativelanguage.googleapis.com` | Endpoint da API Google AI |
#### Exemplos de Configuração```bash
# Basic Gemini setup
GEMINI_API_KEY=your_gemini_api_key
GEMINI_SERVER_URL=https://generativelanguage.googleapis.com
# Using with proxy
GEMINI_API_KEY=your_gemini_api_key
PROXY_URL=http://your-proxy:8080
O PentAGI suporta 9 modelos Gemini com chamada de ferramentas, streaming, modos de pensamento e cache de contexto. Modelos marcados com * são usados na configuração padrão.
Série Gemini 3.5 - Flash Estável Mais Recente (Maio de 2026)
| ID do Modelo | Pensamento | Contexto | Preço (Entrada/Saída/Cache) | Caso de Uso |
|---|---|---|---|---|
gemini-3.5-flash* | ✅ | 1M | $1,50/$9,00/$0,15 | Modelo Flash mais inteligente com desempenho de fronteira sustentado em tarefas agênticas e de codificação, busca e fundamentação superiores |
Série Gemini 3.1 - Flash-Lite Estável + Pré-visualização Pro (Fev-Maio 2026)
| ID do Modelo | Pensamento | Contexto | Preço (Entrada/Saída/Cache) | Caso de Uso |
|---|---|---|---|---|
gemini-3.1-pro-preview* | ✅ | 1M | $2,00/$12,00/$0,20 | Último carro-chefe com pensamento refinado, eficiência de token aprimorada, otimizado para engenharia de software e fluxos de trabalho agênticos |
gemini-3.1-pro-preview-customtools | ✅ | 1M | $2,00/$12,00/$0,20 | Endpoint de ferramentas personalizadas otimizado para bash e priorização de ferramentas personalizadas (view_file, search_code) |
gemini-3.1-flash-lite* | ✅ | 1M | $0,25/$1,50/$0,025 | Modelo multimodal estável mais econômico, desempenho de classe fronteiriça para tarefas agênticas de alto volume e aplicações de baixa latência |
Série Gemini 2.5 - Modelos de Pensamento Avançado (ativos até 16 de outubro de 2026)
| ID do Modelo | Pensamento | Contexto | Preço (Entrada/Saída/Cache) | Caso de Uso |
|---|---|---|---|---|
gemini-2.5-pro | ✅ | 1M | $1,25/$10,00/$0,125 | Estado da arte para codificação e raciocínio complexos, modelagem de ameaças sofisticada |
gemini-2.5-flash | ✅ | 1M | $0,30/$2,50/$0,03 | Primeiro modelo de raciocínio híbrido com orçamentos de pensamento, melhor relação custo-desempenho para avaliações em larga escala |
gemini-2.5-flash-lite | ✅ | 1M | $0,10/$0,40/$0,01 | Menor e mais econômico para uso em escala, varredura de alto rendimento |
Modelos Open-Source Gemma 4 (Apache 2.0, Camada Gratuita)
| ID do Modelo | Pensamento | Contexto | Preço (Entrada/Saída/Cache) | Caso de Uso |
|---|---|---|---|---|
gemma-4-31b-it | ✅ | 256K | Gratuito/Gratuito/Gratuito | Maior modelo denso open-source Gemma 4 (~31B parâmetros), multimodal texto+imagem, 140+ idiomas, operações de segurança on-premises |
gemma-4-26b-a4b-it | ✅ | 256K | Gratuito/Gratuito/Gratuito | Arquitetura MoE (~26B total / ~3.8B parâmetros ativos), inferência altamente eficiente em GPUs de consumo para varredura local de alto rendimento |
Preços: Por 1M de tokens (Camada Padrão Paga). A janela de contexto é o limite de tokens de entrada.
[!NOTE] Encerramento da Série Gemini 2.5
gemini-2.5-pro,gemini-2.5-flashegemini-2.5-flash-liteserão encerrados em 16 de outubro de 2026. Migrações recomendadas:
gemini-2.5-pro→gemini-3.1-pro-preview(mesmo nível de preço de entrada de $2,00)gemini-2.5-flash→gemini-3.5-flash(capacidades de fronteira aprimoradas)gemini-2.5-flash-lite→gemini-3.1-flash-lite(mesmo preço de entrada de $0,25)
Atribuições de Modelo Padrão (config.yml):
gemini-3.1-pro-preview - primary_agent, assistant, generator, refiner, adviser, coder, pentestergemini-3.5-flash - reflector, searcher, enricher, installergemini-3.1-flash-lite - simple, simple_jsonRecursos Principais:
gemini-3.1-pro-preview-customtools para fluxos de trabalho agênticos pesados em ferramentas que preferem ferramentas registradas em vez de bashNíveis de Esforço de Raciocínio:
O PentAGI integra-se com o Amazon Bedrock, oferecendo acesso a mais de 20 modelos de base de empresas líderes de IA, incluindo Anthropic, Amazon, Cohere, DeepSeek, OpenAI, Qwen, Mistral e Moonshot.
| Variável | Padrão | Descrição |
|---|---|---|
BEDROCK_REGION | us-east-1 | Região AWS para o serviço Bedrock |
BEDROCK_DEFAULT_AUTH | false | Usar cadeia de credenciais padrão do AWS SDK (ambiente, função EC2, ~/.aws/credentials) - prioridade máxima |
BEDROCK_BEARER_TOKEN | Autenticação via token Bearer - prioridade sobre credenciais estáticas | |
BEDROCK_ACCESS_KEY_ID | ID da chave de acesso AWS para credenciais estáticas | |
BEDROCK_SECRET_ACCESS_KEY | Chave de acesso secreta AWS para credenciais estáticas | |
BEDROCK_SESSION_TOKEN | Token de sessão AWS para credenciais temporárias (opcional, usado com credenciais estáticas) | |
BEDROCK_SERVER_URL | Endpoint Bedrock personalizado (endpoints VPC, testes locais) |
Prioridade de Autenticação: BEDROCK_DEFAULT_AUTH → BEDROCK_BEARER_TOKEN → BEDROCK_ACCESS_KEY_ID+BEDROCK_SECRET_ACCESS_KEY
BEDROCK_REGION=us-east-1 BEDROCK_DEFAULT_AUTH=true
BEDROCK_REGION=us-east-1 BEDROCK_BEARER_TOKEN=your_bearer_token
BEDROCK_REGION=us-east-1 BEDROCK_ACCESS_KEY_ID=your_aws_access_key BEDROCK_SECRET_ACCESS_KEY=your_aws_secret_key
BEDROCK_REGION=us-east-1 BEDROCK_DEFAULT_AUTH=true BEDROCK_SERVER_URL=https://bedrock-runtime.us-east-1.vpce-xxx.amazonaws.com PROXY_URL=http://your-proxy:8080
#### Modelos Suportados
PentAGI suporta 21 modelos AWS Bedrock com capacidades de chamada de ferramenta, streaming e multimodal. Modelos marcados com `*` são usados na configuração padrão.
| Model ID | Provedor | Pensamento | Multimodal | Preço (Entrada/Saída) | Caso de Uso |
| ------------------------------------------------ | --------------- | ---------- | ---------- | --------------------- | ------------------------------------------ |
| `us.amazon.nova-2-lite-v1:0` | Amazon Nova | ❌ | ✅ | $0.33/$2.75 | Raciocínio adaptativo, pensamento eficiente |
| `us.amazon.nova-premier-v1:0` | Amazon Nova | ❌ | ✅ | $2.50/$12.50 | Raciocínio complexo, análise avançada |
| `us.amazon.nova-pro-v1:0` | Amazon Nova | ❌ | ✅ | $0.80/$3.20 | Precisão balanceada, velocidade, custo |
| `us.amazon.nova-lite-v1:0` | Amazon Nova | ❌ | ✅ | $0.06/$0.24 | Processamento rápido, operações de alto volume |
| `us.amazon.nova-micro-v1:0` | Amazon Nova | ❌ | ❌ | $0.035/$0.14 | Latência ultrabaixa, monitoramento em tempo real |
| `us.anthropic.claude-opus-4-6-v1`* | Anthropic | ✅ | ✅ | $5.00/$25.00 | Codificação de classe mundial, agentes empresariais |
| `us.anthropic.claude-sonnet-4-6` | Anthropic | ✅ | ✅ | $3.00/$15.00 | Inteligência de fronteira, escala empresarial |
| `us.anthropic.claude-opus-4-5-20251101-v1:0` | Anthropic | ✅ | ✅ | $5.00/$25.00 | Desenvolvimento de software de vários dias |
| `us.anthropic.claude-haiku-4-5-20251001-v1:0`* | Anthropic | ✅ | ✅ | $1.00/$5.00 | Desempenho próximo da fronteira, alta velocidade |
| `us.anthropic.claude-sonnet-4-5-20250929-v1:0`* | Anthropic | ✅ | ✅ | $3.00/$15.00 | Agentes do mundo real, excelência em codificação |
| `us.anthropic.claude-sonnet-4-20250514-v1:0` | Anthropic | ✅ | ✅ | $3.00/$15.00 | Desempenho balanceado, pronto para produção |
| `us.anthropic.claude-3-5-haiku-20241022-v1:0` | Anthropic | ❌ | ❌ | $0.80/$4.00 | Modelo mais rápido, varredura econômica |
| `cohere.command-r-plus-v1:0` | Cohere | ❌ | ❌ | $3.00/$15.00 | Operações em larga escala, RAG superior |
| `deepseek.v3.2` | DeepSeek | ❌ | ❌ | $0.58/$1.68 | Raciocínio de contexto longo, eficiência |
| `openai.gpt-oss-120b-1:0`* | OpenAI (OSS) | ✅ | ❌ | $0.15/$0.60 | Raciocínio forte, análise científica |
| `openai.gpt-oss-20b-1:0` | OpenAI (OSS) | ✅ | ❌ | $0.07/$0.30 | Codificação eficiente, desenvolvimento de software |
| `qwen.qwen3-next-80b-a3b` | Qwen | ❌ | ❌ | $0.15/$1.20 | Contexto ultra longo, raciocínio de ponta |
| `qwen.qwen3-32b-v1:0` | Qwen | ❌ | ❌ | $0.15/$0.60 | Raciocínio balanceado, casos de uso de pesquisa |
| `qwen.qwen3-coder-30b-a3b-v1:0` | Qwen | ❌ | ❌ | $0.15/$0.60 | Codificação por vibração, primeiramente em linguagem natural |
| `qwen.qwen3-coder-next` | Qwen | ❌ | ❌ | $0.45/$1.80 | Uso de ferramentas, chamada de função otimizada |
| `mistral.mistral-large-3-675b-instruct` | Mistral | ❌ | ✅ | $4.00/$12.00 | Multimodal avançado, contexto longo |
| `moonshotai.kimi-k2.5` | Moonshot | ❌ | ✅ | $0.60/$3.00 | Visão, linguagem, código em um modelo |
**Preços**: Por 1M tokens. Modelos com suporte a pensamento/raciocínio incorrem em custos de computação adicionais durante a fase de raciocínio.
#### Modelos Testados mas Incompatíveis
Alguns modelos AWS Bedrock foram testados, mas **não são suportados** devido a limitações técnicas:
| Família do Modelo | Motivo da Incompatibilidade |
| ------------------------ | -------------------------------------------------------------------------------------------- |
| **GLM (Z.AI)** | Formato de chamada de ferramenta incompatível com a API Converse (espera string em vez de JSON) |
| **AI21 Jamba** | Limites de taxa severos (1-2 req/min) impedem testes confiáveis e uso em produção |
| **Meta Llama 3.3/3.1** | Processamento instável de resultados de chamada de ferramenta, causando falhas inesperadas em fluxos de trabalho de múltiplas rodadas |
| **Mistral Magistral** | Chamada de ferramenta não suportada pelo modelo |
| **Moonshot K2-Thinking** | Comportamento de streaming instável com chamadas de ferramenta, não confiável em produção |
| **Qwen3-VL** | Streaming instável com chamada de ferramenta, combinação multimodal + ferramentas falha intermitentemente |
> [!IMPORTANT]
> **Gerenciamento de Limites de Taxa e Cotas**
>
> As cotas padrão do AWS Bedrock para modelos Claude são **extremamente restritivas** (2-20 solicitações/minuto para novas contas). Para testes de penetração em produção:
>
> 1. **Solicite aumentos de cota** através do console AWS Service Quotas para os modelos que você planeja usar
> 2. **Use modelos Amazon Nova** - cotas padrão mais altas e excelente desempenho
> 3. **Habilite throughput provisionado** para testes consistentes de alto volume
> 4. **Monitore o uso** - a AWS limita agressivamente nos limites de cota
>
> Sem aumentos de cota, espere atrasos frequentes e interrupções no fluxo de trabalho.
> [!WARNING]
> **Requisitos da API Converse**
>
> PentAGI usa a **API Converse** do Amazon Bedrock para acesso unificado ao modelo. Todos os modelos suportados requerem:
>
> - ✅ Suporte à API Converse/ConverseStream
> - ✅ Uso de ferramentas (chamada de função) para fluxos de trabalho de teste de penetração
> - ✅ Uso de ferramentas em streaming para feedback em tempo real
>
> Verifique as capacidades do modelo em: [AWS Bedrock Model Features](https://docs.aws.amazon.com/bedrock/latest/userguide/conversation-inference-supported-models-features.html)
**Principais Recursos**:
- **Cache Automático de Prompt**: redução de 40-70% nos custos em contexto repetido (modelos Claude 4.x)
- **Pensamento Estendido**: raciocínio passo a passo para análise de segurança complexa (Claude, DeepSeek R1, OpenAI GPT)
- **Análise Multimodal**: Processar capturas de tela, diagramas, vídeo para testes abrangentes (Nova, Claude, Mistral, Kimi)
- **Chamada de Ferramenta**: Integração perfeita com mais de 20 ferramentas de pentest via chamada de função
- **Streaming**: Fluxo de resposta em tempo real para fluxos de trabalho interativos de avaliação de segurança
### Configuração do Provedor DeepSeek
PentAGI se integra ao DeepSeek, fornecendo acesso a modelos avançados de IA com forte raciocínio, capacidades de codificação e cache de contexto a preços competitivos.
#### Variáveis de Configuração
| Variável | Valor Padrão | Descrição |
| --------------------- | ------------------------------ | ------------------------------------------------ |
| `DEEPSEEK_API_KEY` | | Chave da API DeepSeek para autenticação |
| `DEEPSEEK_SERVER_URL` | `https://api.deepseek.com` | URL do endpoint da API DeepSeek |
| `DEEPSEEK_PROVIDER` | | Prefixo do provedor para integração com LiteLLM (opcional) |
#### Exemplos de Configuração```bash
# Direct API usage
DEEPSEEK_API_KEY=your_deepseek_api_key
DEEPSEEK_SERVER_URL=https://api.deepseek.com
# With LiteLLM proxy
DEEPSEEK_API_KEY=your_litellm_key
DEEPSEEK_SERVER_URL=http://litellm-proxy:4000
DEEPSEEK_PROVIDER=deepseek # Adds prefix to model names (deepseek/deepseek-v4-flash) for LiteLLM
PentAGI suporta 2 modelos DeepSeek V4 com chamada de ferramentas, streaming, modos híbridos de pensamento/não-pensamento e cache de contexto. Ambos os modelos suportam o modo de pensamento por padrão e podem ser alternados para o modo de não-pensamento via extra_body. Modelos marcados com * são usados na configuração padrão.
| Model ID | Pensamento | Saída Máxima | Contexto | Preço (Entrada/Saída/Cache) | Caso de Uso |
|---|---|---|---|---|---|
deepseek-v4-flash* | ✅ híbrido | 384K | 1M | $0.14/$0.28/$0.0028 | Agentes utilitários, diálogo geral, chamada rápida de ferramentas |
deepseek-v4-pro* | ✅ híbrido | 384K | 1M | $1.74/$3.48/$0.0145 | Raciocínio avançado, lógica complexa, análise de segurança |
Preços: Por 1M de tokens. O preço de cache aplica-se a tokens de prompt servidos do cache (acerto de cache de entrada, reduzido a 1/10 do preço de lançamento desde 2026-04-26). Ambos os modelos suportam pensamento híbrido — o modo thinking está ativado por padrão; passe extra_body.thinking.type: disabled para mudar para o modo de não-pensamento para respostas mais rápidas/baratas.
Nota de Preço (deepseek-v4-pro): O desconto promocional de 75% no
deepseek-v4-proterminou oficialmente em 2026-05-31 às 15:59 UTC. Os preços acima refletem os preços pós-promocionais padrão. Se você tiver configurações legadas usando os preços com desconto ($0.435/$0.87/$0.003625), atualize-as para as taxas atuais para um acompanhamento preciso dos custos.
Os nomes legados dos modelos
deepseek-chatedeepseek-reasonerestão programados para serem descontinuados pela DeepSeek em 2026-07-24. As configurações de usuário existentes que referenciam os nomes legados continuam funcionando até essa data; os padrões acima usam os nomes atuais da V4.deepseek-chatmapeia paradeepseek-v4-flashmodo de não-pensamento;deepseek-reasonermapeia paradeepseek-v4-flashmodo de pensamento.
Configuração Padrão do Agente:
Estratégia: prefira deepseek-v4-flash (12x mais barato na entrada, 12x mais barato na saída) como o burro de carga para agentes utilitários/leves; reserve deepseek-v4-pro para raciocínio complexo de múltiplas etapas. O agente installer executa no Flash com pensamento ativado porque tarefas de configuração de ambiente (comandos de shell, edições de configuração) raramente exigem raciocínio de nível Pro. Execute testes A/B em suas próprias cargas de trabalho antes de promover mais agentes para Pro.
| Função do Agente | Modelo Padrão | Pensamento | Esforço de Raciocínio | Saída Máxima | Temperatura | Top P |
|---|---|---|---|---|---|---|
| Gerador / Refinador | deepseek-v4-pro | Ativado | Alto | 32768 | (auto) | (auto) |
| Codificador | deepseek-v4-pro | Ativado | Alto | 20480 | (auto) | (auto) |
| Agente Principal / Assistente / Pentester | deepseek-v4-pro | Ativado | Alto | 16384 | (auto) | (auto) |
| Conselheiro (mentor/planejador) | deepseek-v4-pro | Ativado | Alto | 8192 | (auto) | (auto) |
| Instalador | deepseek-v4-flash | Ativado | Alto | 12288 | (auto) | (auto) |
| Refletor / Pesquisador / Enriquecedor | deepseek-v4-flash | Desativado | — | 4096 | 0.5 | 0.9 |
| Simples / JSON Simples | deepseek-v4-flash | Desativado | — | 2048 | 0.3 | 0.9 |
Nota: Quando o modo de pensamento está ativado, o DeepSeek ignora silenciosamente
temperature,top_p,presence_penaltyefrequency_penalty. O cliente langchaingo anula automaticamentetemperature/top_pquandoreasoning_effortestá definido, então eles aparecem como "(auto)" na tabela acima. Todos os agentes com pensamento ativado também passam explicitamenteextra_body.thinking.type: enabledcomo codificação defensiva contra futuras mudanças padrão do provedor.
Principais Recursos:
extra_body.thinking.typeLimites de Concorrência: deepseek-v4-flash: 2500 requisições concorrentes; deepseek-v4-pro: 500 requisições concorrentes.
Integração LiteLLM: Defina DEEPSEEK_PROVIDER=deepseek para ativar a prefixação do nome do modelo ao usar configurações padrão do PentAGI com proxy LiteLLM. Deixe vazio para uso direto da API.
PentAGI integra-se com GLM da Zhipu AI (Z.AI), fornecendo modelos de linguagem avançados com arquitetura MoE, raciocínio forte e capacidades agentivas desenvolvidas pela Universidade Tsinghua.
| Variável | Valor Padrão | Descrição |
|---|---|---|
GLM_API_KEY | Chave da API GLM para autenticação | |
GLM_SERVER_URL | https://api.z.ai/api/paas/v4 | URL do endpoint da API GLM (internacional) |
GLM_PROVIDER | Prefixo do provedor para integração LiteLLM (opcional) |
GLM_API_KEY=your_glm_api_key GLM_SERVER_URL=https://api.z.ai/api/paas/v4
GLM_SERVER_URL=https://open.bigmodel.cn/api/paas/v4 # China GLM_SERVER_URL=https://api.z.ai/api/coding/paas/v4 # Coding-specific
GLM_API_KEY=your_litellm_key GLM_SERVER_URL=http://litellm-proxy:4000 GLM_PROVIDER=zai # Adds prefix to model names (zai/glm-4) for LiteLLM
#### Modelos Suportados
O PentAGI suporta 13 modelos GLM com chamada de ferramentas, streaming, modos de pensamento híbridos e cache de prompt. Modelos marcados com `*` são usados na configuração padrão. O pensamento é controlado via `extra_body.thinking.type` ("enabled"/"disabled"); diferente do Kimi, o GLM é permissivo quanto à temperatura em ambos os modos.
**Série GLM-5.x - Última Geração (contexto de 200K, saída máxima de 128K)**
| ID do Modelo | Pensamento | Contexto | Saída Máx. | Preço (Entrada/Saída/Cache) | Caso de Uso |
| --------------- | ---------- | -------- | ---------- | ---------------------------- | ---------------------------------------------------------------------------------------------------------------------------------------- |
| `glm-5.1`* | ✅ Híbrido | 200K | 128K | $1,40/$4,40/$0,26 | Principal mais recente: execução autônoma sustentada por 8h, alinhado ao Claude Opus 4.6 (padrão para gerador/refinador/conselheiro/pentester) |
| `glm-5` | ✅ Híbrido | 200K | 128K | $1,00/$3,20/$0,20 | Fundação para Engenharia de Agentes, MoE 744B/40B ativos, codificação no nível Claude Opus 4.5 |
| `glm-5-turbo`* | ✅ Híbrido | 200K | 128K | $1,20/$4,00/$0,24 | Nativo OpenClaw: otimizado para invocação de ferramentas, tarefas persistentes, execução de longa cadeia (padrão para agente_principal/assistente) |
**Série GLM-4.7 - Premium com Pensamento Intercalado**
| ID do Modelo | Pensamento | Contexto | Saída Máx. | Preço (Entrada/Saída/Cache) | Caso de Uso |
| ---------------- | ---------- | -------- | ---------- | ---------------------------- | ------------------------------------------------------------------------- |
| `glm-4.7` | ✅ Híbrido | 200K | 128K | $0,60/$2,20/$0,11 | Programação aprimorada, raciocínio multi-etapas estável |
| `glm-4.7-flashx` | ✅ Híbrido | 200K | 128K | $0,07/$0,40/$0,01 | Ultra barato com GPU prioritária, mas limites RPM mais baixos (evite para uso de alta frequência) |
| `glm-4.7-flash` | ✅ Híbrido | 200K | 128K | Grátis/Grátis/Grátis | Modelo SOTA ~30B gratuito, 1 requisição concorrente |
**Série GLM-4.6 - Equilibrado com Pensamento Automático**
| ID do Modelo | Pensamento | Contexto | Saída Máx. | Preço (Entrada/Saída/Cache) | Caso de Uso |
| ------------ | ---------- | -------- | ---------- | ---------------------------- | ----------------------------------------------------- |
| `glm-4.6` | ✅ Auto | 200K | 128K | $0,60/$2,20/$0,11 | Equilibrado, chamadas de ferramentas em streaming, eficiente em tokens |
**Série GLM-4.5 - Raciocínio/Codificação/Agentes Unificados**
| ID do Modelo | Pensamento | Contexto | Saída Máx. | Preço (Entrada/Saída/Cache) | Caso de Uso |
| ------------------- | ---------- | -------- | ---------- | ---------------------------- | ---------------------------------------------------- |
| `glm-4.5` | ✅ Auto | 128K | 96K | $0,60/$2,20/$0,11 | Unificado, MoE 355B/32B ativos |
| `glm-4.5-x` | ✅ Auto | 128K | 96K | $2,20/$8,90/$0,45 | Premium ultra-rápido, menor latência |
| `glm-4.5-air`* | ✅ Auto | 128K | 96K | $0,20/$1,10/$0,03 | MoE 106B/12B econômico (padrão para simple/simple_json/reflector/searcher/enricher/installer) |
| `glm-4.5-airx` | ✅ Auto | 128K | 96K | $1,10/$4,50/$0,22 | Air acelerado com GPU prioritária |
| `glm-4.5-flash` | ✅ Auto | 128K | 96K | Grátis/Grátis/Grátis | Gratuito com suporte a raciocínio/codificação/agentes |
**GLM-4 Legado - Arquitetura Densa**
| ID do Modelo | Pensamento | Contexto | Saída Máx. | Preço (Entrada/Saída) | Caso de Uso |
| -------------------------- | ---------- | -------- | ---------- | --------------------- | -------------------------------------------------- |
| `glm-4-32b-0414-128k` | ❌ | 128K | 16K | $0,10/$0,10 | Denso 32B ultra-econômico, análise sem raciocínio |
**Preços**: Por 1 milhão de tokens. O preço de cache é para acerto de cache do prompt; o armazenamento de cache é atualmente gratuito conforme promoção do Z.AI. GLM-4-32B não possui suporte a cache.
**Configuração Padrão de Agentes**:
Estratégia: `glm-5.1` (principal mais recente, $1,40 de entrada) para raciocínio crítico, `glm-5-turbo` (nativo OpenClaw, otimizado para agentes) para orquestração, `glm-4.5-air` (MoE barato com pensamento híbrido e RPM confiável) para todos os agentes utilitários/instaladores. `glm-4.7-flashx` é evitado como padrão devido aos limites RPM mais baixos que causam erros 429 frequentes em alta frequência.
| Função do Agente | Modelo Padrão | Pensamento | Temperatura | Top P | Saída Máx. |
| --------------------------------- | ------------- | ---------- | ----------- | ----- | ---------- |
| Gerador / Refinador | `glm-5.1` | Ativado | 1,0 | 0,95 | 32768 |
| Codificador | `glm-5.1` | Ativado | 1,0 | 0,95 | 20480 |
| Conselheiro / Pentester | `glm-5.1` | Ativado | 1,0 | 0,95 | 16384 |
| Agente Principal / Assistente | `glm-5-turbo` | Ativado | 1,0 | 0,95 | 16384 |
| Instalador | `glm-4.5-air` | Ativado | 1,0 | 0,95 | 16384 |
| Simples / Refletor | `glm-4.5-air` | Desativado | 0,6 | 0,9 | 8192 |
| Pesquisador / Enriquecedor / JSON Simples | `glm-4.5-air` | Desativado | 0,6 | 0,9 | 4096 |
> **Nota sobre temperatura**: GLM aceita tanto `1.0` quanto `0.6` em ambos os modos de pensamento/não pensamento (conforme docs do Z.AI). O `IsReasoningModel` do langchaingo corresponde aos prefixos `glm-4.5*`/`glm-4.6*`/`glm-4.7*` e força a substituição da temperatura para 1.0 em `createChatRequest` — isso é inofensivo para GLM (diferente do Kimi), mas significa que os valores de temperatura para esses modelos no YAML são meramente informativos. `glm-5`/`glm-5.1`/`glm-5-turbo` não são correspondidos, portanto os valores explícitos passam sem alteração.
**Modos de Pensamento**:
- **Híbrido** (GLM-5.x, GLM-4.7): Alternância explícita via `extra_body.thinking.type`
- **Automático** (séries GLM-4.6, GLM-4.5): O modelo determina automaticamente quando o raciocínio é necessário
- **Pensamento Preservado** (capacidade de Codificação Z.AI): todos os agentes com pensamento ativado no PentAGI também passam `extra_body.thinking.clear_thinking: false` para que o `reasoning_content` de turnos anteriores do assistente seja mantido ao longo da conversa. Isso é necessário no endpoint padrão da API (`/api/paas/v4`) — no endpoint do Plano de Codificação estaria ativado por padrão. Melhora a continuidade do raciocínio e as taxas de acerto de cache em cadeias de chamadas de ferramentas com múltiplos turnos.
- Todos os agentes com pensamento ativado também passam `extra_body.tool_choice: auto` defensivamente
**Principais Características**:
- **Tarefas de Longo Horizonte**: GLM-5.1 suporta execução autônoma sustentada por 8 horas, ideal para workflows agentivos complexos de múltiplas etapas
- **Orquestração Nativa OpenClaw**: GLM-5-Turbo é especificamente otimizado para invocação de ferramentas, seguimento de instruções e execução de longa cadeia
- **Cache de Prompt**: Redução significativa de custos em contexto repetido (preço de entrada em cache mostrado)
- **Contexto Ultra Longo**: 200K tokens para as séries GLM-5.x/4.7/4.6
- **Arquitetura MoE**: Eficiente 744B/40B ativos (GLM-5/5.1), 355B/32B (GLM-4.5), 106B/12B (GLM-4.5-Air)
- **Chamada de Ferramentas**: Integração perfeita com mais de 20 ferramentas de pentest via chamada de funções
- **Streaming**: Streaming em tempo real com suporte a chamadas de ferramentas em streaming (GLM-4.6+)
- **Multilíngue**: Capacidades excepcionais de PNL em Chinês e Inglês
- **Opções Gratuitas**: GLM-4.7-Flash e GLM-4.5-Flash para prototipagem e experimentação
**Integração LiteLLM**: Defina `GLM_PROVIDER=zai` para ativar o prefixo do nome do modelo ao usar configurações padrão do PentAGI com proxy LiteLLM. Deixe vazio para uso direto da API.
### Configuração do Provedor Kimi
O PentAGI integra-se com o Kimi da Moonshot AI, fornecendo modelos de contexto ultra longo com capacidades multimodais perfeitas para analisar bases de código e documentação extensas.
#### Variáveis de Configuração
| Variável | Valor Padrão | Descrição |
| ------------------ | ------------------------------ | -------------------------------------------------- |
| `KIMI_API_KEY` | | Chave da API Kimi para autenticação |
| `KIMI_SERVER_URL` | `https://api.moonshot.ai/v1` | URL do endpoint da API Kimi (internacional) |
| `KIMI_PROVIDER` | | Prefixo do provedor para integração LiteLLM (opcional) |
#### Exemplos de Configuração```bash
# Direct API usage (international endpoint)
KIMI_API_KEY=your_kimi_api_key
KIMI_SERVER_URL=https://api.moonshot.ai/v1
# Alternative endpoint
KIMI_SERVER_URL=https://api.moonshot.cn/v1 # China
# With LiteLLM proxy
KIMI_API_KEY=your_litellm_key
KIMI_SERVER_URL=http://litellm-proxy:4000
KIMI_PROVIDER=moonshot # Adds prefix to model names (moonshot/kimi-k2.5) for LiteLLM
O PentAGI suporta 8 modelos Kimi/Moonshot com chamada de ferramentas, streaming, modos de pensamento híbrido e capacidades multimodais (texto/imagem/vídeo para K2.x). Todos os modelos legados kimi-k2-* (turbo-preview, 0905-preview, 0711-preview, thinking, thinking-turbo) foram descontinuados pela Moonshot em 2026-05-25 e NÃO estão incluídos. Modelos marcados com * são usados na configuração padrão.
Série Kimi K2.x - Flagship Multimodal
| ID do Modelo | Pensamento | Multimodal | Contexto | Preço (Input Miss / Output / Cache Hit) | Caso de Uso |
|---|---|---|---|---|---|
kimi-k2.6* | ✅ híbrido | ✅ | 256K | $0,95 / $4,00 / $0,16 | Flagship mais recente: multimodal nativo, código mais forte, conformidade de instruções aprimorada (padrão para generator/refiner/adviser/coder/pentester) |
---
[Read more](https://github.com/vxcontrol/pentagi)