
Vollständig autonomes KI-Agenten-System, das komplexe Penetrationstest-Aufgaben durchführen kann.
Treten Sie der Community bei! Vernetzen Sie sich mit Sicherheitsforschern, KI-Enthusiasten und ethischen Hackern. Erhalten Sie Unterstützung, teilen Sie Erkenntnisse und bleiben Sie über die neuesten PentAGI-Entwicklungen auf dem Laufenden.
PentAGI ist ein innovatives Tool für automatisierte Sicherheitstests, das modernste KI-Technologien nutzt. Das Projekt richtet sich an Fachleute für Informationssicherheit, Forscher und Enthusiasten, die eine leistungsstarke und flexible Lösung für Penetrationstests benötigen.
Sie können sich das Video PentAGI-Übersicht ansehen:

flowchart TB classDef person fill:#08427B,stroke:#073B6F,color:#fff classDef system fill:#1168BD,stroke:#0B4884,color:#fff classDef external fill:#666666,stroke:#0B4884,color:#fff
pentester["👤 Security Engineer
(User of the system)"]
pentagi["✨ PentAGI
(Autonomous penetration testing system)"]
target["🎯 target-system
(System under test)"]
llm["🧠 llm-provider
(OpenAI/Anthropic/Ollama/Bedrock/Gemini/Custom)"]
search["🔍 search-systems
(Google/DuckDuckGo/Tavily/Traversaal/Perplexity/Sploitus/Searxng)"]
langfuse["📊 langfuse-ui
(LLM Observability Dashboard)"]
grafana["📈 grafana
(System Monitoring Dashboard)"]
pentester --> |Uses HTTPS| pentagi
pentester --> |Monitors AI HTTPS| langfuse
pentester --> |Monitors System HTTPS| grafana
pentagi --> |Tests Various protocols| target
pentagi --> |Queries HTTPS| llm
pentagi --> |Searches HTTPS| search
pentagi --> |Reports HTTPS| langfuse
pentagi --> |Reports HTTPS| grafana
class pentester person
class pentagi system
class target,llm,search,langfuse,grafana external
linkStyle default stroke:#ffffff,color:#ffffff
<details>
<summary><b>Container-Architektur</b> (klicken zum Erweitern)</summary>```mermaid
graph TB
subgraph Core Services
UI[Frontend UI<br/>React + TypeScript]
API[Backend API<br/>Go + GraphQL]
DB[(Vector Store<br/>PostgreSQL + pgvector)]
MQ[Task Queue<br/>Async Processing]
Agent[AI Agents<br/>Multi-Agent System]
end
subgraph Knowledge Graph
Graphiti[Graphiti<br/>Knowledge Graph API]
Neo4j[(Neo4j<br/>Graph Database)]
end
subgraph Monitoring
Grafana[Grafana<br/>Dashboards]
VictoriaMetrics[VictoriaMetrics<br/>Time-series DB]
Jaeger[Jaeger<br/>Distributed Tracing]
Loki[Loki<br/>Log Aggregation]
OTEL[OpenTelemetry<br/>Data Collection]
end
subgraph Analytics
Langfuse[Langfuse<br/>LLM Analytics]
ClickHouse[ClickHouse<br/>Analytics DB]
Redis[Redis<br/>Cache + Rate Limiter]
MinIO[MinIO<br/>S3 Storage]
end
subgraph Security Tools
Scraper[Web Scraper<br/>Isolated Browser]
PenTest[Security Tools<br/>20+ Pro Tools<br/>Sandboxed Execution]
end
UI --> |HTTP/WS| API
API --> |SQL| DB
API --> |Events| MQ
MQ --> |Tasks| Agent
Agent --> |Commands| PenTest
Agent --> |Queries| DB
Agent --> |Knowledge| Graphiti
Graphiti --> |Graph| Neo4j
API --> |Telemetry| OTEL
OTEL --> |Metrics| VictoriaMetrics
OTEL --> |Traces| Jaeger
OTEL --> |Logs| Loki
Grafana --> |Query| VictoriaMetrics
Grafana --> |Query| Jaeger
Grafana --> |Query| Loki
API --> |Analytics| Langfuse
Langfuse --> |Store| ClickHouse
Langfuse --> |Cache| Redis
Langfuse --> |Files| MinIO
classDef core fill:#f9f,stroke:#333,stroke-width:2px,color:#000
classDef knowledge fill:#ffa,stroke:#333,stroke-width:2px,color:#000
classDef monitoring fill:#bbf,stroke:#333,stroke-width:2px,color:#000
classDef analytics fill:#bfb,stroke:#333,stroke-width:2px,color:#000
classDef tools fill:#fbb,stroke:#333,stroke-width:2px,color:#000
class UI,API,DB,MQ,Agent core
class Graphiti,Neo4j knowledge
class Grafana,VictoriaMetrics,Jaeger,Loki,OTEL monitoring
class Langfuse,ClickHouse,Redis,MinIO analytics
class Scraper,PenTest tools
Flow {
string id PK
string name "Flow name"
string description "Flow description"
string status "active/completed/failed"
json parameters "Flow parameters"
timestamp created_at
timestamp updated_at
}
Task {
string id PK
string flow_id FK
string name "Task name"
string description "Task description"
string status "pending/running/done/failed"
json result "Task results"
timestamp created_at
timestamp updated_at
}
SubTask {
string id PK
string task_id FK
string name "Subtask name"
string description "Subtask description"
string status "queued/running/completed/failed"
string agent_type "researcher/developer/executor"
json context "Agent context"
timestamp created_at
timestamp updated_at
}
Action {
string id PK
string subtask_id FK
string type "command/search/analyze/etc"
string status "success/failure"
json parameters "Action parameters"
json result "Action results"
timestamp created_at
}
Artifact {
string id PK
string action_id FK
string type "file/report/log"
string path "Storage path"
json metadata "Additional info"
timestamp created_at
}
Memory {
string id PK
string action_id FK
string type "observation/conclusion"
vector embedding "Vector representation"
text content "Memory content"
timestamp created_at
}
subgraph "Working Memory"
Context[Current Context<br/>Task State]
Goals[Active Goals<br/>Objectives]
State[System State<br/>Resources]
end
subgraph "Episodic Memory"
Actions[Past Actions<br/>Commands History]
Results[Action Results<br/>Outcomes]
Patterns[Success Patterns<br/>Best Practices]
end
Context --> |Query| VS
VS --> |Retrieve| Context
Goals --> |Consult| KB
KB --> |Guide| Goals
State --> |Record| Actions
Actions --> |Learn| Patterns
Patterns --> |Store| VS
Tools --> |Inform| State
Results --> |Update| Tools
VS --> |Enhance| KB
KB --> |Index| VS
classDef ltm fill:#f9f,stroke:#333,stroke-width:2px,color:#000
classDef wm fill:#bbf,stroke:#333,stroke-width:2px,color:#000
classDef em fill:#bfb,stroke:#333,stroke-width:2px,color:#000
class VS,KB,Tools ltm
class Context,Goals,State wm
class Actions,Results,Patterns em
</details>
<details>
<summary><b>Chain-Zusammenfassung</b> (click to expand)</summary>
Das Chain-Zusammenfassungssystem verwaltet das Wachstum des Gesprächskontexts, indem es ältere Nachrichten selektiv zusammenfasst. Dies ist entscheidend, um zu verhindern, dass Token-Limits überschritten werden, während die Gesprächskohärenz erhalten bleibt.```mermaid
flowchart TD
A[Input Chain] --> B{Needs Summarization?}
B -->|No| C[Return Original Chain]
B -->|Yes| D[Convert to ChainAST]
D --> E[Apply Section Summarization]
E --> F[Process Oversized Pairs]
F --> G[Manage Last Section Size]
G --> H[Apply QA Summarization]
H --> I[Rebuild Chain with Summaries]
I --> J{Is New Chain Smaller?}
J -->|Yes| K[Return Optimized Chain]
J -->|No| C
classDef process fill:#bbf,stroke:#333,stroke-width:2px,color:#000
classDef decision fill:#bfb,stroke:#333,stroke-width:2px,color:#000
classDef output fill:#fbb,stroke:#333,stroke-width:2px,color:#000
class A,D,E,F,G,H,I process
class B,J decision
class C,K output
</details>
<details>
<summary><b>Agenteninteraktion</b> (zum Erweitern klicken)</summary>```mermaid
sequenceDiagram
participant O as Orchestrator
participant R as Researcher
participant D as Developer
participant E as Executor
participant VS as Vector Store
participant KB as Knowledge Base
Note over O,KB: Flow Initialization
O->>VS: Query similar tasks
VS-->>O: Return experiences
O->>KB: Load relevant knowledge
KB-->>O: Return context
Note over O,R: Research Phase
O->>R: Analyze target
R->>VS: Search similar cases
VS-->>R: Return patterns
R->>KB: Query vulnerabilities
KB-->>R: Return known issues
R->>VS: Store findings
R-->>O: Research results
Note over O,D: Planning Phase
O->>D: Plan attack
D->>VS: Query exploits
VS-->>D: Return techniques
D->>KB: Load tools info
KB-->>D: Return capabilities
D-->>O: Attack plan
Note over O,E: Execution Phase
O->>E: Execute plan
E->>KB: Load tool guides
KB-->>E: Return procedures
E->>VS: Store results
E-->>O: Execution status
Der Algorithmus arbeitet auf einer strukturierten Repräsentation von Gesprächsketten (ChainAST), die Nachrichtentypen einschließlich Tool-Aufrufen und deren Antworten berücksichtigt. Alle Zusammenfassungsvorgänge bewahren den wesentlichen Gesprächsfluss bei gleichzeitiger Reduzierung der Kontextgröße.
| Parameter | Umgebungsvariable | Standard | Beschreibung |
|---|---|---|---|
| Letzte Abschnitte bewahren | SUMMARIZER_PRESERVE_LAST | true | Ob alle Nachrichten im letzten Abschnitt unverändert bleiben sollen |
| QA-Paare verwenden | SUMMARIZER_USE_QA | true | Ob die QA-Paar-Zusammenfassungsstrategie verwendet werden soll |
| Menschliche QA-Zusammenfassung | SUMMARIZER_SUM_MSG_HUMAN_IN_QA | false | Ob menschliche Nachrichten in QA-Paaren zusammengefasst werden sollen |
| Letzte Abschnittsgröße | SUMMARIZER_LAST_SEC_BYTES | 51200 | Maximale Byte-Größe für den letzten Abschnitt (50 KB) |
| Maximale Körperpaargröße | SUMMARIZER_MAX_BP_BYTES | 16384 | Maximale Byte-Größe für ein einzelnes Körperpaar (16 KB) |
| Maximale QA-Abschnitte | SUMMARIZER_MAX_QA_SECTIONS | 10 | Maximale Anzahl an QA-Paar-Abschnitten, die erhalten bleiben |
| Maximale QA-Größe | SUMMARIZER_MAX_QA_BYTES | 65536 | Maximale Byte-Größe für QA-Paar-Abschnitte (64 KB) |
| QA-Abschnitte behalten | SUMMARIZER_KEEP_QA_SECTIONS | 1 | Anzahl der letzten QA-Abschnitte, die ohne Zusammenfassung bleiben |
Assistenteninstanzen können benutzerdefinierte Zusammenfassungseinstellungen verwenden, um das Kontextmanagement zu optimieren:
| Parameter | Umgebungsvariable | Standard | Beschreibung |
|---|---|---|---|
| Letzte Abschnitte bewahren | ASSISTANT_SUMMARIZER_PRESERVE_LAST | true | Ob alle Nachrichten im letzten Abschnitt des Assistenten erhalten bleiben |
| Letzte Abschnittsgröße | ASSISTANT_SUMMARIZER_LAST_SEC_BYTES | 76800 | Maximale Byte-Größe für den letzten Abschnitt des Assistenten (75 KB) |
| Maximale Körperpaargröße | ASSISTANT_SUMMARIZER_MAX_BP_BYTES | 16384 | Maximale Byte-Größe für ein einzelnes Körperpaar im Assistentenkontext (16 KB) |
| Maximale QA-Abschnitte | ASSISTANT_SUMMARIZER_MAX_QA_SECTIONS | 7 | Maximale Anzahl an QA-Abschnitten im Assistentenkontext |
| Maximale QA-Größe | ASSISTANT_SUMMARIZER_MAX_QA_BYTES | 76800 | Maximale Byte-Größe für QA-Abschnitte des Assistenten (75 KB) |
| QA-Abschnitte behalten | ASSISTANT_SUMMARIZER_KEEP_QA_SECTIONS | 3 | Anzahl der letzten QA-Abschnitte, die ohne Zusammenfassung bleiben |
Die Konfiguration des Assistenten-Zusammenfassers bietet mehr Speicher für die Kontexterhaltung im Vergleich zu den globalen Einstellungen. Dabei bleibt mehr des aktuellen Gesprächsverlaufs erhalten, während eine effiziente Token-Nutzung gewährleistet wird.
SUMMARIZER_PRESERVE_LAST=true SUMMARIZER_USE_QA=true SUMMARIZER_SUM_MSG_HUMAN_IN_QA=false SUMMARIZER_LAST_SEC_BYTES=51200 SUMMARIZER_MAX_BP_BYTES=16384 SUMMARIZER_MAX_QA_SECTIONS=10 SUMMARIZER_MAX_QA_BYTES=65536 SUMMARIZER_KEEP_QA_SECTIONS=1
ASSISTANT_SUMMARIZER_PRESERVE_LAST=true ASSISTANT_SUMMARIZER_LAST_SEC_BYTES=76800 ASSISTANT_SUMMARIZER_MAX_BP_BYTES=16384 ASSISTANT_SUMMARIZER_MAX_QA_SECTIONS=7 ASSISTANT_SUMMARIZER_MAX_QA_BYTES=76800 ASSISTANT_SUMMARIZER_KEEP_QA_SECTIONS=3
</details>
<a id="advanced-agent-supervision"></a>
<details>
<summary><b>Erweiterte Agentenüberwachung</b> (anklicken, um zu erweitern)</summary>
PentAGI enthält ausgeklügelte mehrschichtige Agentenüberwachungsmechanismen, um eine effiziente Aufgabenausführung sicherzustellen, Endlosschleifen zu verhindern und eine intelligente Wiederherstellung aus festgefahrenen Zuständen zu ermöglichen:
### Ausführungsüberwachung (Beta)
- **Automatisches Mentor-Eingreifen**: Beratungs-Agent (Mentor) wird automatisch aufgerufen, wenn Ausführungsmuster auf potenzielle Probleme hindeuten
- **Mustererkennung**: Überwacht identische Tool-Aufrufe (Grenzwert: 5, konfigurierbar) und gesamte Tool-Aufrufe (Grenzwert: 10, konfigurierbar)
- **Fortschrittsanalyse**: Bewertet, ob der Agent in Richtung Teilaufgabenziel voranschreitet, erkennt Schleifen und Ineffizienzen
- **Alternative Strategien**: Empfiehlt andere Ansätze, wenn die aktuelle Strategie fehlschlägt
- **Informationsbeschaffungshilfe**: Schlägt vor, nach bewährten Lösungen zu suchen, anstatt sie neu zu erfinden
- **Verbessertes Antwortformat**: Tool-Antworten enthalten sowohl `<original_result>` als auch `<mentor_analysis>`-Abschnitte
- **Konfigurierbar**: Aktivieren über `EXECUTION_MONITOR_ENABLED` (Standard: false), Grenzwerte anpassen mit `EXECUTION_MONITOR_SAME_TOOL_LIMIT` und `EXECUTION_MONITOR_TOTAL_TOOL_LIMIT`
**Am besten geeignet für**: Kleinere Modelle (< 32B Parameter), komplexe Angriffsszenarien, die kontinuierliche Anleitung erfordern, verhindert, dass Agenten auf einem einzigen Ansatz hängen bleiben
**Leistungsauswirkung**: 2-3x längere Ausführungszeit und Tokenverbrauch, aber liefert **2x Verbesserung der Ergebnisqualität** basierend auf Tests mit Qwen3.5-27B-FP8
### Intelligente Aufgabenplanung (Beta)
- **Automatische Zerlegung**: Planer (Berater im Planungsmodus) generiert 3-7 spezifische, handlungsorientierte Schritte, bevor Spezialisten-Agenten mit der Arbeit beginnen
- **Kontextbewusste Pläne**: Analysiert den vollständigen Ausführungskontext über den Anreicherungs-Agenten, um fundierte Pläne zu erstellen
- **Strukturierte Zuweisung**: Ursprüngliche Anfrage wird in `<task_assignment>`-Struktur mit Ausführungsplan und Anweisungen eingeschlossen
- **Umfangsmanagement**: Verhindert Umfangsausweitung, indem die Agenten auf die aktuelle Teilaufgabe fokussiert bleiben
- **Angereicherte Anweisungen**: Pläne heben kritische Aktionen, potenzielle Fallstricke und Überprüfungspunkte hervor
- **Konfigurierbar**: Aktivieren über `AGENT_PLANNING_STEP_ENABLED` (Standard: false)
**Am besten geeignet für**: Modelle < 32B Parameter, komplexe Penetrationstest-Workflows, Verbesserung der Erfolgsraten bei anspruchsvollen Aufgaben
**Erweiterte Beraterkonfiguration**: Funktioniert besonders gut, wenn der Berater-Agent ein stärkeres Modell oder erweiterte Einstellungen verwendet. Beispiel: Verwendung desselben Basismodells mit maximalem Reasoning-Modus für den Berater (siehe [`vllm-qwen3.5-27b-fp8.provider.yml`](https://github.com/vxcontrol/pentagi/blob/HEAD/examples/configs/vllm-qwen3.5-27b-fp8.provider.yml)) ermöglicht umfassende Aufgabenanalyse und strategische Planung von identischer Modellarchitektur.
**Leistungsauswirkung**: Fügt Planungs-Overhead hinzu, verbessert aber deutlich die Abschlussraten und reduziert redundante Arbeit
### Tool-Aufruf-Grenzen (immer aktiv)
- **Harte Grenzen**: Verhindern unkontrollierte Ausführungen unabhängig vom Überwachungsmodus
- **Nach Agententyp unterschieden**:
- Allgemeine Agenten (Assistent, Primäragent, Pentester, Coder, Installer): `MAX_GENERAL_AGENT_TOOL_CALLS` (Standard: 100)
- Eingeschränkte Agenten (Sucher, Anreicherer, Memorisierer, Generator, Reporter, Berater, Reflektor, Planer): `MAX_LIMITED_AGENT_TOOL_CALLS` (Standard: 20)
- **Sanfte Beendigung**: Reflektor führt Agenten bei Annäherung an die Grenzen zur ordnungsgemäßen Fertigstellung
- **Ressourcenschutz**: Stellt Systemstabilität sicher und verhindert Ressourcenerschöpfung
### Reflektor-Integration (immer aktiv)
- **Automatische Korrektur**: Wird aufgerufen, wenn das LLM nach 3 Versuchen keine Tool-Aufrufe generiert
- **Strategische Anleitung**: Analysiert Fehler und führt Agenten zur korrekten Tool-Nutzung oder zu Barriere-Tools (`done`, `ask`)
- **Wiederherstellungsmechanismus**: Bietet kontextbezogene Anleitung basierend auf spezifischen Fehlermustern
- **Grenzendurchsetzung**: Koordiniert die sanfte Beendigung, wenn Tool-Aufruf-Grenzen erreicht sind
### Empfehlungen für Open-Source-Modelle
**Muss-Have für Modelle < 32B Parameter**:
Tests mit Qwen3.5-27B-FP8 zeigen, dass die Aktivierung von Ausführungsüberwachung und Aufgabenplanung **unerlässlich** für kleinere Open-Source-Modelle ist:
- **Qualitätsverbesserung**: 2x bessere Ergebnisse im Vergleich zur Basisausführung ohne Überwachung
- **Schleifenvermeidung**: Reduziert Endlosschleifen und redundante Arbeit signifikant
- **Angriffsvielfalt**: Fördert die Erkundung mehrerer Angriffsvektoren anstatt Fixierung auf einen einzelnen Ansatz
- **Luftgesperrte Bereitstellungen**: Ermöglicht produktionsreife autonome Penetrationstests in geschlossenen Netzwerkumgebungen mit lokaler LLM-Inferenz
**Kompromisse**:
- Tokenverbrauch: 2-3x höher durch Mentor/Planer-Aufrufe
- Ausführungszeit: 2-3x länger durch Analyse- und Planungsschritte
- Ergebnisqualität: 2x Verbesserung in Vollständigkeit, Genauigkeit und Angriffsabdeckung
- Modellanforderungen: Funktioniert am besten, wenn der Berater eine erweiterte Konfiguration verwendet (höhere Reasoning-Parameter, stärkere Modellvariante oder anderes Modell)
**Konfigurationsstrategie**:
Für optimale Leistung mit kleineren Modellen den Berater-Agenten mit erweiterten Einstellungen konfigurieren:
- Gleiches Modell mit maximalem Reasoning-Modus verwenden (Beispiel: [`vllm-qwen3.5-27b-fp8.provider.yml`](https://github.com/vxcontrol/pentagi/blob/HEAD/examples/configs/vllm-qwen3.5-27b-fp8.provider.yml))
- Oder ein stärkeres Modell für den Berater verwenden, während das Basismodell für andere Agenten beibehalten wird
- Überwachungsschwellenwerte basierend auf Aufgabenkomplexität und Modellfähigkeiten anpassen
</details>
Die Architektur von PentAGI ist modular, skalierbar und sicher. Hier sind die Schlüsselkomponenten:
1. **Kerndienste**
- Frontend-UI: React-basierte Weboberfläche mit TypeScript für Typsicherheit
- Backend-API: Go-basierte REST- und GraphQL-APIs mit Bearer-Token-Authentifizierung für programmatischen Zugriff
- Vektor-Speicher: PostgreSQL mit pgvector für semantische Suche und Speicher
- Aufgabenwarteschlange: Async-Aufgabenverarbeitungssystem für zuverlässigen Betrieb
- KI-Agent: Multi-Agenten-System mit spezialisierten Rollen für effizientes Testen
2. **Wissensgraph**
- Graphiti: Wissensgraph-API für semantische Beziehungsverfolgung und kontextuelles Verständnis
- Neo4j: Graphdatenbank zum Speichern und Abfragen von Beziehungen zwischen Entitäten, Aktionen und Ergebnissen
- Automatische Erfassung von Agentenantworten und Tool-Ausführungen zum Aufbau einer umfassenden Wissensbasis
3. **Monitoring-Stack**
- OpenTelemetry: Einheitliche Observability-Datenerfassung und -korrelation
- Grafana: Echtzeit-Visualisierung und Alarmierungs-Dashboards
- VictoriaMetrics: Hochleistungs-Zeitreihen-Metrikspeicher
- Jaeger: End-to-End verteiltes Tracing zum Debuggen
- Loki: Skalierbare Log-Aggregation und -Analyse
4. **Analyseplattform**
- Langfuse: Erweiterte LLM-Observability und Leistungsanalyse
- ClickHouse: Spaltenorientiertes Analyse-Datenlager
- Redis: Hochgeschwindigkeits-Caching und Ratenbegrenzung
- MinIO: S3-kompatibler Objektspeicher für Artefakte
5. **Sicherheitswerkzeuge**
- Web Scraper: Isolierte Browser-Umgebung für sichere Web-Interaktion
- Pentesting-Tools: Umfassende Suite von über 20 professionellen Sicherheitswerkzeugen
- Sandbox-Ausführung: Alle Operationen laufen in isolierten Containern
6. **Gedächtnissysteme**
- Langzeitgedächtnis: Dauerhafte Speicherung von Wissen und Erfahrungen
- Arbeitsgedächtnis: Aktiver Kontext und Ziele für aktuelle Operationen
- Episodisches Gedächtnis: Historische Aktionen und Erfolgsmuster
- Wissensbasis: Strukturiertes Domain-Wissen und Tool-Fähigkeiten
- Kontextmanagement: Intelligentes Management wachsender LLM-Kontextfenster mittels Kettenzusammenfassung
Das System verwendet Docker-Container für Isolation und einfache Bereitstellung, mit getrennten Netzwerken für Kerndienste, Monitoring und Analyse, um angemessene Sicherheitsgrenzen zu gewährleisten. Jede Komponente ist für horizontale Skalierung ausgelegt und kann für hohe Verfügbarkeit in Produktionsumgebungen konfiguriert werden.
## Schnellstart
### Systemanforderungen
- Docker und Docker Compose (oder Podman – siehe [Podman-Konfiguration](#running-pentagi-with-podman))
- Mindestens 2 vCPU
- Mindestens 4 GB RAM
- 20 GB freier Speicherplatz
- Internetzugang zum Herunterladen von Images und Updates
### Mit dem Installer (empfohlen)
PentAGI bietet einen interaktiven Installer mit einer terminalbasierten Benutzeroberfläche für optimierte Konfiguration und Bereitstellung. Der Installer führt Sie durch Systemprüfungen, LLM-Provider-Einrichtung, Suchmaschinenkonfiguration und Sicherheitshärtung.
**Unterstützte Plattformen:**
- **Linux**: amd64 [Download](https://pentagi.com/downloads/linux/amd64/installer-latest.zip) | arm64 [Download](https://pentagi.com/downloads/linux/arm64/installer-latest.zip)
- **Windows**: amd64 [Download](https://pentagi.com/downloads/windows/amd64/installer-latest.zip)
- **macOS**: amd64 (Intel) [Download](https://pentagi.com/downloads/darwin/amd64/installer-latest.zip) | arm64 (M-Serie) [Download](https://pentagi.com/downloads/darwin/arm64/installer-latest.zip)
**Schnellinstallation (Linux amd64):**```bash
# Create installation directory
mkdir -p pentagi && cd pentagi
# Download installer
wget -O installer.zip https://pentagi.com/downloads/linux/amd64/installer-latest.zip
# Extract
unzip installer.zip
# Run interactive installer
./installer
Voraussetzungen & Berechtigungen:
Das Installationsprogramm benötigt geeignete Berechtigungen, um ordnungsgemäß mit der Docker-API zu interagieren. Standardmäßig wird der Docker-Socket (/var/run/docker.sock) verwendet, der Folgendes erfordert:
Option 1 (für Produktion empfohlen): Führen Sie das Installationsprogramm als root aus: ```bash sudo ./installer
Option 2 (Entwicklungsumgebungen): Gewähren Sie Ihrem Benutzer Zugriff auf den Docker-Socket, indem Sie ihn zur Gruppe docker hinzufügen: ```bash
sudo usermod -aG docker $USER
newgrp docker
docker ps
⚠️ Sicherheitshinweis: Das Hinzufügen eines Benutzers zur docker-Gruppe gewährt root-äquivalente Berechtigungen. Tun Sie dies nur für vertrauenswürdige Benutzer in kontrollierten Umgebungen. Für Produktionsumgebungen sollten Sie den rootless Docker-Modus in Betracht ziehen oder den Installer mit sudo ausführen.
Der Installer wird:
.env-Datei mit optimalen StandardwertenDie PentAGI-Webkonsole verwaltet bereits mehrere Einstellungsbereiche, nachdem der Server läuft und betriebsbereit ist:
Die folgenden Konfigurationsbereiche müssen weiterhin auf dem Server über Umgebungsvariablen, Compose-Dateien oder eingebundene Konfigurationsdateien festgelegt werden:
OLLAMA_SERVER_CONFIG_PATH und LLM_SERVER_CONFIG_PATH.DUCKDUCKGO_*, GOOGLE_*, TAVILY_API_KEY, TRAVERSAAL_API_KEY, PERPLEXITY_*, SEARXNG_* und SPLOITUS_ENABLED.Für Produktion & erweiterte Sicherheit:
Für Produktionsumgebungen oder sicherheitskritische Umgebungen empfehlen wir dringend die Verwendung einer verteilten Zwei-Knoten-Architektur, bei der Worker-Operationen auf einem separaten Server isoliert werden. Dies verhindert die Ausführung nicht vertrauenswürdigen Codes und Netzwerkzugriffsprobleme auf Ihrem Hauptsystem.
Siehe ausführliche Anleitung: Worker Node Setup
Die Zwei-Knoten-Einrichtung bietet:
2. Kopieren Sie `.env.example` nach `.env` oder laden Sie es herunter:```bash
curl -o .env https://raw.githubusercontent.com/vxcontrol/pentagi/master/.env.example
touch für die Beispieldateien (example.custom.provider.yml, example.ollama.provider.yml) aus oder laden Sie sie herunter:```bash
curl -o example.custom.provider.yml https://raw.githubusercontent.com/vxcontrol/pentagi/master/examples/configs/custom-openai.provider.yml
curl -o example.ollama.provider.yml https://raw.githubusercontent.com/vxcontrol/pentagi/master/examples/configs/ollama-llama318b.provider.yml4. Füge die erforderlichen API-Schlüssel in die `.env`-Datei ein.```bash
# Required: At least one of these LLM providers
OPEN_AI_KEY=your_openai_key
ANTHROPIC_API_KEY=your_anthropic_key
GEMINI_API_KEY=your_gemini_key
# Optional: AWS Bedrock provider (enterprise-grade models)
BEDROCK_REGION=us-east-1
# Choose one authentication method:
BEDROCK_DEFAULT_AUTH=true # Option 1: Use AWS SDK default credential chain (recommended for EC2/ECS)
# BEDROCK_BEARER_TOKEN=your_bearer_token # Option 2: Bearer token authentication
# BEDROCK_ACCESS_KEY_ID=your_aws_access_key # Option 3: Static credentials
# BEDROCK_SECRET_ACCESS_KEY=your_aws_secret_key
# Optional: Ollama provider (local or cloud)
# OLLAMA_SERVER_URL=http://ollama-server:11434 # Local server
# OLLAMA_SERVER_URL=https://ollama.com # Cloud service
# OLLAMA_SERVER_API_KEY=your_ollama_cloud_key # Required for cloud, empty for local
# Optional: Chinese AI providers
# DEEPSEEK_API_KEY=your_deepseek_key # DeepSeek (strong reasoning)
# GLM_API_KEY=your_glm_key # GLM (Zhipu AI)
# KIMI_API_KEY=your_kimi_key # Kimi (Moonshot AI, ultra-long context)
# QWEN_API_KEY=your_qwen_key # Qwen (Alibaba Cloud, multimodal)
# Optional: Local LLM provider (zero-cost inference)
OLLAMA_SERVER_URL=http://localhost:11434
OLLAMA_SERVER_MODEL=your_model_name
# Optional: Additional search capabilities
DUCKDUCKGO_ENABLED=true
DUCKDUCKGO_REGION=us-en
DUCKDUCKGO_SAFESEARCH=
DUCKDUCKGO_TIME_RANGE=
SPLOITUS_ENABLED=true
GOOGLE_API_KEY=your_google_key
GOOGLE_CX_KEY=your_google_cx
TAVILY_API_KEY=your_tavily_key
TRAVERSAAL_API_KEY=your_traversaal_key
PERPLEXITY_API_KEY=your_perplexity_key
PERPLEXITY_MODEL=sonar-pro
PERPLEXITY_CONTEXT_SIZE=medium
# Searxng meta search engine (aggregates results from multiple sources)
SEARXNG_URL=http://your-searxng-instance:8080
SEARXNG_CATEGORIES=general
SEARXNG_LANGUAGE=
SEARXNG_SAFESEARCH=0
SEARXNG_TIME_RANGE=
SEARXNG_TIMEOUT=
## Graphiti knowledge graph settings
GRAPHITI_ENABLED=true
GRAPHITI_TIMEOUT=30
GRAPHITI_URL=http://graphiti:8000
GRAPHITI_MODEL_NAME=gpt-5-mini
# Neo4j settings (used by Graphiti stack)
NEO4J_USER=neo4j
NEO4J_DATABASE=neo4j
NEO4J_PASSWORD=devpassword
NEO4J_URI=bolt://neo4j:7687
# Assistant configuration
ASSISTANT_USE_AGENTS=false # Default value for agent usage when creating new assistants
.env-Datei, um die Sicherheit zu verbessern.COOKIE_SIGNING_SALT - Salt für die Cookie-Signierung, auf einen zufälligen Wert ändernPUBLIC_URL - Öffentliche URL Ihres Servers (z. B. https://pentagi.example.com)SERVER_SSL_CRT und SERVER_SSL_KEY - Benutzerdefinierte Pfade zu Ihrem vorhandenen SSL-Zertifikat und -Schlüssel für HTTPS (diese Pfade sollten in der docker-compose.yml-Datei verwendet werden, um als Volumes einzubinden)SCRAPER_PUBLIC_URL - Öffentliche URL für den Scraper, falls Sie einen anderen Scraper-Server für öffentliche URLs verwenden möchtenSCRAPER_PRIVATE_URL - Private URL für den Scraper (lokaler Scraper-Server in der docker-compose.yml-Datei, um auf lokale URLs zuzugreifen)PENTAGI_POSTGRES_USER und PENTAGI_POSTGRES_PASSWORD - PostgreSQL-AnmeldeinformationenNEO4J_USER und NEO4J_PASSWORD - Neo4j-Anmeldeinformationen (für den Graphiti-Wissensgraphen).env-Datei, wenn Sie sie in VSCode oder anderen IDEs als envFile-Option verwenden möchten:```bash
perl -i -pe 's/\s+#.*$//' .env7. Führen Sie den PentAGI-Stack aus:```bash
curl -O https://raw.githubusercontent.com/vxcontrol/pentagi/master/docker-compose.yml
docker compose up -d
Besuchen Sie localhost:8443, um auf die PentAGI Web UI zuzugreifen (Standard ist [email protected] / admin)
PentAGI bietet keine öffentliche Selbstregistrierung auf der Anmeldeseite an. Eine Neuinstallation erstellt das standardmäßige lokale Administratorkonto:
[email protected]adminÄndern Sie bei der ersten Anmeldung das Standardpasswort, bevor Sie die Instanz für produktive Arbeiten verwenden. Falls das Administratorkennwort später verloren geht, nutzen Sie das Installations-Wartungsmenü, um das Passwort des Standardkontos [email protected] zurückzusetzen.
Für Mehrbenutzerkonfigurationen kann ein authentifizierter Administrator lokale Benutzer über die Users REST API (/api/v1/users/) verwalten. Die OpenAPI-Oberfläche ist nach dem Start der Instanz unter https://localhost:8443/api/v1/swagger/index.html verfügbar.
[!NOTE] Falls Sie einen Fehler bezüglich
pentagi-networkoderobservability-networkoderlangfuse-networkerhalten haben, müssen Sie zuerstdocker-compose.ymlausführen, um diese Netzwerke zu erstellen, und danachdocker-compose-langfuse.yml,docker-compose-graphiti.ymlunddocker-compose-observability.ymlausführen, um die Langfuse-, Graphiti- und Observability-Dienste zu nutzen.Sie müssen mindestens einen Sprachmodellanbieter (OpenAI, Anthropic, Gemini, AWS Bedrock oder Ollama) konfigurieren, um PentAGI nutzen zu können. AWS Bedrock bietet unternehmensgerechten Zugriff auf mehrere Foundation-Modelle führender KI-Unternehmen, während Ollama kostenlose lokale Inferenz bietet, sofern Sie ausreichende Rechenressourcen haben. Zusätzliche API-Schlüssel für Suchmaschinen sind optional, aber für bessere Ergebnisse empfohlen.
Für vollständig lokalen Einsatz mit fortschrittlichen Modellen: Siehe unseren umfassenden Leitfaden zum Ausführen von PentAGI mit vLLM und Qwen3.5-27B-FP8 für eine produktionsreife lokale LLM-Einrichtung. Diese Konfiguration erreicht ~13.000 TPS für die Prompt-Verarbeitung und ~650 TPS für die Vervollständigung auf 4× RTX 5090 GPUs und unterstützt 12+ gleichzeitige Abläufe bei völliger Unabhängigkeit von Cloud-Anbietern.
LLM_SERVER_*Umgebungsvariablen sind experimentelle Funktionen und werden in Zukunft geändert. Derzeit können Sie damit eine benutzerdefinierte LLM-Server-URL und ein Modell für alle Agententypen angeben.
PROXY_URList eine globale Proxy-URL für alle LLM-Anbieter und externen Suchsysteme. Sie können sie zur Isolierung von externen Netzwerken verwenden.Die Datei
docker-compose.ymlführt den PentAGI-Dienst als Root-Benutzer aus, da er Zugriff auf docker.sock für die Containerverwaltung benötigt. Wenn Sie eine TCP/IP-Netzwerkverbindung zu Docker anstelle der Socket-Datei verwenden, können Sie die Root-Berechtigungen entfernen und den Standardbenutzerpentagifür eine bessere Sicherheit verwenden.
Standardmäßig bindet PentAGI aus Sicherheitsgründen an 127.0.0.1 (nur localhost). Um von anderen Rechnern im Netzwerk auf PentAGI zuzugreifen, müssen Sie den externen Zugriff konfigurieren.
.env-Datei mit der IP-Adresse Ihres Servers:```bashPENTAGI_LISTEN_IP=0.0.0.0 PENTAGI_LISTEN_PORT=8443
PUBLIC_URL=https://192.168.1.100:8443
CORS_ORIGINS=https://localhost:8443,https://192.168.1.100:8443
> [!WICHTIG]
> - Ersetzen Sie `192.168.1.100` durch die tatsächliche IP-Adresse Ihres Servers
> - Verwenden Sie NICHT `0.0.0.0` in `PUBLIC_URL` oder `CORS_ORIGINS` – verwenden Sie die tatsächliche IP-Adresse
> - Schließen Sie sowohl localhost als auch Ihre Server-IP in `CORS_ORIGINS` ein, um Flexibilität zu gewährleisten
2. **Container neu erstellen**, um die Änderungen zu übernehmen:```bash
docker compose down
docker compose up -d --force-recreate
Sie sollten `0.0.0.0:8443->8443/tcp` oder `:::8443->8443/tcp` sehen.
Wenn Sie `127.0.0.1:8443->8443/tcp` sehen, wurde die Umgebungsvariable nicht übernommen. Bearbeiten Sie in diesem Fall direkt `docker-compose.yml` Zeile 31:```yaml
ports:
- "0.0.0.0:8443:8443"
Dann erstelle die Container erneut.
sudo ufw allow 8443/tcp sudo ufw reload
sudo firewall-cmd --permanent --add-port=8443/tcp sudo firewall-cmd --reload
5. **Zugriff auf PentAGI:**
- **Lokaler Zugriff:** `https://localhost:8443`
- **Netzwerkzugriff:** `https://your-server-ip:8443`
> [!NOTE]
> Sie müssen die Warnung zum selbstsignierten SSL-Zertifikat in Ihrem Browser akzeptieren, wenn Sie über die IP-Adresse zugreifen.
---
### PentAGI mit Podman ausführen
PentAGI unterstützt Podman vollständig als Docker-Alternative. Allerdings erfordert der Scraper-Dienst bei Verwendung des **rootless-Modus von Podman** eine spezielle Konfiguration, da rootless-Container keine privilegierten Ports (Ports unter 1024) binden können.
#### Rootless-Konfiguration für Podman
Die Standardkonfiguration des Scrapers verwendet Port 443 (HTTPS), einen privilegierten Port. Konfigurieren Sie den Scraper für Podman rootless so um, dass er einen nicht-privilegierten Port verwendet:
**1. Bearbeiten Sie `docker-compose.yml`** - modifizieren Sie den `scraper`-Dienst (etwa in Zeile 199):```yaml
scraper:
image: vxcontrol/scraper:latest
restart: unless-stopped
container_name: scraper
hostname: scraper
expose:
- 3000/tcp # Changed from 443 to 3000
ports:
- "${SCRAPER_LISTEN_IP:-127.0.0.1}:${SCRAPER_LISTEN_PORT:-9443}:3000" # Map to port 3000
environment:
- MAX_CONCURRENT_SESSIONS=${LOCAL_SCRAPER_MAX_CONCURRENT_SESSIONS:-10}
- USERNAME=${LOCAL_SCRAPER_USERNAME:-someuser}
- PASSWORD=${LOCAL_SCRAPER_PASSWORD:-somepass}
logging:
options:
max-size: 50m
max-file: "7"
volumes:
- scraper-ssl:/usr/src/app/ssl
networks:
- pentagi-network
shm_size: 2g
2. .env-Datei aktualisieren – Ändern Sie die Scraper-URL zur Verwendung von HTTP und Port 3000:```bash
SCRAPER_PRIVATE_URL=http://someuser:somepass@scraper:3000/ LOCAL_SCRAPER_USERNAME=someuser LOCAL_SCRAPER_PASSWORD=somepass
> [!IMPORTANT]
> Wichtige Änderungen für Podman:
> - Verwende **HTTP** anstelle von HTTPS für `SCRAPER_PRIVATE_URL`
> - Verwende Port **3000** anstelle von 443
> - Ändere internes `expose` auf `3000/tcp`
> - Aktualisiere Port-Zuordnung, um auf `3000` statt `443` zu verweisen
**3. Container neu erstellen:**```bash
podman-compose down
podman-compose up -d --force-recreate
4. Scraper-Konnektivität testen:```bash
podman exec -it pentagi wget -O- "http://someuser:somepass@scraper:3000/html?url=http://example.com"
Wenn Sie HTML-Ausgabe sehen, funktioniert der Scraper korrekt.
#### Podman Rootful Mode
Wenn Sie Podman im Rootful-Modus (mit sudo) ausführen, können Sie die Standardkonfiguration ohne Änderungen verwenden. Der Scraper funktioniert wie vorgesehen auf Port 443.
#### Docker Compatibility
Alle Podman-Konfigurationen bleiben vollständig kompatibel mit Docker. Der nicht-privilegierte Port-Ansatz funktioniert auf beiden Container-Laufzeiten identisch.
### Assistentenkonfiguration
Mit PentAGI können Sie das Standardverhalten für Assistenten konfigurieren:
| Variable | Standard | Beschreibung |
| ---------------------- | ------- | ----------------------------------------------------------------------- |
| `ASSISTANT_USE_AGENTS` | `false` | Steuert den Standardwert für die Agentennutzung beim Erstellen neuer Assistenten |
Die Einstellung `ASSISTANT_USE_AGENTS` beeinflusst den Anfangszustand des Umschalters "Use Agents" beim Erstellen eines neuen Assistenten in der Benutzeroberfläche:
- `false` (Standard): Neue Assistenten werden standardmäßig ohne Agenten-Delegation erstellt
- `true`: Neue Assistenten werden standardmäßig mit aktivierter Agenten-Delegation erstellt
Beachten Sie, dass Benutzer diese Einstellung jederzeit überschreiben können, indem sie den Schalter "Use Agents" in der Benutzeroberfläche beim Erstellen oder Bearbeiten eines Assistenten umlegen. Diese Umgebungsvariable steuert nur den anfänglichen Standardzustand.
## So verwenden Sie PentAGI nach der Anmeldung
Sobald der Stack läuft und Sie sich in der Web-UI anmelden können, ist der schnellste Weg über den Flows-Workflow.
### 1. Erstellen Sie Ihren ersten Flow
1. Öffnen Sie **Flows** in der Seitenleiste.
2. Klicken Sie auf **Neuer Flow**.
3. Wählen Sie den Modus, der zu Ihrem Ziel passt:
- **Automation**: vollständig autonome Ausführung für ein Testziel, das PentAGI von Anfang bis Ende durchführen soll
- **Assistant**: interaktive Unterstützung, wenn Sie die Untersuchung Schritt für Schritt steuern möchten. In diesem Modus können Sie auch den Schalter **Use Agents** aktivieren, damit PentAGI Unteraufgaben an spezialisierte Unter-Agenten für komplexere Untersuchungen delegieren kann.
4. Wählen Sie den LLM-Anbieter aus, den Sie für diesen Flow verwenden möchten.
5. Beschreiben Sie das Ziel und die Aufgabenstellung in natürlicher Sprache im Nachrichtenfeld.
Gute erste Anweisungen umfassen in der Regel:
- das Zielsystem oder die URL
- die Art der gewünschten Bewertung
- etwaige Bereichsbeschränkungen oder Verhaltensregeln
- das erwartete Ergebnis, z. B. einen Schwachstellenbericht oder die Bestätigung einer Hypothese
Beispiel:```text
Assess https://target.example for common web application vulnerabilities. Focus on authentication, file handling, and injection issues. Stay within the provided target only and summarize confirmed findings with reproduction steps.
Only test systems you own or are explicitly authorized to assess. See EULA.md for the acceptable use requirements.
Das neue Flow-Formular enthält eine Vorlagenauswahl, die das Nachrichtenfeld mit einer gespeicherten Flow-Vorlage vorausfüllen kann. Dies ist nützlich, wenn Sie ähnliche Bewertungen wiederholt durchführen.
examples/prompts/base_web_pentest.md, wenn Sie eine praktische Grundlage für Webtests benötigenVorlagen sind Ausgangspunkte. Sie benötigen keine spezielle Syntax, um PentAGI zu verwenden: einfache Anweisungen in natürlicher Sprache funktionieren gut, solange Ziel und Zweck klar sind.
Nach dem Absenden des Flows öffnet PentAGI automatisch die Flow-Seite.
Sobald der Flow genügend Ergebnisse hat, verwenden Sie das Bericht-Menü auf der Flow-Seite, um:
Jeder Flow enthält auch eine Assistant-Ansicht für interaktive Anleitung. Dies ist nützlich, wenn der autonome Lauf etwas aufdeckt, das menschliche Anleitung anstelle eines harten Neustarts erfordert.
Jeder Flow hat seinen eigenen Dateien-Tab auf der Flow-Seite. Dateien sind auf den übergeordneten Flow beschränkt: Sie befinden sich in {dataDir}/flow-{id}-data/ auf dem Host und gelangen nie in andere Flows.
Der Tab zeigt drei Dateiquellen an:
uploads/): Dateien, die Sie über die Weboberfläche bereitstellen. Verwenden Sie die Aktion Dateien hochladen oder ziehen Sie Dateien direkt auf den Dateien-Tab. Während der Agentencontainer läuft, werden hochgeladene Dateien auch in diesen unter /work/uploads/ übertragen, sodass der Agent sie mit normalen Shell-Tools lesen kann.resources/): Dateien, die aus Ihrer gespeicherten Benutzerressourcenbibliothek über Ressourcen aus Bibliothek anhängen angehängt werden. Angehängte Ressourcen werden in den Flow kopiert und in den laufenden Container unter /work/resources/ übertragen.container/): Snapshots, die über Datei oder Verzeichnis aus Container abrufen aus dem laufenden Agentencontainer gezogen werden. Diese sind auf der Flow-Seite schreibgeschützt und werden nie zurück an den Container gesendet.Pro-Datei-Aktionen im Dateien-Tab umfassen Herunterladen, Pfad kopieren, Als Ressource speichern (Befördern einer Flow-Datei in Ihre wiederverwendbare Ressourcenbibliothek) und Löschen. Die Abruf-Aktion ist deaktiviert, wenn der Container nicht läuft, mit dem Tooltip "Container läuft nicht".
Hochgeladene Dateien und angehängte Ressourcen werden automatisch in den System-Prompts des Agenten über die Vorlagenvariable {{.UserFiles}} aufgelistet, die einen kompakten <task_files>-XML-Block (mit verschachtelten <uploads>- und <resources>-Abschnitten) rendert, sodass der Assistant und Automatisierungsagenten sie über den Pfad referenzieren können, ohne dass Sie den Inhalt in den Chat einfügen müssen. Container-Snapshots sind nur in der UI sichtbar und werden nicht automatisch zurück in den Prompt injiziert.
Aktuelle Grenzen und Einschränkungen, die zu beachten sind:
/work/uploads/ und /work/resources/ gespiegelt; Dateien, die in andere Containerpfade geschrieben werden, werden nicht automatisch zurück in das Flow-Dateimodell gespiegelt. Container-Snapshots können von jedem Containerpfad stammen, den Sie abrufen (z.B. /etc/...), und werden auf der Flow-Seite unter container/ zwischengespeichert; sie werden nicht zurück in den Container übertragen.flow-{id}-data/ auf der Festplatte. Betreiber werden weiterhin gebeten, das Datenverzeichnis manuell zu bereinigen, wenn sie den Speicherplatz zurückgewinnen möchten.Für frühe Tests beginnen Sie mit einem engen Ziel und einem einzigen klaren Zweck. Dies erleichtert die Überprüfung der Ausgabe und hilft Ihnen, Ihre Prompts zu verfeinern, bevor Sie größere Bewertungen durchführen.
PentAGI bietet umfassenden programmatischen Zugriff sowohl über REST- als auch GraphQL-APIs, sodass Sie Penetrationstest-Workflows in Ihre Automatisierungspipelines, CI/CD-Prozesse und benutzerdefinierten Anwendungen integrieren können.
API-Tokens werden über die PentAGI-Weboberfläche verwaltet:
Jedes Token ist Ihrem Benutzerkonto zugeordnet und erbt die Berechtigungen Ihrer Rolle.
Fügen Sie das API-Token in den Authorization-Header Ihrer HTTP-Anfragen ein:```bash
curl -X POST https://your-pentagi-instance:8443/api/v1/graphql
-H "Authorization: Bearer YOUR_API_TOKEN"
-H "Content-Type: application/json"
-d '{"query": "{ flows { id title status } }"}'
curl https://your-pentagi-instance:8443/api/v1/flows
-H "Authorization: Bearer YOUR_API_TOKEN"
### API-Erkundung und -Testen
PentAGI bietet interaktive Dokumentation zur Erkundung und zum Testen von API-Endpunkten:
#### GraphQL Playground
Greifen Sie auf das GraphQL Playground unter `https://your-pentagi-instance:8443/api/v1/graphql/playground` zu
1. Klicken Sie auf die Registerkarte **HTTP Headers** unten
2. Fügen Sie Ihren Autorisierungs-Header hinzu: ```json
{
"Authorization": "Bearer YOUR_API_TOKEN"
}
Zugriff auf die REST-API-Dokumentation unter https://your-pentagi-instance:8443/api/v1/swagger/index.html
Bearer YOUR_API_TOKENSie können typsichere API-Clients für Ihre bevorzugte Programmiersprache mit den in PentAGI enthaltenen Schemadateien generieren:
Das GraphQL-Schema ist verfügbar unter:
schema.graphqls herunterzuladenbackend/pkg/graph/schema.graphqls im RepositoryGenerieren Sie Clients mit Tools wie:
Die OpenAPI-Spezifikation ist verfügbar unter:
https://your-pentagi-instance:8443/api/v1/swagger/doc.jsonbackend/pkg/server/docs/swagger.yamlGenerieren Sie Clients mit:
class PentAGIClient: def init(self, base_url, api_token): self.base_url = base_url self.headers = { "Authorization": f"Bearer {api_token}", "Content-Type": "application/json" }
def create_flow(self, provider, target):
query = """
mutation CreateFlow($provider: String!, $input: String!) {
createFlow(modelProvider: $provider, input: $input) {
id
title
status
}
}
"""
response = requests.post(
f"{self.base_url}/api/v1/graphql",
json={
"query": query,
"variables": {
"provider": provider,
"input": target
}
},
headers=self.headers
)
return response.json()
def get_flows(self):
response = requests.get(
f"{self.base_url}/api/v1/flows",
headers=self.headers
)
return response.json()
client = PentAGIClient( "https://your-pentagi-instance:8443", "your_api_token_here" )
flow = client.create_flow("openai", "Scan https://example.com for vulnerabilities") print(f"Created flow: {flow}")
flows = client.get_flows() print(f"Total flows: {len(flows['flows'])}")
</details>
<details>
<summary><b>TypeScript-Client-Beispiel</b></summary>```typescript
import axios, { AxiosInstance } from 'axios';
interface Flow {
id: string;
title: string;
status: string;
createdAt: string;
}
class PentAGIClient {
private client: AxiosInstance;
constructor(baseURL: string, apiToken: string) {
this.client = axios.create({
baseURL: `${baseURL}/api/v1`,
headers: {
'Authorization': `Bearer ${apiToken}`,
'Content-Type': 'application/json',
},
});
}
async createFlow(provider: string, input: string): Promise<Flow> {
const query = `
mutation CreateFlow($provider: String!, $input: String!) {
createFlow(modelProvider: $provider, input: $input) {
id
title
status
createdAt
}
}
`;
const response = await this.client.post('/graphql', {
query,
variables: { provider, input },
});
return response.data.data.createFlow;
}
async getFlows(): Promise<Flow[]> {
const response = await this.client.get('/flows');
return response.data.flows;
}
async getFlow(flowId: string): Promise<Flow> {
const response = await this.client.get(`/flows/${flowId}`);
return response.data;
}
}
// Usage
const client = new PentAGIClient(
'https://your-pentagi-instance:8443',
'your_api_token_here'
);
// Create a new flow
const flow = await client.createFlow(
'openai',
'Perform penetration test on https://example.com'
);
console.log('Created flow:', flow);
// List all flows
const flows = await client.getFlows();
console.log(`Total flows: ${flows.length}`);
Bei der Arbeit mit API-Tokens:
Die Token-Liste zeigt:
Bei Verwendung benutzerdefinierter LLM-Anbieter mit den LLM_SERVER_*-Variablen können Sie das Reasoning-Format, das in Anfragen verwendet wird, optimieren.
[!TIP] Für produktionsreife lokale Bereitstellungen sollten Sie die Verwendung von vLLM mit Qwen3.5-27B-FP8 für optimale Leistung in Betracht ziehen. Siehe unseren umfassenden Bereitstellungsleitfaden, der Hardwareanforderungen, Konfigurationsvorlagen (Thinking-Modus und Nicht-Thinking-Modus) sowie Leistungsbenchmarks mit 13K TPS Prompt-Verarbeitung auf 4× RTX 5090 GPUs enthält.
| Variable | Standard | Beschreibung |
|---|---|---|
LLM_SERVER_URL | Basis-URL für den benutzerdefinierten LLM-API-Endpunkt | |
LLM_SERVER_KEY | API-Schlüssel für den benutzerdefinierten LLM-Anbieter | |
LLM_SERVER_MODEL | Standardmodell (kann in der Anbieterkonfiguration überschrieben werden) | |
LLM_SERVER_CONFIG_PATH | Pfad zur YAML-Konfigurationsdatei für agentenspezifische Modelle | |
LLM_SERVER_PROVIDER | Anbieternamenspräfix für Modellnamen (z. B. openrouter, deepseek für LiteLLM-Proxy) | |
LLM_SERVER_LEGACY_REASONING | false | Steuert das Reasoning-Format in API-Anfragen |
LLM_SERVER_PRESERVE_REASONING | false | Reasoning-Inhalt in mehrteiligen Konversationen beibehalten (von einigen Anbietern erforderlich) |
Die Einstellung LLM_SERVER_PROVIDER ist besonders nützlich bei Verwendung des LiteLLM-Proxys, der ein Anbieternamenspräfix zu Modellnamen hinzufügt. Wenn Sie z. B. über LiteLLM eine Verbindung zur Moonshot-API herstellen, werden Modelle wie kimi-2.5 zu moonshot/kimi-2.5. Indem Sie LLM_SERVER_PROVIDER=moonshot setzen, können Sie dieselbe Anbieterkonfigurationsdatei sowohl für den direkten API-Zugriff als auch für den LiteLLM-Proxy-Zugriff ohne Änderungen verwenden.
Die Einstellung LLM_SERVER_LEGACY_REASONING beeinflusst, wie Reasoning-Parameter an das LLM gesendet werden:
false (Standard): Verwendet modernes Format, bei dem Reasoning als strukturiertes Objekt mit dem Parameter max_tokens gesendet wirdtrue: Verwendet Legacy-Format mit dem zeichenkettenbasierten Parameter reasoning_effortDiese Einstellung ist wichtig, wenn Sie mit verschiedenen LLM-Anbietern arbeiten, da diese möglicherweise unterschiedliche Reasoning-Formate in ihren API-Anfragen erwarten. Wenn bei benutzerdefinierten Anbietern Reasoning-bezogene Fehler auftreten, versuchen Sie, diese Einstellung zu ändern.
Die Einstellung LLM_SERVER_PRESERVE_REASONING steuert, ob Reasoning-Inhalte in mehrteiligen Konversationen beibehalten werden:
false (Standard): Reasoning-Inhalte werden nicht im Konversationsverlauf beibehaltentrue: Reasoning-Inhalte werden beibehalten und in nachfolgenden API-Aufrufen gesendetDiese Einstellung ist von einigen LLM-Anbietern (z. B. Moonshot) erforderlich, die Fehler wie "thinking is enabled but reasoning_content is missing in assistant tool call message" zurückgeben, wenn Reasoning-Inhalte nicht in mehrteiligen Konversationen enthalten sind. Aktivieren Sie diese Einstellung, wenn Ihr Anbieter die Beibehaltung von Reasoning-Inhalten verlangt.
PentAGI unterstützt Ollama sowohl für die lokale LLM-Inferenz (null Kosten, verbesserte Privatsphäre) als auch für Ollama Cloud (verwalteter Dienst mit kostenloser Stufe).
| Variable | Standard | Beschreibung |
|---|---|---|
OLLAMA_SERVER_URL | URL Ihres Ollama-Servers oder von Ollama Cloud | |
OLLAMA_SERVER_API_KEY | API-Schlüssel für die Ollama-Cloud-Authentifizierung | |
OLLAMA_SERVER_MODEL | Standardmodell für die Inferenz | |
OLLAMA_SERVER_CONFIG_PATH | Pfad zur benutzerdefinierten Agentenkonfigurationsdatei | |
OLLAMA_SERVER_PULL_MODELS_TIMEOUT | 600 | Timeout für Modell-Downloads (Sekunden) |
OLLAMA_SERVER_PULL_MODELS_ENABLED | false | Modelle beim Start automatisch herunterladen |
OLLAMA_SERVER_LOAD_MODELS_ENABLED | false | Server nach verfügbaren Modellen abfragen |
Ollama Cloud bietet verwaltete Inferenz mit einer großzügigen kostenlosen Stufe und skalierbaren kostenpflichtigen Plänen.
Einrichtung der kostenlosen Stufe (Einzelmodell)```bash
OLLAMA_SERVER_URL=https://ollama.com OLLAMA_SERVER_API_KEY=your_ollama_cloud_api_key OLLAMA_SERVER_MODEL=gpt-oss:120b # Example: OpenAI OSS 120B model
**Paid Tier Setup (Multi-Model mit vorgefertigter Konfiguration)**
Verwenden Sie für kostenpflichtige Tarife, die mehrere gleichzeitige Modelle unterstützen, die vorgefertigte Ollama Cloud-Konfiguration:```bash
# Using pre-built Ollama Cloud configuration (included in Docker image)
OLLAMA_SERVER_URL=https://ollama.com
OLLAMA_SERVER_API_KEY=your_ollama_cloud_api_key
OLLAMA_SERVER_CONFIG_PATH=/opt/pentagi/conf/ollama-cloud.provider.yml
Die vorgefertigte Konfiguration ollama-cloud.provider.yml enthält optimierte Modellzuweisungen für alle Agententypen:
nemotron-3-super:cloud - Schnelles Allzweckmodellqwen3-coder-next:cloud - Fortschrittliches Denken mit hohem Aufwandsmodusqwen3-coder-next:cloud - Spezialisierte Codierungsmodelleqwen3.5:397b-cloud - Großer Kontext für Informationssammlungglm-5:cloud - Hochwertige Textverfeinerungminimax-m2.7:cloud - Effiziente Beratungsaufgabendevstral-2:123b-cloud - Installations- und EinrichtungsaufgabenBenutzerdefinierte Konfiguration (Fortgeschritten)
Um eine eigene Agentenkonfiguration zu erstellen, binden Sie eine benutzerdefinierte Datei von Ihrem Host-Dateisystem ein:```bash
OLLAMA_SERVER_URL=https://ollama.com OLLAMA_SERVER_API_KEY=your_ollama_cloud_api_key OLLAMA_SERVER_CONFIG_PATH=/opt/pentagi/conf/ollama.provider.yml
PENTAGI_OLLAMA_SERVER_CONFIG_PATH=/path/on/host/my-ollama-config.yml
Die Umgebungsvariable `PENTAGI_OLLAMA_SERVER_CONFIG_PATH` ordnet Ihre Host-Konfigurationsdatei dem Pfad `/opt/pentagi/conf/ollama.provider.yml` im Container zu.
**Beispiel für benutzerdefinierte Konfiguration** (`my-ollama-config.yml`):```yaml
primary_agent:
model: "qwen3-coder-next:cloud"
temperature: 1.0
top_p: 0.9
max_tokens: 32768
reasoning:
effort: high
coder:
model: "qwen3-coder:32b"
temperature: 1.0
max_tokens: 20480
Für selbst gehostete Ollama-Instanzen:```bash
OLLAMA_SERVER_URL=http://localhost:11434 OLLAMA_SERVER_MODEL=llama3.1:8b-instruct-q8_0
OLLAMA_SERVER_URL=http://ollama-server:11434 OLLAMA_SERVER_PULL_MODELS_ENABLED=true OLLAMA_SERVER_PULL_MODELS_TIMEOUT=900 OLLAMA_SERVER_LOAD_MODELS_ENABLED=true
OLLAMA_SERVER_CONFIG_PATH=/opt/pentagi/conf/ollama-llama318b.provider.yml
OLLAMA_SERVER_CONFIG_PATH=/opt/pentagi/conf/ollama-qwen332b-fp16-tc.provider.yml
OLLAMA_SERVER_CONFIG_PATH=/opt/pentagi/conf/ollama-qwq32b-fp16-tc.provider.yml
**Überlegungen zur Leistung:**
- **Modell-Erkennung** (`OLLAMA_SERVER_LOAD_MODELS_ENABLED=true`): Fügt 1-2s Startlatenz durch Abfrage der Ollama-API hinzu
- **Automatischer Pull** (`OLLAMA_SERVER_PULL_MODELS_ENABLED=true`): Erster Start kann mehrere Minuten dauern, um Modelle herunterzuladen
- **Pull-Timeout** (`OLLAMA_SERVER_PULL_MODELS_TIMEOUT=900`): 15 Minuten in Sekunden
- **Statische Konfiguration**: Deaktivieren Sie beide Flags und geben Sie Modelle in der Konfigurationsdatei an, um den schnellsten Start zu erreichen
#### Erstellen benutzerdefinierter Ollama-Modelle mit erweitertem Kontext
PentAGI benötigt Modelle mit größeren Kontextfenstern als die Standard-Ollama-Konfigurationen. Sie müssen benutzerdefinierte Modelle mit erhöhtem `num_ctx`-Parameter über Modelfiles erstellen. Während typische Agenten-Workflows etwa 64K Tokens verbrauchen, verwendet PentAGI eine Kontextgröße von 110K für eine Sicherheitsmarge und zur Bewältigung komplexer Penetrationstest-Szenarien.
**Wichtig**: Der `num_ctx`-Parameter kann nur während der Modellerstellung über die Modelfile gesetzt werden – er kann nach der Erstellung nicht mehr geändert oder zur Laufzeit überschrieben werden.
##### Beispiel: Qwen3 32B FP16 mit erweitertem Kontext
Erstellen Sie eine Modelfile mit dem Namen `Modelfile_qwen3_32b_fp16_tc`:```dockerfile
FROM qwen3:32b-fp16
PARAMETER num_ctx 110000
PARAMETER temperature 0.3
PARAMETER top_p 0.8
PARAMETER min_p 0.0
PARAMETER top_k 20
PARAMETER repeat_penalty 1.1
Erstelle das benutzerdefinierte Modell:```bash ollama create qwen3:32b-fp16-tc -f Modelfile_qwen3_32b_fp16_tc
##### Beispiel: QwQ 32B FP16 mit erweitertem Kontext
Erstellen Sie eine Modelfile mit dem Namen `Modelfile_qwq_32b_fp16_tc`:```dockerfile
FROM qwq:32b-fp16
PARAMETER num_ctx 110000
PARAMETER temperature 0.2
PARAMETER top_p 0.7
PARAMETER min_p 0.0
PARAMETER top_k 40
PARAMETER repeat_penalty 1.2
Erstellen Sie das benutzerdefinierte Modell:```bash ollama create qwq:32b-fp16-tc -f Modelfile_qwq_32b_fp16_tc
> **Hinweis**: Das QwQ 32B FP16-Modell benötigt für die Inferenz etwa **71,3 GB VRAM**. Stellen Sie sicher, dass Ihr System über ausreichend GPU-Speicher verfügt, bevor Sie versuchen, dieses Modell zu verwenden.
Diese benutzerdefinierten Modelle werden in den vorgefertigten Anbieterkonfigurationsdateien (`ollama-qwen332b-fp16-tc.provider.yml` und `ollama-qwq32b-fp16-tc.provider.yml`) referenziert, die im Docker-Image unter `/opt/pentagi/conf/` enthalten sind.
### OpenAI-Anbieterkonfiguration
PentAGI integriert sich in die umfassende Modellpalette von OpenAI, die erweiterte Reasoning-Fähigkeiten mit erweiterter Gedankenkette, agentische Modelle mit verbesserter Tool-Integration und spezialisierte Codemodelle für Sicherheitstechnik bietet.
#### Konfigurationsvariablen
| Variable | Standard | Beschreibung |
| -------------------- | --------------------------- | -------------------------------- |
| `OPEN_AI_KEY` | | API-Schlüssel für OpenAI-Dienste |
| `OPEN_AI_SERVER_URL` | `https://api.openai.com/v1` | OpenAI-API-Endpunkt |
#### Konfigurationsbeispiele```bash
# Basic OpenAI setup
OPEN_AI_KEY=your_openai_api_key
OPEN_AI_SERVER_URL=https://api.openai.com/v1
# Using with proxy for enhanced security
OPEN_AI_KEY=your_openai_api_key
PROXY_URL=http://your-proxy:8080
PentAGI unterstützt 31 OpenAI-Modelle mit Tool-Aufruf, Streaming, Reasoning-Modi und Prompt-Caching. Mit * markierte Modelle werden in der Standardkonfiguration verwendet.
GPT-5.2 Serie - Neuestes Flaggschiff Agentic (Dezember 2025)
| Modell-ID | Denken | Preis (Input/Output/Cache) | Anwendungsfall |
|---|---|---|---|
gpt-5.2* | ✅ | $1.75/$14.00/$0.18 | Neuestes Flaggschiff mit verbessertem Reasoning und Tool-Integration, autonome Sicherheitsforschung |
gpt-5.2-pro | ✅ | $21.00/$168.00/$0.00 | Premium-Version mit überlegenem agentischem Coding, sicherheitskritischer Forschung, Zero-Day-Entdeckung |
gpt-5.2-codex | ✅ | $1.75/$14.00/$0.18 | Fortschrittlichste code-spezialisierte, Kontextkomprimierung, starke Cybersicherheitsfähigkeiten |
GPT-5/5.1 Serie - Fortschrittliche Agentic-Modelle
| Modell-ID | Denken | Preis (Input/Output/Cache) | Anwendungsfall |
|---|---|---|---|
gpt-5 | ✅ | $1.25/$10.00/$0.13 | Premier Agentic mit fortgeschrittenem Reasoning, autonome Sicherheitsforschung, Exploit-Kettenentwicklung |
gpt-5.1 | ✅ | $1.25/$10.00/$0.13 | Verbessertes Agentic mit adaptivem Reasoning, ausgewogener Penetrationstest mit starker Tool-Koordination |
gpt-5-pro | ✅ | $15.00/$120.00/$0.00 | Premium-Version mit großen Reasoning-Verbesserungen, reduzierten Halluzinationen, kritischen Sicherheitsoperationen |
gpt-5-mini | ✅ | $0.25/$2.00/$0.03 | Effizient, Geschwindigkeit und Intelligenz ausgleichend, automatisierte Schwachstellenanalyse, Exploit-Generierung |
gpt-5-nano | ✅ | $0.05/$0.40/$0.01 | Schnellste für Hochdurchsatz-Scans, Aufklärung, Massen-Schwachstellenerkennung |
GPT-5/5.1 Codex Serie - Code-spezialisiert
| Modell-ID | Denken | Preis (Input/Output/Cache) | Anwendungsfall |
|---|---|---|---|
gpt-5.1-codex-max | ✅ | $1.25/$10.00/$0.13 | Verbessertes Reasoning für anspruchsvolles Coding, nachgewiesene CVE-Ergebnisse, systematische Exploit-Entwicklung |
gpt-5.1-codex | ✅ | $1.25/$10.00/$0.13 | Standard code-optimiert mit starkem Reasoning, Exploit-Generierung, Schwachstellenanalyse |
gpt-5-codex | ✅ | $1.25/$10.00/$0.13 | Grundlegendes code-spezialisiert, Schwachstellenscanning, grundlegende Exploit-Generierung |
gpt-5.1-codex-mini | ✅ | $0.25/$2.00/$0.03 | Kompakt mit hoher Leistung, 4x höhere Kapazität, schnelle Schwachstellenerkennung |
codex-mini-latest | ✅ | $1.50/$6.00/$0.38 | Neuestes kompaktes Code-Modell, automatisierte Code-Überprüfung, grundlegende Schwachstellenanalyse |
GPT-4.1 Serie - Erweiterte Intelligenz
| Modell-ID | Denken | Preis (Input/Output/Cache) | Anwendungsfall |
|---|---|---|---|
gpt-4.1 | ❌ | $2.00/$8.00/$0.50 | Verbessertes Flaggschiff mit überlegenem Funktionsaufruf, komplexer Bedrohungsanalyse, anspruchsvoller Exploit-Entwicklung |
gpt-4.1-mini* | ❌ | $0.40/$1.60/$0.10 | Ausgewogene Leistung mit verbesserter Effizienz, routinemäßige Sicherheitsbewertungen, automatisierte Code-Analyse |
gpt-4.1-nano | ❌ | $0.10/$0.40/$0.03 | Ultra-schnell und leichtgewichtig, Massen-Sicherheitsscans, schnelle Aufklärung, kontinuierliche Überwachung |
GPT-4o Serie - Multimodales Flaggschiff
| Modell-ID | Denken | Preis (Input/Output/Cache) | Anwendungsfall |
|---|---|---|---|
gpt-4o | ❌ | $2.50/$10.00/$1.25 | Multimodales Flaggschiff mit Vision, Bildanalyse, Web-UI-Bewertung, Multi-Tool-Orchestrierung |
gpt-4o-mini | ❌ | $0.15/$0.60/$0.08 | Kompakt multimodal mit starkem Funktionsaufruf, hochfrequentem Scannen, kosteneffizienten Massenoperationen |
o-Serie - Fortschrittliche Reasoning-Modelle
| Modell-ID | Denken | Preis (Input/Output/Cache) | Anwendungsfall |
|---|---|---|---|
o4-mini* | ✅ | $1.10/$4.40/$0.28 | Nächste Generation Reasoning mit verbesserter Geschwindigkeit, methodische Sicherheitsbewertungen, systematische Exploit-Entwicklung |
o3* | ✅ | $2.00/$8.00/$0.50 | Fortschrittliches Reasoning-Kraftpaket, mehrstufige Angriffsketten, tiefgehende Schwachstellenanalyse |
o3-mini | ✅ | $1.10/$4.40/$0.55 | Kompaktes Reasoning mit erweitertem Denken, schrittweise Angriffsplanung, logische Schwachstellenverknüpfung |
o1 | ✅ | $15.00/$60.00/$7.50 | Premier Reasoning mit maximaler Tiefe, fortgeschrittenes Penetrationstesten, neuartige Exploit-Forschung |
o3-pro | ✅ | $20.00/$80.00/$0.00 | Fortschrittlichstes Reasoning, 80% günstiger als o1-pro, Zero-Day-Forschung, kritische Sicherheitsuntersuchungen |
o1-pro | ✅ | $150.00/$600.00/$0.00 | Premium-Reasoning der vorherigen Generation, erschöpfende Sicherheitsanalyse, missionskritische Herausforderungen |
Preise: Pro 1M Tokens. Reasoning-Modelle enthalten Denk-Token in der Ausgabepreisgestaltung.
[!WARNING] GPT-5 Modelle - Vertrauenswürdiger Zugriff erforderlich*
Alle GPT-5-Serienmodelle (
gpt-5,gpt-5.1,gpt-5.2,gpt-5-pro,gpt-5.2-pround alle Codex-Varianten) arbeiten instabil mit PentAGI und können ohne verifizierten Zugriff OpenAIs Cybersicherheitsmechanismen auslösen.Um GPT-5 Modelle zuverlässig zu nutzen:*
- Einzelne Benutzer: Verifizieren Sie Ihre Identität unter chatgpt.com/cyber
- Unternehmensteams: Fordern Sie vertrauenswürdigen Zugriff über Ihren OpenAI-Vertreter an
- Sicherheitsforscher: Bewerben Sie sich für das Cybersecurity-Grant-Program (beinhaltet $10 Mio. in API-Guthaben)
Empfohlene Alternativen ohne Verifizierung:
- Verwenden Sie
o-series-Modelle (o3, o4-mini, o1) für Reasoning-Aufgaben- Verwenden Sie die
gpt-4.1-Serie für allgemeine Intelligenz und Funktionsaufruf- Alle o-series- und gpt-4.x-Modelle funktionieren zuverlässig ohne speziellen Zugriff
Reasoning-Aufwandsstufen:
Hauptmerkmale:
PentAGI integriert sich in Anthropics Claude-Modelle, die fortschrittliche erweiterte Denkfähigkeiten, außergewöhnliche Sicherheitsmechanismen und ein anspruchsvolles Verständnis komplexer Sicherheitskontexte mit Prompt-Caching bieten.
| Variable | Standard | Beschreibung |
|---|---|---|
ANTHROPIC_API_KEY | API-Schlüssel für Anthropic-Dienste | |
ANTHROPIC_SERVER_URL | https://api.anthropic.com/v1 | Anthropic-API-Endpunkt |
ANTHROPIC_API_KEY=your_anthropic_api_key ANTHROPIC_SERVER_URL=https://api.anthropic.com/v1
ANTHROPIC_API_KEY=your_anthropic_api_key PROXY_URL=http://your-proxy:8080
> [!NOTE]
> **Google Vertex KI für Claude-Modelle**
>
> PentAGI stellt derzeit keinen dedizierten Google Vertex AI-Konfigurationspfad für Anthropic Claude in `.env` bereit. Es gibt derzeit kein separates Vertex AI-API-Schlüsselfeld, und die vorhandenen Anthropic-Variablen (`ANTHROPIC_API_KEY`, `ANTHROPIC_SERVER_URL`) zielen auf die direkte Anthropic-API. Unterstützte Routen für Claude sind:
>
> - **Direkte Anthropic-API**: `ANTHROPIC_API_KEY` und `ANTHROPIC_SERVER_URL` (siehe oben).
> - **AWS Bedrock**: `BEDROCK_*`-Variablen (siehe [AWS Bedrock Provider-Konfiguration](#aws-bedrock-provider-configuration)).
>
> Wenn Sie Vertex AI heute verwenden müssen, ist die sicherste unterstützte Problemumgehung, Vertex AI über einen OpenAI-kompatiblen Proxy oder Gateway bereitzustellen, der Vertex AI-Aufrufe in das Chat Completions-Format übersetzt, während das Chat- und Tool-Call-Verhalten, auf das PentAGI angewiesen ist, erhalten bleibt. Richten Sie dann den Custom LLM-Anbieter auf dieses Gateway über `LLM_SERVER_URL`, `LLM_SERVER_KEY` und `LLM_SERVER_MODEL` aus. Dieser Weg ist nur so zuverlässig wie das von Ihnen gewählte Gateway.
#### Unterstützte Modelle
PentAGI unterstützt 10 Claude-Modelle mit Tool Calling, Streaming, Extended Thinking, Adaptive Thinking und Prompt Caching. Modelle, die mit `*` markiert sind, werden in der Standardkonfiguration verwendet.
**Claude 4 Serie - Neueste Modelle (2025-2026)**
| Modell-ID | Denken | Veröffentlichungsdatum | Preis (Eingabe/Ausgabe/Cache R/W) | Anwendungsfall |
| ------------------------- | ------ | ---------------------- | --------------------------------- | ---------------------------------------------------- |
| `claude-opus-4-6`* | ✅ | Mai 2025 | $5.00/$25.00/$0.50/$6.25 | Das intelligenteste Modell für autonome Agenten und Codierung. Extended + Adaptive Thinking für komplexe Exploit-Entwicklung, mehrstufige Angriffssimulation |
| `claude-sonnet-4-6`* | ✅ | Aug 2025 | $3.00/$15.00/$0.30/$3.75 | Beste Balance zwischen Geschwindigkeit und Intelligenz mit Adaptive Thinking. Mehrphasige Sicherheitsbewertungen, intelligente Schwachstellenanalyse, Echtzeit-Bedrohungsjagd |
| `claude-haiku-4-5`* | ✅ | Okt 2025 | $1.00/$5.00/$0.10/$1.25 | Schnellstes Modell mit nahezu Grenzintelligenz. Hochfrequenz-Scanning, Echtzeit-Überwachung, automatisierte Massentests |
**Legacy-Modelle - Weiterhin unterstützt**
| Modell-ID | Denken | Veröffentlichungsdatum | Preis (Eingabe/Ausgabe/Cache R/W) | Anwendungsfall |
| ------------------------- | ------ | ---------------------- | --------------------------------- | ---------------------------------------------------- |
| `claude-sonnet-4-5` | ✅ | Sep 2025 | $3.00/$15.00/$0.30/$3.75 | Hochmodernes Reasoning (durch 4-6 abgelöst). Anspruchsvolle Penetrationstests, erweiterte Bedrohungsanalyse |
| `claude-opus-4-5` | ✅ | Nov 2025 | $5.00/$25.00/$0.50/$6.25 | Ultimatives Reasoning (durch opus-4-6 abgelöst). Kritische Sicherheitsforschung, Zero-Day-Entdeckung, Red-Team-Operationen |
| `claude-opus-4-1` | ✅ | Aug 2025 | $15.00/$75.00/$1.50/$18.75 | Erweitertes Reasoning (abgelöst). Komplexe Penetrationstests, anspruchsvolle Bedrohungsmodellierung |
| `claude-sonnet-4-0` | ✅ | Mai 2025 | $3.00/$15.00/$0.30/$3.75 | Hochleistungs-Reasoning (abgelöst). Komplexe Bedrohungsmodellierung, Multi-Tool-Koordination |
| `claude-opus-4-0` | ✅ | Mai 2025 | $15.00/$75.00/$1.50/$18.75 | Erste Generation Opus (abgelöst). Mehrstufige Exploit-Entwicklung, autonome Pentesting-Workflows |
**Veraltete Modelle - Migration zu aktuellen Modellen**
| Modell-ID | Denken | Veröffentlichungsdatum | Preis (Eingabe/Ausgabe/Cache R/W) | Hinweise |
| ------------------------------ | ------ | ---------------------- | --------------------------------- | -------------------------------------------- |
| `claude-3-haiku-20240307` | ❌ | Mär 2024 | $0.25/$1.25/$0.03/$0.30 | Wird am 19. April 2026 eingestellt. Migrieren Sie zu claude-haiku-4-5 |
**Preise**: Pro 1M Tokens. Cache-Preise beinhalten sowohl Lese- als auch Schreibkosten.
**Konfiguration für Extended Thinking**:
- **Max Tokens 4096**: Generator (claude-opus-4-6) für maximale Reasoning-Tiefe bei komplexer Exploit-Entwicklung
- **Max Tokens 2048**: Coder (claude-sonnet-4-6) für ausgewogene Code-Analyse und Schwachstellenforschung
- **Max Tokens 1024**: Primäragent, Assistent, Verfeinerer, Berater, Reflektor, Sucher, Installer, Pentester für fokussiertes Reasoning bei spezifischen Aufgaben
- **Extended Thinking**: Alle Claude 4.5+- und 4.6-Modelle unterstützen konfigurierbares Extended Thinking für tiefgehende Reasoning-Aufgaben
**Hauptfunktionen**:
- **Extended Thinking**: Alle Claude 4.5+- und 4.6-Modelle mit konfigurierbaren Chain-of-Thought-Reasoning-Tiefen für komplexe Sicherheitsanalysen
- **Adaptive Thinking**: Die Claude 4.6-Serie (Opus/Sonnet) passt die Reasoning-Tiefe dynamisch an die Aufgabenkomplexität an, um optimale Leistung zu erzielen
- **Prompt Caching**: Deutliche Kostenreduzierung mit separater Lese-/Schreib-Preisgestaltung (10 % Lesen, 125 % Schreiben des Inputs)
- **Erweitertes Kontextfenster**: 200K Tokens Standard, bis zu 1M Tokens (Beta) für Claude Opus/Sonnet 4.6 für umfassende Codebasis-Analyse
- **Tool Calling**: Robustes Function Calling mit außergewöhnlicher Genauigkeit für die Orchestrierung von Sicherheitstools
- **Streaming**: Echtzeit-Response-Streaming für interaktive Penetrationstest-Workflows
- **Safety-First-Design**: Integrierte Sicherheitsmechanismen, die verantwortungsvolle Sicherheitstestpraktiken gewährleisten
- **Multimodale Unterstützung**: Vision-Funktionen in den neuesten Modellen für Screenshot-Analyse und UI-Sicherheitsbewertung
- **Constitutional AI**: Fortschrittliches Safety-Training, das zuverlässige und ethische Sicherheitsberatung bietet
### Google AI (Gemini) Provider-Konfiguration
PentAGI integriert sich über die Google AI API in Googles Gemini-Modelle und bietet hochmoderne multimodale Reasoning-Fähigkeiten mit Extended Thinking und Context Caching.
#### Konfigurationsvariablen
| Variable | Standardwert | Beschreibung |
| ------------------- | ------------------------------------------- | ------------------------------ |
| `GEMINI_API_KEY` | | API-Schlüssel für Google AI-Dienste |
| `GEMINI_SERVER_URL` | `https://generativelanguage.googleapis.com` | Google AI API-Endpunkt |
#### Konfigurationsbeispiele```bash
# Basic Gemini setup
GEMINI_API_KEY=your_gemini_api_key
GEMINI_SERVER_URL=https://generativelanguage.googleapis.com
# Using with proxy
GEMINI_API_KEY=your_gemini_api_key
PROXY_URL=http://your-proxy:8080
PentAGI unterstützt 9 Gemini-Modelle mit Tool-Aufruf, Streaming, Denkmodi und Kontext-Caching. Mit * markierte Modelle werden in der Standardkonfiguration verwendet.
Gemini 3.5 Serie – Neuestes stabiles Flash (Mai 2026)
| Modell-ID | Denken | Kontext | Preis (Eingabe/Ausgabe/Cache) | Anwendungsfall |
|---|---|---|---|---|
gemini-3.5-flash* | ✅ | 1M | $1.50/$9.00/$0.15 | Intelligentestes Flash-Modell mit nachhaltiger Spitzenleistung bei agentischen und Programmieraufgaben, überlegene Suche und Grounding |
Gemini 3.1 Serie – Stabiles Flash-Lite + Pro Vorschau (Feb.–Mai 2026)
| Modell-ID | Denken | Kontext | Preis (Eingabe/Ausgabe/Cache) | Anwendungsfall |
|---|---|---|---|---|
gemini-3.1-pro-preview* | ✅ | 1M | $2.00/$12.00/$0.20 | Neuestes Flaggschiff mit verbessertem Denken, verbesserter Token-Effizienz, optimiert für Softwareentwicklung und agentische Arbeitsabläufe |
gemini-3.1-pro-preview-customtools | ✅ | 1M | $2.00/$12.00/$0.20 | Custom-Tools-Endpunkt optimiert für Bash und Priorisierung von benutzerdefinierten Tools (view_file, search_code) |
gemini-3.1-flash-lite* | ✅ | 1M | $0.25/$1.50/$0.025 | Kostengünstigstes stabiles multimodales Modell, erstklassige Leistung für hochvolumige agentische Aufgaben und latenzarme Anwendungen |
Gemini 2.5 Serie – Erweiterte Denkmodelle (aktiv bis 16. Oktober 2026)
| Modell-ID | Denken | Kontext | Preis (Eingabe/Ausgabe/Cache) | Anwendungsfall |
|---|---|---|---|---|
gemini-2.5-pro | ✅ | 1M | $1.25/$10.00/$0.125 | Modernste Technik für komplexes Programmieren und Denken, anspruchsvolle Bedrohungsmodellierung |
gemini-2.5-flash | ✅ | 1M | $0.30/$2.50/$0.03 | Erstes hybrides Denkmodell mit Denkbudgets, bestes Preis-Leistungs-Verhältnis für groß angelegte Bewertungen |
gemini-2.5-flash-lite | ✅ | 1M | $0.10/$0.40/$0.01 | Kleinstes und kostengünstigstes Modell für die Nutzung im großen Maßstab, Hochdurchsatz-Scans |
Gemma 4 Open-Source-Modelle (Apache 2.0, Kostenlose Stufe)
| Modell-ID | Denken | Kontext | Preis (Eingabe/Ausgabe/Cache) | Anwendungsfall |
|---|---|---|---|---|
gemma-4-31b-it | ✅ | 256K | Kostenlos/Kostenlos/Kostenlos | Größtes Open-Source-Gemma-4-Dense-Modell (~31B Parameter), multimodal Text+Bild, 140+ Sprachen, lokale Sicherheitsoperationen |
gemma-4-26b-a4b-it | ✅ | 256K | Kostenlos/Kostenlos/Kostenlos | MoE-Architektur (~26B gesamt / ~3.8B aktive Parameter), hoch effiziente Inferenz auf Consumer-GPUs für lokale Hochdurchsatz-Scans |
Preise: Pro 1M Token (Standard-Bezahlstufe). Kontextfenster ist das Eingabe-Token-Limit.
[!NOTE] Abschaltung der Gemini 2.5 Serie
gemini-2.5-pro,gemini-2.5-flashundgemini-2.5-flash-litewerden am 16. Oktober 2026 abgeschaltet. Empfohlene Migrationen:
gemini-2.5-pro→gemini-3.1-pro-preview(gleiche $2.00 Eingabe-Preisstufe)gemini-2.5-flash→gemini-3.5-flash(verbesserte Spitzenfähigkeiten)gemini-2.5-flash-lite→gemini-3.1-flash-lite(gleiche $0.25 Eingabe-Preisstufe)
Standard-Modellzuweisungen (config.yml):
gemini-3.1-pro-preview - primary_agent, assistant, generator, refiner, adviser, coder, pentestergemini-3.5-flash - reflector, searcher, enricher, installergemini-3.1-flash-lite - simple, simple_jsonHauptmerkmale:
gemini-3.1-pro-preview-customtools-Route für tool-lastige agentische Arbeitsabläufe, die registrierte Tools gegenüber Bash bevorzugenDenk-Anstrengungsstufen:
PentAGI integriert sich in Amazon Bedrock und bietet Zugriff auf 20+ Foundation-Modelle von führenden KI-Unternehmen, darunter Anthropic, Amazon, Cohere, DeepSeek, OpenAI, Qwen, Mistral und Moonshot.
| Variable | Standard | Beschreibung |
|---|---|---|
BEDROCK_REGION | us-east-1 | AWS-Region für den Bedrock-Dienst |
BEDROCK_DEFAULT_AUTH | false | AWS-SDK-Standardanmeldeinformationskette verwenden (Umgebung, EC2-Rolle, ~/.aws/credentials) – höchste Priorität |
BEDROCK_BEARER_TOKEN | Bearer-Token-Authentifizierung – Priorität gegenüber statischen Anmeldeinformationen | |
BEDROCK_ACCESS_KEY_ID | AWS-Zugriffsschlüssel-ID für statische Anmeldeinformationen | |
BEDROCK_SECRET_ACCESS_KEY | AWS-Geheimer Zugriffsschlüssel für statische Anmeldeinformationen | |
BEDROCK_SESSION_TOKEN | AWS-Sitzungstoken für temporäre Anmeldeinformationen (optional, wird mit statischen Anmeldeinformationen verwendet) | |
BEDROCK_SERVER_URL | Benutzerdefinierter Bedrock-Endpunkt (VPC-Endpunkte, lokale Tests) |
Authentifizierungspriorität: BEDROCK_DEFAULT_AUTH → BEDROCK_BEARER_TOKEN → BEDROCK_ACCESS_KEY_ID+BEDROCK_SECRET_ACCESS_KEY
BEDROCK_REGION=us-east-1 BEDROCK_DEFAULT_AUTH=true
BEDROCK_REGION=us-east-1 BEDROCK_BEARER_TOKEN=your_bearer_token
BEDROCK_REGION=us-east-1 BEDROCK_ACCESS_KEY_ID=your_aws_access_key BEDROCK_SECRET_ACCESS_KEY=your_aws_secret_key
BEDROCK_REGION=us-east-1 BEDROCK_DEFAULT_AUTH=true BEDROCK_SERVER_URL=https://bedrock-runtime.us-east-1.vpce-xxx.amazonaws.com PROXY_URL=http://your-proxy:8080
#### Unterstützte Modelle
PentAGI unterstützt 21 AWS-Bedrock-Modelle mit Tool-Calling, Streaming und multimodalen Fähigkeiten. Mit `*` markierte Modelle werden in der Standardkonfiguration verwendet.
| Modell-ID | Anbieter | Denken | Multimodal | Preis (Eingabe/Ausgabe) | Anwendungsfall |
| ------------------------------------------------ | --------------- | ------ | ---------- | ----------------------- | ---------------------------------------- |
| `us.amazon.nova-2-lite-v1:0` | Amazon Nova | ❌ | ✅ | $0,33/$2,75 | Adaptives Denken, effizientes Schlussfolgern |
| `us.amazon.nova-premier-v1:0` | Amazon Nova | ❌ | ✅ | $2,50/$12,50 | Komplexes Schlussfolgern, fortgeschrittene Analyse |
| `us.amazon.nova-pro-v1:0` | Amazon Nova | ❌ | ✅ | $0,80/$3,20 | Ausgewogene Genauigkeit, Geschwindigkeit, Kosten |
| `us.amazon.nova-lite-v1:0` | Amazon Nova | ❌ | ✅ | $0,06/$0,24 | Schnelle Verarbeitung, Vorgänge mit hohem Volumen |
| `us.amazon.nova-micro-v1:0` | Amazon Nova | ❌ | ❌ | $0,035/$0,14 | Ultra-niedrige Latenz, Echtzeit-Überwachung |
| `us.anthropic.claude-opus-4-6-v1`* | Anthropic | ✅ | ✅ | $5,00/$25,00 | Weltklasse-Codierung, Unternehmens-Agenten |
| `us.anthropic.claude-sonnet-4-6` | Anthropic | ✅ | ✅ | $3,00/$15,00 | Grenzüberschreitende Intelligenz, Unternehmensmaßstab |
| `us.anthropic.claude-opus-4-5-20251101-v1:0` | Anthropic | ✅ | ✅ | $5,00/$25,00 | Mehrtägige Softwareentwicklung |
| `us.anthropic.claude-haiku-4-5-20251001-v1:0`* | Anthropic | ✅ | ✅ | $1,00/$5,00 | Fast-Grenzleistung, hohe Geschwindigkeit |
| `us.anthropic.claude-sonnet-4-5-20250929-v1:0`* | Anthropic | ✅ | ✅ | $3,00/$15,00 | Praxisnahe Agenten, Codierung auf Spitzenniveau |
| `us.anthropic.claude-sonnet-4-20250514-v1:0` | Anthropic | ✅ | ✅ | $3,00/$15,00 | Ausgewogene Leistung, produktionsbereit |
| `us.anthropic.claude-3-5-haiku-20241022-v1:0` | Anthropic | ❌ | ❌ | $0,80/$4,00 | Schnellstes Modell, kosteneffizientes Scannen |
| `cohere.command-r-plus-v1:0` | Cohere | ❌ | ❌ | $3,00/$15,00 | Großflächige Vorgänge, überlegenes RAG |
| `deepseek.v3.2` | DeepSeek | ❌ | ❌ | $0,58/$1,68 | Langkontext-Schlussfolgern, Effizienz |
| `openai.gpt-oss-120b-1:0`* | OpenAI (OSS) | ✅ | ❌ | $0,15/$0,60 | Starkes Schlussfolgern, wissenschaftliche Analyse |
| `openai.gpt-oss-20b-1:0` | OpenAI (OSS) | ✅ | ❌ | $0,07/$0,30 | Effizientes Codieren, Softwareentwicklung |
| `qwen.qwen3-next-80b-a3b` | Qwen | ❌ | ❌ | $0,15/$1,20 | Ultra-langer Kontext, Flaggschiff-Schlussfolgern |
| `qwen.qwen3-32b-v1:0` | Qwen | ❌ | ❌ | $0,15/$0,60 | Ausgewogenes Schlussfolgern, Forschungsanwendungsfälle |
| `qwen.qwen3-coder-30b-a3b-v1:0` | Qwen | ❌ | ❌ | $0,15/$0,60 | Vibe-Codierung, natürlichsprachlich zuerst |
| `qwen.qwen3-coder-next` | Qwen | ❌ | ❌ | $0,45/$1,80 | Tool-Nutzung, funktionsaufrufoptimiert |
| `mistral.mistral-large-3-675b-instruct` | Mistral | ❌ | ✅ | $4,00/$12,00 | Fortschrittliches Multimodal, langer Kontext |
| `moonshotai.kimi-k2.5` | Moonshot | ❌ | ✅ | $0,60/$3,00 | Vision, Sprache, Code in einem Modell |
**Preise**: Pro 1M Token. Modelle mit Denk-/Schlussfolgerungsunterstützung verursachen während der Denkphase zusätzliche Rechenkosten.
#### Getestete, aber inkompatible Modelle
Einige AWS-Bedrock-Modelle wurden getestet, werden aber aufgrund technischer Einschränkungen **nicht unterstützt**:
| Modellfamilie | Grund für Inkompatibilität |
| -------------------------- | ----------------------------------------------------------------------------------------------------- |
| **GLM (Z.AI)** | Tool-Calling-Format inkompatibel mit Converse API (erwartet String statt JSON) |
| **AI21 Jamba** | Starke Ratenbegrenzungen (1-2 Anfragen/Min) verhindern zuverlässige Tests und den Produktionseinsatz |
| **Meta Llama 3.3/3.1** | Instabile Verarbeitung von Tool-Call-Ergebnissen, verursacht unerwartete Fehler in Multi-Turn-Workflows|
| **Mistral Magistral** | Tool Calling wird vom Modell nicht unterstellt |
| **Moonshot K2-Thinking** | Instabiles Streaming-Verhalten mit Tool-Aufrufen, unzuverlässig in der Produktion |
| **Qwen3-VL** | Instabiles Streaming mit Tool Calling, multimodale + Tools-Kombination schlägt zeitweise fehl |
> [!IMPORTANT]
> **Ratenbegrenzungen und Kontingentverwaltung**
>
> Standardkontingente von AWS Bedrock für Claude-Modelle sind **extrem restriktiv** (2-20 Anfragen/Minute für neue Konten). Für produktiven Penetrationstests:
>
> 1. **Kontingenterhöhungen beantragen** über die AWS Service Quotas-Konsole für die Modelle, die Sie verwenden möchten
> 2. **Amazon Nova-Modelle verwenden** – höhere Standardkontingente und hervorragende Leistung
> 3. **Bereitgestellten Durchsatz aktivieren** für konsistentes Hochvolumen-Testing
> 4. **Nutzung überwachen** – AWS drosselt aggressiv an Kontingentgrenzen
>
> Ohne Kontingenterhöhungen ist mit häufigen Verzögerungen und Arbeitsablaufunterbrechungen zu rechnen.
> [!WARNING]
> **Converse-API-Anforderungen**
>
> PentAGI verwendet die Amazon Bedrock **Converse API** für einheitlichen Modellzugriff. Alle unterstützten Modelle erfordern:
>
> - ✅ Converse/ConverseStream-API-Unterstützung
> - ✅ Tool-Nutzung (Funktionsaufruf) für Penetrationstest-Workflows
> - ✅ Streaming-Tool-Nutzung für Echtzeit-Feedback
>
> Modellfähigkeiten überprüfen unter: [AWS Bedrock Model Features](https://docs.aws.amazon.com/bedrock/latest/userguide/conversation-inference-supported-models-features.html)
**Wichtige Funktionen**:
- **Automatisches Prompt-Caching**: 40-70% Kostensenkung bei wiederholtem Kontext (Claude 4.x-Modelle)
- **Erweitertes Denken**: Schritt-für-Schritt-Schlussfolgerungen für komplexe Sicherheitsanalysen (Claude, DeepSeek R1, OpenAI GPT)
- **Multimodale Analyse**: Verarbeitung von Screenshots, Diagrammen, Videos für umfassende Tests (Nova, Claude, Mistral, Kimi)
- **Tool Calling**: Nahtlose Integration mit 20+ Penetrationstest-Tools via Funktionsaufruf
- **Streaming**: Echtzeit-Response-Streaming für interaktive Sicherheitsbewertungs-Workflows
### DeepSeek-Anbieterkonfiguration
PentAGI integriert DeepSeek und bietet Zugang zu fortschrittlichen KI-Modellen mit starken Schlussfolgerungs- und Codierungsfähigkeiten sowie Kontext-Caching zu wettbewerbsfähigen Preisen.
#### Konfigurationsvariablen
| Variable | Standardwert | Beschreibung |
| --------------------- | ----------------------------- | ----------------------------------------------------- |
| `DEEPSEEK_API_KEY` | | DeepSeek-API-Schlüssel für die Authentifizierung |
| `DEEPSEEK_SERVER_URL` | `https://api.deepseek.com` | DeepSeek-API-Endpunkt-URL |
| `DEEPSEEK_PROVIDER` | | Anbieterpräfix für LiteLLM-Integration (optional) |
#### Konfigurationsbeispiele```bash
# Direct API usage
DEEPSEEK_API_KEY=your_deepseek_api_key
DEEPSEEK_SERVER_URL=https://api.deepseek.com
# With LiteLLM proxy
DEEPSEEK_API_KEY=your_litellm_key
DEEPSEEK_SERVER_URL=http://litellm-proxy:4000
DEEPSEEK_PROVIDER=deepseek # Adds prefix to model names (deepseek/deepseek-v4-flash) for LiteLLM
PentAGI unterstützt 2 DeepSeek V4 Modelle mit Tool-Aufruf, Streaming, hybriden Thinking-/Non-Thinking-Modi und Kontext-Caching. Beide Modelle unterstützen standardmäßig den Thinking-Modus und können über extra_body in den Non-Thinking-Modus umgeschaltet werden. Mit * markierte Modelle werden in der Standardkonfiguration verwendet.
| Model ID | Thinking | Max Output | Context | Price (Input/Output/Cache) | Use Case |
|---|---|---|---|---|---|
deepseek-v4-flash* | ✅ hybrid | 384K | 1M | $0.14/$0.28/$0.0028 | Utility agents, general dialogue, fast tool calling |
deepseek-v4-pro* | ✅ hybrid | 384K | 1M | $1.74/$3.48/$0.0145 | Advanced reasoning, complex logic, security analysis |
Preise: Pro 1 Mio. Token. Cache-Preise gelten für Prompt-Token, die aus dem Cache bedient werden (Input-Cache-Hit, seit dem 26.04.2026 auf 1/10 des Einführungspreises reduziert). Beide Modelle unterstützen hybrides Denken – der thinking-Modus ist standardmäßig aktiviert; übergeben Sie extra_body.thinking.type: disabled, um in den Non-Thinking-Modus zu wechseln, um schnellere/günstigere Antworten zu erhalten.
Preishinweis (deepseek-v4-pro): Der 75%ige Aktionsrabatt auf
deepseek-v4-proendete offiziell am 31.05.2026 um 15:59 UTC. Die obigen Preise spiegeln die Standardpreise nach der Aktion wider. Wenn Sie alte Konfigurationen mit den rabattierten Preisen ($0,435/$0,87/$0,003625) verwenden, aktualisieren Sie diese auf die aktuellen Tarife für eine genaue Kostenverfolgung.
Die veralteten Modellnamen
deepseek-chatunddeepseek-reasonerwerden voraussichtlich am 24.07.2026 von DeepSeek eingestellt. Bestehende Benutzerkonfigurationen, die auf die alten Namen verweisen, funktionieren bis dahin weiter; die obigen Standardeinstellungen verwenden die aktuellen V4-Namen.deepseek-chatwird auf dendeepseek-v4-flashNon-Thinking-Modus abgebildet;deepseek-reasonerauf dendeepseek-v4-flashThinking-Modus.
Standard-Agent-Konfiguration:
Strategie: Bevorzugen Sie deepseek-v4-flash (12x günstigerer Input, 12x günstigerer Output) als Arbeitstier für Dienstprogramm-/leichte Agenten; reservieren Sie deepseek-v4-pro für komplexe mehrstufige Überlegungen. Der installer-Agent läuft auf Flash mit aktiviertem Thinking, da Umgebungsaufgaben (Shell-Befehle, Konfigurationsänderungen) selten Pro-Level-Überlegungen erfordern. Führen Sie A/B-Tests mit Ihren eigenen Workloads durch, bevor Sie weitere Agenten auf Pro umstellen.
| Agent Role | Default Model | Thinking | Reasoning Effort | Max Output | Temperature | Top P |
|---|---|---|---|---|---|---|
| Generator / Refiner | deepseek-v4-pro | Enabled | High | 32768 | (auto) | (auto) |
| Coder | deepseek-v4-pro | Enabled | High | 20480 | (auto) | (auto) |
| Primary Agent / Assistant / Pentester | deepseek-v4-pro | Enabled | High | 16384 | (auto) | (auto) |
| Adviser (mentor/planner) | deepseek-v4-pro | Enabled | High | 8192 | (auto) | (auto) |
| Installer | deepseek-v4-flash | Enabled | High | 12288 | (auto) | (auto) |
| Reflector / Searcher / Enricher | deepseek-v4-flash | Disabled | — | 4096 | 0.5 | 0.9 |
| Simple / Simple JSON | deepseek-v4-flash | Disabled | — | 2048 | 0.3 | 0.9 |
Hinweis: Wenn der Thinking-Modus aktiviert ist, ignoriert DeepSeek stillschweigend
temperature,top_p,presence_penaltyundfrequency_penalty. Der langchaingo-Client setzttemperature/top_pautomatisch auf null, wennreasoning_effortgesetzt ist, sodass sie in der obigen Tabelle als "(auto)" erscheinen. Alle Thinking-aktivierten Agenten übergeben außerdem explizitextra_body.thinking.type: enabledals defensive Codierung gegen zukünftige Standardänderungen des Anbieters.
Hauptfunktionen:
extra_body.thinking.typeParallelitätsgrenzen: deepseek-v4-flash: 2500 gleichzeitige Anfragen; deepseek-v4-pro: 500 gleichzeitige Anfragen.
LiteLLM-Integration: Setzen Sie DEEPSEEK_PROVIDER=deepseek, um die Modellnamen-Präfixierung bei Verwendung der Standard-PentAGI-Konfigurationen mit dem LiteLLM-Proxy zu aktivieren. Lassen Sie das Feld für die direkte API-Nutzung leer.
PentAGI integriert sich mit GLM von Zhipu AI (Z.AI) und bietet fortschrittliche Sprachmodelle mit MoE-Architektur, starkem Denken und agentischen Fähigkeiten, die von der Tsinghua-Universität entwickelt wurden.
| Variable | Default Value | Description |
|---|---|---|
GLM_API_KEY | GLM API-Schlüssel zur Authentifizierung | |
GLM_SERVER_URL | https://api.z.ai/api/paas/v4 | GLM API-Endpunkt-URL (international) |
GLM_PROVIDER | Anbieter-Präfix für LiteLLM-Integration (optional) |
GLM_API_KEY=your_glm_api_key GLM_SERVER_URL=https://api.z.ai/api/paas/v4
GLM_SERVER_URL=https://open.bigmodel.cn/api/paas/v4 # China GLM_SERVER_URL=https://api.z.ai/api/coding/paas/v4 # Coding-specific
GLM_API_KEY=your_litellm_key GLM_SERVER_URL=http://litellm-proxy:4000 GLM_PROVIDER=zai # Adds prefix to model names (zai/glm-4) for LiteLLM
#### Unterstützte Modelle
PentAGI unterstützt 13 GLM-Modelle mit Tool-Aufruf, Streaming, hybriden Denkmodi und Prompt-Caching. Mit `*` markierte Modelle werden in der Standardkonfiguration verwendet. Das Denken wird über `extra_body.thinking.type` ("enabled"/"disabled") gesteuert; im Gegensatz zu Kimi ist GLM in beiden Modi bezüglich der Temperatur nachsichtig.
**GLM-5.x Serie - Neueste Generation (200K Kontext, 128K max Ausgabe)**
| Modell-ID | Denken | Kontext | Max Ausgabe | Preis (Input/Output/Cache) | Anwendungsfall |
| ---------------- | -------- | ------- | ---------- | -------------------------- | ------------------------------------------------------------------- |
| `glm-5.1`* | ✅ Hybrid | 200K | 128K | $1.40/$4.40/$0.26 | Neuestes Flaggschiff: 8h anhaltende autonome Ausführung, Claude Opus 4.6-ausgerichtet (Generator/Refiner/Berater/Coder/Pentester Standard) |
| `glm-5` | ✅ Hybrid | 200K | 128K | $1.00/$3.20/$0.20 | Grundlage für agentisches Engineering, MoE 744B/40B aktiv, Claude Opus 4.5-level Codierung |
| `glm-5-turbo`* | ✅ Hybrid | 200K | 128K | $1.20/$4.00/$0.24 | OpenClaw-nativ: optimiert für Tool-Aufruf, persistente Aufgaben, langkettige Ausführung (primary_agent/assistant Standard) |
**GLM-4.7 Serie - Premium mit verschränktem Denken**
| Modell-ID | Denken | Kontext | Max Ausgabe | Preis (Input/Output/Cache) | Anwendungsfall |
| ----------------- | -------- | ------- | ---------- | -------------------------- | --------------------------------------------------- |
| `glm-4.7` | ✅ Hybrid | 200K | 128K | $0.60/$2.20/$0.11 | Verbesserte Programmierung, stabiles mehrstufiges Denken |
| `glm-4.7-flashx` | ✅ Hybrid | 200K | 128K | $0.07/$0.40/$0.01 | Ultrabillig mit priorisierter GPU, aber niedrigeren RPM-Grenzen (für hochfrequente Nutzung vermeiden) |
| `glm-4.7-flash` | ✅ Hybrid | 200K | 128K | Free/Free/Free | Kostenloses ~30B SOTA-Modell, 1 gleichzeitige Anfrage |
**GLM-4.6 Serie - Ausgewogen mit Auto-Denken**
| Modell-ID | Denken | Kontext | Max Ausgabe | Preis (Input/Output/Cache) | Anwendungsfall |
| --------- | -------- | ------- | ---------- | -------------------------- | ------------------------------------------------- |
| `glm-4.6` | ✅ Auto | 200K | 128K | $0.60/$2.20/$0.11 | Ausgewogen, Streaming-Tool-Aufrufe, token-effizient |
**GLM-4.5 Serie - Unified Reasoning/Coding/Agents**
| Modell-ID | Denken | Kontext | Max Ausgabe | Preis (Input/Output/Cache) | Anwendungsfall |
| ---------------- | -------- | ------- | ---------- | -------------------------- | ------------------------------------------------- |
| `glm-4.5` | ✅ Auto | 128K | 96K | $0.60/$2.20/$0.11 | Unified, MoE 355B/32B aktiv |
| `glm-4.5-x` | ✅ Auto | 128K | 96K | $2.20/$8.90/$0.45 | Ultra-schnelles Premium, niedrigste Latenz |
| `glm-4.5-air`* | ✅ Auto | 128K | 96K | $0.20/$1.10/$0.03 | Kosteneffizientes MoE 106B/12B (simple/simple_json/reflector/searcher/enricher/installer Standard) |
| `glm-4.5-airx` | ✅ Auto | 128K | 96K | $1.10/$4.50/$0.22 | Beschleunigtes Air mit priorisierter GPU |
| `glm-4.5-flash` | ✅ Auto | 128K | 96K | Free/Free/Free | Kostenlos mit Reasoning/Coding/Agents-Unterstützung |
**GLM-4 Legacy - Dichte Architektur**
| Modell-ID | Denken | Kontext | Max Ausgabe | Preis (Input/Output) | Anwendungsfall |
| --------------------- | -------- | ------- | ---------- | -------------------- | --------------------------------------------- |
| `glm-4-32b-0414-128k` | ❌ | 128K | 16K | $0.10/$0.10 | Ultra-Budget dichte 32B, Parsen ohne Reasoning |
**Preise**: Pro 1M Tokens. Cache-Preis gilt für Prompt-Cache-Treffer; Cache-Speicher ist derzeit kostenlos gemäß Z.AI-Werbung. GLM-4-32B hat keine Cache-Unterstützung.
**Standard-Agent-Konfiguration**:
Strategie: `glm-5.1` (neuestes Flaggschiff, $1.40 Input) für kritisches Denken, `glm-5-turbo` (OpenClaw-nativ, agentenoptimiert) für Orchestrierung, `glm-4.5-air` (günstiges MoE mit hybridem Denken und zuverlässigen RPM) für alle Dienstprogramm/Installer-Agenten. `glm-4.7-flashx` wird als Standard vermieden, da niedrigere RPM-Grenzen bei hoher Frequenz häufige 429-Fehler verursachen.
| Agentenrolle | Standard-Modell | Denken | Temperatur | Top P | Max Ausgabe |
| ----------------------------------- | ------------- | -------- | ----------- | ----- | ---------- |
| Generator / Refiner | `glm-5.1` | Aktiviert | 1.0 | 0.95 | 32768 |
| Coder | `glm-5.1` | Aktiviert | 1.0 | 0.95 | 20480 |
| Berater / Pentester | `glm-5.1` | Aktiviert | 1.0 | 0.95 | 16384 |
| Primärer Agent / Assistent | `glm-5-turbo` | Aktiviert | 1.0 | 0.95 | 16384 |
| Installer | `glm-4.5-air` | Aktiviert | 1.0 | 0.95 | 16384 |
| Einfach / Reflector | `glm-4.5-air` | Deaktiviert | 0.6 | 0.9 | 8192 |
| Sucher / Enricher / Simple JSON | `glm-4.5-air` | Deaktiviert | 0.6 | 0.9 | 4096 |
> **Hinweis zur Temperatur**: GLM akzeptiert sowohl `1.0` als auch `0.6` im Denk- oder Nicht-Denk-Modus (laut Z.AI-Dokumentation). langchaingos `IsReasoningModel` erkennt die Präfixe `glm-4.5*`/`glm-4.6*`/`glm-4.7*` und überschreibt die Temperatur in `createChatRequest` zwangsweise auf 1.0 – dies ist für GLM harmlos (im Gegensatz zu Kimi), bedeutet jedoch, dass die Temperaturwerte für diese Modelle in YAML als Richtwerte zu verstehen sind. `glm-5`/`glm-5.1`/`glm-5-turbo` werden nicht erkannt, sodass explizite Werte unverändert durchgereicht werden.
**Denkmodi**:
- **Hybrid** (GLM-5.x, GLM-4.7): Expliziter Umschalter über `extra_body.thinking.type`
- **Auto** (GLM-4.6, GLM-4.5 Serie): Modell bestimmt automatisch, wann Reasoning erforderlich ist
- **Bewahrtes Denken** (Z.AI Coding-Fähigkeit): alle denkfähigen Agenten in PentAGI übergeben auch `extra_body.thinking.clear_thinking: false`, sodass `reasoning_content` von vorherigen Assistant-Durchläufen über das Gespräch hinweg erhalten bleibt. Dies ist auf dem Standard-API-Endpunkt (`/api/paas/v4`) erforderlich – auf dem Coding-Plan-Endpunkt wäre es standardmäßig aktiviert. Verbessert die Reasoning-Kontinuität und Cache-Trefferraten in mehrstufigen Tool-Aufruf-Ketten.
- Alle denkfähigen Agenten übergeben defensiv auch `extra_body.tool_choice: auto`
**Hauptfunktionen**:
- **Langzeithorizont-Aufgaben**: GLM-5.1 unterstützt 8-stündige anhaltende autonome Ausführung, ideal für komplexe mehrstufige agentische Arbeitsabläufe
- **OpenClaw-native Orchestrierung**: GLM-5-Turbo ist speziell optimiert für Tool-Aufruf, Befehlsbefolgung und langkettige Ausführung
- **Prompt-Caching**: Deutliche Kostenreduzierung bei wiederholtem Kontext (gezeigte Cache-Input-Preise)
- **Ultra-langer Kontext**: 200K Tokens für GLM-5.x/4.7/4.6 Serie
- **MoE-Architektur**: Effizient 744B/40B aktiv (GLM-5/5.1), 355B/32B (GLM-4.5), 106B/12B (GLM-4.5-Air)
- **Tool-Aufruf**: Nahtlose Integration mit über 20 Pentesting-Tools via Function Calling
- **Streaming**: Echtzeit-Streaming mit Unterstützung für Streaming-Tool-Aufrufe (GLM-4.6+)
- **Mehrsprachig**: Hervorragende NLP-Fähigkeiten für Chinesisch und Englisch
- **Kostenlose Optionen**: GLM-4.7-Flash und GLM-4.5-Flash für Prototyping und Experimente
**LiteLLM-Integration**: Setzen Sie `GLM_PROVIDER=zai`, um die Modellnamen-Präfixierung bei Verwendung der Standard-PentAGI-Konfigurationen mit dem LiteLLM-Proxy zu aktivieren. Lassen Sie es für die direkte API-Nutzung leer.
### Kimi-Anbieterkonfiguration
PentAGI integriert sich mit Kimi von Moonshot AI und bietet ultra-lange Kontextmodelle mit multimodalen Fähigkeiten, die sich perfekt für die Analyse umfangreicher Codebasen und Dokumentationen eignen.
#### Konfigurationsvariablen
| Variable | Standardwert | Beschreibung |
| ------------------ | ----------------------------- | --------------------------------------------------- |
| `KIMI_API_KEY` | | Kimi-API-Schlüssel für die Authentifizierung |
| `KIMI_SERVER_URL` | `https://api.moonshot.ai/v1` | Kimi-API-Endpunkt-URL (international) |
| `KIMI_PROVIDER` | | Anbieterpräfix für LiteLLM-Integration (optional) |
#### Konfigurationsbeispiele```bash
# Direct API usage (international endpoint)
KIMI_API_KEY=your_kimi_api_key
KIMI_SERVER_URL=https://api.moonshot.ai/v1
# Alternative endpoint
KIMI_SERVER_URL=https://api.moonshot.cn/v1 # China
# With LiteLLM proxy
KIMI_API_KEY=your_litellm_key
KIMI_SERVER_URL=http://litellm-proxy:4000
KIMI_PROVIDER=moonshot # Adds prefix to model names (moonshot/kimi-k2.5) for LiteLLM
PentAGI unterstützt 8 Kimi/Moonshot-Modelle mit Tool-Aufruf, Streaming, hybriden Denkmodi und multimodalen Fähigkeiten (Text/Bild/Video für K2.x). Alle Legacy-Modelle kimi-k2-* (turbo-preview, 0905-preview, 0711-preview, thinking, thinking-turbo) wurden von Moonshot am 25.05.2026 eingestellt und sind NICHT enthalten. Mit * gekennzeichnete Modelle werden in der Standardkonfiguration verwendet.
Kimi K2.x Serie – Multimodales Flaggschiff
| Modell-ID | Denken | Multimodal | Kontext | Preis (Eingabe / Ausgabe / Cache-Treffer) | Anwendungsfall |
|---|---|---|---|---|---|
kimi-k2.6* | ✅ hybrid | ✅ | 256K | $0,95 / $4,00 / $0,16 | Neuestes Flaggschiff: natives Multimodal, stärkerer Code, verbesserte Befehlsbefolgung (Generator/Verfeinerer/Berater/Programmierer/Pentester-Standard) |
kimi-k2.5* | ✅ hybrid | ✅ | 256K | $0,60 / $3,00 / $0,10 | Vorherige Generation: 36 % günstigere Eingabe, gleiche Architektur (Primärer Agent/Assistent/Installateur/Dienstprogramm-Standard) |
Moonshot V1 Serie – Generierungsmodelle (Flexible Parameter)
| Modell-ID | Denken | Multimodal | Kontext | Preis (Eingabe / Ausgabe) | Anwendungsfall |
|---|---|---|---|---|---|
moonshot-v1-8k | ❌ | ❌ | 8K | $0,20 / $2,00 | Kurze Textgenerierung, extrem günstig |
moonshot-v1-32k | ❌ | ❌ | 32K | $1,00 / $3,00 | Lange Textgenerierung |
moonshot-v1-128k | ❌ | ❌ | 128K | $2,00 / $5,00 | Sehr langer Kontext |
Moonshot V1 Vision Serie – Bildverständnis
| Modell-ID | Denken | Multimodal | Kontext | Preis (Eingabe / Ausgabe) | Anwendungsfall |
|---|---|---|---|---|---|
moonshot-v1-8k-vision-preview | ❌ | ✅ | 8K | $0,20 / $2,00 | Vision + kurzer Kontext |
---
[Read more](https://github.com/vxcontrol/pentagi)