Skip to content
KitploitKITPLOIT
ToolsBlog
Einreichen
ToolsBlog
Einreichen

Hacking-, PenTest- und Cybersicherheits-Tools für Ihr Sicherheitsarsenal!

Kitploit ist ein Verzeichnis von Hacking-, Cybersicherheits- und Pentesting-Tools. Entdecken Sie die neuesten Projekt-Updates, um Schwachstellen zu finden, Systeme zu analysieren, Tests zu automatisieren und Ihre Sicherheit zu stärken.

··Feeds·Kontakt·Datenschutz·© 2026 Kitploit

Tool-Verzeichnis

Kategorien

Alle Kategorien anzeigen
Loading categories
pentagi — Vollständig autonomes KI-Agenten-System, das komplexe Penetrationstest-Aufgaben durchführen kann. | Kitploit
Tools/GitHubGitHub/vxcontrol/pentagi
Penetrationstest-FrameworksAufklärungSchwachstellenscannerExploit-FrameworksInformationsbeschaffungWebsicherheitPenetrationstestsLernen & BildungKI-Sicherheit
GitHubvxcontrol/pentagi

pentagi

Vollständig autonomes KI-Agenten-System, das komplexe Penetrationstest-Aufgaben durchführen kann.

21.8k2.9k1vor 14 TagenVon Kitploit geprüft

Beliebteste

Alle anzeigen →

Entdecken Sie die meistgenutzten Tools unserer Community.

Alle Tools erkunden

Durchsuchen Sie unsere Tool-Sammlung

Alle Tools anzeigen →
Teilen
Repository anzeigenWebseite

PentAGI

Penetrationstest Artificial General Intelligence

Treten Sie der Community bei! Vernetzen Sie sich mit Sicherheitsforschern, KI-Enthusiasten und ethischen Hackern. Erhalten Sie Unterstützung, teilen Sie Erkenntnisse und bleiben Sie über die neuesten PentAGI-Entwicklungen auf dem Laufenden.

Discord⠀Telegram

vxcontrol%2Fpentagi | Trendshift

Inhaltsverzeichnis

  • Übersicht
  • Funktionen
  • Architektur
    • Erweiterte Agentenüberwachung
  • Schnellstart
  • Wie man PentAGI nach dem Login verwendet
  • API-Zugriff
    • LLM-Anbieterkonfiguration
      • Ollama
      • OpenAI
      • Anthropic
      • Google AI (Gemini)
      • AWS Bedrock
      • DeepSeek
      • GLM
      • Kimi
      • Qwen
  • Erweiterte Einrichtung
    • Langfuse-Integration
    • Überwachung und Beobachtbarkeit
    • Wissensgraph (Graphiti)
    • OAuth-Integration
    • Docker-Image-Konfiguration
  • Entwicklung
  • Testen von LLM-Agenten
  • Embedding-Konfiguration und -Test
  • Funktionstest mit ftester
  • Erstellen
  • Danksagungen
  • Lizenz

Übersicht

PentAGI ist ein innovatives Tool für automatisierte Sicherheitstests, das modernste KI-Technologien nutzt. Das Projekt richtet sich an Fachleute für Informationssicherheit, Forscher und Enthusiasten, die eine leistungsstarke und flexible Lösung für Penetrationstests benötigen.

Sie können sich das Video PentAGI-Übersicht ansehen: PentAGI Übersicht Video

Funktionen

  • Sicher und isoliert. Alle Vorgänge werden in einer Sandbox-Docker-Umgebung mit vollständiger Isolierung durchgeführt.
  • Vollautonom. KI-gestützter Agent, der Penetrationstestschritte automatisch bestimmt und ausführt, mit optionaler Ausführungsüberwachung und intelligenter Aufgabenplanung für erhöhte Zuverlässigkeit.
  • Professionelle Pentesting-Tools. Integrierte Suite von über 20 professionellen Sicherheitstools, darunter nmap, metasploit, sqlmap und mehr.
  • Intelligentes Speichersystem. Langzeitspeicherung von Forschungsergebnissen und erfolgreichen Ansätzen für die zukünftige Nutzung.
  • Wissensgraph-Integration. Graphiti-gestützter Wissensgraph mit Neo4j für semantische Beziehungsverfolgung und erweitertes Kontextverständnis.
  • Web-Intelligenz. Integrierter Browser über scraper zum Sammeln aktueller Informationen aus Webquellen.
  • Externe Suchsysteme. Integration mit erweiterten Such-APIs, darunter Tavily, Traversaal, Perplexity, DuckDuckGo, Google Custom Search, Sploitus Search und Searxng für umfassende Informationssammlung.
  • Team von Spezialisten. Delegationssystem mit spezialisierten KI-Agenten für Forschungs-, Entwicklungs- und Infrastrukturaufgaben, erweitert durch optionale Ausführungsüberwachung und intelligente Aufgabenplanung für optimale Leistung mit kleineren Modellen.
  • Umfassende Überwachung. Detaillierte Protokollierung und Integration mit Grafana/Prometheus für Echtzeit-Systembeobachtung.
  • Detaillierte Berichterstellung. Erstellung gründlicher Schwachstellenberichte mit Ausbeutungsanleitungen.
  • Intelligentes Container-Management. Automatische Docker-Image-Auswahl basierend auf spezifischen Aufgabenanforderungen.
  • Moderne Oberfläche. Saubere und intuitive Weboberfläche für Systemverwaltung und -überwachung.
  • Umfassende APIs. Voll ausgestattete REST- und GraphQL-APIs mit Bearer-Token-Authentifizierung für Automatisierung und Integration.
  • Alle Befehle und Ausgaben werden in PostgreSQL mit -Erweiterung gespeichert.

Aktuelle Fähigkeitsgrenzen

  • PentAGI ist heute eine autonome und assistentengeführte Penetrationstest-Plattform, kein CALDERA-artiges Breach and Attack Simulation (BAS)- oder Gegner-Emulationsprodukt mit vordefinierten Kampagnen oder Angriffsplänen.
  • BAS-ähnliche, vom Agenten verfasste Angriffsskripte sollten als konzeptionelle oder zukünftige Arbeit betrachtet werden, nicht als heute implementierte Funktion.
  • Die aktuelle Flow-Report-Benutzeroberfläche unterstützt Webansicht, Kopieren in die Zwischenablage, Markdown-Download und PDF-Download. Der JSON-Flow-Report-Export ist derzeit nicht als unterstütztes Ausgabeformat dokumentiert.
  • Die Anbieterflexibilität ist heute durch integrierte Anbieter und benutzerdefinierte/OpenAI-kompatible Endpunkte verfügbar. Siehe Benutzerdefinierte LLM-Anbieterkonfiguration und den vLLM + Qwen3.5-27B-FP8-Leitfaden.

Architektur

Systemkontext```mermaid

flowchart TB classDef person fill:#08427B,stroke:#073B6F,color:#fff classDef system fill:#1168BD,stroke:#0B4884,color:#fff classDef external fill:#666666,stroke:#0B4884,color:#fff

root@kitploit:~
pentester["👤 Security Engineer
(User of the system)"]

pentagi["✨ PentAGI
(Autonomous penetration testing system)"]

target["🎯 target-system
(System under test)"]
llm["🧠 llm-provider
(OpenAI/Anthropic/Ollama/Bedrock/Gemini/Custom)"]
search["🔍 search-systems
(Google/DuckDuckGo/Tavily/Traversaal/Perplexity/Sploitus/Searxng)"]
langfuse["📊 langfuse-ui
(LLM Observability Dashboard)"]
grafana["📈 grafana
(System Monitoring Dashboard)"]

pentester --> |Uses HTTPS| pentagi
pentester --> |Monitors AI HTTPS| langfuse
pentester --> |Monitors System HTTPS| grafana
pentagi --> |Tests Various protocols| target
pentagi --> |Queries HTTPS| llm
pentagi --> |Searches HTTPS| search
pentagi --> |Reports HTTPS| langfuse
pentagi --> |Reports HTTPS| grafana

class pentester person
class pentagi system
class target,llm,search,langfuse,grafana external

linkStyle default stroke:#ffffff,color:#ffffff
root@kitploit:~
<details>
<summary><b>Container-Architektur</b> (klicken zum Erweitern)</summary>```mermaid
graph TB
    subgraph Core Services
        UI[Frontend UI<br/>React + TypeScript]
        API[Backend API<br/>Go + GraphQL]
        DB[(Vector Store<br/>PostgreSQL + pgvector)]
        MQ[Task Queue<br/>Async Processing]
        Agent[AI Agents<br/>Multi-Agent System]
    end

    subgraph Knowledge Graph
        Graphiti[Graphiti<br/>Knowledge Graph API]
        Neo4j[(Neo4j<br/>Graph Database)]
    end

    subgraph Monitoring
        Grafana[Grafana<br/>Dashboards]
        VictoriaMetrics[VictoriaMetrics<br/>Time-series DB]
        Jaeger[Jaeger<br/>Distributed Tracing]
        Loki[Loki<br/>Log Aggregation]
        OTEL[OpenTelemetry<br/>Data Collection]
    end

    subgraph Analytics
        Langfuse[Langfuse<br/>LLM Analytics]
        ClickHouse[ClickHouse<br/>Analytics DB]
        Redis[Redis<br/>Cache + Rate Limiter]
        MinIO[MinIO<br/>S3 Storage]
    end

    subgraph Security Tools
        Scraper[Web Scraper<br/>Isolated Browser]
        PenTest[Security Tools<br/>20+ Pro Tools<br/>Sandboxed Execution]
    end

    UI --> |HTTP/WS| API
    API --> |SQL| DB
    API --> |Events| MQ
    MQ --> |Tasks| Agent
    Agent --> |Commands| PenTest
    Agent --> |Queries| DB
    Agent --> |Knowledge| Graphiti
    Graphiti --> |Graph| Neo4j

    API --> |Telemetry| OTEL
    OTEL --> |Metrics| VictoriaMetrics
    OTEL --> |Traces| Jaeger
    OTEL --> |Logs| Loki

    Grafana --> |Query| VictoriaMetrics
    Grafana --> |Query| Jaeger
    Grafana --> |Query| Loki

    API --> |Analytics| Langfuse
    Langfuse --> |Store| ClickHouse
    Langfuse --> |Cache| Redis
    Langfuse --> |Files| MinIO

    classDef core fill:#f9f,stroke:#333,stroke-width:2px,color:#000
    classDef knowledge fill:#ffa,stroke:#333,stroke-width:2px,color:#000
    classDef monitoring fill:#bbf,stroke:#333,stroke-width:2px,color:#000
    classDef analytics fill:#bfb,stroke:#333,stroke-width:2px,color:#000
    classDef tools fill:#fbb,stroke:#333,stroke-width:2px,color:#000

    class UI,API,DB,MQ,Agent core
    class Graphiti,Neo4j knowledge
    class Grafana,VictoriaMetrics,Jaeger,Loki,OTEL monitoring
    class Langfuse,ClickHouse,Redis,MinIO analytics
    class Scraper,PenTest tools
Entitätsbeziehung (zum Erweitern klicken)```mermaid erDiagram Flow ||--o{ Task : contains Task ||--o{ SubTask : contains SubTask ||--o{ Action : contains Action ||--o{ Artifact : produces Action ||--o{ Memory : stores
root@kitploit:~
Flow {
    string id PK
    string name "Flow name"
    string description "Flow description"
    string status "active/completed/failed"
    json parameters "Flow parameters"
    timestamp created_at
    timestamp updated_at
}

Task {
    string id PK
    string flow_id FK
    string name "Task name"
    string description "Task description"
    string status "pending/running/done/failed"
    json result "Task results"
    timestamp created_at
    timestamp updated_at
}

SubTask {
    string id PK
    string task_id FK
    string name "Subtask name"
    string description "Subtask description"
    string status "queued/running/completed/failed"
    string agent_type "researcher/developer/executor"
    json context "Agent context"
    timestamp created_at
    timestamp updated_at
}

Action {
    string id PK
    string subtask_id FK
    string type "command/search/analyze/etc"
    string status "success/failure"
    json parameters "Action parameters"
    json result "Action results"
    timestamp created_at
}

Artifact {
    string id PK
    string action_id FK
    string type "file/report/log"
    string path "Storage path"
    json metadata "Additional info"
    timestamp created_at
}

Memory {
    string id PK
    string action_id FK
    string type "observation/conclusion"
    vector embedding "Vector representation"
    text content "Memory content"
    timestamp created_at
}
Speichersystem (klicken zum Erweitern)```mermaid graph TB subgraph "Long-term Memory" VS[(Vector Store
Embeddings DB)] KB[Knowledge Base
Domain Expertise] Tools[Tools Knowledge
Usage Patterns] end
root@kitploit:~
subgraph "Working Memory"
    Context[Current Context<br/>Task State]
    Goals[Active Goals<br/>Objectives]
    State[System State<br/>Resources]
end

subgraph "Episodic Memory"
    Actions[Past Actions<br/>Commands History]
    Results[Action Results<br/>Outcomes]
    Patterns[Success Patterns<br/>Best Practices]
end

Context --> |Query| VS
VS --> |Retrieve| Context

Goals --> |Consult| KB
KB --> |Guide| Goals

State --> |Record| Actions
Actions --> |Learn| Patterns
Patterns --> |Store| VS

Tools --> |Inform| State
Results --> |Update| Tools

VS --> |Enhance| KB
KB --> |Index| VS

classDef ltm fill:#f9f,stroke:#333,stroke-width:2px,color:#000
classDef wm fill:#bbf,stroke:#333,stroke-width:2px,color:#000
classDef em fill:#bfb,stroke:#333,stroke-width:2px,color:#000

class VS,KB,Tools ltm
class Context,Goals,State wm
class Actions,Results,Patterns em
root@kitploit:~
</details>

<details>
<summary><b>Chain-Zusammenfassung</b> (click to expand)</summary>

Das Chain-Zusammenfassungssystem verwaltet das Wachstum des Gesprächskontexts, indem es ältere Nachrichten selektiv zusammenfasst. Dies ist entscheidend, um zu verhindern, dass Token-Limits überschritten werden, während die Gesprächskohärenz erhalten bleibt.```mermaid
flowchart TD
    A[Input Chain] --> B{Needs Summarization?}
    B -->|No| C[Return Original Chain]
    B -->|Yes| D[Convert to ChainAST]
    D --> E[Apply Section Summarization]
    E --> F[Process Oversized Pairs]
    F --> G[Manage Last Section Size]
    G --> H[Apply QA Summarization]
    H --> I[Rebuild Chain with Summaries]
    I --> J{Is New Chain Smaller?}
    J -->|Yes| K[Return Optimized Chain]
    J -->|No| C

    classDef process fill:#bbf,stroke:#333,stroke-width:2px,color:#000
    classDef decision fill:#bfb,stroke:#333,stroke-width:2px,color:#000
    classDef output fill:#fbb,stroke:#333,stroke-width:2px,color:#000

    class A,D,E,F,G,H,I process
    class B,J decision
    class C,K output
Tool herunterladen
Persistenter Speicher.
pgvector
  • Skalierbare Architektur. Mikroservices-basiertes Design, das horizontale Skalierung unterstützt.
  • Self-Hosted-Lösung. Vollständige Kontrolle über Ihre Bereitstellung und Daten.
  • Flexible Authentifizierung. Unterstützung von über 10 LLM-Anbietern (OpenAI, Anthropic, Google AI/Gemini, AWS Bedrock, Ollama, DeepSeek, GLM, Kimi, Qwen, benutzerdefiniert) sowie Aggregatoren (OpenRouter, DeepInfra). Für lokale Produktionsbereitstellungen siehe unseren vLLM + Qwen3.5-27B-FP8-Leitfaden.
  • API-Token-Authentifizierung. Sicheres Bearer-Token-System für programmatischen Zugriff auf REST- und GraphQL-APIs.
  • Schnelle Bereitstellung. Einfache Einrichtung über Docker Compose mit umfassender Umgebungskonfiguration.
  • root@kitploit:~
    </details>
    
    <details>
    <summary><b>Agenteninteraktion</b> (zum Erweitern klicken)</summary>```mermaid
    sequenceDiagram
        participant O as Orchestrator
        participant R as Researcher
        participant D as Developer
        participant E as Executor
        participant VS as Vector Store
        participant KB as Knowledge Base
    
        Note over O,KB: Flow Initialization
        O->>VS: Query similar tasks
        VS-->>O: Return experiences
        O->>KB: Load relevant knowledge
        KB-->>O: Return context
    
        Note over O,R: Research Phase
        O->>R: Analyze target
        R->>VS: Search similar cases
        VS-->>R: Return patterns
        R->>KB: Query vulnerabilities
        KB-->>R: Return known issues
        R->>VS: Store findings
        R-->>O: Research results
    
        Note over O,D: Planning Phase
        O->>D: Plan attack
        D->>VS: Query exploits
        VS-->>D: Return techniques
        D->>KB: Load tools info
        KB-->>D: Return capabilities
        D-->>O: Attack plan
    
        Note over O,E: Execution Phase
        O->>E: Execute plan
        E->>KB: Load tool guides
        KB-->>E: Return procedures
        E->>VS: Store results
        E-->>O: Execution status
    

    Der Algorithmus arbeitet auf einer strukturierten Repräsentation von Gesprächsketten (ChainAST), die Nachrichtentypen einschließlich Tool-Aufrufen und deren Antworten berücksichtigt. Alle Zusammenfassungsvorgänge bewahren den wesentlichen Gesprächsfluss bei gleichzeitiger Reduzierung der Kontextgröße.

    Globale Konfigurationsoptionen für die Zusammenfassung

    ParameterUmgebungsvariableStandardBeschreibung
    Letzte Abschnitte bewahrenSUMMARIZER_PRESERVE_LASTtrueOb alle Nachrichten im letzten Abschnitt unverändert bleiben sollen
    QA-Paare verwendenSUMMARIZER_USE_QAtrueOb die QA-Paar-Zusammenfassungsstrategie verwendet werden soll
    Menschliche QA-ZusammenfassungSUMMARIZER_SUM_MSG_HUMAN_IN_QAfalseOb menschliche Nachrichten in QA-Paaren zusammengefasst werden sollen
    Letzte AbschnittsgrößeSUMMARIZER_LAST_SEC_BYTES51200Maximale Byte-Größe für den letzten Abschnitt (50 KB)
    Maximale KörperpaargrößeSUMMARIZER_MAX_BP_BYTES16384Maximale Byte-Größe für ein einzelnes Körperpaar (16 KB)
    Maximale QA-AbschnitteSUMMARIZER_MAX_QA_SECTIONS10Maximale Anzahl an QA-Paar-Abschnitten, die erhalten bleiben
    Maximale QA-GrößeSUMMARIZER_MAX_QA_BYTES65536Maximale Byte-Größe für QA-Paar-Abschnitte (64 KB)
    QA-Abschnitte behaltenSUMMARIZER_KEEP_QA_SECTIONS1Anzahl der letzten QA-Abschnitte, die ohne Zusammenfassung bleiben

    Konfigurationsoptionen für die Assistenten-Zusammenfassung

    Assistenteninstanzen können benutzerdefinierte Zusammenfassungseinstellungen verwenden, um das Kontextmanagement zu optimieren:

    ParameterUmgebungsvariableStandardBeschreibung
    Letzte Abschnitte bewahrenASSISTANT_SUMMARIZER_PRESERVE_LASTtrueOb alle Nachrichten im letzten Abschnitt des Assistenten erhalten bleiben
    Letzte AbschnittsgrößeASSISTANT_SUMMARIZER_LAST_SEC_BYTES76800Maximale Byte-Größe für den letzten Abschnitt des Assistenten (75 KB)
    Maximale KörperpaargrößeASSISTANT_SUMMARIZER_MAX_BP_BYTES16384Maximale Byte-Größe für ein einzelnes Körperpaar im Assistentenkontext (16 KB)
    Maximale QA-AbschnitteASSISTANT_SUMMARIZER_MAX_QA_SECTIONS7Maximale Anzahl an QA-Abschnitten im Assistentenkontext
    Maximale QA-GrößeASSISTANT_SUMMARIZER_MAX_QA_BYTES76800Maximale Byte-Größe für QA-Abschnitte des Assistenten (75 KB)
    QA-Abschnitte behaltenASSISTANT_SUMMARIZER_KEEP_QA_SECTIONS3Anzahl der letzten QA-Abschnitte, die ohne Zusammenfassung bleiben

    Die Konfiguration des Assistenten-Zusammenfassers bietet mehr Speicher für die Kontexterhaltung im Vergleich zu den globalen Einstellungen. Dabei bleibt mehr des aktuellen Gesprächsverlaufs erhalten, während eine effiziente Token-Nutzung gewährleistet wird.

    Umgebungskonfiguration der Zusammenfassung```bash

    Default values for global summarizer logic

    SUMMARIZER_PRESERVE_LAST=true SUMMARIZER_USE_QA=true SUMMARIZER_SUM_MSG_HUMAN_IN_QA=false SUMMARIZER_LAST_SEC_BYTES=51200 SUMMARIZER_MAX_BP_BYTES=16384 SUMMARIZER_MAX_QA_SECTIONS=10 SUMMARIZER_MAX_QA_BYTES=65536 SUMMARIZER_KEEP_QA_SECTIONS=1

    Default values for assistant summarizer logic

    ASSISTANT_SUMMARIZER_PRESERVE_LAST=true ASSISTANT_SUMMARIZER_LAST_SEC_BYTES=76800 ASSISTANT_SUMMARIZER_MAX_BP_BYTES=16384 ASSISTANT_SUMMARIZER_MAX_QA_SECTIONS=7 ASSISTANT_SUMMARIZER_MAX_QA_BYTES=76800 ASSISTANT_SUMMARIZER_KEEP_QA_SECTIONS=3

    root@kitploit:~
    </details>
    
    <a id="advanced-agent-supervision"></a>
    <details>
    <summary><b>Erweiterte Agentenüberwachung</b> (anklicken, um zu erweitern)</summary>
    
    PentAGI enthält ausgeklügelte mehrschichtige Agentenüberwachungsmechanismen, um eine effiziente Aufgabenausführung sicherzustellen, Endlosschleifen zu verhindern und eine intelligente Wiederherstellung aus festgefahrenen Zuständen zu ermöglichen:
    
    ### Ausführungsüberwachung (Beta)
    - **Automatisches Mentor-Eingreifen**: Beratungs-Agent (Mentor) wird automatisch aufgerufen, wenn Ausführungsmuster auf potenzielle Probleme hindeuten
    - **Mustererkennung**: Überwacht identische Tool-Aufrufe (Grenzwert: 5, konfigurierbar) und gesamte Tool-Aufrufe (Grenzwert: 10, konfigurierbar)
    - **Fortschrittsanalyse**: Bewertet, ob der Agent in Richtung Teilaufgabenziel voranschreitet, erkennt Schleifen und Ineffizienzen
    - **Alternative Strategien**: Empfiehlt andere Ansätze, wenn die aktuelle Strategie fehlschlägt
    - **Informationsbeschaffungshilfe**: Schlägt vor, nach bewährten Lösungen zu suchen, anstatt sie neu zu erfinden
    - **Verbessertes Antwortformat**: Tool-Antworten enthalten sowohl `<original_result>` als auch `<mentor_analysis>`-Abschnitte
    - **Konfigurierbar**: Aktivieren über `EXECUTION_MONITOR_ENABLED` (Standard: false), Grenzwerte anpassen mit `EXECUTION_MONITOR_SAME_TOOL_LIMIT` und `EXECUTION_MONITOR_TOTAL_TOOL_LIMIT`
    
    **Am besten geeignet für**: Kleinere Modelle (< 32B Parameter), komplexe Angriffsszenarien, die kontinuierliche Anleitung erfordern, verhindert, dass Agenten auf einem einzigen Ansatz hängen bleiben
    
    **Leistungsauswirkung**: 2-3x längere Ausführungszeit und Tokenverbrauch, aber liefert **2x Verbesserung der Ergebnisqualität** basierend auf Tests mit Qwen3.5-27B-FP8
    
    ### Intelligente Aufgabenplanung (Beta)
    - **Automatische Zerlegung**: Planer (Berater im Planungsmodus) generiert 3-7 spezifische, handlungsorientierte Schritte, bevor Spezialisten-Agenten mit der Arbeit beginnen
    - **Kontextbewusste Pläne**: Analysiert den vollständigen Ausführungskontext über den Anreicherungs-Agenten, um fundierte Pläne zu erstellen
    - **Strukturierte Zuweisung**: Ursprüngliche Anfrage wird in `<task_assignment>`-Struktur mit Ausführungsplan und Anweisungen eingeschlossen
    - **Umfangsmanagement**: Verhindert Umfangsausweitung, indem die Agenten auf die aktuelle Teilaufgabe fokussiert bleiben
    - **Angereicherte Anweisungen**: Pläne heben kritische Aktionen, potenzielle Fallstricke und Überprüfungspunkte hervor
    - **Konfigurierbar**: Aktivieren über `AGENT_PLANNING_STEP_ENABLED` (Standard: false)
    
    **Am besten geeignet für**: Modelle < 32B Parameter, komplexe Penetrationstest-Workflows, Verbesserung der Erfolgsraten bei anspruchsvollen Aufgaben
    
    **Erweiterte Beraterkonfiguration**: Funktioniert besonders gut, wenn der Berater-Agent ein stärkeres Modell oder erweiterte Einstellungen verwendet. Beispiel: Verwendung desselben Basismodells mit maximalem Reasoning-Modus für den Berater (siehe [`vllm-qwen3.5-27b-fp8.provider.yml`](https://github.com/vxcontrol/pentagi/blob/HEAD/examples/configs/vllm-qwen3.5-27b-fp8.provider.yml)) ermöglicht umfassende Aufgabenanalyse und strategische Planung von identischer Modellarchitektur.
    
    **Leistungsauswirkung**: Fügt Planungs-Overhead hinzu, verbessert aber deutlich die Abschlussraten und reduziert redundante Arbeit
    
    ### Tool-Aufruf-Grenzen (immer aktiv)
    - **Harte Grenzen**: Verhindern unkontrollierte Ausführungen unabhängig vom Überwachungsmodus
    - **Nach Agententyp unterschieden**:
      - Allgemeine Agenten (Assistent, Primäragent, Pentester, Coder, Installer): `MAX_GENERAL_AGENT_TOOL_CALLS` (Standard: 100)
      - Eingeschränkte Agenten (Sucher, Anreicherer, Memorisierer, Generator, Reporter, Berater, Reflektor, Planer): `MAX_LIMITED_AGENT_TOOL_CALLS` (Standard: 20)
    - **Sanfte Beendigung**: Reflektor führt Agenten bei Annäherung an die Grenzen zur ordnungsgemäßen Fertigstellung
    - **Ressourcenschutz**: Stellt Systemstabilität sicher und verhindert Ressourcenerschöpfung
    
    ### Reflektor-Integration (immer aktiv)
    - **Automatische Korrektur**: Wird aufgerufen, wenn das LLM nach 3 Versuchen keine Tool-Aufrufe generiert
    - **Strategische Anleitung**: Analysiert Fehler und führt Agenten zur korrekten Tool-Nutzung oder zu Barriere-Tools (`done`, `ask`)
    - **Wiederherstellungsmechanismus**: Bietet kontextbezogene Anleitung basierend auf spezifischen Fehlermustern
    - **Grenzendurchsetzung**: Koordiniert die sanfte Beendigung, wenn Tool-Aufruf-Grenzen erreicht sind
    
    ### Empfehlungen für Open-Source-Modelle
    
    **Muss-Have für Modelle < 32B Parameter**:
    Tests mit Qwen3.5-27B-FP8 zeigen, dass die Aktivierung von Ausführungsüberwachung und Aufgabenplanung **unerlässlich** für kleinere Open-Source-Modelle ist:
    - **Qualitätsverbesserung**: 2x bessere Ergebnisse im Vergleich zur Basisausführung ohne Überwachung
    - **Schleifenvermeidung**: Reduziert Endlosschleifen und redundante Arbeit signifikant
    - **Angriffsvielfalt**: Fördert die Erkundung mehrerer Angriffsvektoren anstatt Fixierung auf einen einzelnen Ansatz
    - **Luftgesperrte Bereitstellungen**: Ermöglicht produktionsreife autonome Penetrationstests in geschlossenen Netzwerkumgebungen mit lokaler LLM-Inferenz
    
    **Kompromisse**:
    - Tokenverbrauch: 2-3x höher durch Mentor/Planer-Aufrufe
    - Ausführungszeit: 2-3x länger durch Analyse- und Planungsschritte
    - Ergebnisqualität: 2x Verbesserung in Vollständigkeit, Genauigkeit und Angriffsabdeckung
    - Modellanforderungen: Funktioniert am besten, wenn der Berater eine erweiterte Konfiguration verwendet (höhere Reasoning-Parameter, stärkere Modellvariante oder anderes Modell)
    
    **Konfigurationsstrategie**:
    Für optimale Leistung mit kleineren Modellen den Berater-Agenten mit erweiterten Einstellungen konfigurieren:
    - Gleiches Modell mit maximalem Reasoning-Modus verwenden (Beispiel: [`vllm-qwen3.5-27b-fp8.provider.yml`](https://github.com/vxcontrol/pentagi/blob/HEAD/examples/configs/vllm-qwen3.5-27b-fp8.provider.yml))
    - Oder ein stärkeres Modell für den Berater verwenden, während das Basismodell für andere Agenten beibehalten wird
    - Überwachungsschwellenwerte basierend auf Aufgabenkomplexität und Modellfähigkeiten anpassen
    
    
    
    </details>
    
    Die Architektur von PentAGI ist modular, skalierbar und sicher. Hier sind die Schlüsselkomponenten:
    
    1. **Kerndienste**
       - Frontend-UI: React-basierte Weboberfläche mit TypeScript für Typsicherheit
       - Backend-API: Go-basierte REST- und GraphQL-APIs mit Bearer-Token-Authentifizierung für programmatischen Zugriff
       - Vektor-Speicher: PostgreSQL mit pgvector für semantische Suche und Speicher
       - Aufgabenwarteschlange: Async-Aufgabenverarbeitungssystem für zuverlässigen Betrieb
       - KI-Agent: Multi-Agenten-System mit spezialisierten Rollen für effizientes Testen
    
    2. **Wissensgraph**
       - Graphiti: Wissensgraph-API für semantische Beziehungsverfolgung und kontextuelles Verständnis
       - Neo4j: Graphdatenbank zum Speichern und Abfragen von Beziehungen zwischen Entitäten, Aktionen und Ergebnissen
       - Automatische Erfassung von Agentenantworten und Tool-Ausführungen zum Aufbau einer umfassenden Wissensbasis
    
    3. **Monitoring-Stack**
       - OpenTelemetry: Einheitliche Observability-Datenerfassung und -korrelation
       - Grafana: Echtzeit-Visualisierung und Alarmierungs-Dashboards
       - VictoriaMetrics: Hochleistungs-Zeitreihen-Metrikspeicher
       - Jaeger: End-to-End verteiltes Tracing zum Debuggen
       - Loki: Skalierbare Log-Aggregation und -Analyse
    
    4. **Analyseplattform**
       - Langfuse: Erweiterte LLM-Observability und Leistungsanalyse
       - ClickHouse: Spaltenorientiertes Analyse-Datenlager
       - Redis: Hochgeschwindigkeits-Caching und Ratenbegrenzung
       - MinIO: S3-kompatibler Objektspeicher für Artefakte
    
    5. **Sicherheitswerkzeuge**
       - Web Scraper: Isolierte Browser-Umgebung für sichere Web-Interaktion
       - Pentesting-Tools: Umfassende Suite von über 20 professionellen Sicherheitswerkzeugen
       - Sandbox-Ausführung: Alle Operationen laufen in isolierten Containern
    
    6. **Gedächtnissysteme**
       - Langzeitgedächtnis: Dauerhafte Speicherung von Wissen und Erfahrungen
       - Arbeitsgedächtnis: Aktiver Kontext und Ziele für aktuelle Operationen
       - Episodisches Gedächtnis: Historische Aktionen und Erfolgsmuster
       - Wissensbasis: Strukturiertes Domain-Wissen und Tool-Fähigkeiten
       - Kontextmanagement: Intelligentes Management wachsender LLM-Kontextfenster mittels Kettenzusammenfassung
    
    Das System verwendet Docker-Container für Isolation und einfache Bereitstellung, mit getrennten Netzwerken für Kerndienste, Monitoring und Analyse, um angemessene Sicherheitsgrenzen zu gewährleisten. Jede Komponente ist für horizontale Skalierung ausgelegt und kann für hohe Verfügbarkeit in Produktionsumgebungen konfiguriert werden.
    
    ## Schnellstart
    
    ### Systemanforderungen
    
    - Docker und Docker Compose (oder Podman – siehe [Podman-Konfiguration](#running-pentagi-with-podman))
    - Mindestens 2 vCPU
    - Mindestens 4 GB RAM
    - 20 GB freier Speicherplatz
    - Internetzugang zum Herunterladen von Images und Updates
    
    ### Mit dem Installer (empfohlen)
    
    PentAGI bietet einen interaktiven Installer mit einer terminalbasierten Benutzeroberfläche für optimierte Konfiguration und Bereitstellung. Der Installer führt Sie durch Systemprüfungen, LLM-Provider-Einrichtung, Suchmaschinenkonfiguration und Sicherheitshärtung.
    
    **Unterstützte Plattformen:**
    - **Linux**: amd64 [Download](https://pentagi.com/downloads/linux/amd64/installer-latest.zip) | arm64 [Download](https://pentagi.com/downloads/linux/arm64/installer-latest.zip)
    - **Windows**: amd64 [Download](https://pentagi.com/downloads/windows/amd64/installer-latest.zip)
    - **macOS**: amd64 (Intel) [Download](https://pentagi.com/downloads/darwin/amd64/installer-latest.zip) | arm64 (M-Serie) [Download](https://pentagi.com/downloads/darwin/arm64/installer-latest.zip)
    
    **Schnellinstallation (Linux amd64):**```bash
    # Create installation directory
    mkdir -p pentagi && cd pentagi
    
    # Download installer
    wget -O installer.zip https://pentagi.com/downloads/linux/amd64/installer-latest.zip
    
    # Extract
    unzip installer.zip
    
    # Run interactive installer
    ./installer
    

    Voraussetzungen & Berechtigungen:

    Das Installationsprogramm benötigt geeignete Berechtigungen, um ordnungsgemäß mit der Docker-API zu interagieren. Standardmäßig wird der Docker-Socket (/var/run/docker.sock) verwendet, der Folgendes erfordert:

    • Option 1 (für Produktion empfohlen): Führen Sie das Installationsprogramm als root aus: ```bash sudo ./installer

      root@kitploit:~
    • Option 2 (Entwicklungsumgebungen): Gewähren Sie Ihrem Benutzer Zugriff auf den Docker-Socket, indem Sie ihn zur Gruppe docker hinzufügen: ```bash

      Add your user to the docker group

      sudo usermod -aG docker $USER

      Log out and log back in, or activate the group immediately

      newgrp docker

      Verify Docker access (should run without sudo)

      docker ps

      root@kitploit:~

    ⚠️ Sicherheitshinweis: Das Hinzufügen eines Benutzers zur docker-Gruppe gewährt root-äquivalente Berechtigungen. Tun Sie dies nur für vertrauenswürdige Benutzer in kontrollierten Umgebungen. Für Produktionsumgebungen sollten Sie den rootless Docker-Modus in Betracht ziehen oder den Installer mit sudo ausführen.

    Der Installer wird:

    1. Systemprüfungen: Überprüfung von Docker, Netzwerkkonnektivität und Systemanforderungen
    2. Umgebungseinrichtung: Erstellen und Konfigurieren der .env-Datei mit optimalen Standardwerten
    3. Anbieterkonfiguration: Einrichtung von LLM-Anbietern (OpenAI, Anthropic, Gemini, Bedrock, Ollama, Custom)
    4. Suchmaschinen: Konfiguration von DuckDuckGo, Google, Tavily, Traversaal, Perplexity, Sploitus, Searxng
    5. Sicherheitshärtung: Generieren sicherer Anmeldeinformationen und Konfiguration von SSL-Zertifikaten
    6. Bereitstellung: Starten von PentAGI mit docker-compose

    Aktuelle Abdeckung der Web-Einstellungen

    Die PentAGI-Webkonsole verwaltet bereits mehrere Einstellungsbereiche, nachdem der Server läuft und betriebsbereit ist:

    • Einstellungen -> Anbieter: Erstellen, Bearbeiten, Löschen und Testen von benutzerdefinierten Anbieterprofilen für unterstützte Anbietertypen. Diese Profile steuern die agentenspezifische Modellauswahl, Laufzeitparameter, Reasoning-Optionen und Preismetadaten.
    • Einstellungen -> Prompts: Verwalten von System-, Human- und Tool-Prompt-Vorlagen.
    • Einstellungen -> PentAGI API: Erstellen und Verwalten von PentAGI-Bearer-Tokens für REST- und GraphQL-Zugriff.
    • Andere von der UI verwaltete Einstellungen: Bevorzugte Abläufe werden als Benutzereinstellungen gespeichert, und die Themenauswahl erfolgt über die Hauptseitenleiste/Profilsteuerung und nicht über die Einstellungsseiten.

    Weiterhin serververwaltet

    Die folgenden Konfigurationsbereiche müssen weiterhin auf dem Server über Umgebungsvariablen, Compose-Dateien oder eingebundene Konfigurationsdateien festgelegt werden:

    • LLM-Anmeldeinformationen und Verbindungsdetails: API-Schlüssel, Endpunkte, Authentifizierungsmodi und anbieterspezifische Verbindungseinstellungen für OpenAI, Anthropic, Bedrock, Ollama, benutzerdefinierte Anbieter und ähnliche Backends; Konfigurationspfad-Einstellungen gelten nur, wo unterstützt, wie OLLAMA_SERVER_CONFIG_PATH und LLM_SERVER_CONFIG_PATH.
    • Suchanbieter-Anmeldeinformationen und Optionen: Einstellungen wie DUCKDUCKGO_*, GOOGLE_*, TAVILY_API_KEY, TRAVERSAAL_API_KEY, PERPLEXITY_*, SEARXNG_* und SPLOITUS_ENABLED.
    • Integrationen von Drittanbietern: Langfuse, Graphiti und ähnliche externe Dienste bleiben serverseitige Konfiguration.
    • MCP-Serververwaltung: MCP-Einstellungsseiten sind derzeit nicht als Live-Webkonsole-Funktion verfügbar.

    Für Produktion & erweiterte Sicherheit:

    Für Produktionsumgebungen oder sicherheitskritische Umgebungen empfehlen wir dringend die Verwendung einer verteilten Zwei-Knoten-Architektur, bei der Worker-Operationen auf einem separaten Server isoliert werden. Dies verhindert die Ausführung nicht vertrauenswürdigen Codes und Netzwerkzugriffsprobleme auf Ihrem Hauptsystem.

    Siehe ausführliche Anleitung: Worker Node Setup

    Die Zwei-Knoten-Einrichtung bietet:

    • Isolierte Ausführung: Worker-Container laufen auf dedizierter Hardware
    • Netzwerkisolierung: Separate Netzwerkgrenzen für Penetrationstests
    • Sicherheitsgrenzen: Docker-in-Docker mit TLS-Authentifizierung
    • OOB-Angriffsunterstützung: Dedizierte Portbereiche für Out-of-Band-Techniken

    Manuelle Installation

    1. Erstellen Sie ein Arbeitsverzeichnis oder klonen Sie das Repository:```bash mkdir pentagi && cd pentagi
    root@kitploit:~
    2. Kopieren Sie `.env.example` nach `.env` oder laden Sie es herunter:```bash
    curl -o .env https://raw.githubusercontent.com/vxcontrol/pentagi/master/.env.example
    
    1. Führen Sie touch für die Beispieldateien (example.custom.provider.yml, example.ollama.provider.yml) aus oder laden Sie sie herunter:```bash curl -o example.custom.provider.yml https://raw.githubusercontent.com/vxcontrol/pentagi/master/examples/configs/custom-openai.provider.yml curl -o example.ollama.provider.yml https://raw.githubusercontent.com/vxcontrol/pentagi/master/examples/configs/ollama-llama318b.provider.yml
    root@kitploit:~
    4. Füge die erforderlichen API-Schlüssel in die `.env`-Datei ein.```bash
    # Required: At least one of these LLM providers
    OPEN_AI_KEY=your_openai_key
    ANTHROPIC_API_KEY=your_anthropic_key
    GEMINI_API_KEY=your_gemini_key
    
    # Optional: AWS Bedrock provider (enterprise-grade models)
    BEDROCK_REGION=us-east-1
    # Choose one authentication method:
    BEDROCK_DEFAULT_AUTH=true                        # Option 1: Use AWS SDK default credential chain (recommended for EC2/ECS)
    # BEDROCK_BEARER_TOKEN=your_bearer_token         # Option 2: Bearer token authentication
    # BEDROCK_ACCESS_KEY_ID=your_aws_access_key      # Option 3: Static credentials
    # BEDROCK_SECRET_ACCESS_KEY=your_aws_secret_key
    
    # Optional: Ollama provider (local or cloud)
    # OLLAMA_SERVER_URL=http://ollama-server:11434   # Local server
    # OLLAMA_SERVER_URL=https://ollama.com           # Cloud service
    # OLLAMA_SERVER_API_KEY=your_ollama_cloud_key    # Required for cloud, empty for local
    
    # Optional: Chinese AI providers
    # DEEPSEEK_API_KEY=your_deepseek_key             # DeepSeek (strong reasoning)
    # GLM_API_KEY=your_glm_key                       # GLM (Zhipu AI)
    # KIMI_API_KEY=your_kimi_key                     # Kimi (Moonshot AI, ultra-long context)
    # QWEN_API_KEY=your_qwen_key                     # Qwen (Alibaba Cloud, multimodal)
    
    # Optional: Local LLM provider (zero-cost inference)
    OLLAMA_SERVER_URL=http://localhost:11434
    OLLAMA_SERVER_MODEL=your_model_name
    
    # Optional: Additional search capabilities
    DUCKDUCKGO_ENABLED=true
    DUCKDUCKGO_REGION=us-en
    DUCKDUCKGO_SAFESEARCH=
    DUCKDUCKGO_TIME_RANGE=
    SPLOITUS_ENABLED=true
    GOOGLE_API_KEY=your_google_key
    GOOGLE_CX_KEY=your_google_cx
    TAVILY_API_KEY=your_tavily_key
    TRAVERSAAL_API_KEY=your_traversaal_key
    PERPLEXITY_API_KEY=your_perplexity_key
    PERPLEXITY_MODEL=sonar-pro
    PERPLEXITY_CONTEXT_SIZE=medium
    
    # Searxng meta search engine (aggregates results from multiple sources)
    SEARXNG_URL=http://your-searxng-instance:8080
    SEARXNG_CATEGORIES=general
    SEARXNG_LANGUAGE=
    SEARXNG_SAFESEARCH=0
    SEARXNG_TIME_RANGE=
    SEARXNG_TIMEOUT=
    
    ## Graphiti knowledge graph settings
    GRAPHITI_ENABLED=true
    GRAPHITI_TIMEOUT=30
    GRAPHITI_URL=http://graphiti:8000
    GRAPHITI_MODEL_NAME=gpt-5-mini
    
    # Neo4j settings (used by Graphiti stack)
    NEO4J_USER=neo4j
    NEO4J_DATABASE=neo4j
    NEO4J_PASSWORD=devpassword
    NEO4J_URI=bolt://neo4j:7687
    
    # Assistant configuration
    ASSISTANT_USE_AGENTS=false         # Default value for agent usage when creating new assistants
    
    1. Ändern Sie alle sicherheitsrelevanten Umgebungsvariablen in der .env-Datei, um die Sicherheit zu verbessern.
    Sicherheitsrelevante Umgebungsvariablen

    Hauptsicherheitseinstellungen

    • COOKIE_SIGNING_SALT - Salt für die Cookie-Signierung, auf einen zufälligen Wert ändern
    • PUBLIC_URL - Öffentliche URL Ihres Servers (z. B. https://pentagi.example.com)
    • SERVER_SSL_CRT und SERVER_SSL_KEY - Benutzerdefinierte Pfade zu Ihrem vorhandenen SSL-Zertifikat und -Schlüssel für HTTPS (diese Pfade sollten in der docker-compose.yml-Datei verwendet werden, um als Volumes einzubinden)

    Scraper-Zugriff

    • SCRAPER_PUBLIC_URL - Öffentliche URL für den Scraper, falls Sie einen anderen Scraper-Server für öffentliche URLs verwenden möchten
    • SCRAPER_PRIVATE_URL - Private URL für den Scraper (lokaler Scraper-Server in der docker-compose.yml-Datei, um auf lokale URLs zuzugreifen)

    Zugangsdaten

    • PENTAGI_POSTGRES_USER und PENTAGI_POSTGRES_PASSWORD - PostgreSQL-Anmeldeinformationen
    • NEO4J_USER und NEO4J_PASSWORD - Neo4j-Anmeldeinformationen (für den Graphiti-Wissensgraphen)
    1. Entfernen Sie alle Inline-Kommentare aus der .env-Datei, wenn Sie sie in VSCode oder anderen IDEs als envFile-Option verwenden möchten:```bash perl -i -pe 's/\s+#.*$//' .env
    root@kitploit:~
    7. Führen Sie den PentAGI-Stack aus:```bash
    curl -O https://raw.githubusercontent.com/vxcontrol/pentagi/master/docker-compose.yml
    docker compose up -d
    

    Besuchen Sie localhost:8443, um auf die PentAGI Web UI zuzugreifen (Standard ist [email protected] / admin)

    Web UI Konten

    PentAGI bietet keine öffentliche Selbstregistrierung auf der Anmeldeseite an. Eine Neuinstallation erstellt das standardmäßige lokale Administratorkonto:

    • E-Mail: [email protected]
    • Passwort: admin

    Ändern Sie bei der ersten Anmeldung das Standardpasswort, bevor Sie die Instanz für produktive Arbeiten verwenden. Falls das Administratorkennwort später verloren geht, nutzen Sie das Installations-Wartungsmenü, um das Passwort des Standardkontos [email protected] zurückzusetzen.

    Für Mehrbenutzerkonfigurationen kann ein authentifizierter Administrator lokale Benutzer über die Users REST API (/api/v1/users/) verwalten. Die OpenAPI-Oberfläche ist nach dem Start der Instanz unter https://localhost:8443/api/v1/swagger/index.html verfügbar.

    [!NOTE] Falls Sie einen Fehler bezüglich pentagi-network oder observability-network oder langfuse-network erhalten haben, müssen Sie zuerst docker-compose.yml ausführen, um diese Netzwerke zu erstellen, und danach docker-compose-langfuse.yml, docker-compose-graphiti.yml und docker-compose-observability.yml ausführen, um die Langfuse-, Graphiti- und Observability-Dienste zu nutzen.

    Sie müssen mindestens einen Sprachmodellanbieter (OpenAI, Anthropic, Gemini, AWS Bedrock oder Ollama) konfigurieren, um PentAGI nutzen zu können. AWS Bedrock bietet unternehmensgerechten Zugriff auf mehrere Foundation-Modelle führender KI-Unternehmen, während Ollama kostenlose lokale Inferenz bietet, sofern Sie ausreichende Rechenressourcen haben. Zusätzliche API-Schlüssel für Suchmaschinen sind optional, aber für bessere Ergebnisse empfohlen.

    Für vollständig lokalen Einsatz mit fortschrittlichen Modellen: Siehe unseren umfassenden Leitfaden zum Ausführen von PentAGI mit vLLM und Qwen3.5-27B-FP8 für eine produktionsreife lokale LLM-Einrichtung. Diese Konfiguration erreicht ~13.000 TPS für die Prompt-Verarbeitung und ~650 TPS für die Vervollständigung auf 4× RTX 5090 GPUs und unterstützt 12+ gleichzeitige Abläufe bei völliger Unabhängigkeit von Cloud-Anbietern.

    LLM_SERVER_* Umgebungsvariablen sind experimentelle Funktionen und werden in Zukunft geändert. Derzeit können Sie damit eine benutzerdefinierte LLM-Server-URL und ein Modell für alle Agententypen angeben.

    PROXY_URL ist eine globale Proxy-URL für alle LLM-Anbieter und externen Suchsysteme. Sie können sie zur Isolierung von externen Netzwerken verwenden.

    Die Datei docker-compose.yml führt den PentAGI-Dienst als Root-Benutzer aus, da er Zugriff auf docker.sock für die Containerverwaltung benötigt. Wenn Sie eine TCP/IP-Netzwerkverbindung zu Docker anstelle der Socket-Datei verwenden, können Sie die Root-Berechtigungen entfernen und den Standardbenutzer pentagi für eine bessere Sicherheit verwenden.

    Zugriff auf PentAGI aus externen Netzwerken

    Standardmäßig bindet PentAGI aus Sicherheitsgründen an 127.0.0.1 (nur localhost). Um von anderen Rechnern im Netzwerk auf PentAGI zuzugreifen, müssen Sie den externen Zugriff konfigurieren.

    Konfigurationsschritte

    1. Aktualisieren Sie die .env-Datei mit der IP-Adresse Ihres Servers:```bash

    Network binding - allow external connections

    PENTAGI_LISTEN_IP=0.0.0.0 PENTAGI_LISTEN_PORT=8443

    Public URL - use your actual server IP or hostname

    Replace 192.168.1.100 with your server's IP address

    PUBLIC_URL=https://192.168.1.100:8443

    CORS origins - list all URLs that will access PentAGI

    Include localhost for local access AND your server IP for external access

    CORS_ORIGINS=https://localhost:8443,https://192.168.1.100:8443

    root@kitploit:~
    > [!WICHTIG]
    > - Ersetzen Sie `192.168.1.100` durch die tatsächliche IP-Adresse Ihres Servers
    > - Verwenden Sie NICHT `0.0.0.0` in `PUBLIC_URL` oder `CORS_ORIGINS` – verwenden Sie die tatsächliche IP-Adresse
    > - Schließen Sie sowohl localhost als auch Ihre Server-IP in `CORS_ORIGINS` ein, um Flexibilität zu gewährleisten
    
    2. **Container neu erstellen**, um die Änderungen zu übernehmen:```bash
    docker compose down
    docker compose up -d --force-recreate
    
    1. Portbindung überprüfen:```bash docker ps | grep pentagi
    root@kitploit:~
    Sie sollten `0.0.0.0:8443->8443/tcp` oder `:::8443->8443/tcp` sehen.
    
    Wenn Sie `127.0.0.1:8443->8443/tcp` sehen, wurde die Umgebungsvariable nicht übernommen. Bearbeiten Sie in diesem Fall direkt `docker-compose.yml` Zeile 31:```yaml
    ports:
      - "0.0.0.0:8443:8443"
    

    Dann erstelle die Container erneut.

    1. Konfiguriere die Firewall, um eingehende Verbindungen auf Port 8443 zuzulassen:```bash

    Ubuntu/Debian with UFW

    sudo ufw allow 8443/tcp sudo ufw reload

    CentOS/RHEL with firewalld

    sudo firewall-cmd --permanent --add-port=8443/tcp sudo firewall-cmd --reload

    root@kitploit:~
    5. **Zugriff auf PentAGI:**
    
    - **Lokaler Zugriff:** `https://localhost:8443`
    - **Netzwerkzugriff:** `https://your-server-ip:8443`
    
    > [!NOTE]
    > Sie müssen die Warnung zum selbstsignierten SSL-Zertifikat in Ihrem Browser akzeptieren, wenn Sie über die IP-Adresse zugreifen.
    
    ---
    
    ### PentAGI mit Podman ausführen
    
    PentAGI unterstützt Podman vollständig als Docker-Alternative. Allerdings erfordert der Scraper-Dienst bei Verwendung des **rootless-Modus von Podman** eine spezielle Konfiguration, da rootless-Container keine privilegierten Ports (Ports unter 1024) binden können.
    
    #### Rootless-Konfiguration für Podman
    
    Die Standardkonfiguration des Scrapers verwendet Port 443 (HTTPS), einen privilegierten Port. Konfigurieren Sie den Scraper für Podman rootless so um, dass er einen nicht-privilegierten Port verwendet:
    
    **1. Bearbeiten Sie `docker-compose.yml`** - modifizieren Sie den `scraper`-Dienst (etwa in Zeile 199):```yaml
    scraper:
      image: vxcontrol/scraper:latest
      restart: unless-stopped
      container_name: scraper
      hostname: scraper
      expose:
        - 3000/tcp  # Changed from 443 to 3000
      ports:
        - "${SCRAPER_LISTEN_IP:-127.0.0.1}:${SCRAPER_LISTEN_PORT:-9443}:3000"  # Map to port 3000
      environment:
        - MAX_CONCURRENT_SESSIONS=${LOCAL_SCRAPER_MAX_CONCURRENT_SESSIONS:-10}
        - USERNAME=${LOCAL_SCRAPER_USERNAME:-someuser}
        - PASSWORD=${LOCAL_SCRAPER_PASSWORD:-somepass}
      logging:
        options:
          max-size: 50m
          max-file: "7"
      volumes:
        - scraper-ssl:/usr/src/app/ssl
      networks:
        - pentagi-network
      shm_size: 2g
    

    2. .env-Datei aktualisieren – Ändern Sie die Scraper-URL zur Verwendung von HTTP und Port 3000:```bash

    Scraper configuration for Podman rootless

    SCRAPER_PRIVATE_URL=http://someuser:somepass@scraper:3000/ LOCAL_SCRAPER_USERNAME=someuser LOCAL_SCRAPER_PASSWORD=somepass

    root@kitploit:~
    > [!IMPORTANT]
    > Wichtige Änderungen für Podman:
    > - Verwende **HTTP** anstelle von HTTPS für `SCRAPER_PRIVATE_URL`
    > - Verwende Port **3000** anstelle von 443
    > - Ändere internes `expose` auf `3000/tcp`
    > - Aktualisiere Port-Zuordnung, um auf `3000` statt `443` zu verweisen
    
    **3. Container neu erstellen:**```bash
    podman-compose down
    podman-compose up -d --force-recreate
    

    4. Scraper-Konnektivität testen:```bash

    Test from within the pentagi container

    podman exec -it pentagi wget -O- "http://someuser:somepass@scraper:3000/html?url=http://example.com"

    root@kitploit:~
    Wenn Sie HTML-Ausgabe sehen, funktioniert der Scraper korrekt.
    
    #### Podman Rootful Mode
    
    Wenn Sie Podman im Rootful-Modus (mit sudo) ausführen, können Sie die Standardkonfiguration ohne Änderungen verwenden. Der Scraper funktioniert wie vorgesehen auf Port 443.
    
    #### Docker Compatibility
    
    Alle Podman-Konfigurationen bleiben vollständig kompatibel mit Docker. Der nicht-privilegierte Port-Ansatz funktioniert auf beiden Container-Laufzeiten identisch.
    
    ### Assistentenkonfiguration
    
    Mit PentAGI können Sie das Standardverhalten für Assistenten konfigurieren:
    
    | Variable | Standard | Beschreibung |
    | ---------------------- | ------- | ----------------------------------------------------------------------- |
    | `ASSISTANT_USE_AGENTS` | `false` | Steuert den Standardwert für die Agentennutzung beim Erstellen neuer Assistenten |
    
    Die Einstellung `ASSISTANT_USE_AGENTS` beeinflusst den Anfangszustand des Umschalters "Use Agents" beim Erstellen eines neuen Assistenten in der Benutzeroberfläche:
    - `false` (Standard): Neue Assistenten werden standardmäßig ohne Agenten-Delegation erstellt
    - `true`: Neue Assistenten werden standardmäßig mit aktivierter Agenten-Delegation erstellt
    
    Beachten Sie, dass Benutzer diese Einstellung jederzeit überschreiben können, indem sie den Schalter "Use Agents" in der Benutzeroberfläche beim Erstellen oder Bearbeiten eines Assistenten umlegen. Diese Umgebungsvariable steuert nur den anfänglichen Standardzustand.
    
    ## So verwenden Sie PentAGI nach der Anmeldung
    
    Sobald der Stack läuft und Sie sich in der Web-UI anmelden können, ist der schnellste Weg über den Flows-Workflow.
    
    ### 1. Erstellen Sie Ihren ersten Flow
    
    1. Öffnen Sie **Flows** in der Seitenleiste.
    2. Klicken Sie auf **Neuer Flow**.
    3. Wählen Sie den Modus, der zu Ihrem Ziel passt:
       - **Automation**: vollständig autonome Ausführung für ein Testziel, das PentAGI von Anfang bis Ende durchführen soll
       - **Assistant**: interaktive Unterstützung, wenn Sie die Untersuchung Schritt für Schritt steuern möchten. In diesem Modus können Sie auch den Schalter **Use Agents** aktivieren, damit PentAGI Unteraufgaben an spezialisierte Unter-Agenten für komplexere Untersuchungen delegieren kann.
    4. Wählen Sie den LLM-Anbieter aus, den Sie für diesen Flow verwenden möchten.
    5. Beschreiben Sie das Ziel und die Aufgabenstellung in natürlicher Sprache im Nachrichtenfeld.
    
    Gute erste Anweisungen umfassen in der Regel:
    
    - das Zielsystem oder die URL
    - die Art der gewünschten Bewertung
    - etwaige Bereichsbeschränkungen oder Verhaltensregeln
    - das erwartete Ergebnis, z. B. einen Schwachstellenbericht oder die Bestätigung einer Hypothese
    
    Beispiel:```text
    Assess https://target.example for common web application vulnerabilities. Focus on authentication, file handling, and injection issues. Stay within the provided target only and summarize confirmed findings with reproduction steps.
    

    Only test systems you own or are explicitly authorized to assess. See EULA.md for the acceptable use requirements.

    2. Verwenden Sie Vorlagen für wiederholbare Arbeitsabläufe

    Das neue Flow-Formular enthält eine Vorlagenauswahl, die das Nachrichtenfeld mit einer gespeicherten Flow-Vorlage vorausfüllen kann. Dies ist nützlich, wenn Sie ähnliche Bewertungen wiederholt durchführen.

    • Verwenden Sie eine vorhandene Vorlage, wenn Sie bereits eine in Vorlagen gespeichert haben
    • Beginnen Sie mit dem Beispiel-Prompt in examples/prompts/base_web_pentest.md, wenn Sie eine praktische Grundlage für Webtests benötigen
    • Passen Sie Ziel, Umfang und Einschränkungen an, bevor Sie den Flow starten

    Vorlagen sind Ausgangspunkte. Sie benötigen keine spezielle Syntax, um PentAGI zu verwenden: einfache Anweisungen in natürlicher Sprache funktionieren gut, solange Ziel und Zweck klar sind.

    3. Überwachen Sie die Ausführung und überprüfen Sie die Ausgabe

    Nach dem Absenden des Flows öffnet PentAGI automatisch die Flow-Seite.

    • Verwenden Sie die Haupt-Flow-Ansicht, um Nachrichten, Agentenaktivität und Aufgabenfortschritt zu verfolgen
    • Überprüfen Sie die Tool-Aktivität und die Terminalausgabe, während der Flow läuft
    • Überprüfen Sie generierte Aufgaben und Unteraufgaben, um zu verstehen, was PentAGI tut

    Sobald der Flow genügend Ergebnisse hat, verwenden Sie das Bericht-Menü auf der Flow-Seite, um:

    • den Bericht in einer Webansicht zu öffnen
    • den generierten Bericht in die Zwischenablage zu kopieren
    • den Bericht als Markdown herunterzuladen
    • den Bericht als PDF herunterzuladen

    4. Verwenden Sie die Assistant-Ansicht, um einen aktiven Flow zu steuern

    Jeder Flow enthält auch eine Assistant-Ansicht für interaktive Anleitung. Dies ist nützlich, wenn der autonome Lauf etwas aufdeckt, das menschliche Anleitung anstelle eines harten Neustarts erfordert.

    • Öffnen Sie die Assistant-Ansicht für denselben Flow, wenn Sie den aktuellen Zustand überprüfen möchten, bevor Sie etwas ändern.
    • Verwenden Sie den Assistant, um den Flow-Status zu überprüfen, die aktuelle Aufgabe zu stoppen, Folgeanweisungen zu übermitteln oder die verbleibenden geplanten Unteraufgaben zu patchen, bevor der nächste Schritt ausgeführt wird.
    • Behandeln Sie dies als expliziten Kontrollpfad für den aktuellen Flow, nicht als unsichtbare Hintergrundwarteschlange. Wenn Sie die Richtung ändern möchten, sagen Sie dies klar und halten Sie die neue Anweisung an den aktuellen Engagement-Umfang gebunden.
    • Dies funktioniert am besten zur Klärung des Umfangs, zur Neusetzung von Prioritäten nach Zwischenergebnissen oder zur Beantwortung eines Automatisierungs-Checkpoints, ohne den restlichen Flow-Kontext zu verlieren.

    5. Verwalten Sie Flow-bezogene Dateien

    Jeder Flow hat seinen eigenen Dateien-Tab auf der Flow-Seite. Dateien sind auf den übergeordneten Flow beschränkt: Sie befinden sich in {dataDir}/flow-{id}-data/ auf dem Host und gelangen nie in andere Flows.

    Der Tab zeigt drei Dateiquellen an:

    • Uploads (uploads/): Dateien, die Sie über die Weboberfläche bereitstellen. Verwenden Sie die Aktion Dateien hochladen oder ziehen Sie Dateien direkt auf den Dateien-Tab. Während der Agentencontainer läuft, werden hochgeladene Dateien auch in diesen unter /work/uploads/ übertragen, sodass der Agent sie mit normalen Shell-Tools lesen kann.
    • Ressourcen (resources/): Dateien, die aus Ihrer gespeicherten Benutzerressourcenbibliothek über Ressourcen aus Bibliothek anhängen angehängt werden. Angehängte Ressourcen werden in den Flow kopiert und in den laufenden Container unter /work/resources/ übertragen.
    • Container (container/): Snapshots, die über Datei oder Verzeichnis aus Container abrufen aus dem laufenden Agentencontainer gezogen werden. Diese sind auf der Flow-Seite schreibgeschützt und werden nie zurück an den Container gesendet.

    Pro-Datei-Aktionen im Dateien-Tab umfassen Herunterladen, Pfad kopieren, Als Ressource speichern (Befördern einer Flow-Datei in Ihre wiederverwendbare Ressourcenbibliothek) und Löschen. Die Abruf-Aktion ist deaktiviert, wenn der Container nicht läuft, mit dem Tooltip "Container läuft nicht".

    Hochgeladene Dateien und angehängte Ressourcen werden automatisch in den System-Prompts des Agenten über die Vorlagenvariable {{.UserFiles}} aufgelistet, die einen kompakten <task_files>-XML-Block (mit verschachtelten <uploads>- und <resources>-Abschnitten) rendert, sodass der Assistant und Automatisierungsagenten sie über den Pfad referenzieren können, ohne dass Sie den Inhalt in den Chat einfügen müssen. Container-Snapshots sind nur in der UI sichtbar und werden nicht automatisch zurück in den Prompt injiziert.

    Aktuelle Grenzen und Einschränkungen, die zu beachten sind:

    • Die maximale Upload-Dateigröße beträgt 300 MB; pro Upload-Anfrage bis zu 1000 Dateien und insgesamt 2 GB. Dateinamen sind auf 255 Bytes begrenzt (etwa 255 ASCII-Zeichen; Nicht-ASCII-Namen verwenden mehrere Bytes pro Zeichen).
    • Uploads und Ressourcen werden in den laufenden Container unter den festen Pfaden /work/uploads/ und /work/resources/ gespiegelt; Dateien, die in andere Containerpfade geschrieben werden, werden nicht automatisch zurück in das Flow-Dateimodell gespiegelt. Container-Snapshots können von jedem Containerpfad stammen, den Sie abrufen (z.B. /etc/...), und werden auf der Flow-Seite unter container/ zwischengespeichert; sie werden nicht zurück in den Container übertragen.
    • Container-Snapshots sind Momentaufnahmen. Das Bearbeiten eines Snapshots in der UI schreibt nicht zurück in den laufenden Container.
    • Das Löschen eines Flows entfernt derzeit den Flow-Eintrag und seine Langzeitgedächtniseinträge, archiviert oder entfernt jedoch noch nicht das Verzeichnis flow-{id}-data/ auf der Festplatte. Betreiber werden weiterhin gebeten, das Datenverzeichnis manuell zu bereinigen, wenn sie den Speicherplatz zurückgewinnen möchten.

    Für frühe Tests beginnen Sie mit einem engen Ziel und einem einzigen klaren Zweck. Dies erleichtert die Überprüfung der Ausgabe und hilft Ihnen, Ihre Prompts zu verfeinern, bevor Sie größere Bewertungen durchführen.

    API-Zugriff

    PentAGI bietet umfassenden programmatischen Zugriff sowohl über REST- als auch GraphQL-APIs, sodass Sie Penetrationstest-Workflows in Ihre Automatisierungspipelines, CI/CD-Prozesse und benutzerdefinierten Anwendungen integrieren können.

    Generieren von API-Tokens

    API-Tokens werden über die PentAGI-Weboberfläche verwaltet:

    1. Navigieren Sie in der Weboberfläche zu Einstellungen → API-Tokens
    2. Klicken Sie auf Token erstellen, um ein neues API-Token zu generieren
    3. Konfigurieren Sie die Token-Eigenschaften:
      • Name (optional): Ein beschreibender Name für das Token
      • Ablaufdatum: Wann das Token abläuft (mindestens 1 Minute, maximal 3 Jahre)
    4. Klicken Sie auf Erstellen und kopieren Sie das Token sofort - es wird aus Sicherheitsgründen nur einmal angezeigt
    5. Verwenden Sie das Token als Bearer-Token in Ihren API-Anfragen

    Jedes Token ist Ihrem Benutzerkonto zugeordnet und erbt die Berechtigungen Ihrer Rolle.

    Verwenden von API-Tokens

    Fügen Sie das API-Token in den Authorization-Header Ihrer HTTP-Anfragen ein:```bash

    GraphQL API example

    curl -X POST https://your-pentagi-instance:8443/api/v1/graphql
    -H "Authorization: Bearer YOUR_API_TOKEN"
    -H "Content-Type: application/json"
    -d '{"query": "{ flows { id title status } }"}'

    REST API example

    curl https://your-pentagi-instance:8443/api/v1/flows
    -H "Authorization: Bearer YOUR_API_TOKEN"

    root@kitploit:~
    ### API-Erkundung und -Testen
    
    PentAGI bietet interaktive Dokumentation zur Erkundung und zum Testen von API-Endpunkten:
    
    #### GraphQL Playground
    
    Greifen Sie auf das GraphQL Playground unter `https://your-pentagi-instance:8443/api/v1/graphql/playground` zu
    
    1. Klicken Sie auf die Registerkarte **HTTP Headers** unten
    2. Fügen Sie Ihren Autorisierungs-Header hinzu:   ```json
       {
         "Authorization": "Bearer YOUR_API_TOKEN"
       }
    
    1. Erkunden Sie das Schema, führen Sie Abfragen aus und testen Sie Mutationen interaktiv

    Swagger UI

    Zugriff auf die REST-API-Dokumentation unter https://your-pentagi-instance:8443/api/v1/swagger/index.html

    1. Klicken Sie auf die Schaltfläche Authorize
    2. Geben Sie Ihr Token im Format ein: Bearer YOUR_API_TOKEN
    3. Klicken Sie auf Authorize, um zu bestätigen
    4. Testen Sie Endpunkte direkt über die Swagger-Benutzeroberfläche

    Generieren von API-Clients

    Sie können typsichere API-Clients für Ihre bevorzugte Programmiersprache mit den in PentAGI enthaltenen Schemadateien generieren:

    GraphQL Clients

    Das GraphQL-Schema ist verfügbar unter:

    • Web-Benutzeroberfläche: Navigieren Sie zu den Einstellungen, um schema.graphqls herunterzuladen
    • Direkte Datei: backend/pkg/graph/schema.graphqls im Repository

    Generieren Sie Clients mit Tools wie:

    • GraphQL Code Generator (JavaScript/TypeScript): https://the-guild.dev/graphql/codegen
    • genqlient (Go): https://github.com/Khan/genqlient
    • Apollo iOS (Swift): https://www.apollographql.com/docs/ios

    REST API Clients

    Die OpenAPI-Spezifikation ist verfügbar unter:

    • Swagger JSON: https://your-pentagi-instance:8443/api/v1/swagger/doc.json
    • Swagger YAML: Verfügbar in backend/pkg/server/docs/swagger.yaml

    Generieren Sie Clients mit:

    • OpenAPI Generator: https://openapi-generator.tech ```bash openapi-generator-cli generate
      -i https://your-pentagi-instance:8443/api/v1/swagger/doc.json
      -g python
      -o ./pentagi-client
      root@kitploit:~
    • Swagger Codegen: https://github.com/swagger-api/swagger-codegen ```bash swagger-codegen generate
      -i https://your-pentagi-instance:8443/api/v1/swagger/doc.json
      -l typescript-axios
      -o ./pentagi-client
      root@kitploit:~
    • swagger-typescript-api (TypeScript): https://github.com/acacode/swagger-typescript-api ```bash npx swagger-typescript-api
      -p https://your-pentagi-instance:8443/api/v1/swagger/doc.json
      -o ./src/api
      -n pentagi-api.ts
      root@kitploit:~

    API-Nutzungsbeispiele

    Erstellen eines neuen Flows (GraphQL)```graphql mutation CreateFlow { createFlow( modelProvider: "openai" input: "Test the security of https://example.com" ) { id title status createdAt } } ```
    Flows auflisten (REST API)```bash curl https://your-pentagi-instance:8443/api/v1/flows \ -H "Authorization: Bearer YOUR_API_TOKEN" \ | jq '.flows[] | {id, title, status}' ```
    Python Client Beispiel```python import requests

    class PentAGIClient: def init(self, base_url, api_token): self.base_url = base_url self.headers = { "Authorization": f"Bearer {api_token}", "Content-Type": "application/json" }

    root@kitploit:~
    def create_flow(self, provider, target):
        query = """
        mutation CreateFlow($provider: String!, $input: String!) {
          createFlow(modelProvider: $provider, input: $input) {
            id
            title
            status
          }
        }
        """
        response = requests.post(
            f"{self.base_url}/api/v1/graphql",
            json={
                "query": query,
                "variables": {
                    "provider": provider,
                    "input": target
                }
            },
            headers=self.headers
        )
        return response.json()
    
    def get_flows(self):
        response = requests.get(
            f"{self.base_url}/api/v1/flows",
            headers=self.headers
        )
        return response.json()
    

    Usage

    client = PentAGIClient( "https://your-pentagi-instance:8443", "your_api_token_here" )

    Create a new flow

    flow = client.create_flow("openai", "Scan https://example.com for vulnerabilities") print(f"Created flow: {flow}")

    List all flows

    flows = client.get_flows() print(f"Total flows: {len(flows['flows'])}")

    root@kitploit:~
    </details>
    
    <details>
    <summary><b>TypeScript-Client-Beispiel</b></summary>```typescript
    import axios, { AxiosInstance } from 'axios';
    
    interface Flow {
      id: string;
      title: string;
      status: string;
      createdAt: string;
    }
    
    class PentAGIClient {
      private client: AxiosInstance;
    
      constructor(baseURL: string, apiToken: string) {
        this.client = axios.create({
          baseURL: `${baseURL}/api/v1`,
          headers: {
            'Authorization': `Bearer ${apiToken}`,
            'Content-Type': 'application/json',
          },
        });
      }
    
      async createFlow(provider: string, input: string): Promise<Flow> {
        const query = `
          mutation CreateFlow($provider: String!, $input: String!) {
            createFlow(modelProvider: $provider, input: $input) {
              id
              title
              status
              createdAt
            }
          }
        `;
    
        const response = await this.client.post('/graphql', {
          query,
          variables: { provider, input },
        });
    
        return response.data.data.createFlow;
      }
    
      async getFlows(): Promise<Flow[]> {
        const response = await this.client.get('/flows');
        return response.data.flows;
      }
    
      async getFlow(flowId: string): Promise<Flow> {
        const response = await this.client.get(`/flows/${flowId}`);
        return response.data;
      }
    }
    
    // Usage
    const client = new PentAGIClient(
      'https://your-pentagi-instance:8443',
      'your_api_token_here'
    );
    
    // Create a new flow
    const flow = await client.createFlow(
      'openai',
      'Perform penetration test on https://example.com'
    );
    console.log('Created flow:', flow);
    
    // List all flows
    const flows = await client.getFlows();
    console.log(`Total flows: ${flows.length}`);
    

    Sicherheitsempfehlungen

    Bei der Arbeit mit API-Tokens:

    • Committen Sie Tokens niemals in die Versionskontrolle – verwenden Sie Umgebungsvariablen oder Secrets-Management
    • Rotieren Sie Tokens regelmäßig – legen Sie angemessene Ablaufdaten fest und erstellen Sie regelmäßig neue Tokens
    • Verwenden Sie separate Tokens für verschiedene Anwendungen – erleichtert das Widerrufen des Zugriffs bei Bedarf
    • Überwachen Sie die Token-Nutzung – überprüfen Sie die API-Token-Aktivität auf der Einstellungsseite
    • Widerrufen Sie ungenutzte Tokens – deaktivieren oder löschen Sie Tokens, die nicht mehr benötigt werden
    • Verwenden Sie ausschließlich HTTPS – senden Sie API-Tokens niemals über unverschlüsselte Verbindungen

    Token-Verwaltung

    • Tokens anzeigen: Alle Ihre aktiven Tokens unter Einstellungen → API-Tokens anzeigen
    • Tokens bearbeiten: Token-Namen aktualisieren oder Tokens widerrufen
    • Tokens löschen: Tokens dauerhaft entfernen (diese Aktion kann nicht rückgängig gemacht werden)
    • Token-ID: Jeder Token hat eine eindeutige ID, die zur Referenz kopiert werden kann

    Die Token-Liste zeigt:

    • Token-Name (falls angegeben)
    • Token-ID (eindeutige Kennung)
    • Status (aktiv/widerrufen/abgelaufen)
    • Erstellungsdatum
    • Ablaufdatum

    Konfiguration benutzerdefinierter LLM-Anbieter

    Bei Verwendung benutzerdefinierter LLM-Anbieter mit den LLM_SERVER_*-Variablen können Sie das Reasoning-Format, das in Anfragen verwendet wird, optimieren.

    [!TIP] Für produktionsreife lokale Bereitstellungen sollten Sie die Verwendung von vLLM mit Qwen3.5-27B-FP8 für optimale Leistung in Betracht ziehen. Siehe unseren umfassenden Bereitstellungsleitfaden, der Hardwareanforderungen, Konfigurationsvorlagen (Thinking-Modus und Nicht-Thinking-Modus) sowie Leistungsbenchmarks mit 13K TPS Prompt-Verarbeitung auf 4× RTX 5090 GPUs enthält.

    VariableStandardBeschreibung
    LLM_SERVER_URLBasis-URL für den benutzerdefinierten LLM-API-Endpunkt
    LLM_SERVER_KEYAPI-Schlüssel für den benutzerdefinierten LLM-Anbieter
    LLM_SERVER_MODELStandardmodell (kann in der Anbieterkonfiguration überschrieben werden)
    LLM_SERVER_CONFIG_PATHPfad zur YAML-Konfigurationsdatei für agentenspezifische Modelle
    LLM_SERVER_PROVIDERAnbieternamenspräfix für Modellnamen (z. B. openrouter, deepseek für LiteLLM-Proxy)
    LLM_SERVER_LEGACY_REASONINGfalseSteuert das Reasoning-Format in API-Anfragen
    LLM_SERVER_PRESERVE_REASONINGfalseReasoning-Inhalt in mehrteiligen Konversationen beibehalten (von einigen Anbietern erforderlich)

    Die Einstellung LLM_SERVER_PROVIDER ist besonders nützlich bei Verwendung des LiteLLM-Proxys, der ein Anbieternamenspräfix zu Modellnamen hinzufügt. Wenn Sie z. B. über LiteLLM eine Verbindung zur Moonshot-API herstellen, werden Modelle wie kimi-2.5 zu moonshot/kimi-2.5. Indem Sie LLM_SERVER_PROVIDER=moonshot setzen, können Sie dieselbe Anbieterkonfigurationsdatei sowohl für den direkten API-Zugriff als auch für den LiteLLM-Proxy-Zugriff ohne Änderungen verwenden.

    Die Einstellung LLM_SERVER_LEGACY_REASONING beeinflusst, wie Reasoning-Parameter an das LLM gesendet werden:

    • false (Standard): Verwendet modernes Format, bei dem Reasoning als strukturiertes Objekt mit dem Parameter max_tokens gesendet wird
    • true: Verwendet Legacy-Format mit dem zeichenkettenbasierten Parameter reasoning_effort

    Diese Einstellung ist wichtig, wenn Sie mit verschiedenen LLM-Anbietern arbeiten, da diese möglicherweise unterschiedliche Reasoning-Formate in ihren API-Anfragen erwarten. Wenn bei benutzerdefinierten Anbietern Reasoning-bezogene Fehler auftreten, versuchen Sie, diese Einstellung zu ändern.

    Die Einstellung LLM_SERVER_PRESERVE_REASONING steuert, ob Reasoning-Inhalte in mehrteiligen Konversationen beibehalten werden:

    • false (Standard): Reasoning-Inhalte werden nicht im Konversationsverlauf beibehalten
    • true: Reasoning-Inhalte werden beibehalten und in nachfolgenden API-Aufrufen gesendet

    Diese Einstellung ist von einigen LLM-Anbietern (z. B. Moonshot) erforderlich, die Fehler wie "thinking is enabled but reasoning_content is missing in assistant tool call message" zurückgeben, wenn Reasoning-Inhalte nicht in mehrteiligen Konversationen enthalten sind. Aktivieren Sie diese Einstellung, wenn Ihr Anbieter die Beibehaltung von Reasoning-Inhalten verlangt.

    Ollama-Anbieterkonfiguration

    PentAGI unterstützt Ollama sowohl für die lokale LLM-Inferenz (null Kosten, verbesserte Privatsphäre) als auch für Ollama Cloud (verwalteter Dienst mit kostenloser Stufe).

    Konfigurationsvariablen

    VariableStandardBeschreibung
    OLLAMA_SERVER_URLURL Ihres Ollama-Servers oder von Ollama Cloud
    OLLAMA_SERVER_API_KEYAPI-Schlüssel für die Ollama-Cloud-Authentifizierung
    OLLAMA_SERVER_MODELStandardmodell für die Inferenz
    OLLAMA_SERVER_CONFIG_PATHPfad zur benutzerdefinierten Agentenkonfigurationsdatei
    OLLAMA_SERVER_PULL_MODELS_TIMEOUT600Timeout für Modell-Downloads (Sekunden)
    OLLAMA_SERVER_PULL_MODELS_ENABLEDfalseModelle beim Start automatisch herunterladen
    OLLAMA_SERVER_LOAD_MODELS_ENABLEDfalseServer nach verfügbaren Modellen abfragen

    Ollama-Cloud-Konfiguration

    Ollama Cloud bietet verwaltete Inferenz mit einer großzügigen kostenlosen Stufe und skalierbaren kostenpflichtigen Plänen.

    Einrichtung der kostenlosen Stufe (Einzelmodell)```bash

    Free tier allows one model at a time

    OLLAMA_SERVER_URL=https://ollama.com OLLAMA_SERVER_API_KEY=your_ollama_cloud_api_key OLLAMA_SERVER_MODEL=gpt-oss:120b # Example: OpenAI OSS 120B model

    root@kitploit:~
    **Paid Tier Setup (Multi-Model mit vorgefertigter Konfiguration)**
    
    Verwenden Sie für kostenpflichtige Tarife, die mehrere gleichzeitige Modelle unterstützen, die vorgefertigte Ollama Cloud-Konfiguration:```bash
    # Using pre-built Ollama Cloud configuration (included in Docker image)
    OLLAMA_SERVER_URL=https://ollama.com
    OLLAMA_SERVER_API_KEY=your_ollama_cloud_api_key
    OLLAMA_SERVER_CONFIG_PATH=/opt/pentagi/conf/ollama-cloud.provider.yml
    

    Die vorgefertigte Konfiguration ollama-cloud.provider.yml enthält optimierte Modellzuweisungen für alle Agententypen:

    • Simple/Assistant: nemotron-3-super:cloud - Schnelles Allzweckmodell
    • Primary Agent: qwen3-coder-next:cloud - Fortschrittliches Denken mit hohem Aufwandsmodus
    • Coder/Pentester: qwen3-coder-next:cloud - Spezialisierte Codierungsmodelle
    • Searcher: qwen3.5:397b-cloud - Großer Kontext für Informationssammlung
    • Refiner/Refactor: glm-5:cloud - Hochwertige Textverfeinerung
    • Adviser/Enricher: minimax-m2.7:cloud - Effiziente Beratungsaufgaben
    • Installer: devstral-2:123b-cloud - Installations- und Einrichtungsaufgaben

    Benutzerdefinierte Konfiguration (Fortgeschritten)

    Um eine eigene Agentenkonfiguration zu erstellen, binden Sie eine benutzerdefinierte Datei von Ihrem Host-Dateisystem ein:```bash

    Using custom provider configuration

    OLLAMA_SERVER_URL=https://ollama.com OLLAMA_SERVER_API_KEY=your_ollama_cloud_api_key OLLAMA_SERVER_CONFIG_PATH=/opt/pentagi/conf/ollama.provider.yml

    Mount custom configuration from host filesystem (in .env or docker-compose override)

    PENTAGI_OLLAMA_SERVER_CONFIG_PATH=/path/on/host/my-ollama-config.yml

    root@kitploit:~
    Die Umgebungsvariable `PENTAGI_OLLAMA_SERVER_CONFIG_PATH` ordnet Ihre Host-Konfigurationsdatei dem Pfad `/opt/pentagi/conf/ollama.provider.yml` im Container zu.
    
    **Beispiel für benutzerdefinierte Konfiguration** (`my-ollama-config.yml`):```yaml
    primary_agent:
      model: "qwen3-coder-next:cloud"
      temperature: 1.0
      top_p: 0.9
      max_tokens: 32768
      reasoning:
        effort: high
    
    coder:
      model: "qwen3-coder:32b"
      temperature: 1.0
      max_tokens: 20480
    

    Lokale Ollama-Konfiguration

    Für selbst gehostete Ollama-Instanzen:```bash

    Basic local Ollama setup

    OLLAMA_SERVER_URL=http://localhost:11434 OLLAMA_SERVER_MODEL=llama3.1:8b-instruct-q8_0

    Production setup with auto-pull and model discovery

    OLLAMA_SERVER_URL=http://ollama-server:11434 OLLAMA_SERVER_PULL_MODELS_ENABLED=true OLLAMA_SERVER_PULL_MODELS_TIMEOUT=900 OLLAMA_SERVER_LOAD_MODELS_ENABLED=true

    Using pre-built configurations from Docker image

    OLLAMA_SERVER_CONFIG_PATH=/opt/pentagi/conf/ollama-llama318b.provider.yml

    or

    OLLAMA_SERVER_CONFIG_PATH=/opt/pentagi/conf/ollama-qwen332b-fp16-tc.provider.yml

    or

    OLLAMA_SERVER_CONFIG_PATH=/opt/pentagi/conf/ollama-qwq32b-fp16-tc.provider.yml

    root@kitploit:~
    **Überlegungen zur Leistung:**
    
    - **Modell-Erkennung** (`OLLAMA_SERVER_LOAD_MODELS_ENABLED=true`): Fügt 1-2s Startlatenz durch Abfrage der Ollama-API hinzu
    - **Automatischer Pull** (`OLLAMA_SERVER_PULL_MODELS_ENABLED=true`): Erster Start kann mehrere Minuten dauern, um Modelle herunterzuladen
    - **Pull-Timeout** (`OLLAMA_SERVER_PULL_MODELS_TIMEOUT=900`): 15 Minuten in Sekunden
    - **Statische Konfiguration**: Deaktivieren Sie beide Flags und geben Sie Modelle in der Konfigurationsdatei an, um den schnellsten Start zu erreichen
    
    #### Erstellen benutzerdefinierter Ollama-Modelle mit erweitertem Kontext
    
    PentAGI benötigt Modelle mit größeren Kontextfenstern als die Standard-Ollama-Konfigurationen. Sie müssen benutzerdefinierte Modelle mit erhöhtem `num_ctx`-Parameter über Modelfiles erstellen. Während typische Agenten-Workflows etwa 64K Tokens verbrauchen, verwendet PentAGI eine Kontextgröße von 110K für eine Sicherheitsmarge und zur Bewältigung komplexer Penetrationstest-Szenarien.
    
    **Wichtig**: Der `num_ctx`-Parameter kann nur während der Modellerstellung über die Modelfile gesetzt werden – er kann nach der Erstellung nicht mehr geändert oder zur Laufzeit überschrieben werden.
    
    ##### Beispiel: Qwen3 32B FP16 mit erweitertem Kontext
    
    Erstellen Sie eine Modelfile mit dem Namen `Modelfile_qwen3_32b_fp16_tc`:```dockerfile
    FROM qwen3:32b-fp16
    PARAMETER num_ctx 110000
    PARAMETER temperature 0.3
    PARAMETER top_p 0.8
    PARAMETER min_p 0.0
    PARAMETER top_k 20
    PARAMETER repeat_penalty 1.1
    

    Erstelle das benutzerdefinierte Modell:```bash ollama create qwen3:32b-fp16-tc -f Modelfile_qwen3_32b_fp16_tc

    root@kitploit:~
    ##### Beispiel: QwQ 32B FP16 mit erweitertem Kontext
    
    Erstellen Sie eine Modelfile mit dem Namen `Modelfile_qwq_32b_fp16_tc`:```dockerfile
    FROM qwq:32b-fp16
    PARAMETER num_ctx 110000
    PARAMETER temperature 0.2
    PARAMETER top_p 0.7
    PARAMETER min_p 0.0
    PARAMETER top_k 40
    PARAMETER repeat_penalty 1.2
    

    Erstellen Sie das benutzerdefinierte Modell:```bash ollama create qwq:32b-fp16-tc -f Modelfile_qwq_32b_fp16_tc

    root@kitploit:~
    > **Hinweis**: Das QwQ 32B FP16-Modell benötigt für die Inferenz etwa **71,3 GB VRAM**. Stellen Sie sicher, dass Ihr System über ausreichend GPU-Speicher verfügt, bevor Sie versuchen, dieses Modell zu verwenden.
    
    Diese benutzerdefinierten Modelle werden in den vorgefertigten Anbieterkonfigurationsdateien (`ollama-qwen332b-fp16-tc.provider.yml` und `ollama-qwq32b-fp16-tc.provider.yml`) referenziert, die im Docker-Image unter `/opt/pentagi/conf/` enthalten sind.
    
    ### OpenAI-Anbieterkonfiguration
    
    PentAGI integriert sich in die umfassende Modellpalette von OpenAI, die erweiterte Reasoning-Fähigkeiten mit erweiterter Gedankenkette, agentische Modelle mit verbesserter Tool-Integration und spezialisierte Codemodelle für Sicherheitstechnik bietet.
    
    #### Konfigurationsvariablen
    
    | Variable             | Standard                    | Beschreibung                     |
    | -------------------- | --------------------------- | -------------------------------- |
    | `OPEN_AI_KEY`        |                             | API-Schlüssel für OpenAI-Dienste |
    | `OPEN_AI_SERVER_URL` | `https://api.openai.com/v1` | OpenAI-API-Endpunkt              |
    
    #### Konfigurationsbeispiele```bash
    # Basic OpenAI setup
    OPEN_AI_KEY=your_openai_api_key
    OPEN_AI_SERVER_URL=https://api.openai.com/v1
    
    # Using with proxy for enhanced security
    OPEN_AI_KEY=your_openai_api_key
    PROXY_URL=http://your-proxy:8080
    

    Unterstützte Modelle

    PentAGI unterstützt 31 OpenAI-Modelle mit Tool-Aufruf, Streaming, Reasoning-Modi und Prompt-Caching. Mit * markierte Modelle werden in der Standardkonfiguration verwendet.

    GPT-5.2 Serie - Neuestes Flaggschiff Agentic (Dezember 2025)

    Modell-IDDenkenPreis (Input/Output/Cache)Anwendungsfall
    gpt-5.2*✅$1.75/$14.00/$0.18Neuestes Flaggschiff mit verbessertem Reasoning und Tool-Integration, autonome Sicherheitsforschung
    gpt-5.2-pro✅$21.00/$168.00/$0.00Premium-Version mit überlegenem agentischem Coding, sicherheitskritischer Forschung, Zero-Day-Entdeckung
    gpt-5.2-codex✅$1.75/$14.00/$0.18Fortschrittlichste code-spezialisierte, Kontextkomprimierung, starke Cybersicherheitsfähigkeiten

    GPT-5/5.1 Serie - Fortschrittliche Agentic-Modelle

    Modell-IDDenkenPreis (Input/Output/Cache)Anwendungsfall
    gpt-5✅$1.25/$10.00/$0.13Premier Agentic mit fortgeschrittenem Reasoning, autonome Sicherheitsforschung, Exploit-Kettenentwicklung
    gpt-5.1✅$1.25/$10.00/$0.13Verbessertes Agentic mit adaptivem Reasoning, ausgewogener Penetrationstest mit starker Tool-Koordination
    gpt-5-pro✅$15.00/$120.00/$0.00Premium-Version mit großen Reasoning-Verbesserungen, reduzierten Halluzinationen, kritischen Sicherheitsoperationen
    gpt-5-mini✅$0.25/$2.00/$0.03Effizient, Geschwindigkeit und Intelligenz ausgleichend, automatisierte Schwachstellenanalyse, Exploit-Generierung
    gpt-5-nano✅$0.05/$0.40/$0.01Schnellste für Hochdurchsatz-Scans, Aufklärung, Massen-Schwachstellenerkennung

    GPT-5/5.1 Codex Serie - Code-spezialisiert

    Modell-IDDenkenPreis (Input/Output/Cache)Anwendungsfall
    gpt-5.1-codex-max✅$1.25/$10.00/$0.13Verbessertes Reasoning für anspruchsvolles Coding, nachgewiesene CVE-Ergebnisse, systematische Exploit-Entwicklung
    gpt-5.1-codex✅$1.25/$10.00/$0.13Standard code-optimiert mit starkem Reasoning, Exploit-Generierung, Schwachstellenanalyse
    gpt-5-codex✅$1.25/$10.00/$0.13Grundlegendes code-spezialisiert, Schwachstellenscanning, grundlegende Exploit-Generierung
    gpt-5.1-codex-mini✅$0.25/$2.00/$0.03Kompakt mit hoher Leistung, 4x höhere Kapazität, schnelle Schwachstellenerkennung
    codex-mini-latest✅$1.50/$6.00/$0.38Neuestes kompaktes Code-Modell, automatisierte Code-Überprüfung, grundlegende Schwachstellenanalyse

    GPT-4.1 Serie - Erweiterte Intelligenz

    Modell-IDDenkenPreis (Input/Output/Cache)Anwendungsfall
    gpt-4.1❌$2.00/$8.00/$0.50Verbessertes Flaggschiff mit überlegenem Funktionsaufruf, komplexer Bedrohungsanalyse, anspruchsvoller Exploit-Entwicklung
    gpt-4.1-mini*❌$0.40/$1.60/$0.10Ausgewogene Leistung mit verbesserter Effizienz, routinemäßige Sicherheitsbewertungen, automatisierte Code-Analyse
    gpt-4.1-nano❌$0.10/$0.40/$0.03Ultra-schnell und leichtgewichtig, Massen-Sicherheitsscans, schnelle Aufklärung, kontinuierliche Überwachung

    GPT-4o Serie - Multimodales Flaggschiff

    Modell-IDDenkenPreis (Input/Output/Cache)Anwendungsfall
    gpt-4o❌$2.50/$10.00/$1.25Multimodales Flaggschiff mit Vision, Bildanalyse, Web-UI-Bewertung, Multi-Tool-Orchestrierung
    gpt-4o-mini❌$0.15/$0.60/$0.08Kompakt multimodal mit starkem Funktionsaufruf, hochfrequentem Scannen, kosteneffizienten Massenoperationen

    o-Serie - Fortschrittliche Reasoning-Modelle

    Modell-IDDenkenPreis (Input/Output/Cache)Anwendungsfall
    o4-mini*✅$1.10/$4.40/$0.28Nächste Generation Reasoning mit verbesserter Geschwindigkeit, methodische Sicherheitsbewertungen, systematische Exploit-Entwicklung
    o3*✅$2.00/$8.00/$0.50Fortschrittliches Reasoning-Kraftpaket, mehrstufige Angriffsketten, tiefgehende Schwachstellenanalyse
    o3-mini✅$1.10/$4.40/$0.55Kompaktes Reasoning mit erweitertem Denken, schrittweise Angriffsplanung, logische Schwachstellenverknüpfung
    o1✅$15.00/$60.00/$7.50Premier Reasoning mit maximaler Tiefe, fortgeschrittenes Penetrationstesten, neuartige Exploit-Forschung
    o3-pro✅$20.00/$80.00/$0.00Fortschrittlichstes Reasoning, 80% günstiger als o1-pro, Zero-Day-Forschung, kritische Sicherheitsuntersuchungen
    o1-pro✅$150.00/$600.00/$0.00Premium-Reasoning der vorherigen Generation, erschöpfende Sicherheitsanalyse, missionskritische Herausforderungen

    Preise: Pro 1M Tokens. Reasoning-Modelle enthalten Denk-Token in der Ausgabepreisgestaltung.

    [!WARNING] GPT-5 Modelle - Vertrauenswürdiger Zugriff erforderlich*

    Alle GPT-5-Serienmodelle (gpt-5, gpt-5.1, gpt-5.2, gpt-5-pro, gpt-5.2-pro und alle Codex-Varianten) arbeiten instabil mit PentAGI und können ohne verifizierten Zugriff OpenAIs Cybersicherheitsmechanismen auslösen.

    Um GPT-5 Modelle zuverlässig zu nutzen:*

    1. Einzelne Benutzer: Verifizieren Sie Ihre Identität unter chatgpt.com/cyber
    2. Unternehmensteams: Fordern Sie vertrauenswürdigen Zugriff über Ihren OpenAI-Vertreter an
    3. Sicherheitsforscher: Bewerben Sie sich für das Cybersecurity-Grant-Program (beinhaltet $10 Mio. in API-Guthaben)

    Empfohlene Alternativen ohne Verifizierung:

    • Verwenden Sie o-series-Modelle (o3, o4-mini, o1) für Reasoning-Aufgaben
    • Verwenden Sie die gpt-4.1-Serie für allgemeine Intelligenz und Funktionsaufruf
    • Alle o-series- und gpt-4.x-Modelle funktionieren zuverlässig ohne speziellen Zugriff

    Reasoning-Aufwandsstufen:

    • Hoch: Maximale Reasoning-Tiefe (refiner - o3 mit hohem Aufwand)
    • Mittel: Ausgewogenes Reasoning (primary_agent, assistant, reflector - o4-mini/o3 mit mittlerem Aufwand)
    • Niedrig: Effizientes gezieltes Reasoning (coder, installer, pentester - o3/o4-mini mit niedrigem Aufwand; adviser - gpt-5.2 mit niedrigem Aufwand)

    Hauptmerkmale:

    • Erweitertes Reasoning: o-series-Modelle mit chain-of-thought für komplexe Sicherheitsanalyse
    • Agentic Intelligence: GPT-5/5.1/5.2-Serie mit verbesserter Tool-Integration und autonomen Fähigkeiten
    • Prompt-Caching: Kostenreduzierung bei wiederholtem Kontext (10-50% des Eingabepreises)
    • Code-Spezialisierung: Dedizierte Codex-Modelle für Schwachstellenentdeckung und Exploit-Entwicklung
    • Multimodale Unterstützung: GPT-4o-Serie für vision-basierte Sicherheitsbewertungen
    • Tool-Aufruf: Robuster Funktionsaufruf über alle Modelle für Pentesting-Tool-Orchestrierung
    • Streaming: Echtzeit-Response-Streaming für interaktive Workflows
    • Bewährte Erfolgsbilanz: Branchenführende Modelle mit CVE-Entdeckungen und realen Sicherheitsanwendungen

    Anthropic-Anbieterkonfiguration

    PentAGI integriert sich in Anthropics Claude-Modelle, die fortschrittliche erweiterte Denkfähigkeiten, außergewöhnliche Sicherheitsmechanismen und ein anspruchsvolles Verständnis komplexer Sicherheitskontexte mit Prompt-Caching bieten.

    Konfigurationsvariablen

    VariableStandardBeschreibung
    ANTHROPIC_API_KEYAPI-Schlüssel für Anthropic-Dienste
    ANTHROPIC_SERVER_URLhttps://api.anthropic.com/v1Anthropic-API-Endpunkt

    Konfigurationsbeispiele```bash

    Basic Anthropic setup

    ANTHROPIC_API_KEY=your_anthropic_api_key ANTHROPIC_SERVER_URL=https://api.anthropic.com/v1

    Using with proxy for secure environments

    ANTHROPIC_API_KEY=your_anthropic_api_key PROXY_URL=http://your-proxy:8080

    root@kitploit:~
    > [!NOTE]
    > **Google Vertex KI für Claude-Modelle**
    >
    > PentAGI stellt derzeit keinen dedizierten Google Vertex AI-Konfigurationspfad für Anthropic Claude in `.env` bereit. Es gibt derzeit kein separates Vertex AI-API-Schlüsselfeld, und die vorhandenen Anthropic-Variablen (`ANTHROPIC_API_KEY`, `ANTHROPIC_SERVER_URL`) zielen auf die direkte Anthropic-API. Unterstützte Routen für Claude sind:
    >
    > - **Direkte Anthropic-API**: `ANTHROPIC_API_KEY` und `ANTHROPIC_SERVER_URL` (siehe oben).
    > - **AWS Bedrock**: `BEDROCK_*`-Variablen (siehe [AWS Bedrock Provider-Konfiguration](#aws-bedrock-provider-configuration)).
    >
    > Wenn Sie Vertex AI heute verwenden müssen, ist die sicherste unterstützte Problemumgehung, Vertex AI über einen OpenAI-kompatiblen Proxy oder Gateway bereitzustellen, der Vertex AI-Aufrufe in das Chat Completions-Format übersetzt, während das Chat- und Tool-Call-Verhalten, auf das PentAGI angewiesen ist, erhalten bleibt. Richten Sie dann den Custom LLM-Anbieter auf dieses Gateway über `LLM_SERVER_URL`, `LLM_SERVER_KEY` und `LLM_SERVER_MODEL` aus. Dieser Weg ist nur so zuverlässig wie das von Ihnen gewählte Gateway.
    
    #### Unterstützte Modelle
    
    PentAGI unterstützt 10 Claude-Modelle mit Tool Calling, Streaming, Extended Thinking, Adaptive Thinking und Prompt Caching. Modelle, die mit `*` markiert sind, werden in der Standardkonfiguration verwendet.
    
    **Claude 4 Serie - Neueste Modelle (2025-2026)**
    
    | Modell-ID                 | Denken | Veröffentlichungsdatum | Preis (Eingabe/Ausgabe/Cache R/W) | Anwendungsfall                                        |
    | ------------------------- | ------ | ---------------------- | --------------------------------- | ---------------------------------------------------- |
    | `claude-opus-4-6`*        | ✅      | Mai 2025               | $5.00/$25.00/$0.50/$6.25          | Das intelligenteste Modell für autonome Agenten und Codierung. Extended + Adaptive Thinking für komplexe Exploit-Entwicklung, mehrstufige Angriffssimulation |
    | `claude-sonnet-4-6`*      | ✅      | Aug 2025               | $3.00/$15.00/$0.30/$3.75          | Beste Balance zwischen Geschwindigkeit und Intelligenz mit Adaptive Thinking. Mehrphasige Sicherheitsbewertungen, intelligente Schwachstellenanalyse, Echtzeit-Bedrohungsjagd |
    | `claude-haiku-4-5`*       | ✅      | Okt 2025               | $1.00/$5.00/$0.10/$1.25           | Schnellstes Modell mit nahezu Grenzintelligenz. Hochfrequenz-Scanning, Echtzeit-Überwachung, automatisierte Massentests |
    
    **Legacy-Modelle - Weiterhin unterstützt**
    
    | Modell-ID                 | Denken | Veröffentlichungsdatum | Preis (Eingabe/Ausgabe/Cache R/W) | Anwendungsfall                                        |
    | ------------------------- | ------ | ---------------------- | --------------------------------- | ---------------------------------------------------- |
    | `claude-sonnet-4-5`       | ✅      | Sep 2025               | $3.00/$15.00/$0.30/$3.75          | Hochmodernes Reasoning (durch 4-6 abgelöst). Anspruchsvolle Penetrationstests, erweiterte Bedrohungsanalyse |
    | `claude-opus-4-5`         | ✅      | Nov 2025               | $5.00/$25.00/$0.50/$6.25          | Ultimatives Reasoning (durch opus-4-6 abgelöst). Kritische Sicherheitsforschung, Zero-Day-Entdeckung, Red-Team-Operationen |
    | `claude-opus-4-1`         | ✅      | Aug 2025               | $15.00/$75.00/$1.50/$18.75        | Erweitertes Reasoning (abgelöst). Komplexe Penetrationstests, anspruchsvolle Bedrohungsmodellierung |
    | `claude-sonnet-4-0`       | ✅      | Mai 2025               | $3.00/$15.00/$0.30/$3.75          | Hochleistungs-Reasoning (abgelöst). Komplexe Bedrohungsmodellierung, Multi-Tool-Koordination |
    | `claude-opus-4-0`         | ✅      | Mai 2025               | $15.00/$75.00/$1.50/$18.75        | Erste Generation Opus (abgelöst). Mehrstufige Exploit-Entwicklung, autonome Pentesting-Workflows |
    
    **Veraltete Modelle - Migration zu aktuellen Modellen**
    
    | Modell-ID                      | Denken | Veröffentlichungsdatum | Preis (Eingabe/Ausgabe/Cache R/W) | Hinweise                                     |
    | ------------------------------ | ------ | ---------------------- | --------------------------------- | -------------------------------------------- |
    | `claude-3-haiku-20240307`      | ❌      | Mär 2024               | $0.25/$1.25/$0.03/$0.30          | Wird am 19. April 2026 eingestellt. Migrieren Sie zu claude-haiku-4-5 |
    
    **Preise**: Pro 1M Tokens. Cache-Preise beinhalten sowohl Lese- als auch Schreibkosten.
    
    **Konfiguration für Extended Thinking**:
    - **Max Tokens 4096**: Generator (claude-opus-4-6) für maximale Reasoning-Tiefe bei komplexer Exploit-Entwicklung
    - **Max Tokens 2048**: Coder (claude-sonnet-4-6) für ausgewogene Code-Analyse und Schwachstellenforschung
    - **Max Tokens 1024**: Primäragent, Assistent, Verfeinerer, Berater, Reflektor, Sucher, Installer, Pentester für fokussiertes Reasoning bei spezifischen Aufgaben
    - **Extended Thinking**: Alle Claude 4.5+- und 4.6-Modelle unterstützen konfigurierbares Extended Thinking für tiefgehende Reasoning-Aufgaben
    
    **Hauptfunktionen**:
    - **Extended Thinking**: Alle Claude 4.5+- und 4.6-Modelle mit konfigurierbaren Chain-of-Thought-Reasoning-Tiefen für komplexe Sicherheitsanalysen
    - **Adaptive Thinking**: Die Claude 4.6-Serie (Opus/Sonnet) passt die Reasoning-Tiefe dynamisch an die Aufgabenkomplexität an, um optimale Leistung zu erzielen
    - **Prompt Caching**: Deutliche Kostenreduzierung mit separater Lese-/Schreib-Preisgestaltung (10 % Lesen, 125 % Schreiben des Inputs)
    - **Erweitertes Kontextfenster**: 200K Tokens Standard, bis zu 1M Tokens (Beta) für Claude Opus/Sonnet 4.6 für umfassende Codebasis-Analyse
    - **Tool Calling**: Robustes Function Calling mit außergewöhnlicher Genauigkeit für die Orchestrierung von Sicherheitstools
    - **Streaming**: Echtzeit-Response-Streaming für interaktive Penetrationstest-Workflows
    - **Safety-First-Design**: Integrierte Sicherheitsmechanismen, die verantwortungsvolle Sicherheitstestpraktiken gewährleisten
    - **Multimodale Unterstützung**: Vision-Funktionen in den neuesten Modellen für Screenshot-Analyse und UI-Sicherheitsbewertung
    - **Constitutional AI**: Fortschrittliches Safety-Training, das zuverlässige und ethische Sicherheitsberatung bietet
    
    ### Google AI (Gemini) Provider-Konfiguration
    
    PentAGI integriert sich über die Google AI API in Googles Gemini-Modelle und bietet hochmoderne multimodale Reasoning-Fähigkeiten mit Extended Thinking und Context Caching.
    
    #### Konfigurationsvariablen
    
    | Variable            | Standardwert                                | Beschreibung                   |
    | ------------------- | ------------------------------------------- | ------------------------------ |
    | `GEMINI_API_KEY`    |                                             | API-Schlüssel für Google AI-Dienste |
    | `GEMINI_SERVER_URL` | `https://generativelanguage.googleapis.com` | Google AI API-Endpunkt         |
    
    #### Konfigurationsbeispiele```bash
    # Basic Gemini setup
    GEMINI_API_KEY=your_gemini_api_key
    GEMINI_SERVER_URL=https://generativelanguage.googleapis.com
    
    # Using with proxy
    GEMINI_API_KEY=your_gemini_api_key
    PROXY_URL=http://your-proxy:8080
    

    Unterstützte Modelle

    PentAGI unterstützt 9 Gemini-Modelle mit Tool-Aufruf, Streaming, Denkmodi und Kontext-Caching. Mit * markierte Modelle werden in der Standardkonfiguration verwendet.

    Gemini 3.5 Serie – Neuestes stabiles Flash (Mai 2026)

    Modell-IDDenkenKontextPreis (Eingabe/Ausgabe/Cache)Anwendungsfall
    gemini-3.5-flash*✅1M$1.50/$9.00/$0.15Intelligentestes Flash-Modell mit nachhaltiger Spitzenleistung bei agentischen und Programmieraufgaben, überlegene Suche und Grounding

    Gemini 3.1 Serie – Stabiles Flash-Lite + Pro Vorschau (Feb.–Mai 2026)

    Modell-IDDenkenKontextPreis (Eingabe/Ausgabe/Cache)Anwendungsfall
    gemini-3.1-pro-preview*✅1M$2.00/$12.00/$0.20Neuestes Flaggschiff mit verbessertem Denken, verbesserter Token-Effizienz, optimiert für Softwareentwicklung und agentische Arbeitsabläufe
    gemini-3.1-pro-preview-customtools✅1M$2.00/$12.00/$0.20Custom-Tools-Endpunkt optimiert für Bash und Priorisierung von benutzerdefinierten Tools (view_file, search_code)
    gemini-3.1-flash-lite*✅1M$0.25/$1.50/$0.025Kostengünstigstes stabiles multimodales Modell, erstklassige Leistung für hochvolumige agentische Aufgaben und latenzarme Anwendungen

    Gemini 2.5 Serie – Erweiterte Denkmodelle (aktiv bis 16. Oktober 2026)

    Modell-IDDenkenKontextPreis (Eingabe/Ausgabe/Cache)Anwendungsfall
    gemini-2.5-pro✅1M$1.25/$10.00/$0.125Modernste Technik für komplexes Programmieren und Denken, anspruchsvolle Bedrohungsmodellierung
    gemini-2.5-flash✅1M$0.30/$2.50/$0.03Erstes hybrides Denkmodell mit Denkbudgets, bestes Preis-Leistungs-Verhältnis für groß angelegte Bewertungen
    gemini-2.5-flash-lite✅1M$0.10/$0.40/$0.01Kleinstes und kostengünstigstes Modell für die Nutzung im großen Maßstab, Hochdurchsatz-Scans

    Gemma 4 Open-Source-Modelle (Apache 2.0, Kostenlose Stufe)

    Modell-IDDenkenKontextPreis (Eingabe/Ausgabe/Cache)Anwendungsfall
    gemma-4-31b-it✅256KKostenlos/Kostenlos/KostenlosGrößtes Open-Source-Gemma-4-Dense-Modell (~31B Parameter), multimodal Text+Bild, 140+ Sprachen, lokale Sicherheitsoperationen
    gemma-4-26b-a4b-it✅256KKostenlos/Kostenlos/KostenlosMoE-Architektur (~26B gesamt / ~3.8B aktive Parameter), hoch effiziente Inferenz auf Consumer-GPUs für lokale Hochdurchsatz-Scans

    Preise: Pro 1M Token (Standard-Bezahlstufe). Kontextfenster ist das Eingabe-Token-Limit.

    [!NOTE] Abschaltung der Gemini 2.5 Serie

    gemini-2.5-pro, gemini-2.5-flash und gemini-2.5-flash-lite werden am 16. Oktober 2026 abgeschaltet. Empfohlene Migrationen:

    • gemini-2.5-pro → gemini-3.1-pro-preview (gleiche $2.00 Eingabe-Preisstufe)
    • gemini-2.5-flash → gemini-3.5-flash (verbesserte Spitzenfähigkeiten)
    • gemini-2.5-flash-lite → gemini-3.1-flash-lite (gleiche $0.25 Eingabe-Preisstufe)

    Standard-Modellzuweisungen (config.yml):

    • gemini-3.1-pro-preview - primary_agent, assistant, generator, refiner, adviser, coder, pentester
    • gemini-3.5-flash - reflector, searcher, enricher, installer
    • gemini-3.1-flash-lite - simple, simple_json

    Hauptmerkmale:

    • Erweitertes Denken: Schrittweise Schlussfolgerungen für komplexe Sicherheitsanalysen (alle Gemini 3.x, 2.5 Serie und Gemma 4 mit umschaltbarem Denken)
    • Kontext-Caching: Deutliche Kostenreduzierung bei wiederholtem Kontext (10% des Eingabepreises für die meisten Modelle)
    • Ultra-langer Kontext: 1M Token für Gemini-Chat-Modelle, 256K Token für Gemma 4 Open-Source-Modelle
    • Multimodale Unterstützung: Text-, Bild-, Video-, Audio- und PDF-Verarbeitung für umfassende Bewertungen
    • Tool-Aufruf: Nahtlose Integration mit 20+ Pentest-Tools über Funktionsaufrufe
    • Streaming: Echtzeit-Response-Streaming für interaktive Sicherheits-Workflows
    • Code-Ausführung: Integrierte Code-Ausführung für offensive Tool-Tests und Exploit-Validierung
    • Such-Grounding: Google-Suche-Integration für Bedrohungsinformationen und CVE-Recherche
    • Dateisuche: Dokumentenabruf und RAG-Fähigkeiten für wissensbasierte Bewertungen
    • Batch-API: 50% Kostenreduzierung für nicht-echtzeit-Batch-Verarbeitung
    • Custom-Tools-Endpunkt: Dedizierte gemini-3.1-pro-preview-customtools-Route für tool-lastige agentische Arbeitsabläufe, die registrierte Tools gegenüber Bash bevorzugen

    Denk-Anstrengungsstufen:

    • Hoch: Maximale Denktiefe für komplexe mehrstufige Analysen (generator)
    • Mittel: Ausgewogenes Denken für allgemeine agentische Aufgaben (primary_agent, assistant, refiner, adviser)
    • Niedrig: Effizientes Denken für fokussierte Aufgaben (coder, installer, pentester)

    AWS-Bedrock-Provider-Konfiguration

    PentAGI integriert sich in Amazon Bedrock und bietet Zugriff auf 20+ Foundation-Modelle von führenden KI-Unternehmen, darunter Anthropic, Amazon, Cohere, DeepSeek, OpenAI, Qwen, Mistral und Moonshot.

    Konfigurationsvariablen

    VariableStandardBeschreibung
    BEDROCK_REGIONus-east-1AWS-Region für den Bedrock-Dienst
    BEDROCK_DEFAULT_AUTHfalseAWS-SDK-Standardanmeldeinformationskette verwenden (Umgebung, EC2-Rolle, ~/.aws/credentials) – höchste Priorität
    BEDROCK_BEARER_TOKENBearer-Token-Authentifizierung – Priorität gegenüber statischen Anmeldeinformationen
    BEDROCK_ACCESS_KEY_IDAWS-Zugriffsschlüssel-ID für statische Anmeldeinformationen
    BEDROCK_SECRET_ACCESS_KEYAWS-Geheimer Zugriffsschlüssel für statische Anmeldeinformationen
    BEDROCK_SESSION_TOKENAWS-Sitzungstoken für temporäre Anmeldeinformationen (optional, wird mit statischen Anmeldeinformationen verwendet)
    BEDROCK_SERVER_URLBenutzerdefinierter Bedrock-Endpunkt (VPC-Endpunkte, lokale Tests)

    Authentifizierungspriorität: BEDROCK_DEFAULT_AUTH → BEDROCK_BEARER_TOKEN → BEDROCK_ACCESS_KEY_ID+BEDROCK_SECRET_ACCESS_KEY

    Konfigurationsbeispiele```bash

    Recommended: Default AWS SDK authentication (EC2/ECS/Lambda roles)

    BEDROCK_REGION=us-east-1 BEDROCK_DEFAULT_AUTH=true

    Bearer token authentication (AWS STS, custom auth)

    BEDROCK_REGION=us-east-1 BEDROCK_BEARER_TOKEN=your_bearer_token

    Static credentials (development, testing)

    BEDROCK_REGION=us-east-1 BEDROCK_ACCESS_KEY_ID=your_aws_access_key BEDROCK_SECRET_ACCESS_KEY=your_aws_secret_key

    With proxy and custom endpoint

    BEDROCK_REGION=us-east-1 BEDROCK_DEFAULT_AUTH=true BEDROCK_SERVER_URL=https://bedrock-runtime.us-east-1.vpce-xxx.amazonaws.com PROXY_URL=http://your-proxy:8080

    root@kitploit:~
    #### Unterstützte Modelle
    
    PentAGI unterstützt 21 AWS-Bedrock-Modelle mit Tool-Calling, Streaming und multimodalen Fähigkeiten. Mit `*` markierte Modelle werden in der Standardkonfiguration verwendet.
    
    | Modell-ID                                        | Anbieter        | Denken | Multimodal | Preis (Eingabe/Ausgabe) | Anwendungsfall                           |
    | ------------------------------------------------ | --------------- | ------ | ---------- | ----------------------- | ---------------------------------------- |
    | `us.amazon.nova-2-lite-v1:0`                     | Amazon Nova     | ❌     | ✅         | $0,33/$2,75             | Adaptives Denken, effizientes Schlussfolgern |
    | `us.amazon.nova-premier-v1:0`                    | Amazon Nova     | ❌     | ✅         | $2,50/$12,50            | Komplexes Schlussfolgern, fortgeschrittene Analyse |
    | `us.amazon.nova-pro-v1:0`                        | Amazon Nova     | ❌     | ✅         | $0,80/$3,20             | Ausgewogene Genauigkeit, Geschwindigkeit, Kosten |
    | `us.amazon.nova-lite-v1:0`                       | Amazon Nova     | ❌     | ✅         | $0,06/$0,24             | Schnelle Verarbeitung, Vorgänge mit hohem Volumen |
    | `us.amazon.nova-micro-v1:0`                      | Amazon Nova     | ❌     | ❌         | $0,035/$0,14            | Ultra-niedrige Latenz, Echtzeit-Überwachung |
    | `us.anthropic.claude-opus-4-6-v1`*               | Anthropic       | ✅     | ✅         | $5,00/$25,00            | Weltklasse-Codierung, Unternehmens-Agenten |
    | `us.anthropic.claude-sonnet-4-6`                 | Anthropic       | ✅     | ✅         | $3,00/$15,00            | Grenzüberschreitende Intelligenz, Unternehmensmaßstab |
    | `us.anthropic.claude-opus-4-5-20251101-v1:0`     | Anthropic       | ✅     | ✅         | $5,00/$25,00            | Mehrtägige Softwareentwicklung             |
    | `us.anthropic.claude-haiku-4-5-20251001-v1:0`*   | Anthropic       | ✅     | ✅         | $1,00/$5,00             | Fast-Grenzleistung, hohe Geschwindigkeit   |
    | `us.anthropic.claude-sonnet-4-5-20250929-v1:0`*  | Anthropic       | ✅     | ✅         | $3,00/$15,00            | Praxisnahe Agenten, Codierung auf Spitzenniveau |
    | `us.anthropic.claude-sonnet-4-20250514-v1:0`     | Anthropic       | ✅     | ✅         | $3,00/$15,00            | Ausgewogene Leistung, produktionsbereit    |
    | `us.anthropic.claude-3-5-haiku-20241022-v1:0`    | Anthropic       | ❌     | ❌         | $0,80/$4,00             | Schnellstes Modell, kosteneffizientes Scannen |
    | `cohere.command-r-plus-v1:0`                     | Cohere          | ❌     | ❌         | $3,00/$15,00            | Großflächige Vorgänge, überlegenes RAG     |
    | `deepseek.v3.2`                                  | DeepSeek        | ❌     | ❌         | $0,58/$1,68             | Langkontext-Schlussfolgern, Effizienz      |
    | `openai.gpt-oss-120b-1:0`*                       | OpenAI (OSS)    | ✅     | ❌         | $0,15/$0,60             | Starkes Schlussfolgern, wissenschaftliche Analyse |
    | `openai.gpt-oss-20b-1:0`                         | OpenAI (OSS)    | ✅     | ❌         | $0,07/$0,30             | Effizientes Codieren, Softwareentwicklung  |
    | `qwen.qwen3-next-80b-a3b`                        | Qwen            | ❌     | ❌         | $0,15/$1,20             | Ultra-langer Kontext, Flaggschiff-Schlussfolgern |
    | `qwen.qwen3-32b-v1:0`                            | Qwen            | ❌     | ❌         | $0,15/$0,60             | Ausgewogenes Schlussfolgern, Forschungsanwendungsfälle |
    | `qwen.qwen3-coder-30b-a3b-v1:0`                  | Qwen            | ❌     | ❌         | $0,15/$0,60             | Vibe-Codierung, natürlichsprachlich zuerst |
    | `qwen.qwen3-coder-next`                          | Qwen            | ❌     | ❌         | $0,45/$1,80             | Tool-Nutzung, funktionsaufrufoptimiert     |
    | `mistral.mistral-large-3-675b-instruct`          | Mistral         | ❌     | ✅         | $4,00/$12,00            | Fortschrittliches Multimodal, langer Kontext |
    | `moonshotai.kimi-k2.5`                           | Moonshot        | ❌     | ✅         | $0,60/$3,00             | Vision, Sprache, Code in einem Modell      |
    
    **Preise**: Pro 1M Token. Modelle mit Denk-/Schlussfolgerungsunterstützung verursachen während der Denkphase zusätzliche Rechenkosten.
    
    #### Getestete, aber inkompatible Modelle
    
    Einige AWS-Bedrock-Modelle wurden getestet, werden aber aufgrund technischer Einschränkungen **nicht unterstützt**:
    
    | Modellfamilie              | Grund für Inkompatibilität                                                                            |
    | -------------------------- | ----------------------------------------------------------------------------------------------------- |
    | **GLM (Z.AI)**             | Tool-Calling-Format inkompatibel mit Converse API (erwartet String statt JSON)                        |
    | **AI21 Jamba**             | Starke Ratenbegrenzungen (1-2 Anfragen/Min) verhindern zuverlässige Tests und den Produktionseinsatz  |
    | **Meta Llama 3.3/3.1**     | Instabile Verarbeitung von Tool-Call-Ergebnissen, verursacht unerwartete Fehler in Multi-Turn-Workflows|
    | **Mistral Magistral**      | Tool Calling wird vom Modell nicht unterstellt                                                          |
    | **Moonshot K2-Thinking**   | Instabiles Streaming-Verhalten mit Tool-Aufrufen, unzuverlässig in der Produktion                       |
    | **Qwen3-VL**               | Instabiles Streaming mit Tool Calling, multimodale + Tools-Kombination schlägt zeitweise fehl            |
    
    > [!IMPORTANT]
    > **Ratenbegrenzungen und Kontingentverwaltung**
    >
    > Standardkontingente von AWS Bedrock für Claude-Modelle sind **extrem restriktiv** (2-20 Anfragen/Minute für neue Konten). Für produktiven Penetrationstests:
    >
    > 1. **Kontingenterhöhungen beantragen** über die AWS Service Quotas-Konsole für die Modelle, die Sie verwenden möchten
    > 2. **Amazon Nova-Modelle verwenden** – höhere Standardkontingente und hervorragende Leistung
    > 3. **Bereitgestellten Durchsatz aktivieren** für konsistentes Hochvolumen-Testing
    > 4. **Nutzung überwachen** – AWS drosselt aggressiv an Kontingentgrenzen
    >
    > Ohne Kontingenterhöhungen ist mit häufigen Verzögerungen und Arbeitsablaufunterbrechungen zu rechnen.
    
    > [!WARNING]
    > **Converse-API-Anforderungen**
    >
    > PentAGI verwendet die Amazon Bedrock **Converse API** für einheitlichen Modellzugriff. Alle unterstützten Modelle erfordern:
    >
    > - ✅ Converse/ConverseStream-API-Unterstützung
    > - ✅ Tool-Nutzung (Funktionsaufruf) für Penetrationstest-Workflows
    > - ✅ Streaming-Tool-Nutzung für Echtzeit-Feedback
    >
    > Modellfähigkeiten überprüfen unter: [AWS Bedrock Model Features](https://docs.aws.amazon.com/bedrock/latest/userguide/conversation-inference-supported-models-features.html)
    
    **Wichtige Funktionen**:
    - **Automatisches Prompt-Caching**: 40-70% Kostensenkung bei wiederholtem Kontext (Claude 4.x-Modelle)
    - **Erweitertes Denken**: Schritt-für-Schritt-Schlussfolgerungen für komplexe Sicherheitsanalysen (Claude, DeepSeek R1, OpenAI GPT)
    - **Multimodale Analyse**: Verarbeitung von Screenshots, Diagrammen, Videos für umfassende Tests (Nova, Claude, Mistral, Kimi)
    - **Tool Calling**: Nahtlose Integration mit 20+ Penetrationstest-Tools via Funktionsaufruf
    - **Streaming**: Echtzeit-Response-Streaming für interaktive Sicherheitsbewertungs-Workflows
    
    ### DeepSeek-Anbieterkonfiguration
    
    PentAGI integriert DeepSeek und bietet Zugang zu fortschrittlichen KI-Modellen mit starken Schlussfolgerungs- und Codierungsfähigkeiten sowie Kontext-Caching zu wettbewerbsfähigen Preisen.
    
    #### Konfigurationsvariablen
    
    | Variable              | Standardwert                  | Beschreibung                                          |
    | --------------------- | ----------------------------- | ----------------------------------------------------- |
    | `DEEPSEEK_API_KEY`    |                               | DeepSeek-API-Schlüssel für die Authentifizierung      |
    | `DEEPSEEK_SERVER_URL` | `https://api.deepseek.com`    | DeepSeek-API-Endpunkt-URL                             |
    | `DEEPSEEK_PROVIDER`   |                               | Anbieterpräfix für LiteLLM-Integration (optional)     |
    
    #### Konfigurationsbeispiele```bash
    # Direct API usage
    DEEPSEEK_API_KEY=your_deepseek_api_key
    DEEPSEEK_SERVER_URL=https://api.deepseek.com
    
    # With LiteLLM proxy
    DEEPSEEK_API_KEY=your_litellm_key
    DEEPSEEK_SERVER_URL=http://litellm-proxy:4000
    DEEPSEEK_PROVIDER=deepseek  # Adds prefix to model names (deepseek/deepseek-v4-flash) for LiteLLM
    

    Unterstützte Modelle

    PentAGI unterstützt 2 DeepSeek V4 Modelle mit Tool-Aufruf, Streaming, hybriden Thinking-/Non-Thinking-Modi und Kontext-Caching. Beide Modelle unterstützen standardmäßig den Thinking-Modus und können über extra_body in den Non-Thinking-Modus umgeschaltet werden. Mit * markierte Modelle werden in der Standardkonfiguration verwendet.

    Model IDThinkingMax OutputContextPrice (Input/Output/Cache)Use Case
    deepseek-v4-flash*✅ hybrid384K1M$0.14/$0.28/$0.0028Utility agents, general dialogue, fast tool calling
    deepseek-v4-pro*✅ hybrid384K1M$1.74/$3.48/$0.0145Advanced reasoning, complex logic, security analysis

    Preise: Pro 1 Mio. Token. Cache-Preise gelten für Prompt-Token, die aus dem Cache bedient werden (Input-Cache-Hit, seit dem 26.04.2026 auf 1/10 des Einführungspreises reduziert). Beide Modelle unterstützen hybrides Denken – der thinking-Modus ist standardmäßig aktiviert; übergeben Sie extra_body.thinking.type: disabled, um in den Non-Thinking-Modus zu wechseln, um schnellere/günstigere Antworten zu erhalten.

    Preishinweis (deepseek-v4-pro): Der 75%ige Aktionsrabatt auf deepseek-v4-pro endete offiziell am 31.05.2026 um 15:59 UTC. Die obigen Preise spiegeln die Standardpreise nach der Aktion wider. Wenn Sie alte Konfigurationen mit den rabattierten Preisen ($0,435/$0,87/$0,003625) verwenden, aktualisieren Sie diese auf die aktuellen Tarife für eine genaue Kostenverfolgung.

    Die veralteten Modellnamen deepseek-chat und deepseek-reasoner werden voraussichtlich am 24.07.2026 von DeepSeek eingestellt. Bestehende Benutzerkonfigurationen, die auf die alten Namen verweisen, funktionieren bis dahin weiter; die obigen Standardeinstellungen verwenden die aktuellen V4-Namen. deepseek-chat wird auf den deepseek-v4-flash Non-Thinking-Modus abgebildet; deepseek-reasoner auf den deepseek-v4-flash Thinking-Modus.

    Standard-Agent-Konfiguration:

    Strategie: Bevorzugen Sie deepseek-v4-flash (12x günstigerer Input, 12x günstigerer Output) als Arbeitstier für Dienstprogramm-/leichte Agenten; reservieren Sie deepseek-v4-pro für komplexe mehrstufige Überlegungen. Der installer-Agent läuft auf Flash mit aktiviertem Thinking, da Umgebungsaufgaben (Shell-Befehle, Konfigurationsänderungen) selten Pro-Level-Überlegungen erfordern. Führen Sie A/B-Tests mit Ihren eigenen Workloads durch, bevor Sie weitere Agenten auf Pro umstellen.

    Agent RoleDefault ModelThinkingReasoning EffortMax OutputTemperatureTop P
    Generator / Refinerdeepseek-v4-proEnabledHigh32768(auto)(auto)
    Coderdeepseek-v4-proEnabledHigh20480(auto)(auto)
    Primary Agent / Assistant / Pentesterdeepseek-v4-proEnabledHigh16384(auto)(auto)
    Adviser (mentor/planner)deepseek-v4-proEnabledHigh8192(auto)(auto)
    Installerdeepseek-v4-flashEnabledHigh12288(auto)(auto)
    Reflector / Searcher / Enricherdeepseek-v4-flashDisabled—40960.50.9
    Simple / Simple JSONdeepseek-v4-flashDisabled—20480.30.9

    Hinweis: Wenn der Thinking-Modus aktiviert ist, ignoriert DeepSeek stillschweigend temperature, top_p, presence_penalty und frequency_penalty. Der langchaingo-Client setzt temperature/top_p automatisch auf null, wenn reasoning_effort gesetzt ist, sodass sie in der obigen Tabelle als "(auto)" erscheinen. Alle Thinking-aktivierten Agenten übergeben außerdem explizit extra_body.thinking.type: enabled als defensive Codierung gegen zukünftige Standardänderungen des Anbieters.

    Hauptfunktionen:

    • Hybride Denkmodi: Wechseln Sie zwischen Thinking (tiefgründiges Denken) und Non-Thinking (schnell) über extra_body.thinking.type
    • Automatisches Prompt-Caching: Deutliche Kostenreduzierung bei wiederholtem Kontext durch Cache-Treffer-Preise (1/10 des Einführungspreises)
    • Erweitertes Denken: Reinforcement Learning CoT für komplexe Sicherheitsanalysen (beide V4-Modelle)
    • Starkes Coding: Optimiert für Codegenerierung und Exploit-Entwicklung
    • Langer Kontext: 1 Mio. Token-Kontextfenster mit bis zu 384K Ausgabe-Token
    • Tool-Aufruf: Nahtlose Integration mit über 20 Pentest-Tools über Funktionsaufrufe
    • Streaming: Echtzeit-Streaming von Antworten für interaktive Arbeitsabläufe
    • Multilingual: Starke Unterstützung für Chinesisch und Englisch
    • Zusätzliche Funktionen: JSON-Ausgabe, Chat-Präfix-Vervollständigung (Beta), FIM/Fill-in-the-Middle-Vervollständigung (nur im Non-Thinking-Modus)

    Parallelitätsgrenzen: deepseek-v4-flash: 2500 gleichzeitige Anfragen; deepseek-v4-pro: 500 gleichzeitige Anfragen.

    LiteLLM-Integration: Setzen Sie DEEPSEEK_PROVIDER=deepseek, um die Modellnamen-Präfixierung bei Verwendung der Standard-PentAGI-Konfigurationen mit dem LiteLLM-Proxy zu aktivieren. Lassen Sie das Feld für die direkte API-Nutzung leer.

    GLM-Anbieter-Konfiguration

    PentAGI integriert sich mit GLM von Zhipu AI (Z.AI) und bietet fortschrittliche Sprachmodelle mit MoE-Architektur, starkem Denken und agentischen Fähigkeiten, die von der Tsinghua-Universität entwickelt wurden.

    Konfigurationsvariablen

    VariableDefault ValueDescription
    GLM_API_KEYGLM API-Schlüssel zur Authentifizierung
    GLM_SERVER_URLhttps://api.z.ai/api/paas/v4GLM API-Endpunkt-URL (international)
    GLM_PROVIDERAnbieter-Präfix für LiteLLM-Integration (optional)

    Konfigurationsbeispiele```bash

    Direct API usage (international endpoint)

    GLM_API_KEY=your_glm_api_key GLM_SERVER_URL=https://api.z.ai/api/paas/v4

    Alternative endpoints

    GLM_SERVER_URL=https://open.bigmodel.cn/api/paas/v4 # China GLM_SERVER_URL=https://api.z.ai/api/coding/paas/v4 # Coding-specific

    With LiteLLM proxy

    GLM_API_KEY=your_litellm_key GLM_SERVER_URL=http://litellm-proxy:4000 GLM_PROVIDER=zai # Adds prefix to model names (zai/glm-4) for LiteLLM

    root@kitploit:~
    #### Unterstützte Modelle
    
    PentAGI unterstützt 13 GLM-Modelle mit Tool-Aufruf, Streaming, hybriden Denkmodi und Prompt-Caching. Mit `*` markierte Modelle werden in der Standardkonfiguration verwendet. Das Denken wird über `extra_body.thinking.type` ("enabled"/"disabled") gesteuert; im Gegensatz zu Kimi ist GLM in beiden Modi bezüglich der Temperatur nachsichtig.
    
    **GLM-5.x Serie - Neueste Generation (200K Kontext, 128K max Ausgabe)**
    
    | Modell-ID         | Denken | Kontext | Max Ausgabe | Preis (Input/Output/Cache) | Anwendungsfall                                                            |
    | ---------------- | -------- | ------- | ---------- | -------------------------- | ------------------------------------------------------------------- |
    | `glm-5.1`*       | ✅ Hybrid | 200K    | 128K       | $1.40/$4.40/$0.26          | Neuestes Flaggschiff: 8h anhaltende autonome Ausführung, Claude Opus 4.6-ausgerichtet (Generator/Refiner/Berater/Coder/Pentester Standard) |
    | `glm-5`          | ✅ Hybrid | 200K    | 128K       | $1.00/$3.20/$0.20          | Grundlage für agentisches Engineering, MoE 744B/40B aktiv, Claude Opus 4.5-level Codierung |
    | `glm-5-turbo`*   | ✅ Hybrid | 200K    | 128K       | $1.20/$4.00/$0.24          | OpenClaw-nativ: optimiert für Tool-Aufruf, persistente Aufgaben, langkettige Ausführung (primary_agent/assistant Standard) |
    
    **GLM-4.7 Serie - Premium mit verschränktem Denken**
    
    | Modell-ID          | Denken | Kontext | Max Ausgabe | Preis (Input/Output/Cache) | Anwendungsfall                                            |
    | ----------------- | -------- | ------- | ---------- | -------------------------- | --------------------------------------------------- |
    | `glm-4.7`         | ✅ Hybrid | 200K    | 128K       | $0.60/$2.20/$0.11          | Verbesserte Programmierung, stabiles mehrstufiges Denken   |
    | `glm-4.7-flashx`  | ✅ Hybrid | 200K    | 128K       | $0.07/$0.40/$0.01          | Ultrabillig mit priorisierter GPU, aber niedrigeren RPM-Grenzen (für hochfrequente Nutzung vermeiden) |
    | `glm-4.7-flash`   | ✅ Hybrid | 200K    | 128K       | Free/Free/Free             | Kostenloses ~30B SOTA-Modell, 1 gleichzeitige Anfrage          |
    
    **GLM-4.6 Serie - Ausgewogen mit Auto-Denken**
    
    | Modell-ID  | Denken | Kontext | Max Ausgabe | Preis (Input/Output/Cache) | Anwendungsfall                                          |
    | --------- | -------- | ------- | ---------- | -------------------------- | ------------------------------------------------- |
    | `glm-4.6` | ✅ Auto   | 200K    | 128K       | $0.60/$2.20/$0.11          | Ausgewogen, Streaming-Tool-Aufrufe, token-effizient   |
    
    **GLM-4.5 Serie - Unified Reasoning/Coding/Agents**
    
    | Modell-ID         | Denken | Kontext | Max Ausgabe | Preis (Input/Output/Cache) | Anwendungsfall                                          |
    | ---------------- | -------- | ------- | ---------- | -------------------------- | ------------------------------------------------- |
    | `glm-4.5`        | ✅ Auto   | 128K    | 96K        | $0.60/$2.20/$0.11          | Unified, MoE 355B/32B aktiv                      |
    | `glm-4.5-x`      | ✅ Auto   | 128K    | 96K        | $2.20/$8.90/$0.45          | Ultra-schnelles Premium, niedrigste Latenz                |
    | `glm-4.5-air`*   | ✅ Auto   | 128K    | 96K        | $0.20/$1.10/$0.03          | Kosteneffizientes MoE 106B/12B (simple/simple_json/reflector/searcher/enricher/installer Standard) |
    | `glm-4.5-airx`   | ✅ Auto   | 128K    | 96K        | $1.10/$4.50/$0.22          | Beschleunigtes Air mit priorisierter GPU                 |
    | `glm-4.5-flash`  | ✅ Auto   | 128K    | 96K        | Free/Free/Free             | Kostenlos mit Reasoning/Coding/Agents-Unterstützung         |
    
    **GLM-4 Legacy - Dichte Architektur**
    
    | Modell-ID              | Denken | Kontext | Max Ausgabe | Preis (Input/Output) | Anwendungsfall                                      |
    | --------------------- | -------- | ------- | ---------- | -------------------- | --------------------------------------------- |
    | `glm-4-32b-0414-128k` | ❌        | 128K    | 16K        | $0.10/$0.10          | Ultra-Budget dichte 32B, Parsen ohne Reasoning |
    
    **Preise**: Pro 1M Tokens. Cache-Preis gilt für Prompt-Cache-Treffer; Cache-Speicher ist derzeit kostenlos gemäß Z.AI-Werbung. GLM-4-32B hat keine Cache-Unterstützung.
    
    **Standard-Agent-Konfiguration**:
    
    Strategie: `glm-5.1` (neuestes Flaggschiff, $1.40 Input) für kritisches Denken, `glm-5-turbo` (OpenClaw-nativ, agentenoptimiert) für Orchestrierung, `glm-4.5-air` (günstiges MoE mit hybridem Denken und zuverlässigen RPM) für alle Dienstprogramm/Installer-Agenten. `glm-4.7-flashx` wird als Standard vermieden, da niedrigere RPM-Grenzen bei hoher Frequenz häufige 429-Fehler verursachen.
    
    | Agentenrolle                          | Standard-Modell | Denken | Temperatur | Top P | Max Ausgabe |
    | ----------------------------------- | ------------- | -------- | ----------- | ----- | ---------- |
    | Generator / Refiner                 | `glm-5.1`     | Aktiviert  | 1.0         | 0.95  | 32768      |
    | Coder                               | `glm-5.1`     | Aktiviert  | 1.0         | 0.95  | 20480      |
    | Berater / Pentester                 | `glm-5.1`     | Aktiviert  | 1.0         | 0.95  | 16384      |
    | Primärer Agent / Assistent           | `glm-5-turbo` | Aktiviert  | 1.0         | 0.95  | 16384      |
    | Installer                           | `glm-4.5-air` | Aktiviert  | 1.0         | 0.95  | 16384      |
    | Einfach / Reflector                  | `glm-4.5-air` | Deaktiviert | 0.6         | 0.9   | 8192       |
    | Sucher / Enricher / Simple JSON   | `glm-4.5-air` | Deaktiviert | 0.6         | 0.9   | 4096       |
    
    > **Hinweis zur Temperatur**: GLM akzeptiert sowohl `1.0` als auch `0.6` im Denk- oder Nicht-Denk-Modus (laut Z.AI-Dokumentation). langchaingos `IsReasoningModel` erkennt die Präfixe `glm-4.5*`/`glm-4.6*`/`glm-4.7*` und überschreibt die Temperatur in `createChatRequest` zwangsweise auf 1.0 – dies ist für GLM harmlos (im Gegensatz zu Kimi), bedeutet jedoch, dass die Temperaturwerte für diese Modelle in YAML als Richtwerte zu verstehen sind. `glm-5`/`glm-5.1`/`glm-5-turbo` werden nicht erkannt, sodass explizite Werte unverändert durchgereicht werden.
    
    **Denkmodi**:
    - **Hybrid** (GLM-5.x, GLM-4.7): Expliziter Umschalter über `extra_body.thinking.type`
    - **Auto** (GLM-4.6, GLM-4.5 Serie): Modell bestimmt automatisch, wann Reasoning erforderlich ist
    - **Bewahrtes Denken** (Z.AI Coding-Fähigkeit): alle denkfähigen Agenten in PentAGI übergeben auch `extra_body.thinking.clear_thinking: false`, sodass `reasoning_content` von vorherigen Assistant-Durchläufen über das Gespräch hinweg erhalten bleibt. Dies ist auf dem Standard-API-Endpunkt (`/api/paas/v4`) erforderlich – auf dem Coding-Plan-Endpunkt wäre es standardmäßig aktiviert. Verbessert die Reasoning-Kontinuität und Cache-Trefferraten in mehrstufigen Tool-Aufruf-Ketten.
    - Alle denkfähigen Agenten übergeben defensiv auch `extra_body.tool_choice: auto`
    
    **Hauptfunktionen**:
    - **Langzeithorizont-Aufgaben**: GLM-5.1 unterstützt 8-stündige anhaltende autonome Ausführung, ideal für komplexe mehrstufige agentische Arbeitsabläufe
    - **OpenClaw-native Orchestrierung**: GLM-5-Turbo ist speziell optimiert für Tool-Aufruf, Befehlsbefolgung und langkettige Ausführung
    - **Prompt-Caching**: Deutliche Kostenreduzierung bei wiederholtem Kontext (gezeigte Cache-Input-Preise)
    - **Ultra-langer Kontext**: 200K Tokens für GLM-5.x/4.7/4.6 Serie
    - **MoE-Architektur**: Effizient 744B/40B aktiv (GLM-5/5.1), 355B/32B (GLM-4.5), 106B/12B (GLM-4.5-Air)
    - **Tool-Aufruf**: Nahtlose Integration mit über 20 Pentesting-Tools via Function Calling
    - **Streaming**: Echtzeit-Streaming mit Unterstützung für Streaming-Tool-Aufrufe (GLM-4.6+)
    - **Mehrsprachig**: Hervorragende NLP-Fähigkeiten für Chinesisch und Englisch
    - **Kostenlose Optionen**: GLM-4.7-Flash und GLM-4.5-Flash für Prototyping und Experimente
    
    **LiteLLM-Integration**: Setzen Sie `GLM_PROVIDER=zai`, um die Modellnamen-Präfixierung bei Verwendung der Standard-PentAGI-Konfigurationen mit dem LiteLLM-Proxy zu aktivieren. Lassen Sie es für die direkte API-Nutzung leer.
    
    ### Kimi-Anbieterkonfiguration
    
    PentAGI integriert sich mit Kimi von Moonshot AI und bietet ultra-lange Kontextmodelle mit multimodalen Fähigkeiten, die sich perfekt für die Analyse umfangreicher Codebasen und Dokumentationen eignen.
    
    #### Konfigurationsvariablen
    
    | Variable           | Standardwert                  | Beschreibung                                         |
    | ------------------ | ----------------------------- | --------------------------------------------------- |
    | `KIMI_API_KEY`     |                              | Kimi-API-Schlüssel für die Authentifizierung                     |
    | `KIMI_SERVER_URL`  | `https://api.moonshot.ai/v1` | Kimi-API-Endpunkt-URL (international)               |
    | `KIMI_PROVIDER`    |                              | Anbieterpräfix für LiteLLM-Integration (optional)  |
    
    #### Konfigurationsbeispiele```bash
    # Direct API usage (international endpoint)
    KIMI_API_KEY=your_kimi_api_key
    KIMI_SERVER_URL=https://api.moonshot.ai/v1
    
    # Alternative endpoint
    KIMI_SERVER_URL=https://api.moonshot.cn/v1  # China
    
    # With LiteLLM proxy
    KIMI_API_KEY=your_litellm_key
    KIMI_SERVER_URL=http://litellm-proxy:4000
    KIMI_PROVIDER=moonshot  # Adds prefix to model names (moonshot/kimi-k2.5) for LiteLLM
    

    Unterstützte Modelle

    PentAGI unterstützt 8 Kimi/Moonshot-Modelle mit Tool-Aufruf, Streaming, hybriden Denkmodi und multimodalen Fähigkeiten (Text/Bild/Video für K2.x). Alle Legacy-Modelle kimi-k2-* (turbo-preview, 0905-preview, 0711-preview, thinking, thinking-turbo) wurden von Moonshot am 25.05.2026 eingestellt und sind NICHT enthalten. Mit * gekennzeichnete Modelle werden in der Standardkonfiguration verwendet.

    Kimi K2.x Serie – Multimodales Flaggschiff

    Modell-IDDenkenMultimodalKontextPreis (Eingabe / Ausgabe / Cache-Treffer)Anwendungsfall
    kimi-k2.6*✅ hybrid✅256K$0,95 / $4,00 / $0,16Neuestes Flaggschiff: natives Multimodal, stärkerer Code, verbesserte Befehlsbefolgung (Generator/Verfeinerer/Berater/Programmierer/Pentester-Standard)
    kimi-k2.5*✅ hybrid✅256K$0,60 / $3,00 / $0,10Vorherige Generation: 36 % günstigere Eingabe, gleiche Architektur (Primärer Agent/Assistent/Installateur/Dienstprogramm-Standard)

    Moonshot V1 Serie – Generierungsmodelle (Flexible Parameter)

    Modell-IDDenkenMultimodalKontextPreis (Eingabe / Ausgabe)Anwendungsfall
    moonshot-v1-8k❌❌8K$0,20 / $2,00Kurze Textgenerierung, extrem günstig
    moonshot-v1-32k❌❌32K$1,00 / $3,00Lange Textgenerierung
    moonshot-v1-128k❌❌128K$2,00 / $5,00Sehr langer Kontext

    Moonshot V1 Vision Serie – Bildverständnis

    Modell-IDDenkenMultimodalKontextPreis (Eingabe / Ausgabe)Anwendungsfall
    moonshot-v1-8k-vision-preview❌✅8K$0,20 / $2,00Vision + kurzer Kontext
    root@kitploit:~
    
    ---
    
    [Read more](https://github.com/vxcontrol/pentagi)