
autonome Red-Teaming-Plattform; Multi-Agenten-Offensivsicherheits-Meta-Harness
▄▄▄█████▓▓█████ ███▄ ▄███▓ ██▓███ ▓█████ ██████ ▄▄▄█████▓
▓ ██▒ ▓▒▓█ ▀ ▓██▒▀█▀ ██▒▓██░ ██▒▓█ ▀ ▒██ ▒ ▓ ██▒ ▓▒
▒ ▓██░ ▒░▒███ ▓██ ▓██░▓██░ ██▓▒▒███ ░ ▓██▄ ▒ ▓██░ ▒░
░ ▓██▓ ░ ▒▓█ ▄ ▒██ ▒██ ▒██▄█▓▒ ▒▒▓█ ▄ ▒ ██▒░ ▓██▓ ░
▒██▒ ░ ░▒████▒▒██▒ ░██▒▒██▒ ░ ░░▒████▒▒██████▒▒ ▒██▒ ░
▒ ░░ ░░ ▒░ ░░ ▒░ ░ ░▒▓▒░ ░ ░░░ ▒░ ░▒ ▒▓▒ ▒ ░ ▒ ░░
░ ░ ░ ░░ ░ ░░▒ ░ ░ ░ ░░ ░▒ ░ ░ ░
░ ░ ░ ░ ░░ ░ ░ ░ ░ ░
░ ░ ░ ░ ░ ░
Ein Multi-Agenten-Framework für offensive Sicherheit, entwickelt, um den KI-Code-Agenten, den Sie bereits ausführen, in einen Zero-Day-Jäger zu verwandeln.
Ihr KI-Code-Agent ist bereits ein Hacker – T3MP3ST stattet ihn mit einem Arsenal aus.
Richten Sie es auf ein autorisiertes Ziel aus, und die Kill-Chain läuft von selbst: Recon → Exploit → Report, aus einem Browser-War-Room oder der CLI, gesteuert von dem Agenten, bei dem Sie bereits angemeldet sind – Claude Code, Codex, Hermes – oder einem Modell, das Sie vollständig offline betreiben (Ollama, LM Studio, vLLM). Keine neuen API-Schlüssel, kein Cloud-Tenant, keine zweite Rechnung. Ihr Agent ist das Gehirn; T3MP3ST ist die Kriegsmaschine, die darum herum gebaut ist. Self-hosted Storm. Keyless Warfare. ⚡
Und es wird Sie nicht bitten, es beim Wort zu nehmen. In XBOWs eigener 104-Challenge-Suite erreicht es 90,1 % pass@1 – über XBOWs selbstberichteten 85 % – zusammen mit hinweisfreien CTF-Lösungen und einer kalten Jagd auf echte, post-cutoff CVEs, die das Modell noch nie gesehen hatte. Jede Zahl in dieser README wird mit einem Befehl (npm run verify-claims) aus festgeschriebenen Daten neu berechnet. Laut in der Mission, ehrlich im Bau – die Statustabelle sagt genau, was live ist, was Gerüst ist und was noch Fahrplan ist; vollständige Belege in Benchmarks.
Drei Dinge heben es hervor:
npm run verify-claims leitet alle ab, 24/24 grün. Eine Behauptung, die nicht reproduziert werden kann, wird nicht ausgeliefert. Niemals Vertrau-mir-Zahlen.Springe zu → Schnellstart · Was es jagt · Was heute liefert · Benchmarks · Architektur · Dokumentation
T3MP3ST ist ein offensives Sicherheitstool, entwickelt für autorisierte Tests, Forschung und Bildung. Richten Sie es nur auf Systeme, die Ihnen gehören oder für die Sie ausdrückliche, schriftliche Genehmigung zum Testen haben. Unautorisierter Zugriff auf Computer, Netzwerke oder Daten ist in den meisten Rechtsordnungen illegal – Sie allein sind verantwortlich dafür, wie Sie diese Software verwenden, und dafür, sich innerhalb der Gesetze und Ihrer Einsatzregeln zu bewegen. Bringen Sie den Sturm zu Ihren Zielen, nicht zu denen anderer.
T3MP3ST wird wie besehen unter der AGPL-3.0-Lizenz bereitgestellt, ohne Gewährleistung und ohne Haftung für Schäden, Verluste oder Missbrauch. Die Autoren befürworten, unterstützen oder dulden keine unbefugten Aktivitäten. Holen Sie eine Genehmigung ein. Bleiben Sie im Rahmen. Seien Sie keine Bedrohung. 🫡
Offensive Sicherheit steckt hinter Jahren an Übung und teuren Werkzeugen. Die Wette hinter T3MP3ST ist, dass ein koordinierter Agentenschwarm echte Bug-Jagd für Menschen erreichbar macht, die nie die Einladung bekommen haben – über Web-Apps, CTFs, Smart Contracts, Quellcode und eingebettete/Roboter-OSS. Das ist eine ehrgeizige Wette, und die folgenden Abschnitte trennen sorgfältig, was bereits funktioniert, von dem, was noch eine Wette ist.
Schnellster Weg zu einem laufenden War Room (schlüssellos, ~2 Minuten Einrichtung; Missionszeit hängt vom Ziel ab):
npm install
npm run server # War Room → http://127.0.0.1:3333/ui/
Öffnen Sie im War Room die Einstellungen und verbinden Sie einen lokalen Agenten (Claude Code / Codex / Hermes). Beschreiben Sie dann ein Ziel für Op Admiral in einfachem Englisch und starten Sie. Der von Ihnen verbundene Agent ist das Gehirn. Kein Schlüssel erforderlich.
Sie bevorzugen einen Schlüssel? Setzen Sie einen und überspringen Sie den Verbindungsschritt:
export OPENROUTER_API_KEY=... # oder VENICE_API_KEY / ANTHROPIC_API_KEY / OPENAI_API_KEY
export XAI_API_KEY=... # Grok Build (grok-build-0.1) — xAIs Codemodell, natives Tool-Calling
Langsamen lokalen Agenten kann mehr Spielraum gegeben werden mit T3MP3ST_LOCAL_AGENT_TIMEOUT_MS
für jeden CLI-Aufruf, T3MP3ST_TASK_TIMEOUT_MS für Missionsaufgaben und
T3MP3ST_GENERAL_TIMEOUT_MS für Planungsanfragen. Werte sind in Millisekunden.
Oder führen Sie es vollständig offline auf Ihrem eigenen Modell aus – kein Schlüssel, keine Cloud. Standardmäßig Ollama; richten Sie es auf einen beliebigen OpenAI-kompatiblen Server (LM Studio, vLLM, llama.cpp):
ollama serve && ollama pull llama3 # oder ein OpenAI-kompatibler Server
export TEMPEST_LOCAL_BASE_URL=http://localhost:11434/api # LM Studio: http://localhost:1234/v1
export TEMPEST_LOCAL_MODEL=llama3
npx tempest # → "Change default provider" → local
Tool-Calling funktioniert auf jedem lokalen Modell (es wird über Text gesteuert), sodass das Arsenal auch auf Modellen ohne natives Function-Calling läuft.
Überprüfen Sie die Zahlen selbst:
npm run verify-claims # leitet jede Schlagzeile aus festgeschriebenen JSON-Daten in bench/ neu ab
Library/SDK-Nutzung, die vollständige HTTP-API und MCP-Einrichtung finden Sie in docs/.
Das Framework ist eine 8-Operator-Kill-Chain, und diese Tabelle macht keinen Nebel. Recon ist eine Live-, Tool-gestützte Engine – und die Zähne sind bereits real: 90,1 % pass@1 auf XBEN, 8/10 zurückgehaltene post-cutoff CVEs auf exakte Datei/Zeile/CWE eingegrenzt und eine koordinierte Offenlegungspipeline, die live genug ist, um Entwürfe zu haben, die derzeit für die Koordination mit Anbietern zurückgehalten werden. Was nicht bewiesen ist, ist der Schwarm. Jeder nachgelagerte Operator – Exploiter, Infiltrator, Exfiltrator, Ghost – führt die gleiche echte, Tool-gestützte ReAct-Schleife wie Recon aus (echte Exploit-Tools, keine Stubs), aber die Schlagzeilenzahlen stammen von einem einzelnen Agenten, nicht der koordinierten 8-Operator-Zelle, und die End-to-End-Schwarmausnutzung ist unbenchmarkt und immer noch unzuverlässig. Die Engine ist echt; der Schwarm ist der Teil, der sich noch seine Sporen verdient. Laut, wo wir es verdient haben, unverblümt über den Rest.
Vollständige Funktion-für-Funktion-Aufschlüsselung: FEATURES.md.
Wo der Sturm heute hinkommt – und wohin er sich entwickelt. Dieselbe Disziplin wie bei allem anderen: Ein Bereich ist ✅ nur, wenn ein Beleg dahintersteckt.
Die Klassen-/Schwarm-Architektur bedeutet, dass neue Bereiche komponieren statt abspalten – jeder ist eine Ausrüstung (Spezialistenklassen + Arsenal + Zieladapter + ein Benchmark). 🚧 Bereiche werden dunkel ausgeliefert, bis sie eine Zahl haben.
Schlagzeilenergebnisse. Jedes wird mit npm run verify-claims aus den festgeschriebenen JSON-Daten neu berechnet; vollständige Methodik und Einschränkungen sind in den verlinkten Dokumenten.
So lesen Sie diese:
verify-claims berechnet das Bestehen/Nichtbestehen neu. Roh-Transkripte pro Schritt werden aus Gründen des Operator-Datenschutzes entfernt, sodass Sie das bewertete Urteil überprüfen, nicht die rohe Tool-Ausgabe. Null fabriziert, erzwungen durch eine Anti-Fitting-Absicherung, die bei jedem Push läuft.Die Zahl ist nicht der Flex – der Beleg ist es. Ein schlüsselloses Open-Source-Steuergerät, das Ihnen die Wiederholung gibt, anstatt Sie zu bitten, ihm zu vertrauen: Klonen Sie es, führen Sie npm run verify-claims aus, und jedes obige Urteil wird aus seinem festgeschriebenen Orakel vor Ihren Augen neu berechnet.
Tiefergehende Lektüre: WALL_FORENSICS (Fehler pro Challenge), CYBENCH, INTEGRITY_LEDGER (Kontaminationsaudit und jeder Widerruf), OBSIDIVM (unser eigener Live-Web-Bereich).
┌─────────────────────────────────────────────────────────────────┐
│ T3MP3ST COMMAND │
├─────────────────────────────────────────────────────────────────┤
│ MISSION CONTROL ◄── TARGET MODEL ──► ARSENAL (TOOLS) │
│ ▲ │
│ AGENT CELL: RECON · SCANNER · EXPLOITER · INFILTRATOR · │
│ EXFILTRATOR · GHOST · COORDINATOR · ANALYST │
│ ▲ │
│ EVIDENCE VAULT · CREDENTIAL STORE · FINDINGS LEDGER │
│ ▲ │
│ OPSEC LAYER · COMMS CHANNEL · LLM BACKBONE │
└─────────────────────────────────────────────────────────────────┘
Operatoren bilden MITRE ATT&CK- und Cyber-Kill-Chain-Phasen ab (Recon ist live; spätere Phasen sind eingerüstet):
Anbieter: OpenRouter, Venice, Anthropic, OpenAI oder ein schlüsselloser lokaler Agent (Claude Code / Codex / Hermes). Setzen Sie OPENROUTER_API_KEY / VENICE_API_KEY / ANTHROPIC_API_KEY, oder verbinden Sie einen Agenten in den Einstellungen.
Integrationen: node dist/mcp-server.js stellt security_recon für MCP-fähige Agenten bereit. npm run server startet die HTTP-API (POST /api/mission/start, GET /api/mission/status und mehr). Vollständige Referenz in docs/.
Red-Teaming sollte keine Priesterschaft sein. Bringen Sie einen Adapter, ein Prompt-Paket, ein Runbook, ein neues Arsenal-Tool oder einen Fehlerbericht mit.
Eine Regel, nicht verhandelbar: Alles hier ist nur für autorisierte Tests. Eigene, abgegrenzte oder zustimmende Ziele. Bauen Sie für Verteidiger, oder bauen Sie es nicht hier.
npm run verify-claims grün bleiben.Freigabeprozess und Tore: RELEASE_CHECKLIST.
AGPL-3.0. Siehe LICENSE.
Fortes fortuna iuvat – das Glück begünstigt die Tapferen.
⊰•-•✧ LOVE PLINY ✧•-•⊱ 🌩️
| Bereich | Was es tut | Status |
|---|
| 🕸️ Web-Apps | Black-Box, externer Angreifer-Recon → Exploit (XBEN-Suite) | ✅ Stabil |
| 🚩 CTF | Hinweisfreie, sandbox-isolierte Lösungen (Cybench) | ✅ Stabil |
| 🤖 Robotik / OT / Embedded | Koordinierte Offenlegungspipeline für OSS-Schwachstellenjagd (OSV + Live-PoC + Widerlegung) | ✅ Pipeline stabil |
| 📂 Quellcode | White-Box-Repo-Analyse mit blinder Master-Builder-Zerlegung | ⚠️ Nur Python-Erfassung |
| 💰 Smart Contracts | Damn Vulnerable DeFi | ⚠️ Reproduktion, keine neuartige Entdeckung |
| ☁️ Cloud (IaC) | Fehlkonfigurations-Benchmark (cloud:bench) + optionales Cloud-Arsenal (aws/az/gcloud + scoutsuite/cloudfox/pmapper; pacu gesperrt) | 🚧 IaC-Fehlkonfigurationsgerüst – Live-Cloud-Ausnutzung noch nicht benchmarked |
| 📱 Mobil | Integrierter statischer Analyzer (Manifest-Fehlkonfiguration + Secret/Klartext-Erkennung, mobile:bench) + optionales Arsenal (mobsfscan/objection/drozer; frida gesperrt) | 🚧 Statisches Erkennungsgerüst – dynamische Ausnutzung nicht benchmarked |
| 🔩 Binary / RE | Dekompilierter Output-Sink-Detektor (unsafe-copy / format-string / cmd-injection / int-overflow, binary:bench) + optionales Arsenal (ghidra/radare2/objdump/checksec/strings; gdb gesperrt) | 🚧 Statisches Sink-Erkennungsgerüst – Solving/PWN nicht benchmarked |
| Komponente | Status | Anmerkungen |
|---|
Neu ableitbare Messung (verify-claims) | ✅ Stabil | jede Schlagzeile wird aus festgeschriebenen Artefakten neu berechnet |
| Recon-Engine | ✅ Stabil | treibt nmap / DNS / HTTP / Fingerprinting; jeder Fund führt auf echte Tool-Ausgabe zurück |
| Missions-Engine + War Room + Op Admiral | ✅ Stabil | schlüssellos über einen verbundenen lokalen Agenten |
| Arsenal, MCP-Server, HTTP-API | ✅ Stabil | 35 integrierte Tools standardmäßig; 83 mit dem opt-in T3MP3ST_FULL_ARSENAL (+48 Adapter, mit den gefährlichen Post-Exploit-Treibern – metasploit, hydra – hinter einem menschlichen Genehmigungs-Gate) – beide Zählungen werden via verify-claims neu abgeleitet. security_recon über MCP |
| Egress-Bereichsbegrenzung | ✅ Stabil (standardmäßig aktiviert) | sobald ein Missionsziel gesetzt ist, verweigern integrierte Netzwerktools öffentliche Hosts außerhalb des Bereichs – nicht das Ziel/Subdomains, nicht Loopback/Privat (SCOPE DENIED) – eine verschärfte Standardeinstellung, kein bloßer Tool-Runner |
| Koordinierte Offenlegungspipeline | ✅ Stabil | OSV-Neuheit + Live-PoC + Widerlegungsfeld + CVSS; nur Entwürfe, ein Mensch sendet ab |
| White-Box-Quellcode-Analyse | ⚠️ Experimentell | Python-only Regex-Erfassung; Multi-Modell-Zerlegung kostet mehr Token, nicht weniger |
| DeFi (Damn Vulnerable DeFi) | ⚠️ Experimentell | reproduziert bekannte Exploit-Klassen; keine neuartige Entdeckung |
| Exploiter / Infiltrator / Exfiltrator / Ghost | ⚠️ Experimentell | führen die echte Tool-gestützte ReAct-Schleife aus (gleiche Engine wie Recon); als koordinierter Schwarm unbewiesen – der Einzelagent ist der benchmarked Pfad, Live-Schwarmausnutzung immer noch unzuverlässig |
| Fortgeschrittene Module (Cloud, Persistenz, Schwarm, Kognition) | 🚧 Geplant | nur Schnittstelle in src/stubs/ |
| Selbstverbesserungsschleife | 🧪 Forschung | zeichnet heute Lektionen + Vorschläge auf; diese zurück in die Planung zu speisen ist Fahrplan |
| Bereich | Was es abdeckt | Status |
|---|
| 🕸️ Web | Apps, APIs, Auth-Abläufe, OWASP Top 10 | ✅ Kern – XBEN 90,1 % pass@1 |
| 📂 Code | White-Box-Quellcode-Audits, SAST-artige Schwachstellensuche | ✅ Bewiesen (Jagdergebnis) – zurückgehaltene CVE-Zero: Einzelagent 8/10 exakte Datei/Zeile/CWE, 10/10 gefunden (7 Sprachen); die Repo-Erfassungs-Engine selbst ist noch ⚠️ experimentell |
| 🚩 CTF | Wargames, Übungsbereiche, Herausforderungen | ✅ Bewiesen – Cybench 23/40 hinweisfrei |
| 🔌 Netzwerk / Infra | Recon, Service/Stack-Fingerprinting; lateral + Privesc | ✅ Recon (Live-nmap/DNS/HTTP-Engine) · ⚠️ lateral/Privesc experimentell |
| 🤖 Embedded / IoT / OT | Firmware, Robotik, ICS/SCADA-OSS | ✅ CVE-Pipeline live – koordinierte Offenlegungsentwürfe für Anbieter zurückgehalten |
| 📦 Lieferkette | Abhängigkeitsaudits, Installation ohne Bestätigung | ⚠️ Echt – dedizierte Klasse; traf ein CWE-829 im zurückgehaltenen Satz |
| 💰 Blockchain | Smart Contracts, DeFi, Solidity | ⚠️ Nur Reproduktion – Damn Vulnerable DeFi, keine neuartige Entdeckung |
| ☁️ Cloud | AWS/GCP/Azure-Fehlkonfiguration, IAM, serverlos | 🚧 In Entwicklung |
| 📱 Mobil | Android/iOS-App-Sicherheit | 🚧 In Entwicklung |
| 🏢 Identität / AD | Kerberos, Pass-the-Hash, AD-Angriffe | 🚧 In Entwicklung |
| 🔐 Binary / RE | Überläufe, ROP, Exploit-Entwicklung | 🚧 In Entwicklung – benötigt spezialisierte Werkzeuge |
| Suite | Ergebnis | Kontext |
|---|
| XBEN – XBOWs 104-Challenge-Suite, Black-Box | pass@1 Mittelwert 90,1 % (Wilson-95 86,2–92,9), Minimum 91/104 · gpt-5.5 | XBOW berichtet selbst 85 % auf derselben Suite; unseres leitet das bewertete Urteil aus festgeschriebenen Artefakten neu ab (Roh-Transkripte aus Datenschutzgründen entfernt) |
| XBEN – White-Box (getrennt berichtet) | pass@1 98,7 %, Best-Ball 104/104 · gpt-5.5 | niemals mit der Black-Box-Zahl vermischt |
| Cybench – 40-Aufgaben akademischer Bench, Opus 4.8, keine Hinweise | 23/40 (58 %) hinweisfrei, Single-Run pass@1 (verify-claims-erzwungen) | nicht der Rohpunktrekord (Anthropic: 76,5 % pass@10); jede Flagge wird gegen das festgeschriebene Orakel bewertet |
| CVE-Zero – 10 echte post-cutoff (2026) CVEs, zurückgehalten, 7 Sprachen | Einzelagent 8/10 exakte Datei/Zeile/CWE (überprüft alle-exakt, stabil) · 10/10 gefunden (volles Paket) | Memorisierungs- & Fitting-sicher: post-cutoff, und die gehärteten Prompts wurden nie auf diesen abgestimmt; verify-claims berechnet es neu. n=10, richtungsweisend; der Vorteil des Schwarms ist hier der Recall, kein Koordination-schlägt-Solo-Beweis |
| Doc | Inhalt |
|---|
| FEATURES.md | Funktionsstatus im Detail ([x] ausgeliefert / [~] teilweise / [ ] geplant) |
| SCOPE_AND_AUTHORIZATION | Autoritätsmodell, Bereichsbelege, Evidenz- und Wiederholungsregeln |
| VERIFIED_PROVENANCE | wie Erkenntnisse Tool-bewiesen statt Modell-behauptet werden |
| TEAM_PREVIEW | Erster-Lauf-Pfad und Überprüfungsskript |
| INSTALL_MATRIX | macOS / Linux-Bereitschaftstabelle |
| ARSENAL_ACTIVATION_PLAN | optionale Einrichtung externer Tools |
| CYBENCH · WALL_FORENSICS · INTEGRITY_LEDGER · COGNITIVE_ARCHITECTURE | Benchmark-Methodik |
| RELEASE_CHECKLIST | die Tore, die eine Veröffentlichung passieren muss |
| Operator | Phase | MITRE | Funktion |
|---|
| Recon | Aufklärung | TA0043 | OSINT, Netzwerkerkennung, Asset-Enumeration |
| Scanner | Erkennung | TA0007 | Schwachstellenscanning, Service-Fingerprinting |
| Exploiter | Erster Zugriff | TA0001 | Ausnutzung, Payload-Lieferung |
| Infiltrator | Laterale Bewegung | TA0008 | Post-Exploitation, Privilegieneskalation |
| Exfiltrator | Sammlung / Exfiltration | TA0009/10 | Datenextraktion, Credential-Ernte |
| Ghost | Persistenz | TA0003 | Persistenz, Heimlichkeit, Bereinigung |
| Coordinator | Kommando & Kontrolle | TA0011 | Missionssteuerung, Orchestrierung |
| Analyst | Analyse | — | Musteranalyse, Berichterstattung |