Skip to content
KitploitKITPLOIT
ToolsExploitsBlog
Log in
Einreichen
ToolsExploitsBlog
Einreichen

Hacking-, PenTest- und Cybersicherheits-Tools für Ihr Sicherheitsarsenal!

Kitploit ist ein Verzeichnis von Hacking-, Cybersicherheits- und Pentesting-Tools. Entdecken Sie die neuesten Projekt-Updates, um Schwachstellen zu finden, Systeme zu analysieren, Tests zu automatisieren und Ihre Sicherheit zu stärken.

··Feeds·Kontakt·Datenschutz·© 2026 Kitploit

Tool-Verzeichnis

Kategorien

Alle Kategorien anzeigen
Loading categories
superpowers-evals — Behaviorales Evaluierungslabor (Quorum) für das Superpowers-Projekt, das echte Coding-Agent-CLIs (Claude, Codex, Gemini, Kimi und weitere) durch einen QA-Agenten antreibt und sie hinsichtlich Workflow-Konformität gegenüber Szenarienkriterien und deterministischen Nachprüfungen bewertet | Kitploit
Tools/GitHubGitHub/prime-radiant-inc/superpowers-evals
Scripting & AutomatisierungPenetrationstestsDienstprogramme & FrameworksLernen & BildungKI-SicherheitLabs & Praxis
GitHubprime-radiant-inc/superpowers-evals

superpowers-evals

Repository anzeigen
971220vor 19 TagenVon Kitploit geprüft

Beliebteste

Alle anzeigen →

Entdecken Sie die meistgenutzten Tools unserer Community.

Alle Tools erkunden

Durchsuchen Sie unsere Tool-Sammlung

Alle Tools anzeigen →

Über

Behaviorales Evaluierungslabor (Quorum) für das Superpowers-Projekt, das echte Coding-Agent-CLIs (Claude, Codex, Gemini, Kimi und weitere) durch einen QA-Agenten antreibt und sie hinsichtlich Workflow-Konformität gegenüber Szenarienkriterien und deterministischen Nachprüfungen bewertet

Teilen

Superpowers Evals

Behaviorales Evaluierungslabor für Superpowers. Quorum treibt echte Coding-Agent-CLIs (Claude, Codex, Antigravity, Gemini, Kimi, OpenCode, Pi und Copilot) durch einen Gauntlet-QA-Agent und bewertet sie anhand von Szenario-Akzeptanzkriterien plus deterministischen Nachkontrollen.

Code, CLI, Pfade und Inline-Prosa verwenden alle Kleinbuchstaben quorum; die großgeschriebene Form Quorum erscheint in Überschriften und der Akteur-Tabelle.

Dies ist keine generische Benchmark-Suite. Es ist ein Evaluierungslabor für die Einhaltung von Arbeitsabläufen: Skill-Auslösung, Worktree-Verhalten, Koordination von Unteragenten, Verifikationsreflexe, Überprüfungsqualität und Kostengestaltungsmuster.

Sicherheitsmodell

quorum hat zwei sehr unterschiedliche Ausführungsmodi:

  • Statische/Unit-Prüfungen sind sicher für öffentliche CI. Sie führen biome, tsc und bun test aus. Sie rufen keine Modell-APIs auf und starten keine Agent-CLIs.
  • Live-Evaluierungen sind vertrauenswürdige Wartungsvorgänge. Sie starten Claude Code, Codex CLI, Antigravity CLI, Gemini CLI, Kimi Code, OpenCode CLI, Pi CLI oder Copilot CLI in permissiven Modi und sammeln rohe Transkripte, Tool-Aufrufe, Dateisystemzustand und Sitzungsprotokolle.

Öffentliche CI muss auf der statischen/Unit-Seite dieser Linie bleiben. Fügen Sie niemals API-Schlüssel, Live-quorum run …-Aufrufe oder gefährliche Modus-Agentenstarts zu öffentlicher CI hinzu.

Risiko von Live-Evaluierungen

Live-Evaluierungen führen den getesteten Coding-Agent mit weitreichenden Ausführungsberechtigungen aus:

  • Claude verwendet --dangerously-skip-permissions.
  • Codex verwendet --dangerously-bypass-approvals-and-sandbox.
  • Antigravity verwendet --dangerously-skip-permissions und verlässt sich auf lokale Browser-/Keyring-Authentifizierung für agy.
  • Gemini verwendet --skip-trust --approval-mode=yolo; API-Key-Auth ist Standard, mit optionaler OAuth-Auth für vertrauenswürdige lokale Läufe.
  • Kimi verwendet --yolo.
  • OpenCode verwendet --dangerously-skip-permissions.
  • Pi verwendet explizite Tool-Allowlists und API-Key-Auth in einem lauf-lokalen Konfigurationsverzeichnis.
  • Copilot verwendet --allow-all.

quorum setzt für jeden Coding-Agent HOME (plus die XDG-Basisverzeichnisse und TMPDIR) auf ein Wegwerf-Pro-Lauf-Home unter <run>/home fest – der Launcher setzt das von src/agents/home-env.ts erstellte $QUORUM_HOME_ENV- Token ein (xdgHomeEnv, die einzige Quelle der Wahrheit). Das Konfigurationsverzeichnis jedes Agenten wird unter dieses Home geklappt (Claude .claude, Codex .codex, Gemini ., OpenCode ., Antigravity ., Copilot .copilot, Kimi .kimi-code, Pi .pi/agent), sodass der Coding-Agent seine Konfiguration über seine eigene $HOME-Vorgabe findet und niemals das echte ~/.claude, ~/.codex, ~/.gemini, ~/.kimi-code, ~/.pi, ~/.copilot, ~/.config des Hosts oder andere heimrelative Zustände, installierte Plugins oder vorherige Sitzungen sieht. Die Bereitstellung fügt die Konfiguration – und die Host-OAuth-Anmeldeinformationen, die jeder Agent benötigt – vor dem Start in dieses Wegwerf-Home ein, sodass kein Login zur Laufzeit erforderlich ist. Copilot legt außerdem das lokale Superpowers-Plugin unter dem isolierten Home bereit, verwendet eine zugelassene äußere Umgebung und schreibt eine geheimnistragende .copilot-env mit chmod-0600 in das Laufverzeichnis. Das verringert den Schadensradius, ist aber keine Sandbox. OpenCode- und Copilot-Starter verwenden zusätzlich zugelassene Umgebungen, aber Live-Coding-Agenten laufen dennoch mit weitreichenden Dateisystem- und Befehlsausführungsberechtigungen.

Führen Sie Live-Evaluierungen nur aus einer vertrauenswürdigen lokalen Umgebung aus:

  • Exportieren Sie nur den für den ausgewählten Coding-Agent benötigten API-Schlüssel.
  • Vermeiden Sie das Ausführen mit umfangreichen Produktions- oder persönlichen Geheimnissen in der Umgebung.
  • Behandeln Sie results/, rohe Sitzungsprotokolle, Sitzungszustand/Tool-Aufruf-Artefakte und Gauntlet-Agent-Eingaben als vertraulich.
  • Übergeben oder fügen Sie rohe Lauf-Artefakte nicht ein, ohne sie zuvor zu überprüfen.

Schnellstart

Installieren und führen Sie die statischen Prüfungen aus:```bash bun install bun run check bun run quorum check

Führen Sie ein lokales oder break-glass-Szenario außerhalb des Containers aus:```bash
export SUPERPOWERS_ROOT=/path/to/superpowers
export ANTHROPIC_API_KEY=...
bun run quorum run scenarios/triggering-writing-plans --coding-agent claude
bun run quorum show <run-dir>

Der Gauntlet-Agent (QA-Treiber) authentifiziert sich standardmäßig bei Anthropic mit ANTHROPIC_API_KEY. Um ihn stattdessen über ein eingeloggtes Claude-Abonnement zu betreiben, setzen Sie CLAUDE_CODE_OAUTH_TOKEN (von claude setup-token) in der Umgebung (z. B. .env); das Harness leitet es weiter und gauntlet bevorzugt es gegenüber dem API-Schlüssel. Hinweis: Ein Abonnement hat Nutzungslimits, die für interaktive Nutzung ausgelegt sind — hochparallele run-all-Batches können diese erreichen, daher bleibt der API-Schlüssel für hohe Last die bessere Wahl.

Agentennamen sind claude, codex, antigravity, gemini, kimi, opencode, pi und copilot. Nicht jedes Szenario ist für jeden Agenten gültig.

BREAKING (Anmeldedatenachse): claude-haiku und claude-sonnet sind keine separaten Agentennamen mehr. Um das Claude-Harness gegen Sonnet oder Haiku auszuführen:```bash bun run quorum run scenarios/ --coding-agent claude --credential sonnet bun run quorum run scenarios/ --coding-agent claude --credential haiku

The `claude` agent's default credential is `opus`.

## Shared Eval Appliance

Shared remote live evals are designed to run from a trusted appliance host with one blessed credential bundle, exact repo/ref provenance, host locks, and recoverable job records. Agents should use the appliance helper once it exists on the configured host:```bash
evals-appliance doctor --json
evals-appliance prepare --json --superpowers-ref <branch-tag-or-sha>
evals-appliance run-all --json --detach \
  --superpowers-ref <branch-tag-or-sha> \
  -- --tier sentinel \
     --coding-agents claude,codex,kimi \
     --jobs 4
evals-appliance status --json <job-id>
evals-appliance show --json <job-id>
evals-appliance costs --json <job-id>
evals-appliance cancel --json <job-id>

Die Zielschnittstelle und die Betriebsregeln befinden sich in docs/appliance-runbook.md, unterstützt durch docs/superpowers/specs/2026-06-18-shared-eval-appliance-design.md. doctor ist schreibgeschützt. prepare gibt lock_busy zurück, anstatt Referenzen zu ändern, während ein laufender Job aktiv ist. Host-Zugriff und anbieter-spezifische Break-Glass-Verfahren werden absichtlich aus diesem öffentlichen Repository ferngehalten; verwenden Sie das private Ops-Runbook für diese Details. Rohe bun run quorum ... und scripts/evals-container exec quorum ... bleiben lokale oder vertrauenswürdige Break-Glass-Workflows für gemeinsame Live-Evals.

Container-Laufzeitumgebung

Die Docker-Laufzeitumgebung ist das primäre Rezept für reale Suite-Läufe. Sie behält das Evals-Checkout, das Superpowers-Checkout unter Test, Anmeldeinformationen, Authentifizierungsquellen und alle Lauf-Artefakte auf dem Host, während Quorum innerhalb eines umfangreichen Ubuntu-Workspace-Containers läuft.

Tool herunterladen