
Behaviorales Evaluierungslabor (Quorum) für das Superpowers-Projekt, das echte Coding-Agent-CLIs (Claude, Codex, Gemini, Kimi und weitere) durch einen QA-Agenten antreibt und sie hinsichtlich Workflow-Konformität gegenüber Szenarienkriterien und deterministischen Nachprüfungen bewertet
Behaviorales Evaluierungslabor für Superpowers. Quorum treibt echte Coding-Agent-CLIs (Claude, Codex, Antigravity, Gemini, Kimi, OpenCode, Pi und Copilot) durch einen Gauntlet-QA-Agent und bewertet sie anhand von Szenario-Akzeptanzkriterien plus deterministischen Nachkontrollen.
Code, CLI, Pfade und Inline-Prosa verwenden alle Kleinbuchstaben quorum; die
großgeschriebene Form Quorum erscheint in Überschriften und der Akteur-Tabelle.
Dies ist keine generische Benchmark-Suite. Es ist ein Evaluierungslabor für die Einhaltung von Arbeitsabläufen: Skill-Auslösung, Worktree-Verhalten, Koordination von Unteragenten, Verifikationsreflexe, Überprüfungsqualität und Kostengestaltungsmuster.
quorum hat zwei sehr unterschiedliche Ausführungsmodi:
biome, tsc und bun test aus. Sie rufen keine Modell-APIs auf und
starten keine Agent-CLIs.Öffentliche CI muss auf der statischen/Unit-Seite dieser Linie bleiben. Fügen
Sie niemals API-Schlüssel, Live-quorum run …-Aufrufe oder gefährliche
Modus-Agentenstarts zu öffentlicher CI hinzu.
Live-Evaluierungen führen den getesteten Coding-Agent mit weitreichenden Ausführungsberechtigungen aus:
--dangerously-skip-permissions.--dangerously-bypass-approvals-and-sandbox.--dangerously-skip-permissions und verlässt sich auf
lokale Browser-/Keyring-Authentifizierung für agy.--skip-trust --approval-mode=yolo; API-Key-Auth ist
Standard, mit optionaler OAuth-Auth für vertrauenswürdige lokale Läufe.--yolo.--dangerously-skip-permissions.--allow-all.quorum setzt für jeden Coding-Agent HOME (plus die XDG-Basisverzeichnisse
und TMPDIR) auf ein Wegwerf-Pro-Lauf-Home unter <run>/home fest – der
Launcher setzt das von src/agents/home-env.ts erstellte $QUORUM_HOME_ENV-
Token ein (xdgHomeEnv, die einzige Quelle der Wahrheit). Das
Konfigurationsverzeichnis jedes Agenten wird unter dieses Home geklappt
(Claude .claude, Codex .codex, Gemini ., OpenCode ., Antigravity .,
Copilot .copilot, Kimi .kimi-code, Pi .pi/agent), sodass der Coding-Agent
seine Konfiguration über seine eigene $HOME-Vorgabe findet und niemals das
echte ~/.claude, ~/.codex, ~/.gemini, ~/.kimi-code, ~/.pi,
~/.copilot, ~/.config des Hosts oder andere heimrelative Zustände,
installierte Plugins oder vorherige Sitzungen sieht. Die Bereitstellung fügt
die Konfiguration – und die Host-OAuth-Anmeldeinformationen, die jeder Agent
benötigt – vor dem Start in dieses Wegwerf-Home ein, sodass kein Login zur
Laufzeit erforderlich ist. Copilot legt außerdem das lokale Superpowers-Plugin
unter dem isolierten Home bereit, verwendet eine zugelassene äußere Umgebung
und schreibt eine geheimnistragende .copilot-env mit chmod-0600 in das
Laufverzeichnis. Das verringert den Schadensradius, ist aber keine Sandbox.
OpenCode- und Copilot-Starter verwenden zusätzlich zugelassene Umgebungen,
aber Live-Coding-Agenten laufen dennoch mit weitreichenden Dateisystem- und
Befehlsausführungsberechtigungen.
Führen Sie Live-Evaluierungen nur aus einer vertrauenswürdigen lokalen Umgebung aus:
results/, rohe Sitzungsprotokolle,
Sitzungszustand/Tool-Aufruf-Artefakte und Gauntlet-Agent-Eingaben als
vertraulich.Installieren und führen Sie die statischen Prüfungen aus:```bash bun install bun run check bun run quorum check
Führen Sie ein lokales oder break-glass-Szenario außerhalb des Containers aus:```bash
export SUPERPOWERS_ROOT=/path/to/superpowers
export ANTHROPIC_API_KEY=...
bun run quorum run scenarios/triggering-writing-plans --coding-agent claude
bun run quorum show <run-dir>
Der Gauntlet-Agent (QA-Treiber) authentifiziert sich standardmäßig bei Anthropic mit ANTHROPIC_API_KEY. Um ihn stattdessen über ein eingeloggtes Claude-Abonnement zu betreiben, setzen Sie CLAUDE_CODE_OAUTH_TOKEN (von claude setup-token) in der Umgebung (z. B. .env); das Harness leitet es weiter und gauntlet bevorzugt es gegenüber dem API-Schlüssel. Hinweis: Ein Abonnement hat Nutzungslimits, die für interaktive Nutzung ausgelegt sind — hochparallele run-all-Batches können diese erreichen, daher bleibt der API-Schlüssel für hohe Last die bessere Wahl.
Agentennamen sind claude, codex, antigravity, gemini, kimi,
opencode, pi und copilot. Nicht jedes Szenario ist für jeden Agenten gültig.
BREAKING (Anmeldedatenachse): claude-haiku und claude-sonnet sind keine separaten Agentennamen mehr. Um das Claude-Harness gegen Sonnet oder Haiku auszuführen:```bash
bun run quorum run scenarios/ --coding-agent claude --credential sonnet
bun run quorum run scenarios/ --coding-agent claude --credential haiku
The `claude` agent's default credential is `opus`.
## Shared Eval Appliance
Shared remote live evals are designed to run from a trusted appliance host with one blessed credential bundle, exact repo/ref provenance, host locks, and recoverable job records. Agents should use the appliance helper once it exists on the configured host:```bash
evals-appliance doctor --json
evals-appliance prepare --json --superpowers-ref <branch-tag-or-sha>
evals-appliance run-all --json --detach \
--superpowers-ref <branch-tag-or-sha> \
-- --tier sentinel \
--coding-agents claude,codex,kimi \
--jobs 4
evals-appliance status --json <job-id>
evals-appliance show --json <job-id>
evals-appliance costs --json <job-id>
evals-appliance cancel --json <job-id>
Die Zielschnittstelle und die Betriebsregeln befinden sich in
docs/appliance-runbook.md, unterstützt durch
docs/superpowers/specs/2026-06-18-shared-eval-appliance-design.md.
doctor ist schreibgeschützt. prepare gibt lock_busy zurück, anstatt Referenzen zu ändern, während ein laufender Job aktiv ist.
Host-Zugriff und anbieter-spezifische Break-Glass-Verfahren werden absichtlich aus diesem öffentlichen Repository ferngehalten; verwenden Sie das private Ops-Runbook für diese Details.
Rohe bun run quorum ... und scripts/evals-container exec quorum ... bleiben lokale oder vertrauenswürdige Break-Glass-Workflows für gemeinsame Live-Evals.
Die Docker-Laufzeitumgebung ist das primäre Rezept für reale Suite-Läufe. Sie behält das Evals-Checkout, das Superpowers-Checkout unter Test, Anmeldeinformationen, Authentifizierungsquellen und alle Lauf-Artefakte auf dem Host, während Quorum innerhalb eines umfangreichen Ubuntu-Workspace-Containers läuft.