
Laboratorio di valutazione comportamentale (Quorum) per il progetto superpowers che guida CLI di agenti di codifica reali (Claude, Codex, Gemini, Kimi e altri) attraverso un agente QA e le valuta in base alla conformità al flusso di lavoro rispetto ai criteri dello scenario e ai controlli deterministici post-esecuzione.
Laboratorio di valutazione comportamentale per superpowers. Quorum guida CLI reali di coding-agent (Claude, Codex, Antigravity, Gemini, Kimi, OpenCode, Pi e Copilot) attraverso un agente Gauntlet QA e li valuta rispetto ai criteri di accettazione dello scenario più controlli deterministici successivi.
Codice, CLI, percorsi e prosa inline usano tutti quorum in minuscolo;
la forma maiuscola Quorum appare nelle intestazioni e nella tabella degli attori.
Questa non è una suite di benchmark generica. È un laboratorio di valutazione per la conformità del flusso di lavoro: attivazione delle skill, comportamento del worktree, coordinamento dei subagenti, riflessi di verifica e pattern di modellazione dei costi.
quorum ha due modalità di esecuzione molto diverse:
biome, tsc e
bun test. Non chiamano API dei modelli e non avviano CLI di agenti.La CI pubblica deve rimanere dalla parte dei controlli statici/di unità di quella linea.
Non aggiungere mai chiavi API, invocazioni live quorum run …, o lanci di agenti in
modalità pericolosa alla CI pubblica.
Le valutazioni live eseguono il Coding-Agent sotto test con ampi poteri di esecuzione:
--dangerously-skip-permissions.--dangerously-bypass-approvals-and-sandbox.--dangerously-skip-permissions e si basa sull'autenticazione
locale tramite browser/keyring per agy.--skip-trust --approval-mode=yolo; l'autenticazione tramite chiave API è predefinita,
con autenticazione OAuth opzionale per esecuzioni locali fidate.--yolo.--dangerously-skip-permissions.--allow-all.quorum fissa la HOME di ogni Coding-Agent (più le directory base XDG e TMPDIR)
in una home temporanea per esecuzione <run>/home — il launcher inserisce il
token $QUORUM_HOME_ENV costruito da src/agents/home-env.ts (xdgHomeEnv, l'unica
fonte di verità). La directory di configurazione di ogni agente è collassata sotto quella home
(Claude .claude, Codex .codex, Gemini ., OpenCode ., Antigravity .,
Copilot .copilot, Kimi .kimi-code, Pi .pi/agent), così il Coding-Agent
trova la sua configurazione tramite il suo default $HOME e non vede mai le reali
directory ~/.claude, ~/.codex, ~/.gemini, ~/.kimi-code, ~/.pi, ~/.copilot,
~/.config, o altro stato relativo alla home dell'host, plugin installati, o sessioni precedenti.
Il provisioning inserisce la configurazione — e le credenziali OAuth dell'host necessarie a ciascun agente — in
quella home temporanea prima del lancio, quindi non c'è login durante l'esecuzione. Copilot prepara anche
il plugin locale Superpowers sotto la home isolata, usa un ambiente esterno autorizzato,
e scrive un .copilot-env con segreti con chmod-0600 all'interno della directory di esecuzione.
Questo restringe il raggio d'impatto ma non è una sandbox. I launcher di OpenCode e Copilot
usano inoltre ambienti autorizzati, ma i Coding-Agent live vengono comunque eseguiti con ampi poteri di
esecuzione di comandi e filesystem.
Esegui le valutazioni live solo da un ambiente locale affidabile:
results/, i log di sessione grezzi, gli artefatti di stato di sessione/chiamate di strumenti e gli input del Gauntlet-Agent come
sensibili.Installa ed esegui i controlli statici:```bash bun install bun run check bun run quorum check
Esegui uno scenario locale o di break-glass all'esterno del contenitore:```bash
export SUPERPOWERS_ROOT=/path/to/superpowers
export ANTHROPIC_API_KEY=...
bun run quorum run scenarios/triggering-writing-plans --coding-agent claude
bun run quorum show <run-dir>
L'agente Gauntlet (driver QA) si autentica ad Anthropic con ANTHROPIC_API_KEY
per impostazione predefinita. Per utilizzarlo invece da un abbonamento Claude con accesso effettuato, imposta
CLAUDE_CODE_OAUTH_TOKEN (da claude setup-token) nell'ambiente (es.
.env); l'harness lo passa e gauntlet lo preferisce alla chiave API.
Nota: un abbonamento ha limiti di utilizzo pensati per l'uso interattivo — ad alta concorrenza
i batch run-all possono raggiungerli, quindi la chiave API rimane la scelta migliore per carichi pesanti.
I nomi degli agenti sono claude, codex, antigravity, gemini, kimi,
opencode, pi e copilot. Non tutti gli scenari sono validi per ogni agente.
BREAKING (credential axis): claude-haiku e claude-sonnet non sono più
nomi di agenti separati. Per eseguire l'harness Claude su Sonnet o Haiku:```bash
bun run quorum run scenarios/ --coding-agent claude --credential sonnet
bun run quorum run scenarios/ --coding-agent claude --credential haiku
La credenziale predefinita dell'agente `claude` è `opus`.
## Shared Eval Appliance
Gli eval live remoti condivisi sono progettati per essere eseguiti da un host appliance affidabile con un bundle di credenziali approvato, provenienza esatta repo/ref, blocchi host e record di job recuperabili. Gli agenti dovrebbero utilizzare l'helper dell'appliance una volta che esiste sull'host configurato:```bash
evals-appliance doctor --json
evals-appliance prepare --json --superpowers-ref <branch-tag-or-sha>
evals-appliance run-all --json --detach \
--superpowers-ref <branch-tag-or-sha> \
-- --tier sentinel \
--coding-agents claude,codex,kimi \
--jobs 4
evals-appliance status --json <job-id>
evals-appliance show --json <job-id>
evals-appliance costs --json <job-id>
evals-appliance cancel --json <job-id>
L'interfaccia di destinazione e le regole operative si trovano in
docs/appliance-runbook.md, supportate da
docs/superpowers/specs/2026-06-18-shared-eval-appliance-design.md.
doctor è in sola lettura. prepare restituisce lock_busy invece di modificare i riferimenti mentre un job attivo è in esecuzione.
L'accesso all'host e le procedure di break-glass specifiche del provider sono intenzionalmente tenuti fuori da questo repository pubblico; usa il runbook operativo privato per quei dettagli.
I comandi grezzi bun run quorum ... e scripts/evals-container exec quorum ... rimangono flussi di lavoro locali o break-glass affidabili per valutazioni live condivise.
Il runtime Docker è la ricetta principale per le esecuzioni reali della suite. Mantiene il checkout degli evals, il checkout di Superpowers in test, le credenziali, le fonti di autenticazione e tutti gli artefatti di esecuzione sull'host mentre quorum viene eseguito all'interno di un contenitore workspace Ubuntu ricco.