
Laboratório de avaliação comportamental (Quorum) para o projeto superpowers que orienta CLIs reais de agentes de codificação (Claude, Codex, Gemini, Kimi e outros) através de um agente de QA e os avalia quanto à conformidade com o fluxo de trabalho em relação aos critérios de cenário e verificações pós-determinísticas.
Laboratório de avaliação comportamental para superpowers. Quorum conduz CLIs reais de agentes de codificação (Claude, Codex, Antigravity, Gemini, Kimi, OpenCode, Pi e Copilot) através de um agente de QA Gauntlet e os avalia com base em critérios de aceitação de cenários mais verificações pós-execução determinísticas.
Código, CLI, caminhos e prosa em linha usam quorum em minúsculas; a forma
capitalizada Quorum aparece em cabeçalhos e na tabela de atores.
Esta não é uma suíte de benchmark genérica. É um laboratório de avaliação para conformidade de fluxo de trabalho: acionamento de habilidades, comportamento de worktree, coordenação de subagentes, reflexos de verificação, qualidade de revisão e padrões de modelagem de custos.
quorum possui dois modos de execução muito diferentes:
biome, tsc e
bun test. Não chamam APIs de modelo nem lançam CLIs de agentes.A CI pública deve permanecer no lado estático/de unidade dessa linha. Nunca adicione chaves de API,
invocações quorum run … ao vivo ou lançamentos de agentes em modo perigoso à CI pública.
Avaliações ao vivo executam o Agente de Codificação sob teste com amplo poder de execução:
--dangerously-skip-permissions.--dangerously-bypass-approvals-and-sandbox.--dangerously-skip-permissions e depende de autenticação
local de navegador/keyring para agy.--skip-trust --approval-mode=yolo; autenticação por chave de API é o padrão,
com autenticação OAuth opcional para execuções locais confiáveis.--yolo.--dangerously-skip-permissions.--allow-all.quorum fixa o HOME de cada Agente de Codificação (mais os diretórios base XDG e TMPDIR)
em um home descartável por execução em <run>/home — o lançador insere o
token $QUORUM_HOME_ENV construído por src/agents/home-env.ts (xdgHomeEnv, a
única fonte da verdade). O diretório de configuração de cada agente é colapsado sob esse home
(Claude .claude, Codex .codex, Gemini ., OpenCode ., Antigravity .,
Copilot .copilot, Kimi .kimi-code, Pi .pi/agent), então o Agente de Codificação
encontra sua configuração através do próprio padrão $HOME e nunca vê o ~/.claude,
~/.codex, ~/.gemini, ~/.kimi-code, ~/.pi, ~/.copilot,
~/.config real do host, nem outros estados relativos ao home, plugins instalados ou sessões anteriores.
O provisionamento semeia a configuração — e as credenciais OAuth do host que cada agente precisa — nesse
home descartável antes da inicialização, portanto não há login em tempo de execução. Copilot também
prepara o plugin local Superpowers sob o home isolado, usa um
ambiente externo na lista de permissões e escreve um .copilot-env contendo segredos com chmod 0600
dentro do diretório de execução. Isso reduz o raio de explosão, mas não é uma sandbox. Os lançadores OpenCode e Copilot usam adicionalmente ambientes
na lista de permissões, mas Agentes de Codificação ao vivo ainda executam com amplo poder de
sistema de arquivos e execução de comandos.
Execute avaliações ao vivo apenas a partir de um ambiente local confiável:
results/, logs de sessão brutos, artefatos de chamadas de ferramentas/estado de sessão e entradas do Agente Gauntlet como
sensíveis.Instale e execute as portas estáticas:```bash bun install bun run check bun run quorum check
Execute um cenário local ou de emergência fora do contêiner:```bash
export SUPERPOWERS_ROOT=/path/to/superpowers
export ANTHROPIC_API_KEY=...
bun run quorum run scenarios/triggering-writing-plans --coding-agent claude
bun run quorum show <run-dir>
O Gauntlet-Agent (driver de QA) autentica-se na Anthropic com ANTHROPIC_API_KEY
por padrão. Para executá-lo a partir de uma assinatura logada do Claude, defina
CLAUDE_CODE_OAUTH_TOKEN (de claude setup-token) no ambiente (ex.
.env); o harness passa o token adiante e o gauntlet o prefere à chave de API.
Nota: uma assinatura tem limites de uso dimensionados para uso interativo — lotes
run-all de alta concorrência podem atingi-los, então a chave de API continua sendo a melhor opção para carga pesada.
Os nomes dos agentes são claude, codex, antigravity, gemini, kimi,
opencode, pi e copilot. Nem todo cenário é válido para todos os agentes.
BREAKING (eixo de credenciais): claude-haiku e claude-sonnet não são mais
nomes de agentes separados. Para executar o harness do Claude contra Sonnet ou Haiku:```bash
bun run quorum run scenarios/ --coding-agent claude --credential sonnet
bun run quorum run scenarios/ --coding-agent claude --credential haiku
A credencial padrão do agente `claude` é `opus`.
## Dispositivo de Avaliação Compartilhado
As avaliações remotas ao vivo compartilhadas são projetadas para serem executadas a partir de um host de dispositivo confiável com um único pacote de credenciais abençoadas, proveniência exata de repo/ref, bloqueios de host e registros de jobs recuperáveis. Os agentes devem usar o helper do dispositivo assim que ele existir no host configurado:```bash
evals-appliance doctor --json
evals-appliance prepare --json --superpowers-ref <branch-tag-or-sha>
evals-appliance run-all --json --detach \
--superpowers-ref <branch-tag-or-sha> \
-- --tier sentinel \
--coding-agents claude,codex,kimi \
--jobs 4
evals-appliance status --json <job-id>
evals-appliance show --json <job-id>
evals-appliance costs --json <job-id>
evals-appliance cancel --json <job-id>
A interface alvo e as regras de operação estão em
docs/appliance-runbook.md, respaldadas por
docs/superpowers/specs/2026-06-18-shared-eval-appliance-design.md.
doctor é somente leitura. prepare retorna lock_busy em vez de alterar referências
enquanto um job ativo estiver em execução.
O acesso ao host e os procedimentos de break-glass específicos do provedor são intencionalmente mantidos
fora deste repositório público; use o runbook de operações privado para esses detalhes.
Os comandos bun run quorum ... e scripts/evals-container exec quorum ... permanecem
como fluxos de trabalho locais ou break-glass confiáveis para avaliações ao vivo compartilhadas.
O runtime do Docker é a receita principal para execuções reais de suíte. Ele mantém o checkout de evals, o checkout do Superpowers em teste, credenciais, fontes de autenticação e todos os artefatos de execução no host enquanto o quorum é executado dentro de um contêiner rico de workspace Ubuntu.