
Laboratorio de evaluación de comportamiento (Quorum) para el proyecto superpowers que impulsa CLIs reales de agentes de codificación (Claude, Codex, Gemini, Kimi y más) a través de un agente de QA y los califica según el cumplimiento del flujo de trabajo contra criterios de escenario y comprobaciones posteriores deterministas.
Laboratorio de evaluación comportamental para superpowers. Quorum impulsa CLIs reales de agentes de codificación (Claude, Codex, Antigravity, Gemini, Kimi, OpenCode, Pi y Copilot) a través de un agente de control de calidad Gauntlet y los califica según los criterios de aceptación del escenario más comprobaciones posteriores deterministas.
El código, la CLI, las rutas y el texto en línea usan quorum en minúsculas; la forma
capitalizada Quorum aparece en los encabezados y la tabla de actores.
No es un conjunto de pruebas genérico. Es un laboratorio de evaluación para el cumplimiento del flujo de trabajo: activación de habilidades, comportamiento del área de trabajo, coordinación de subagentes, reflejos de verificación, calidad de revisión y patrones de modelado de costos.
quorum tiene dos modos de ejecución muy diferentes:
biome, tsc y
bun test. No llaman a las API del modelo ni inician agentes CLI.El CI público debe permanecer en el lado estático/de unidad de esa línea. Nunca agregue claves API,
invocaciones en vivo de quorum run … ni lanzamientos de agentes en modo peligroso al CI público.
Las evaluaciones en vivo ejecutan el Coding-Agent bajo prueba con amplio poder de ejecución:
--dangerously-skip-permissions.--dangerously-bypass-approvals-and-sandbox.--dangerously-skip-permissions y depende de la autenticación local de
navegador/llave para agy.--skip-trust --approval-mode=yolo; la autenticación por clave API es la predeterminada,
con autenticación OAuth opt-in para ejecuciones locales de confianza.--yolo.--dangerously-skip-permissions.--allow-all.quorum fija el HOME de cada Coding-Agent (además de los directorios base XDG y TMPDIR)
a un hogar desechable por ejecución en <run>/home — el lanzador inserta el
token $QUORUM_HOME_ENV construido por src/agents/home-env.ts (xdgHomeEnv, la
única fuente de verdad). El directorio de configuración de cada agente se colapsa debajo de ese
hogar (Claude .claude, Codex .codex, Gemini ., OpenCode ., Antigravity .,
Copilot .copilot, Kimi .kimi-code, Pi .pi/agent), de modo que el Coding-Agent
encuentre su configuración a través de su propio $HOME predeterminado y nunca vea el ~/.claude,
~/.codex, ~/.gemini, ~/.kimi-code, ~/.pi, ~/.copilot, ~/.config real del host
u otro estado relativo al hogar, complementos instalados o sesiones anteriores.
El aprovisionamiento siembra la configuración — y las credenciales OAuth del host que cada agente
necesita — en ese hogar desechable antes del lanzamiento, por lo que no hay inicio de sesión en
tiempo de ejecución. Copilot también coloca el complemento local de Superpowers bajo el hogar
aislado, usa un entorno externo en lista blanca y escribe un .copilot-env que contiene secretos
con permisos chmod-0600 dentro del directorio de ejecución. Esto reduce el radio de explosión pero
no es un sandbox. Los lanzadores de OpenCode y Copilot también usan entornos en lista blanca,
pero los Coding-Agents en vivo aún se ejecutan con amplio poder de sistema de archivos y
ejecución de comandos.
Ejecute evaluaciones en vivo solo desde un entorno local de confianza:
results/, los registros de sesión en bruto, los artefactos de llamadas a herramientas/estado
de sesión y las entradas del Gauntlet-Agent como
sensibles.Instale y ejecute los controles estáticos:```bash bun install bun run check bun run quorum check
Ejecuta un escenario local o de emergencia fuera del contenedor:```bash
export SUPERPOWERS_ROOT=/path/to/superpowers
export ANTHROPIC_API_KEY=...
bun run quorum run scenarios/triggering-writing-plans --coding-agent claude
bun run quorum show <run-dir>
El Gauntlet-Agent (controlador de QA) se autentica con Anthropic usando ANTHROPIC_API_KEY
de manera predeterminada. Para usarlo desde una suscripción activa de Claude en su lugar, establezca
CLAUDE_CODE_OAUTH_TOKEN (de claude setup-token) en el entorno (p. ej.
.env); el arnés lo pasa y gauntlet lo prefiere sobre la clave de API.
Nota: una suscripción tiene límites de uso diseñados para uso interactivo — los lotes
run-all de alta concurrencia pueden alcanzarlos, por lo que la clave de API sigue siendo la opción más adecuada para cargas pesadas.
Los nombres de agentes son claude, codex, antigravity, gemini, kimi,
opencode, pi y copilot. No todos los escenarios son válidos para cada agente.
RUPTURA (eje de credenciales): claude-haiku y claude-sonnet ya no
son nombres de agentes separados. Para ejecutar el arnés de Claude contra Sonnet o Haiku:```bash
bun run quorum run scenarios/ --coding-agent claude --credential sonnet
bun run quorum run scenarios/ --coding-agent claude --credential haiku
La credencial predeterminada del agente `claude` es `opus`.
## Aparato de Evaluación Compartido
Las evaluaciones en vivo remotas compartidas están diseñadas para ejecutarse desde un host del aparato de confianza con un paquete de credenciales autorizado, procedencia exacta de repo/ref, bloqueos de host y registros de trabajo recuperables. Los agentes deben usar el ayudante del aparato una vez que exista en el host configurado:```bash
evals-appliance doctor --json
evals-appliance prepare --json --superpowers-ref <branch-tag-or-sha>
evals-appliance run-all --json --detach \
--superpowers-ref <branch-tag-or-sha> \
-- --tier sentinel \
--coding-agents claude,codex,kimi \
--jobs 4
evals-appliance status --json <job-id>
evals-appliance show --json <job-id>
evals-appliance costs --json <job-id>
evals-appliance cancel --json <job-id>
La interfaz objetivo y las reglas de operación se encuentran en docs/appliance-runbook.md, respaldadas por docs/superpowers/specs/2026-06-18-shared-eval-appliance-design.md. doctor es de solo lectura. prepare devuelve lock_busy en lugar de cambiar las referencias mientras un trabajo en vivo está activo. El acceso al host y los procedimientos break-glass específicos del proveedor se mantienen intencionalmente fuera de este repositorio público; use el runbook privado de operaciones para esos detalles. Los comandos sin formato bun run quorum ... y scripts/evals-container exec quorum ... permanecen como flujos de trabajo break-glass locales o de confianza para evaluaciones en vivo compartidas.
El runtime de Docker es la receta principal para ejecuciones reales de suites. Mantiene el checkout de evals, el checkout de Superpowers bajo prueba, credenciales, fuentes de autenticación y todos los artefactos de ejecución en el host mientras quorum se ejecuta dentro de un contenedor de espacio de trabajo Ubuntu completo.