Skip to content
KitploitKITPLOIT
HerramientasBlog
Log in
Enviar
HerramientasBlog
Enviar

¡Herramientas de Hacking, PenTest y Ciberseguridad para tu Arsenal de Seguridad!

Kitploit es un directorio de herramientas de hacking, ciberseguridad y pentesting. Descubre las últimas actualizaciones de proyectos para encontrar vulnerabilidades, analizar sistemas, automatizar pruebas y fortalecer tu seguridad.

FeedsContactoPrivacidad© 2026 Kitploit

Directorio de Herramientas

Categorías

Ver todas las categorías
Loading categories
superpowers-evals — Laboratorio de evaluación de comportamiento (Quorum) para el proyecto superpowers que impulsa CLIs reales de agentes de codificación (Claude, Codex, Gemini, Kimi y más) a través de un agente de QA y los califica según el cumplimiento del flujo de trabajo contra criterios de escenario y comprobaciones posteriores deterministas. | Kitploit
Herramientas/GitHubGitHub/prime-radiant-inc/superpowers-evals
Scripting y AutomatizaciónPruebas de PenetraciónUtilidades y FrameworksAprendizaje y EducaciónSeguridad de IALabs y Práctica
GitHubprime-radiant-inc/superpowers-evals

superpowers-evals

Ver Repositorio
971221hace 19 díasRevisado por Kitploit

Más Populares

Ver todos →

Descubre las herramientas más usadas por nuestra comunidad.

Explora todas las herramientas

Explora nuestra colección de herramientas

Ver todas las herramientas →

Acerca de

Laboratorio de evaluación de comportamiento (Quorum) para el proyecto superpowers que impulsa CLIs reales de agentes de codificación (Claude, Codex, Gemini, Kimi y más) a través de un agente de QA y los califica según el cumplimiento del flujo de trabajo contra criterios de escenario y comprobaciones posteriores deterministas.

Compartir

Superpowers Evals

Laboratorio de evaluación comportamental para superpowers. Quorum impulsa CLIs reales de agentes de codificación (Claude, Codex, Antigravity, Gemini, Kimi, OpenCode, Pi y Copilot) a través de un agente de control de calidad Gauntlet y los califica según los criterios de aceptación del escenario más comprobaciones posteriores deterministas.

El código, la CLI, las rutas y el texto en línea usan quorum en minúsculas; la forma capitalizada Quorum aparece en los encabezados y la tabla de actores.

No es un conjunto de pruebas genérico. Es un laboratorio de evaluación para el cumplimiento del flujo de trabajo: activación de habilidades, comportamiento del área de trabajo, coordinación de subagentes, reflejos de verificación, calidad de revisión y patrones de modelado de costos.

Modelo de Seguridad

quorum tiene dos modos de ejecución muy diferentes:

  • Las comprobaciones estáticas/de unidad son seguras para CI público. Ejecutan biome, tsc y bun test. No llaman a las API del modelo ni inician agentes CLI.
  • Las evaluaciones en vivo son operaciones de mantenedores de confianza. Inician Claude Code, Codex CLI, Antigravity CLI, Gemini CLI, Kimi Code, OpenCode CLI, Pi CLI o Copilot CLI en modos permisivos y recopilan transcripciones en bruto, llamadas a herramientas, estado del sistema de archivos y registros de sesión.

El CI público debe permanecer en el lado estático/de unidad de esa línea. Nunca agregue claves API, invocaciones en vivo de quorum run … ni lanzamientos de agentes en modo peligroso al CI público.

Riesgo de Evaluación en Vivo

Las evaluaciones en vivo ejecutan el Coding-Agent bajo prueba con amplio poder de ejecución:

  • Claude usa --dangerously-skip-permissions.
  • Codex usa --dangerously-bypass-approvals-and-sandbox.
  • Antigravity usa --dangerously-skip-permissions y depende de la autenticación local de navegador/llave para agy.
  • Gemini usa --skip-trust --approval-mode=yolo; la autenticación por clave API es la predeterminada, con autenticación OAuth opt-in para ejecuciones locales de confianza.
  • Kimi usa --yolo.
  • OpenCode usa --dangerously-skip-permissions.
  • Pi usa listas de herramientas explícitas permitidas y autenticación por clave API en un directorio de configuración local de ejecución.
  • Copilot usa --allow-all.

quorum fija el HOME de cada Coding-Agent (además de los directorios base XDG y TMPDIR) a un hogar desechable por ejecución en <run>/home — el lanzador inserta el token $QUORUM_HOME_ENV construido por src/agents/home-env.ts (xdgHomeEnv, la única fuente de verdad). El directorio de configuración de cada agente se colapsa debajo de ese hogar (Claude .claude, Codex .codex, Gemini ., OpenCode ., Antigravity ., Copilot .copilot, Kimi .kimi-code, Pi .pi/agent), de modo que el Coding-Agent encuentre su configuración a través de su propio $HOME predeterminado y nunca vea el ~/.claude, ~/.codex, ~/.gemini, ~/.kimi-code, ~/.pi, ~/.copilot, ~/.config real del host u otro estado relativo al hogar, complementos instalados o sesiones anteriores. El aprovisionamiento siembra la configuración — y las credenciales OAuth del host que cada agente necesita — en ese hogar desechable antes del lanzamiento, por lo que no hay inicio de sesión en tiempo de ejecución. Copilot también coloca el complemento local de Superpowers bajo el hogar aislado, usa un entorno externo en lista blanca y escribe un .copilot-env que contiene secretos con permisos chmod-0600 dentro del directorio de ejecución. Esto reduce el radio de explosión pero no es un sandbox. Los lanzadores de OpenCode y Copilot también usan entornos en lista blanca, pero los Coding-Agents en vivo aún se ejecutan con amplio poder de sistema de archivos y ejecución de comandos.

Ejecute evaluaciones en vivo solo desde un entorno local de confianza:

  • Exporte únicamente la clave API necesaria para el Coding-Agent seleccionado.
  • Evite ejecutar con secretos de producción o personales amplios en el entorno.
  • Trate results/, los registros de sesión en bruto, los artefactos de llamadas a herramientas/estado de sesión y las entradas del Gauntlet-Agent como sensibles.
  • No confirme ni pegue artefactos de ejecución en bruto sin revisarlos primero.

Inicio Rápido

Instale y ejecute los controles estáticos:```bash bun install bun run check bun run quorum check

Ejecuta un escenario local o de emergencia fuera del contenedor:```bash
export SUPERPOWERS_ROOT=/path/to/superpowers
export ANTHROPIC_API_KEY=...
bun run quorum run scenarios/triggering-writing-plans --coding-agent claude
bun run quorum show <run-dir>

El Gauntlet-Agent (controlador de QA) se autentica con Anthropic usando ANTHROPIC_API_KEY de manera predeterminada. Para usarlo desde una suscripción activa de Claude en su lugar, establezca CLAUDE_CODE_OAUTH_TOKEN (de claude setup-token) en el entorno (p. ej. .env); el arnés lo pasa y gauntlet lo prefiere sobre la clave de API. Nota: una suscripción tiene límites de uso diseñados para uso interactivo — los lotes run-all de alta concurrencia pueden alcanzarlos, por lo que la clave de API sigue siendo la opción más adecuada para cargas pesadas.

Los nombres de agentes son claude, codex, antigravity, gemini, kimi, opencode, pi y copilot. No todos los escenarios son válidos para cada agente.

RUPTURA (eje de credenciales): claude-haiku y claude-sonnet ya no son nombres de agentes separados. Para ejecutar el arnés de Claude contra Sonnet o Haiku:```bash bun run quorum run scenarios/ --coding-agent claude --credential sonnet bun run quorum run scenarios/ --coding-agent claude --credential haiku

La credencial predeterminada del agente `claude` es `opus`.

## Aparato de Evaluación Compartido

Las evaluaciones en vivo remotas compartidas están diseñadas para ejecutarse desde un host del aparato de confianza con un paquete de credenciales autorizado, procedencia exacta de repo/ref, bloqueos de host y registros de trabajo recuperables. Los agentes deben usar el ayudante del aparato una vez que exista en el host configurado:```bash
evals-appliance doctor --json
evals-appliance prepare --json --superpowers-ref <branch-tag-or-sha>
evals-appliance run-all --json --detach \
  --superpowers-ref <branch-tag-or-sha> \
  -- --tier sentinel \
     --coding-agents claude,codex,kimi \
     --jobs 4
evals-appliance status --json <job-id>
evals-appliance show --json <job-id>
evals-appliance costs --json <job-id>
evals-appliance cancel --json <job-id>

La interfaz objetivo y las reglas de operación se encuentran en docs/appliance-runbook.md, respaldadas por docs/superpowers/specs/2026-06-18-shared-eval-appliance-design.md. doctor es de solo lectura. prepare devuelve lock_busy en lugar de cambiar las referencias mientras un trabajo en vivo está activo. El acceso al host y los procedimientos break-glass específicos del proveedor se mantienen intencionalmente fuera de este repositorio público; use el runbook privado de operaciones para esos detalles. Los comandos sin formato bun run quorum ... y scripts/evals-container exec quorum ... permanecen como flujos de trabajo break-glass locales o de confianza para evaluaciones en vivo compartidas.

Tiempo de ejecución del contenedor

El runtime de Docker es la receta principal para ejecuciones reales de suites. Mantiene el checkout de evals, el checkout de Superpowers bajo prueba, credenciales, fuentes de autenticación y todos los artefactos de ejecución en el host mientras quorum se ejecuta dentro de un contenedor de espacio de trabajo Ubuntu completo.

Descargar herramienta