Skip to content
KitploitKITPLOIT
FerramentasBlog
Log in
Enviar
FerramentasBlog
Enviar

Ferramentas de Hacking, PenTest e Cibersegurança para o seu Arsenal de Segurança!

Kitploit é um diretório de ferramentas de hacking, cibersegurança e pentesting. Descubra as últimas atualizações de projetos para encontrar vulnerabilidades, analisar sistemas, automatizar testes e fortalecer sua segurança.

FeedsContatoPrivacidade© 2026 Kitploit

Diretório de Ferramentas

Categorias

Ver todas as categorias
Loading categories
superpowers-evals — Laboratório de avaliação comportamental (Quorum) para o projeto superpowers que orienta CLIs reais de agentes de codificação (Claude, Codex, Gemini, Kimi e outros) através de um agente de QA e os avalia quanto à conformidade com o fluxo de trabalho em relação aos critérios de cenário e verificações pós-determinísticas. | Kitploit
Ferramentas/GitHubGitHub/prime-radiant-inc/superpowers-evals
Scripting e AutomaçãoTestes de PenetraçãoUtilitários e FrameworksAprendizado e EducaçãoSegurança de IALabs e Prática
GitHubprime-radiant-inc/superpowers-evals

superpowers-evals

Ver Repositório
971220há 19 diasRevisado pelo Kitploit

Mais Populares

Ver todos →

Descubra as ferramentas mais usadas pela nossa comunidade.

Explore todas as ferramentas

Navegue pela nossa coleção de ferramentas

Ver todas as ferramentas →

Sobre

Laboratório de avaliação comportamental (Quorum) para o projeto superpowers que orienta CLIs reais de agentes de codificação (Claude, Codex, Gemini, Kimi e outros) através de um agente de QA e os avalia quanto à conformidade com o fluxo de trabalho em relação aos critérios de cenário e verificações pós-determinísticas.

Compartilhar

Superpowers Evals

Laboratório de avaliação comportamental para superpowers. Quorum conduz CLIs reais de agentes de codificação (Claude, Codex, Antigravity, Gemini, Kimi, OpenCode, Pi e Copilot) através de um agente de QA Gauntlet e os avalia com base em critérios de aceitação de cenários mais verificações pós-execução determinísticas.

Código, CLI, caminhos e prosa em linha usam quorum em minúsculas; a forma capitalizada Quorum aparece em cabeçalhos e na tabela de atores.

Esta não é uma suíte de benchmark genérica. É um laboratório de avaliação para conformidade de fluxo de trabalho: acionamento de habilidades, comportamento de worktree, coordenação de subagentes, reflexos de verificação, qualidade de revisão e padrões de modelagem de custos.

Modelo de Segurança

quorum possui dois modos de execução muito diferentes:

  • Verificações estáticas/de unidade são seguras para CI pública. Elas executam biome, tsc e bun test. Não chamam APIs de modelo nem lançam CLIs de agentes.
  • Avaliações ao vivo são operações de mantenedor confiável. Elas lançam Claude Code, Codex CLI, Antigravity CLI, Gemini CLI, Kimi Code, OpenCode CLI, Pi CLI, ou Copilot CLI em modos permissivos e coletam transcrições brutas, chamadas de ferramentas, estado do sistema de arquivos e logs de sessão.

A CI pública deve permanecer no lado estático/de unidade dessa linha. Nunca adicione chaves de API, invocações quorum run … ao vivo ou lançamentos de agentes em modo perigoso à CI pública.

Risco da Avaliação ao Vivo

Avaliações ao vivo executam o Agente de Codificação sob teste com amplo poder de execução:

  • Claude usa --dangerously-skip-permissions.
  • Codex usa --dangerously-bypass-approvals-and-sandbox.
  • Antigravity usa --dangerously-skip-permissions e depende de autenticação local de navegador/keyring para agy.
  • Gemini usa --skip-trust --approval-mode=yolo; autenticação por chave de API é o padrão, com autenticação OAuth opcional para execuções locais confiáveis.
  • Kimi usa --yolo.
  • OpenCode usa --dangerously-skip-permissions.
  • Pi usa listas de permissões explícitas de ferramentas e autenticação por chave de API em um diretório de configuração local de execução.
  • Copilot usa --allow-all.

quorum fixa o HOME de cada Agente de Codificação (mais os diretórios base XDG e TMPDIR) em um home descartável por execução em <run>/home — o lançador insere o token $QUORUM_HOME_ENV construído por src/agents/home-env.ts (xdgHomeEnv, a única fonte da verdade). O diretório de configuração de cada agente é colapsado sob esse home (Claude .claude, Codex .codex, Gemini ., OpenCode ., Antigravity ., Copilot .copilot, Kimi .kimi-code, Pi .pi/agent), então o Agente de Codificação encontra sua configuração através do próprio padrão $HOME e nunca vê o ~/.claude, ~/.codex, ~/.gemini, ~/.kimi-code, ~/.pi, ~/.copilot, ~/.config real do host, nem outros estados relativos ao home, plugins instalados ou sessões anteriores. O provisionamento semeia a configuração — e as credenciais OAuth do host que cada agente precisa — nesse home descartável antes da inicialização, portanto não há login em tempo de execução. Copilot também prepara o plugin local Superpowers sob o home isolado, usa um ambiente externo na lista de permissões e escreve um .copilot-env contendo segredos com chmod 0600 dentro do diretório de execução. Isso reduz o raio de explosão, mas não é uma sandbox. Os lançadores OpenCode e Copilot usam adicionalmente ambientes na lista de permissões, mas Agentes de Codificação ao vivo ainda executam com amplo poder de sistema de arquivos e execução de comandos.

Execute avaliações ao vivo apenas a partir de um ambiente local confiável:

  • Exporte apenas a chave de API necessária para o Agente de Codificação selecionado.
  • Evite executar com segredos amplos de produção ou pessoais no ambiente.
  • Trate results/, logs de sessão brutos, artefatos de chamadas de ferramentas/estado de sessão e entradas do Agente Gauntlet como sensíveis.
  • Não confirme nem cole artefatos brutos de execução sem verificá-los primeiro.

Início Rápido

Instale e execute as portas estáticas:```bash bun install bun run check bun run quorum check

Execute um cenário local ou de emergência fora do contêiner:```bash
export SUPERPOWERS_ROOT=/path/to/superpowers
export ANTHROPIC_API_KEY=...
bun run quorum run scenarios/triggering-writing-plans --coding-agent claude
bun run quorum show <run-dir>

O Gauntlet-Agent (driver de QA) autentica-se na Anthropic com ANTHROPIC_API_KEY por padrão. Para executá-lo a partir de uma assinatura logada do Claude, defina CLAUDE_CODE_OAUTH_TOKEN (de claude setup-token) no ambiente (ex. .env); o harness passa o token adiante e o gauntlet o prefere à chave de API. Nota: uma assinatura tem limites de uso dimensionados para uso interativo — lotes run-all de alta concorrência podem atingi-los, então a chave de API continua sendo a melhor opção para carga pesada.

Os nomes dos agentes são claude, codex, antigravity, gemini, kimi, opencode, pi e copilot. Nem todo cenário é válido para todos os agentes.

BREAKING (eixo de credenciais): claude-haiku e claude-sonnet não são mais nomes de agentes separados. Para executar o harness do Claude contra Sonnet ou Haiku:```bash bun run quorum run scenarios/ --coding-agent claude --credential sonnet bun run quorum run scenarios/ --coding-agent claude --credential haiku

A credencial padrão do agente `claude` é `opus`.

## Dispositivo de Avaliação Compartilhado

As avaliações remotas ao vivo compartilhadas são projetadas para serem executadas a partir de um host de dispositivo confiável com um único pacote de credenciais abençoadas, proveniência exata de repo/ref, bloqueios de host e registros de jobs recuperáveis. Os agentes devem usar o helper do dispositivo assim que ele existir no host configurado:```bash
evals-appliance doctor --json
evals-appliance prepare --json --superpowers-ref <branch-tag-or-sha>
evals-appliance run-all --json --detach \
  --superpowers-ref <branch-tag-or-sha> \
  -- --tier sentinel \
     --coding-agents claude,codex,kimi \
     --jobs 4
evals-appliance status --json <job-id>
evals-appliance show --json <job-id>
evals-appliance costs --json <job-id>
evals-appliance cancel --json <job-id>

A interface alvo e as regras de operação estão em docs/appliance-runbook.md, respaldadas por docs/superpowers/specs/2026-06-18-shared-eval-appliance-design.md. doctor é somente leitura. prepare retorna lock_busy em vez de alterar referências enquanto um job ativo estiver em execução. O acesso ao host e os procedimentos de break-glass específicos do provedor são intencionalmente mantidos fora deste repositório público; use o runbook de operações privado para esses detalhes. Os comandos bun run quorum ... e scripts/evals-container exec quorum ... permanecem como fluxos de trabalho locais ou break-glass confiáveis para avaliações ao vivo compartilhadas.

Runtime do Contêiner

O runtime do Docker é a receita principal para execuções reais de suíte. Ele mantém o checkout de evals, o checkout do Superpowers em teste, credenciais, fontes de autenticação e todos os artefatos de execução no host enquanto o quorum é executado dentro de um contêiner rico de workspace Ubuntu.

Baixar ferramenta