Skip to content
KitploitKITPLOIT
StrumentiExploitsBlog
Log in
Invia
StrumentiExploitsBlog
Invia

Strumenti di Hacking, PenTest e Cybersecurity per il tuo Arsenale di Sicurezza!

Kitploit è una directory di strumenti di hacking, cybersecurity e pentesting. Scopri gli ultimi aggiornamenti dei progetti per trovare vulnerabilità, analizzare sistemi, automatizzare i test e rafforzare la tua sicurezza.

FeedContattoPrivacy© 2026 Kitploit

Directory degli strumenti

Categorie

Vedi tutte le categorie
Loading categories
superpowers-evals — Laboratorio di valutazione comportamentale (Quorum) per il progetto superpowers che guida CLI di agenti di codifica reali (Claude, Codex, Gemini, Kimi e altri) attraverso un agente QA e le valuta in base alla conformità al flusso di lavoro rispetto ai criteri dello scenario e ai controlli deterministici post-esecuzione. | Kitploit
Strumenti/GitHubGitHub/prime-radiant-inc/superpowers-evals
Scripting e AutomazionePenetration TestingUtilità e FrameworkApprendimento e FormazioneSicurezza dell'IALab e Pratica
GitHubprime-radiant-inc/superpowers-evals

superpowers-evals

Vedi Repository
97122019 giorni faRevisionato da Kitploit

Più Popolari

Vedi tutti →

Scopri gli strumenti più utilizzati dalla nostra community.

Esplora tutti gli strumenti

Sfoglia la nostra collezione di strumenti

Vedi tutti gli strumenti →

Informazioni

Laboratorio di valutazione comportamentale (Quorum) per il progetto superpowers che guida CLI di agenti di codifica reali (Claude, Codex, Gemini, Kimi e altri) attraverso un agente QA e le valuta in base alla conformità al flusso di lavoro rispetto ai criteri dello scenario e ai controlli deterministici post-esecuzione.

Condividi

Superpowers Evals

Laboratorio di valutazione comportamentale per superpowers. Quorum guida CLI reali di coding-agent (Claude, Codex, Antigravity, Gemini, Kimi, OpenCode, Pi e Copilot) attraverso un agente Gauntlet QA e li valuta rispetto ai criteri di accettazione dello scenario più controlli deterministici successivi.

Codice, CLI, percorsi e prosa inline usano tutti quorum in minuscolo; la forma maiuscola Quorum appare nelle intestazioni e nella tabella degli attori.

Questa non è una suite di benchmark generica. È un laboratorio di valutazione per la conformità del flusso di lavoro: attivazione delle skill, comportamento del worktree, coordinamento dei subagenti, riflessi di verifica e pattern di modellazione dei costi.

Modello di Sicurezza

quorum ha due modalità di esecuzione molto diverse:

  • Controlli statici/di unità sono sicuri per la CI pubblica. Eseguono biome, tsc e bun test. Non chiamano API dei modelli e non avviano CLI di agenti.
  • Valutazioni live sono operazioni per manutentori fidati. Avviano Claude Code, Codex CLI, Antigravity CLI, Gemini CLI, Kimi Code, OpenCode CLI, Pi CLI, o Copilot CLI in modalità permissive e raccolgono trascrizioni grezze, chiamate di strumenti, stato del filesystem e log di sessione.

La CI pubblica deve rimanere dalla parte dei controlli statici/di unità di quella linea. Non aggiungere mai chiavi API, invocazioni live quorum run …, o lanci di agenti in modalità pericolosa alla CI pubblica.

Rischio delle Valutazioni Live

Le valutazioni live eseguono il Coding-Agent sotto test con ampi poteri di esecuzione:

  • Claude usa --dangerously-skip-permissions.
  • Codex usa --dangerously-bypass-approvals-and-sandbox.
  • Antigravity usa --dangerously-skip-permissions e si basa sull'autenticazione locale tramite browser/keyring per agy.
  • Gemini usa --skip-trust --approval-mode=yolo; l'autenticazione tramite chiave API è predefinita, con autenticazione OAuth opzionale per esecuzioni locali fidate.
  • Kimi usa --yolo.
  • OpenCode usa --dangerously-skip-permissions.
  • Pi usa elenchi di strumenti espliciti e autenticazione tramite chiave API in una directory di configurazione locale per esecuzione.
  • Copilot usa --allow-all.

quorum fissa la HOME di ogni Coding-Agent (più le directory base XDG e TMPDIR) in una home temporanea per esecuzione <run>/home — il launcher inserisce il token $QUORUM_HOME_ENV costruito da src/agents/home-env.ts (xdgHomeEnv, l'unica fonte di verità). La directory di configurazione di ogni agente è collassata sotto quella home (Claude .claude, Codex .codex, Gemini ., OpenCode ., Antigravity ., Copilot .copilot, Kimi .kimi-code, Pi .pi/agent), così il Coding-Agent trova la sua configurazione tramite il suo default $HOME e non vede mai le reali directory ~/.claude, ~/.codex, ~/.gemini, ~/.kimi-code, ~/.pi, ~/.copilot, ~/.config, o altro stato relativo alla home dell'host, plugin installati, o sessioni precedenti. Il provisioning inserisce la configurazione — e le credenziali OAuth dell'host necessarie a ciascun agente — in quella home temporanea prima del lancio, quindi non c'è login durante l'esecuzione. Copilot prepara anche il plugin locale Superpowers sotto la home isolata, usa un ambiente esterno autorizzato, e scrive un .copilot-env con segreti con chmod-0600 all'interno della directory di esecuzione. Questo restringe il raggio d'impatto ma non è una sandbox. I launcher di OpenCode e Copilot usano inoltre ambienti autorizzati, ma i Coding-Agent live vengono comunque eseguiti con ampi poteri di esecuzione di comandi e filesystem.

Esegui le valutazioni live solo da un ambiente locale affidabile:

  • Esporta solo la chiave API necessaria per il Coding-Agent selezionato.
  • Evita di eseguire con ampi segreti di produzione o personali nell'ambiente.
  • Tratta results/, i log di sessione grezzi, gli artefatti di stato di sessione/chiamate di strumenti e gli input del Gauntlet-Agent come sensibili.
  • Non committare o incollare artefatti grezzi di esecuzione senza averli prima controllati.

Avvio Rapido

Installa ed esegui i controlli statici:```bash bun install bun run check bun run quorum check

Esegui uno scenario locale o di break-glass all'esterno del contenitore:```bash
export SUPERPOWERS_ROOT=/path/to/superpowers
export ANTHROPIC_API_KEY=...
bun run quorum run scenarios/triggering-writing-plans --coding-agent claude
bun run quorum show <run-dir>

L'agente Gauntlet (driver QA) si autentica ad Anthropic con ANTHROPIC_API_KEY per impostazione predefinita. Per utilizzarlo invece da un abbonamento Claude con accesso effettuato, imposta CLAUDE_CODE_OAUTH_TOKEN (da claude setup-token) nell'ambiente (es. .env); l'harness lo passa e gauntlet lo preferisce alla chiave API. Nota: un abbonamento ha limiti di utilizzo pensati per l'uso interattivo — ad alta concorrenza i batch run-all possono raggiungerli, quindi la chiave API rimane la scelta migliore per carichi pesanti.

I nomi degli agenti sono claude, codex, antigravity, gemini, kimi, opencode, pi e copilot. Non tutti gli scenari sono validi per ogni agente.

BREAKING (credential axis): claude-haiku e claude-sonnet non sono più nomi di agenti separati. Per eseguire l'harness Claude su Sonnet o Haiku:```bash bun run quorum run scenarios/ --coding-agent claude --credential sonnet bun run quorum run scenarios/ --coding-agent claude --credential haiku

La credenziale predefinita dell'agente `claude` è `opus`.

## Shared Eval Appliance

Gli eval live remoti condivisi sono progettati per essere eseguiti da un host appliance affidabile con un bundle di credenziali approvato, provenienza esatta repo/ref, blocchi host e record di job recuperabili. Gli agenti dovrebbero utilizzare l'helper dell'appliance una volta che esiste sull'host configurato:```bash
evals-appliance doctor --json
evals-appliance prepare --json --superpowers-ref <branch-tag-or-sha>
evals-appliance run-all --json --detach \
  --superpowers-ref <branch-tag-or-sha> \
  -- --tier sentinel \
     --coding-agents claude,codex,kimi \
     --jobs 4
evals-appliance status --json <job-id>
evals-appliance show --json <job-id>
evals-appliance costs --json <job-id>
evals-appliance cancel --json <job-id>

L'interfaccia di destinazione e le regole operative si trovano in docs/appliance-runbook.md, supportate da docs/superpowers/specs/2026-06-18-shared-eval-appliance-design.md. doctor è in sola lettura. prepare restituisce lock_busy invece di modificare i riferimenti mentre un job attivo è in esecuzione. L'accesso all'host e le procedure di break-glass specifiche del provider sono intenzionalmente tenuti fuori da questo repository pubblico; usa il runbook operativo privato per quei dettagli. I comandi grezzi bun run quorum ... e scripts/evals-container exec quorum ... rimangono flussi di lavoro locali o break-glass affidabili per valutazioni live condivise.

Container Runtime

Il runtime Docker è la ricetta principale per le esecuzioni reali della suite. Mantiene il checkout degli evals, il checkout di Superpowers in test, le credenziali, le fonti di autenticazione e tutti gli artefatti di esecuzione sull'host mentre quorum viene eseguito all'interno di un contenitore workspace Ubuntu ricco.

Scarica lo strumento