Skip to content
KitploitKITPLOIT
उपकरणएक्सप्लॉइटब्लॉग
Log in
जमा करें
उपकरणएक्सप्लॉइटब्लॉग
जमा करें

हैकिंग, पेनटेस्ट और साइबर सुरक्षा उपकरण आपके सुरक्षा शस्त्रागार के लिए!

Kitploit हैकिंग, साइबर सुरक्षा और पेंटेस्टिंग टूल्स की एक निर्देशिका है। कमजोरियों को खोजने, सिस्टम का विश्लेषण करने, परीक्षण को स्वचालित करने और अपनी सुरक्षा को मजबूत करने के लिए नवीनतम प्रोजेक्ट अपडेट खोजें।

··फ़ीड·संपर्क·गोपनीयता·© 2026 Kitploit

टूल निर्देशिका

श्रेणियाँ

सभी श्रेणियाँ देखें
Loading categories
superpowers-evals — व्यवहारिक मूल्यांकन प्रयोगशाला (Quorum) superpowers परियोजना के लिए जो वास्तविक कोडिंग-एजेंट CLI (Claude, Codex, Gemini, Kimi, और अन्य) को एक QA एजेंट के माध्यम से संचालित करती है और उन्हें परिदृश्य मानदंडों और नियतात्मक पोस्ट-चेक्स के विरुद्ध कार्यप्रवाह अनुपालन पर ग्रेड देती है। | Kitploit
उपकरण/GitHubGitHub/prime-radiant-inc/superpowers-evals
स्क्रिप्टिंग और स्वचालनपेनिट्रेशन टेस्टिंगउपयोगिताएँ और फ्रेमवर्कलर्निंग और शिक्षाAI सुरक्षालैब और अभ्यास
GitHubprime-radiant-inc/superpowers-evals

superpowers-evals

रिपॉजिटरी देखें
97122018 दिन पहलेKitploit द्वारा समीक्षित

सबसे लोकप्रिय

सभी देखें →

हमारे समुदाय द्वारा सबसे अधिक उपयोग किए जाने वाले उपकरण खोजें।

सभी उपकरण खोजें

हमारे उपकरणों का संग्रह ब्राउज़ करें

सभी उपकरण देखें →

विवरण

व्यवहारिक मूल्यांकन प्रयोगशाला (Quorum) superpowers परियोजना के लिए जो वास्तविक कोडिंग-एजेंट CLI (Claude, Codex, Gemini, Kimi, और अन्य) को एक QA एजेंट के माध्यम से संचालित करती है और उन्हें परिदृश्य मानदंडों और नियतात्मक पोस्ट-चेक्स के विरुद्ध कार्यप्रवाह अनुपालन पर ग्रेड देती है।

साझा करें

Superpowers Evals

Behavioural evals lab for superpowers। Quorum वास्तविक कोडिंग-एजेंट CLI (Claude, Codex, Antigravity, Gemini, Kimi, OpenCode, Pi, और Copilot) को एक Gauntlet QA एजेंट के माध्यम से चलाता है और उन्हें परिदृश्य स्वीकृति मानदंडों और नियतात्मक पोस्ट-जांचों के विरुद्ध ग्रेड करता है।

कोड, CLI, पथ, और इनलाइन गद्य सभी lowercase quorum का उपयोग करते हैं; capitalized रूप Quorum शीर्षकों और एजेंट तालिका में दिखाई देता है।

यह एक सामान्य बेंचमार्क सूट नहीं है। यह वर्कफ़्लो अनुपालन के लिए एक मूल्यांकन प्रयोगशाला है: स्किल ट्रिगरिंग, वर्कट्री व्यवहार, सबएजेंट समन्वय, सत्यापन रिफ्लेक्सिस, समीक्षा गुणवत्ता, और लागत-आकार देने वाले पैटर्न।

Safety Model

quorum के दो बहुत अलग निष्पादन मोड हैं:

  • Static/unit checks सार्वजनिक CI के लिए सुरक्षित हैं। ये biome, tsc, और bun test चलाते हैं। ये मॉडल API को कॉल नहीं करते और एजेंट CLI लॉन्च नहीं करते।
  • Live evals trusted-maintainer संचालन हैं। ये Claude Code, Codex CLI, Antigravity CLI, Gemini CLI, Kimi Code, OpenCode CLI, Pi CLI, या Copilot CLI को अनुमेय मोड में लॉन्च करते हैं और कच्चे ट्रांसक्रिप्ट, टूल कॉल, फ़ाइलसिस्टम स्थिति, और सत्र लॉग एकत्र करते हैं।

सार्वजनिक CI को उस रेखा के static/unit पक्ष पर रहना चाहिए। सार्वजनिक CI में कभी भी API कुंजियाँ, लाइव quorum run … आह्वान, या खतरनाक-मोड एजेंट लॉन्च न जोड़ें।

Live Eval Risk

लाइव evals परीक्षण के तहत Coding-Agent को व्यापक निष्पादन शक्ति के साथ चलाते हैं:

  • Claude --dangerously-skip-permissions का उपयोग करता है।
  • Codex --dangerously-bypass-approvals-and-sandbox का उपयोग करता है।
  • Antigravity --dangerously-skip-permissions का उपयोग करता है और agy के लिए स्थानीय ब्राउज़र/कीरिंग प्रमाणीकरण पर निर्भर करता है।
  • Gemini --skip-trust --approval-mode=yolo का उपयोग करता है; API-कुंजी प्रमाणीकरण डिफ़ॉल्ट है, विश्वसनीय स्थानीय रनों के लिए वैकल्पिक OAuth प्रमाणीकरण के साथ।
  • Kimi --yolo का उपयोग करता है।
  • OpenCode --dangerously-skip-permissions का उपयोग करता है।
  • Pi स्पष्ट टूल अनुमति सूचियों और API-कुंजी प्रमाणीकरण का उपयोग करता है एक रन-लोकल कॉन्फ़िग डिर में।
  • Copilot --allow-all का उपयोग करता है।

quorum प्रत्येक Coding-Agent के HOME (साथ ही XDG बेस डिर और TMPDIR) को एक डिस्पोजेबल प्रति-रन होम पर पिन करता है <run>/home — लॉन्चर $QUORUM_HOME_ENV टोकन को जोड़ता है जो src/agents/home-env.ts (xdgHomeEnv, सत्य का एकमात्र स्रोत) द्वारा निर्मित होता है। प्रत्येक एजेंट का कॉन्फ़िग डिर उस होम के अंतर्गत समाहित होता है (Claude .claude, Codex .codex, Gemini ., OpenCode ., Antigravity ., Copilot .copilot, Kimi .kimi-code, Pi .pi/agent), ताकि Coding-Agent अपने स्वयं के $HOME डिफ़ॉल्ट के माध्यम से अपना कॉन्फ़िग ढूंढे और होस्ट के वास्तविक ~/.claude, ~/.codex, ~/.gemini, ~/.kimi-code, ~/.pi, ~/.copilot, ~/.config, या अन्य होम-संबंधित स्थिति, स्थापित प्लगइन्स, या पिछले सत्रों को कभी न देखे। प्रोविज़निंग कॉन्फ़िग को सीड करती है — और होस्ट OAuth क्रेडेंशियल्स जो प्रत्येक एजेंट को चाहिए — लॉन्च से पहले उस डिस्पोजेबल होम में, इसलिए कोई रन-टाइम लॉगिन नहीं होता। Copilot भी स्थानीय Superpowers प्लगइन को पृथक होम के अंतर्गत स्टेज करता है, एक अनुमत बाहरी वातावरण का उपयोग करता है, और एक गुप्त-युक्त chmod-0600 .copilot-env को रन डिर के अंदर लिखता है। यह विस्फोट त्रिज्या को कम करता है लेकिन सैंडबॉक्स नहीं है। OpenCode और Copilot लॉन्चर इसके अतिरिक्त अनुमत वातावरण का उपयोग करते हैं, लेकिन लाइव Coding-Agent अभी भी व्यापक फ़ाइलसिस्टम और कमांड निष्पादन शक्ति के साथ चलते हैं।

लाइव evals केवल एक विश्वसनीय स्थानीय वातावरण से चलाएं:

  • चयनित Coding-Agent के लिए आवश्यक API कुंजी ही निर्यात करें।
  • व्यापक उत्पादन या व्यक्तिगत गुप्त जानकारी को वातावरण में रखने से बचें।
  • results/, कच्चे सत्र लॉग, सत्र-स्थिति/टूल-कॉल आर्टिफैक्ट्स, और Gauntlet-Agent इनपुट को संवेदनशील मानें।
  • कच्चे रन आर्टिफैक्ट्स को पहले जांचे बिना कमिट या पेस्ट न करें।

Quick Start

स्थिर गेट्स स्थापित करें और चलाएं:```bash bun install bun run check bun run quorum check

एक स्थानीय या break-glass परिदृश्य को कंटेनर के बाहर चलाएँ:```bash
export SUPERPOWERS_ROOT=/path/to/superpowers
export ANTHROPIC_API_KEY=...
bun run quorum run scenarios/triggering-writing-plans --coding-agent claude
bun run quorum show <run-dir>

Gauntlet-Agent (QA ड्राइवर) डिफ़ॉल्ट रूप से ANTHROPIC_API_KEY के साथ Anthropic को प्रमाणित करता है। इसके बजाय लॉग-इन किए गए Claude सब्सक्रिप्शन से इसे चलाने के लिए, पर्यावरण (जैसे .env) में CLAUDE_CODE_OAUTH_TOKEN (claude setup-token से) सेट करें; हार्नेस इसे पार्स करता है और gauntlet इसे API कुंजी पर प्राथमिकता देता है। नोट: एक सब्सक्रिप्शन में इंटरैक्टिव उपयोग के लिए आकार की उपयोग सीमाएँ होती हैं — उच्च-समवर्ती run-all बैच उन्हें हिट कर सकते हैं, इसलिए API कुंजी भारी लोड के लिए बेहतर विकल्प बनी हुई है।

एजेंट के नाम claude, codex, antigravity, gemini, kimi, opencode, pi, और copilot हैं। प्रत्येक परिदृश्य प्रत्येक एजेंट के लिए मान्य नहीं है।

ब्रेकिंग (क्रेडेंशियल एक्सिस): claude-haiku और claude-sonnet अब अलग एजेंट नाम नहीं हैं। Sonnet या Haiku के विरुद्ध Claude हार्नेस चलाने के लिए:```bash bun run quorum run scenarios/ --coding-agent claude --credential sonnet bun run quorum run scenarios/ --coding-agent claude --credential haiku

`claude` एजेंट का डिफ़ॉल्ट क्रेडेंशियल `opus` है।

## Shared Eval Appliance

साझा रिमोट लाइव मूल्यांकन एक विश्वसनीय उपकरण होस्ट से चलाने के लिए डिज़ाइन किए गए हैं जिसमें
एक स्वीकृत क्रेडेंशियल बंडल, सटीक repo/ref उत्पत्ति, होस्ट लॉक, और
पुनर्प्राप्त करने योग्य कार्य रिकॉर्ड हों। एजेंट को कॉन्फ़िगर्ड होस्ट पर उपकरण सहायक का उपयोग करना चाहिए जब यह मौजूद हो:```bash
evals-appliance doctor --json
evals-appliance prepare --json --superpowers-ref <branch-tag-or-sha>
evals-appliance run-all --json --detach \
  --superpowers-ref <branch-tag-or-sha> \
  -- --tier sentinel \
     --coding-agents claude,codex,kimi \
     --jobs 4
evals-appliance status --json <job-id>
evals-appliance show --json <job-id>
evals-appliance costs --json <job-id>
evals-appliance cancel --json <job-id>

लक्ष्य इंटरफ़ेस और संचालन नियम यहाँ हैं docs/appliance-runbook.md, और इसके पीछे docs/superpowers/specs/2026-06-18-shared-eval-appliance-design.md है। doctor केवल-पढ़ने योग्य है। prepare एक सक्रिय कार्य चलने के दौरान refs बदलने के बजाय lock_busy लौटाता है। होस्ट एक्सेस और प्रदाता-विशिष्ट break-glass प्रक्रियाओं को जानबूझकर इस सार्वजनिक रिपॉजिटरी से बाहर रखा गया है; उन विवरणों के लिए निजी ops runbook का उपयोग करें। सीधे bun run quorum ... और scripts/evals-container exec quorum ... साझा लाइव eval के लिए स्थानीय या विश्वसनीय break-glass वर्कफ़्लो बने रहते हैं।

कंटेनर रनटाइम

डॉकर रनटाइम वास्तविक सुइट रन के लिए प्राथमिक रेसिपी है। यह evals चेकआउट, परीक्षण के तहत Superpowers चेकआउट, क्रेडेंशियल्स, प्रमाणीकरण स्रोत, और सभी रन आर्टिफैक्ट्स को होस्ट पर रखता है जबकि quorum एक समृद्ध Ubuntu वर्कस्पेस कंटेनर के अंदर चलता है।

टूल डाउनलोड करें