
व्यवहारिक मूल्यांकन प्रयोगशाला (Quorum) superpowers परियोजना के लिए जो वास्तविक कोडिंग-एजेंट CLI (Claude, Codex, Gemini, Kimi, और अन्य) को एक QA एजेंट के माध्यम से संचालित करती है और उन्हें परिदृश्य मानदंडों और नियतात्मक पोस्ट-चेक्स के विरुद्ध कार्यप्रवाह अनुपालन पर ग्रेड देती है।
Behavioural evals lab for superpowers। Quorum वास्तविक कोडिंग-एजेंट CLI (Claude, Codex, Antigravity, Gemini, Kimi, OpenCode, Pi, और Copilot) को एक Gauntlet QA एजेंट के माध्यम से चलाता है और उन्हें परिदृश्य स्वीकृति मानदंडों और नियतात्मक पोस्ट-जांचों के विरुद्ध ग्रेड करता है।
कोड, CLI, पथ, और इनलाइन गद्य सभी lowercase quorum का उपयोग करते हैं; capitalized रूप Quorum शीर्षकों और एजेंट तालिका में दिखाई देता है।
यह एक सामान्य बेंचमार्क सूट नहीं है। यह वर्कफ़्लो अनुपालन के लिए एक मूल्यांकन प्रयोगशाला है: स्किल ट्रिगरिंग, वर्कट्री व्यवहार, सबएजेंट समन्वय, सत्यापन रिफ्लेक्सिस, समीक्षा गुणवत्ता, और लागत-आकार देने वाले पैटर्न।
quorum के दो बहुत अलग निष्पादन मोड हैं:
biome, tsc, और
bun test चलाते हैं। ये मॉडल API को कॉल नहीं करते और एजेंट CLI लॉन्च नहीं करते।सार्वजनिक CI को उस रेखा के static/unit पक्ष पर रहना चाहिए। सार्वजनिक CI में कभी भी API कुंजियाँ, लाइव quorum run … आह्वान, या खतरनाक-मोड एजेंट लॉन्च न जोड़ें।
लाइव evals परीक्षण के तहत Coding-Agent को व्यापक निष्पादन शक्ति के साथ चलाते हैं:
--dangerously-skip-permissions का उपयोग करता है।--dangerously-bypass-approvals-and-sandbox का उपयोग करता है।--dangerously-skip-permissions का उपयोग करता है और agy के लिए स्थानीय
ब्राउज़र/कीरिंग प्रमाणीकरण पर निर्भर करता है।--skip-trust --approval-mode=yolo का उपयोग करता है; API-कुंजी प्रमाणीकरण डिफ़ॉल्ट है,
विश्वसनीय स्थानीय रनों के लिए वैकल्पिक OAuth प्रमाणीकरण के साथ।--yolo का उपयोग करता है।--dangerously-skip-permissions का उपयोग करता है।--allow-all का उपयोग करता है।quorum प्रत्येक Coding-Agent के HOME (साथ ही XDG बेस डिर और TMPDIR) को एक डिस्पोजेबल प्रति-रन होम पर पिन करता है <run>/home — लॉन्चर $QUORUM_HOME_ENV टोकन को जोड़ता है जो src/agents/home-env.ts (xdgHomeEnv, सत्य का एकमात्र स्रोत) द्वारा निर्मित होता है। प्रत्येक एजेंट का कॉन्फ़िग डिर उस होम के अंतर्गत समाहित होता है (Claude .claude, Codex .codex, Gemini ., OpenCode ., Antigravity ., Copilot .copilot, Kimi .kimi-code, Pi .pi/agent), ताकि Coding-Agent अपने स्वयं के $HOME डिफ़ॉल्ट के माध्यम से अपना कॉन्फ़िग ढूंढे और होस्ट के वास्तविक ~/.claude, ~/.codex, ~/.gemini, ~/.kimi-code, ~/.pi, ~/.copilot, ~/.config, या अन्य होम-संबंधित स्थिति, स्थापित प्लगइन्स, या पिछले सत्रों को कभी न देखे। प्रोविज़निंग कॉन्फ़िग को सीड करती है — और होस्ट OAuth क्रेडेंशियल्स जो प्रत्येक एजेंट को चाहिए — लॉन्च से पहले उस डिस्पोजेबल होम में, इसलिए कोई रन-टाइम लॉगिन नहीं होता। Copilot भी स्थानीय Superpowers प्लगइन को पृथक होम के अंतर्गत स्टेज करता है, एक अनुमत बाहरी वातावरण का उपयोग करता है, और एक गुप्त-युक्त chmod-0600 .copilot-env को रन डिर के अंदर लिखता है। यह विस्फोट त्रिज्या को कम करता है लेकिन सैंडबॉक्स नहीं है। OpenCode और Copilot लॉन्चर इसके अतिरिक्त अनुमत वातावरण का उपयोग करते हैं, लेकिन लाइव Coding-Agent अभी भी व्यापक फ़ाइलसिस्टम और कमांड निष्पादन शक्ति के साथ चलते हैं।
लाइव evals केवल एक विश्वसनीय स्थानीय वातावरण से चलाएं:
results/, कच्चे सत्र लॉग, सत्र-स्थिति/टूल-कॉल आर्टिफैक्ट्स, और Gauntlet-Agent इनपुट को संवेदनशील मानें।स्थिर गेट्स स्थापित करें और चलाएं:```bash bun install bun run check bun run quorum check
एक स्थानीय या break-glass परिदृश्य को कंटेनर के बाहर चलाएँ:```bash
export SUPERPOWERS_ROOT=/path/to/superpowers
export ANTHROPIC_API_KEY=...
bun run quorum run scenarios/triggering-writing-plans --coding-agent claude
bun run quorum show <run-dir>
Gauntlet-Agent (QA ड्राइवर) डिफ़ॉल्ट रूप से ANTHROPIC_API_KEY के साथ Anthropic को प्रमाणित करता है। इसके बजाय लॉग-इन किए गए Claude सब्सक्रिप्शन से इसे चलाने के लिए, पर्यावरण (जैसे .env) में CLAUDE_CODE_OAUTH_TOKEN (claude setup-token से) सेट करें; हार्नेस इसे पार्स करता है और gauntlet इसे API कुंजी पर प्राथमिकता देता है। नोट: एक सब्सक्रिप्शन में इंटरैक्टिव उपयोग के लिए आकार की उपयोग सीमाएँ होती हैं — उच्च-समवर्ती run-all बैच उन्हें हिट कर सकते हैं, इसलिए API कुंजी भारी लोड के लिए बेहतर विकल्प बनी हुई है।
एजेंट के नाम claude, codex, antigravity, gemini, kimi, opencode, pi, और copilot हैं। प्रत्येक परिदृश्य प्रत्येक एजेंट के लिए मान्य नहीं है।
ब्रेकिंग (क्रेडेंशियल एक्सिस): claude-haiku और claude-sonnet अब अलग एजेंट नाम नहीं हैं। Sonnet या Haiku के विरुद्ध Claude हार्नेस चलाने के लिए:```bash
bun run quorum run scenarios/ --coding-agent claude --credential sonnet
bun run quorum run scenarios/ --coding-agent claude --credential haiku
`claude` एजेंट का डिफ़ॉल्ट क्रेडेंशियल `opus` है।
## Shared Eval Appliance
साझा रिमोट लाइव मूल्यांकन एक विश्वसनीय उपकरण होस्ट से चलाने के लिए डिज़ाइन किए गए हैं जिसमें
एक स्वीकृत क्रेडेंशियल बंडल, सटीक repo/ref उत्पत्ति, होस्ट लॉक, और
पुनर्प्राप्त करने योग्य कार्य रिकॉर्ड हों। एजेंट को कॉन्फ़िगर्ड होस्ट पर उपकरण सहायक का उपयोग करना चाहिए जब यह मौजूद हो:```bash
evals-appliance doctor --json
evals-appliance prepare --json --superpowers-ref <branch-tag-or-sha>
evals-appliance run-all --json --detach \
--superpowers-ref <branch-tag-or-sha> \
-- --tier sentinel \
--coding-agents claude,codex,kimi \
--jobs 4
evals-appliance status --json <job-id>
evals-appliance show --json <job-id>
evals-appliance costs --json <job-id>
evals-appliance cancel --json <job-id>
लक्ष्य इंटरफ़ेस और संचालन नियम यहाँ हैं
docs/appliance-runbook.md, और इसके पीछे
docs/superpowers/specs/2026-06-18-shared-eval-appliance-design.md है।
doctor केवल-पढ़ने योग्य है। prepare एक सक्रिय कार्य चलने के दौरान refs बदलने के बजाय lock_busy लौटाता है।
होस्ट एक्सेस और प्रदाता-विशिष्ट break-glass प्रक्रियाओं को जानबूझकर इस सार्वजनिक रिपॉजिटरी से बाहर रखा गया है; उन विवरणों के लिए निजी ops runbook का उपयोग करें।
सीधे bun run quorum ... और scripts/evals-container exec quorum ... साझा लाइव eval के लिए स्थानीय या विश्वसनीय break-glass वर्कफ़्लो बने रहते हैं।
डॉकर रनटाइम वास्तविक सुइट रन के लिए प्राथमिक रेसिपी है। यह evals चेकआउट, परीक्षण के तहत Superpowers चेकआउट, क्रेडेंशियल्स, प्रमाणीकरण स्रोत, और सभी रन आर्टिफैक्ट्स को होस्ट पर रखता है जबकि quorum एक समृद्ध Ubuntu वर्कस्पेस कंटेनर के अंदर चलता है।