Skip to content
KitploitKITPLOIT
أدواتعمليات الاستغلالالمدونة
Log in
إرسال
أدواتعمليات الاستغلالالمدونة
إرسال

أدوات الاختراق واختبار الاختراق والأمن السيبراني لترسانتك الأمنية!

Kitploit هو دليل لأدوات الاختراق والأمن السيبراني واختبار الاختراق. اكتشف آخر تحديثات المشاريع للعثور على الثغرات وتحليل الأنظمة وأتمتة الاختبارات وتعزيز أمنك.

الخلاصاتاتصالالخصوصية© 2026 Kitploit

دليل الأدوات

الفئات

عرض جميع الفئات
Loading categories
superpowers-evals — مختبر التقييم السلوكي (Quorum) لمشروع superpowers الذي يحرك واجهات سطر الأوامر الحقيقية لعوامل الترميز (Claude, Codex, Gemini, Kimi والمزيد) من خلال وكيل QA ويقيمها بناءً على الامتثال لسير العمل وفقًا لمعايير السيناريو والفحوصات اللاحقة الحتمية. | Kitploit
أدوات/GitHubGitHub/prime-radiant-inc/superpowers-evals
البرمجة النصية والأتمتةاختبار الاختراقالأدوات والمكوناتالتعلم والتعليمأمن الذكاء الاصطناعيمختبرات وتدريب عملي
GitHubprime-radiant-inc/superpowers-evals

superpowers-evals

مختبر التقييم السلوكي (Quorum) لمشروع superpowers الذي يحرك واجهات سطر الأوامر الحقيقية لعوامل الترميز (Claude, Codex, Gemini, Kimi والمزيد) من خلال وكيل QA ويقيمها بناءً على الامتثال لسير العمل وفقًا لمعايير السيناريو والفحوصات اللاحقة الحتمية.

عرض المستودع
971220منذ 19 أيامتمت المراجعة من قبل Kitploit

الأكثر شعبية

عرض الكل →

اكتشف الأدوات الأكثر استخدامًا من قبل مجتمعنا.

استكشف جميع الأدوات

تصفح مجموعتنا من الأدوات

عرض جميع الأدوات →
مشاركة

Superpowers Evals

مختبر تقييم سلوكي لـ superpowers. يدير Quorum واجهات سطر أوامر وكيل البرمجة الحقيقية (Claude, Codex, Antigravity, Gemini, Kimi, OpenCode, Pi, و Copilot) عبر وكيل ضمان الجودة Gauntlet ويقيمها مقابل معايير قبول السيناريو بالإضافة إلى فحوصات لاحقة حتمية.

جميع الشفرة و CLI والمسارات والنثر المضمن تستخدم quorum بأحرف صغيرة؛ بينما يظهر النموذج المكتوب بحروف كبيرة Quorum في العناوين وجدول الجهات الفاعلة.

هذه ليست مجموعة معايير عامة. إنه مختبر تقييم للامتثال لسير العمل: تشغيل المهارات، سلوك شجرة العمل، تنسيق الوكلاء الفرعيين، ردود فعل التحقق، جودة المراجعة، وأنماط تشكيل التكلفة.

نموذج الأمان

quorum لديه وضعان مختلفان للتنفيذ:

  • الفحوصات الثابتة/الوحدة آمنة لـ CI العام. تشغيل biome و tsc و bun test. لا تستدعي واجهات برمجة تطبيقات النموذج ولا تشغل واجهات سطر أوامر الوكيل.
  • التقييمات الحية هي عمليات يقوم بها مشرفون موثوقون. تطلق Claude Code, Codex CLI, Antigravity CLI, Gemini CLI, Kimi Code, OpenCode CLI, Pi CLI, أو Copilot CLI في أوضاع متساهلة وتجمع النصوص الأولية، استدعاءات الأدوات، حالة نظام الملفات، وسجلات الجلسة.

يجب أن يبقى CI العام على جانب الفحوصات الثابتة/الوحدة من هذا الخط. لا تضف أبدًا مفاتيح API، أو استدعاءات quorum run … الحية، أو إطلاق الوكيل في الوضع الخطير إلى CI العام.

مخاطر التقييم الحي

تشغل التقييمات الحية وكيل البرمجة قيد الاختبار بسلطة تنفيذ واسعة:

  • Claude يستخدم --dangerously-skip-permissions.
  • Codex يستخدم --dangerously-bypass-approvals-and-sandbox.
  • Antigravity يستخدم --dangerously-skip-permissions ويعتمد على مصادقة المتصفح المحلي/سلسلة المفاتيح لـ agy.
  • Gemini يستخدم --skip-trust --approval-mode=yolo؛ مصادقة مفتاح API هي الافتراضية، مع مصادقة OAuth اختيارية للتشغيل المحلي الموثوق.
  • Kimi يستخدم --yolo.
  • OpenCode يستخدم --dangerously-skip-permissions.
  • Pi يستخدم قوائم مسموح بها للأدوات ومصادقة مفتاح API في دليل تكوين محلي.
  • Copilot يستخدم --allow-all.

quorum يثبت HOME لكل وكيل برمجة (بالإضافة إلى أدلة XDG الأساسية و TMPDIR) في منزل مؤقت لكل تشغيل في <run>/home — يقوم المُشغّل بإدراج رمز $QUORUM_HOME_ENV الذي بنته src/agents/home-env.ts (xdgHomeEnv، المصدر الوحيد للحقيقة). يتم طي دليل التكوين لكل وكيل تحت ذلك المنزل (Claude .claude, Codex .codex, Gemini ., OpenCode ., Antigravity ., Copilot .copilot, Kimi .kimi-code, Pi .pi/agent)، وبالتالي يجد وكيل البرمجة تكوينه عبر إعداداته الافتراضية $HOME ولا يرى أبدًا الحالات الحقيقية للمضيف مثل ~/.claude, ~/.codex, ~/.gemini, ~/.kimi-code, ~/.pi, ~/.copilot, ~/.config، أو حالات أخرى متعلقة بالمنزل، أو المكونات الإضافية المثبتة، أو الجلسات السابقة. يغذي التزويد التكوين — وبيانات اعتماد OAuth للمضيف التي يحتاجها كل وكيل — في هذا المنزل المؤقت قبل الإطلاق، وبالتالي لا يوجد تسجيل دخول أثناء التشغيل. يقوم Copilot أيضًا بترتيب المكون الإضافي Superpowers المحلي تحت المنزل المعزول، ويستخدم بيئة خارجية مسموح بها، ويكتب ملف .copilot-env يحتوي على أسرار بصلاحية chmod-0600 داخل دليل التشغيل. يضيق ذلك نصف قطر الانفجار ولكنه ليس صندوق رمل. تستخدم مُشغّلات OpenCode و Copilot بالإضافة إلى ذلك بيئات مسموح بها، لكن وكلاء البرمجة الأحياء لا يزالون يعملون بسلطة واسعة على نظام الملفات وتنفيذ الأوامر.

قم بتشغيل التقييمات الحية فقط من بيئة محلية موثوقة:

  • قم بتصدير مفتاح API اللازم لوكيل البرمجة المحدد فقط.
  • تجنب التشغيل بأسرار إنتاجية أو شخصية واسعة في البيئة.
  • تعامل مع results/ وسجلات الجلسة الأولية وقطع أثرية حالة الجلسة/استدعاءات الأدوات ومدخلات وكيل Gauntlet على أنها حساسة.
  • لا تقم بإيداع أو لصق قطع أثرية أولية للتشغيل دون فحصها أولاً.

بدء سريع

قم بتثبيت وتشغيل البوابات الثابتة:```bash bun install bun run check bun run quorum check

نفِّذ سيناريو محلي أو سيناريو الطوارئ خارج الحاوية:```bash
export SUPERPOWERS_ROOT=/path/to/superpowers
export ANTHROPIC_API_KEY=...
bun run quorum run scenarios/triggering-writing-plans --coding-agent claude
bun run quorum show <run-dir>

يقوم وكيل Gauntlet (برنامج تشغيل ضمان الجودة) بالمصادقة مع Anthropic باستخدام ANTHROPIC_API_KEY افتراضيًا. لتشغيله من اشتراك Claude مسجل دخول بدلاً من ذلك، قم بتعيين CLAUDE_CODE_OAUTH_TOKEN (من claude setup-token) في البيئة (مثل .env)؛ يمرره الإطار ويُفضل Gauntlet استخدامه على مفتاح API. ملاحظة: الاشتراك له حدود استخدام مناسبة للاستخدام التفاعلي — يمكن لعمليات run-all ذات التزامن العالي أن تصل إليها، لذا يبقى مفتاح API الخيار الأفضل للأحمال الثقيلة.

أسماء الوكلاء هي claude, codex, antigravity, gemini, kimi, opencode, pi, و copilot. ليس كل سيناريو صحيحًا لكل وكيل.

تغيير جذري (محور بيانات الاعتماد): لم يعد claude-haiku و claude-sonnet اسمي وكيل منفصلين. لتشغيل إطار Claude ضد Sonnet أو Haiku:```bash bun run quorum run scenarios/ --coding-agent claude --credential sonnet bun run quorum run scenarios/ --coding-agent claude --credential haiku

الاعتماد الافتراضي لوحدة `claude` هو `opus`.

## جهاز التقييم المشترك

تم تصميم التقييمات الحية عن بعد المشتركة لتشغيلها من مضيف جهاز موثوق به مع حزمة اعتماد واحدة معتمدة، وسجل دقيق للمستودع/المرجع، وأقفال المضيف، وسجلات وظائف قابلة للاسترداد. يجب على العوامل استخدام مساعد الجهاز بمجرد وجوده على المضيف المكوّن:```bash
evals-appliance doctor --json
evals-appliance prepare --json --superpowers-ref <branch-tag-or-sha>
evals-appliance run-all --json --detach \
  --superpowers-ref <branch-tag-or-sha> \
  -- --tier sentinel \
     --coding-agents claude,codex,kimi \
     --jobs 4
evals-appliance status --json <job-id>
evals-appliance show --json <job-id>
evals-appliance costs --json <job-id>
evals-appliance cancel --json <job-id>

الواجهة المستهدفة وقواعد التشغيل موجودة في docs/appliance-runbook.md، مدعومة بـ docs/superpowers/specs/2026-06-18-shared-eval-appliance-design.md. doctor للقراءة فقط. يُرجع prepare lock_busy بدلاً من تغيير المراجع أثناء نشاط وظيفة حية. تم الاحتفاظ عمدًا بالوصول إلى المضيف وإجراءات break-glass الخاصة بالموفر خارج هذا المستودع العام؛ استخدم runbook العمليات الخاص لتلك التفاصيل. لا تزال أوامر bun run quorum ... و scripts/evals-container exec quorum ... سير عمل محلية أو موثوقة لـ break-glass للتقييمات الحية المشتركة.

بيئة تشغيل الحاوية

وقت تشغيل Docker هو الوصفة الأساسية لتشغيل مجموعات الاختبار الحقيقية. إنه يحتفظ بـ checkout التقييمات، و checkout Superpowers قيد الاختبار، وبيانات الاعتماد، ومصادر المصادقة، وجميع نتائج التشغيل على المضيف بينما يعمل quorum داخل حاوية workspace غنية بنظام Ubuntu.

أنشئ .env.container أو مرر ملف env صريح إلى up:```dotenv ANTHROPIC_API_KEY=... OPENAI_API_KEY=... OPENROUTER_API_KEY=... # Pi default: OpenRouter GLM 5.2 GEMINI_API_KEY=... # or GEMINI_AUTH_TYPE=oauth-personal KIMI_MODEL_API_KEY=... # unless using mounted Kimi OAuth PI_PROVIDER=... # only for raw/custom Pi env auth outside the default credential PI_MODEL=... PI_API_KEY=... COPILOT_GITHUB_TOKEN=...

ثم قم ببناء وتشغيل والتحقق من الحاوية:```bash
scripts/evals-container build
scripts/evals-container down || true
scripts/evals-container --env-file .env.container up
scripts/evals-container exec evals-tool-versions
scripts/evals-container exec quorum check

يقوم الغلاف بتركيب نسخة evals هذه في /workspace/evals، ونسخة Superpowers الأصلية في /workspace/superpowers، ومجلد results/ المضيف في /workspace/evals/results. قم بتجاوز نسخة Superpowers باستخدام --superpowers-root <dir> عندما لا يكون مسار الأصل الافتراضي هو النظام قيد الاختبار.

يتطلب بناء الصورة نسخة محلية من Gauntlet. يكتشفها الغلاف من GAUNTLET_ROOT أو من تثبيت bun link العالمي لـ Bun؛ استخدم --gauntlet-root <dir> مع build للاختيار صراحةً.

تنزيل الأداة