Skip to content
KitploitKITPLOIT
أدواتعمليات الاستغلالالمدونة
Log in
إرسال
أدواتعمليات الاستغلالالمدونة
إرسال

أدوات الاختراق واختبار الاختراق والأمن السيبراني لترسانتك الأمنية!

Kitploit هو دليل لأدوات الاختراق والأمن السيبراني واختبار الاختراق. اكتشف آخر تحديثات المشاريع للعثور على الثغرات وتحليل الأنظمة وأتمتة الاختبارات وتعزيز أمنك.

··الخلاصات·اتصال·الخصوصية·© 2026 Kitploit

دليل الأدوات

الفئات

عرض جميع الفئات
Loading categories
ethibench — إطار تقييم لوكلاء اختبار الاختراق المعتمدين على الذكاء الاصطناعي، يقيس اكتشاف الثغرات الموثّق باستخدام المطابقة الدلالية القائمة على نماذج اللغة الكبيرة (LLM)، والتحليل ثنائي الأجزاء، والتحليل التراكمي عبر أهداف واقعية من العالم الحقيقي. | Kitploit
أدوات/GitHubGitHub/jd0965199-oss/ethibench
أطر اختبار الاختراقتحليل الثغرات الأمنيةاختبار الاختراقتعلم الآلةالأوراق والأبحاثالتعلم والتعليمأمن الذكاء الاصطناعي
GitHubjd0965199-oss/ethibench

ethibench

إطار تقييم لوكلاء اختبار الاختراق المعتمدين على الذكاء الاصطناعي، يقيس اكتشاف الثغرات الموثّق باستخدام المطابقة الدلالية القائمة على نماذج اللغة الكبيرة (LLM)، والتحليل ثنائي الأجزاء، والتحليل التراكمي عبر أهداف واقعية من العالم الحقيقي.

عرض المستودع
31منذ 4 أشهرلم تتم المراجعة بعد

الأكثر شعبية

عرض الكل →

اكتشف الأدوات الأكثر استخدامًا من قبل مجتمعنا.

استكشف جميع الأدوات

تصفح مجموعتنا من الأدوات

عرض جميع الأدوات →
مشاركة

من البيئات المُتحكَّم بها إلى العالم الحقيقي: تقييم وكلاء اختبار الاختراق في العالم الواقعي

أصبحت وكلاء اختبار الاختراق القائمة على الذكاء الاصطناعي ذات مصداقية متزايدة بوصفها أنظمة أمن هجومية، لكن المعايير الحالية ما تزال تقدم إرشادات محدودة حول الأنظمة التي ستحقق أفضل أداء على الأهداف الواقعية. تُقيّم معظم التقييمات الحالية أهدافًا محددة مسبقًا وتحسّن الأداء وفقًا لها، مثل التقاط الأعلام، وتنفيذ الأكواد عن بُعد، وإعادة إنتاج الاستغلالات، أو تشابه المسارات، وذلك في بيئات مبسطة أو ضيقة النطاق. هذه المعايير قيّمة لقياس القدرات المحدودة، لكنها لا تلتقط بشكل كافٍ التعقيد، والاستكشاف مفتوح النهاية، واتخاذ القرارات الاستراتيجية المطلوبة في اختبار الاختراق الواقعي. نقدّم إطار عمل تقييم عمليًا ينقل التقييم من إنجاز المهام إلى اكتشاف الثغرات المُتحقق منه، مما يتيح التقييم على أهداف معقدة بما يكفي تمتد عبر أسطح هجوم متعددة وفئات ثغرات متنوعة. يجمع الإطار بين الحقيقة الأرضية المنظمة والمطابقة الدلالية القائمة على نماذج اللغة الكبيرة (LLM) لتحديد الثغرات، والحل ثنائي الأجزاء لتسجيل النتائج تحت الغموض الواقعي، والصيانة المستمرة للحقيقة الأرضية، والتقييم المتكرر والتراكمي للوكلاء العشوائيين، ومقاييس الكفاءة، واختيار حزمة مصغّرة من أجل تجريب مستدام. توسّع هذه المنهجية أحدث ما وصلت إليه التقنيات من خلال تمكين مقارنة أكثر واقعية وفائدة تشغيلية لوكلاء اختبار الاختراق القائمين على الذكاء الاصطناعي. ولتمكين إمكانية إعادة الإنتاج، ننشر أيضًا الحقيقة الأرضية المُعلَّقة من قِبل خبراء والكود الخاص ببروتوكول التقييم المقترح.

خط أنابيب التقييم لأدوات اختبار الأمان. يقارن نتائج الأدوات مع مجموعات بيانات الحقيقة الأرضية باستخدام المطابقة القائمة على نماذج اللغة الكبيرة وينتج مقاييس الدقة والاستدعاء وF1 وF0.5.

التثبيت

poetry install

يتطلب تثبيت Python 3.11+ وPoetry.

البداية السريعة

# 1. Set your LLM API key
export OPENAI_API_KEY="..."

# 2. Run evaluation
ethibench evaluate ./my_experiment --dataset path/to/dataset.yaml

# 3. View results
cat ./my_experiment/evaluation_outputs/summary.md

أوامر CLI

ethibench evaluate

يشغّل خط أنابيب التقييم الكامل على دليل تجربة.

ethibench evaluate <experiment_dir> --dataset <dataset.yaml> [options]

# Batch: evaluate all experiments in a folder
ethibench evaluate --parent-dir final_experiments/ --dataset <dataset.yaml>

# Force re-evaluation (ignore cached artifacts)
ethibench evaluate <experiment_dir> --dataset <dataset.yaml> --force

الوسائط:

  • experiment_dir — (اختياري) دليل يحتوي على أدلة فرعية للأهداف (أو أدلة فرعية run_* يحتوي كل منها على أدلة فرعية للأهداف). يمكن حذفه عند استخدام --parent-dir.

الخيارات:

  • --dataset, -d — (مطلوب) مسار ملف YAML الخاص بمجموعة البيانات.
  • --gt-dir, -g — دليل الحقيقة الأرضية. الافتراضي هو gt/ بجوار ملف YAML الخاص بمجموعة البيانات.
  • --output-dir, -o — دليل الإخراج. الافتراضي هو evaluation_outputs/ داخل دليل التجربة. يُتجاهل في وضع الدُفعات.
  • --replicates, -n — عدد نسخ المطابقة عبر نماذج اللغة الكبيرة (الافتراضي: 1).
  • --force, -f — إعادة تشغيل جميع الخطوات، متجاهلًا المخرجات المخزنة مؤقتًا. افتراضيًا، تُعاد استخدام النتائج الوسيطة الموجودة (المطابقات الأولية، المطابقات ثنائية الأجزاء، المقاييس).
  • --parent-dir, -p — المجلد الرئيسي الذي يحتوي على عدة أدلة تجارب لتقييمها دفعة واحدة. تُعتبر جميع الأدلة الفرعية المباشرة تجارب.

ما الذي يفعله:

  1. يجمع النتائج — يفحص الأدلة الفرعية للأهداف (اسم المجلد = target_id)، ويحمّل كل ملف findings.jsonl، ويُسند subset_name من ملف YAML الخاص بمجموعة البيانات.
  2. المطابقة الأولية عبر نماذج اللغة الكبيرة — يقارن كل نتيجة مع كل مُدخل في الحقيقة الأرضية باستخدام نموذج لغة كبير.
  3. المطابقة ثنائية الأجزاء — خوارزمية هنغارية لإيجاد التوزيع الأمثل 1-إلى-1.
  4. المقاييس — يحسب TP وFP وFN والتكرارات والدقة والاستدعاء وF1 وF0.5 ودرجة الخطورة لكل مجموعة فرعية.
  5. التجميع — يحسب المتوسطات عبر النسخ والتشغيلات، ويحسب الإجمالي الموزون وغير الموزون.
  6. مقاييس التكلفة — يحمّل ملف metrics.json الخاص بكل هدف إن وُجد، ويجمّع التكلفة/الرموز/المدة.
  7. الرسوم البيانية — يولّد مخططات PNG في evaluation_outputs/plots/.
  8. الملخص — يكتب ملف evaluation_outputs/summary.md.

ethibench analyze

يشغّل أدوات التحليل على مخرجات التقييم الموجودة.

ethibench analyze <experiment_dir> --dataset <dataset.yaml> [options]

# Batch: analyze all experiments and produce aggregated results
ethibench analyze --parent-dir final_experiments/ --dataset <dataset.yaml>

الوسائط:

  • experiment_dir — (اختياري) دليل التجربة المطلوب تحليله. يمكن حذفه عند استخدام --parent-dir.

الخيارات:

  • --dataset, -d — (مطلوب) مسار ملف YAML الخاص بمجموعة البيانات.
  • --gt-dir, -g — دليل الحقيقة الأرضية. الافتراضي هو gt/ بجوار ملف YAML الخاص بمجموعة البيانات.
  • --output-dir, -o — دليل مخرجات التقييم. الافتراضي هو evaluation_outputs/ داخل دليل التجربة.
  • --parent-dir, -p — المجلد الرئيسي الذي يحتوي على عدة أدلة تجارب لتحليلها دفعة واحدة. ينتج تحليلًا لكل تجربة بالإضافة إلى نتائج مجمّعة.

مخرجات كل تجربة (evaluation_outputs/analysis/):

  • duplicates.json — النتائج المتطابقة في المطابقة الأولية ولكن أُزيلت بتحسين المطابقة ثنائية الأجزاء.
  • unmatched.json — النتائج التي لا تطابق أي مُدخل في الحقيقة الأرضية (إيجابيات كاذبة).
  • statistics.json — إحصائيات تغطية الحقيقة الأرضية (GT)، وتوزيع النتائج لكل مُدخل في الحقيقة الأرضية.

المخرجات المجمّعة (فقط مع --parent-dir، في <parent-dir>/aggregated_analysis/):

  • all_duplicates.jsonl — جميع النتائج المكررة عبر جميع التجارب (صيغة JSONL، كائنات نتائج كاملة مع حقل experiment).
  • all_false_positives.jsonl — جميع النتائج غير المتطابقة/الإيجابيات الكاذبة عبر جميع التجارب (صيغة JSONL).
  • gt_statistics_avg.json — متوسط تغطية الحقيقة الأرضية لكل مجموعة فرعية، بالإضافة إلى ملخص التغطية لكل تجربة.

ethibench compare

يقارن نتائج التقييم عبر تجارب متعددة، وينتج مخططات جنبًا إلى جنب وتقريرًا ملخصًا. يجب أن يكون لكل تجربة مخرجات تقييم موجودة مسبقًا (شغّل ethibench evaluate أولاً). التسميات هي دائمًا أسماء الأدلة.

# Explicit experiment directories
ethibench compare exp-gpt4o/ exp-claude/ --output-dir comparison/

# Auto-discover all experiments under a parent folder
ethibench compare --parent-dir all-experiments/ --output-dir comparison/

# Mix: explicit dirs + auto-discovery
ethibench compare exp-extra/ --parent-dir all-experiments/ --output-dir comparison/

الوسائط:

  • experiment_dirs — (اختياري) دليل تجربة واحد أو أكثر لإدراجها بشكل صريح.

الخيارات:

  • --output-dir, -o — (مطلوب) دليل الإخراج لنتائج المقارنة.
  • --parent-dir, -p — المجلد الرئيسي لاكتشاف التجارب تلقائيًا. يُدرج أي دليل فرعي مباشر يحتوي على مجلد evaluation_outputs/، مرتبًا أبجديًا. يمكن دمجه مع قيم experiment_dirs الصريحة.

المخرجات (في --output-dir):

  • comparison.json — بيانات المقارنة الأولية لجميع التجارب.
  • plots/ — مخططات PNG جنبًا إلى جنب.
  • comparison.md — ملخص Markdown.
  • pairwise_comparison.md — مقارنة إحصائية ثنائية A/B (أفضل 4 تجارب حسب F1).
  • pairwise_comparison.tex — نسخة LaTeX من الجدول الثنائي.
  • cumulative-analysis/ — (إذا وُجدت بيانات تراكمية) تحليل الفارق (delta) الذي يقارن متوسط F1 بالتراكمي، بالإضافة إلى مخططات المقارنة التراكمية.

صيغ الملفات

النتائج (findings.jsonl)

كائن JSON واحد لكل سطر. الحقلان المطلوبان: title، description. اختيارية: url، cwe، severity، score، steps، evidence، metadata، وغيرها.

يوجد كل ملف findings.jsonl داخل دليل هدف — اسم الدليل يحدد الهدف الذي تنتمي إليه النتائج.

{"title": "SQL Injection in Login", "description": "User input not sanitized", "cwe": "89"}

الحقيقة الأرضية (*_gt.jsonl)

كائن JSON واحد لكل سطر.

{"id": "gt-001", "name": "SQL Injection", "subset_name": "MyApp", "target_id": "app", "category": "CWE-89", "description": "Database query vulnerability", "cvss": 9.8}

مجموعة البيانات YAML

- subset: "MyApp"
  weight: 1.0
  targets:
    - target_id: "app"
تنزيل الأداة