Skip to content
KitploitKITPLOIT
أدواتالمدونة
إرسال
أدواتالمدونة
إرسال

أدوات الاختراق واختبار الاختراق والأمن السيبراني لترسانتك الأمنية!

Kitploit هو دليل لأدوات الاختراق والأمن السيبراني واختبار الاختراق. اكتشف آخر تحديثات المشاريع للعثور على الثغرات وتحليل الأنظمة وأتمتة الاختبارات وتعزيز أمنك.

··الخلاصات·اتصال·الخصوصية·© 2026 Kitploit

دليل الأدوات

الفئات

عرض جميع الفئات
Loading categories
TrustworthyRAG — عامل تقييم لكشف المعلومات المضللة وتسمم المعرفة في أنظمة التوليد المعزز بالاسترجاع. | Kitploit
أدوات/GitHubGitHub/gpt-laboratory/trustworthyrag
تحليل الكودتعلم الآلةالأوراق والأبحاثأمن الذكاء الاصطناعيكشف الشذوذ
GitHubgpt-laboratory/trustworthyrag

TrustworthyRAG

عامل تقييم لكشف المعلومات المضللة وتسمم المعرفة في أنظمة التوليد المعزز بالاسترجاع.

عرض المستودع
منذ شهر واحدلم تتم المراجعة بعد

الأكثر شعبية

عرض الكل →

اكتشف الأدوات الأكثر استخدامًا من قبل مجتمعنا.

استكشف جميع الأدوات

تصفح مجموعتنا من الأدوات

عرض جميع الأدوات →
مشاركة

Trustworthy RAG

وكيل تقييم لكشف المعلومات المضللة وتسميم المعرفة في أنظمة التوليد المعزز بالاسترجاع.

نظرة عامة

ينفّذ هذا المشروع إطار Trustworthy RAG مع وكيل تقييم مدمج يقيّم موثوقية استجابات RAG باستخدام ثلاثة مكونات تحليلية متكاملة:

  • مدقّق NLI - فحص الاتساق الواقعي عبر الاستدلال اللغوي الطبيعي (BART-MNLI)
  • كاشف التسميم - كشف متعدد الإشارات للمحتوى العدائي (لغوي، بنيوي، دلالي، NLI داخل/عبر المستندات)
  • حاسبة مؤشر الثقة - درجة مركّبة موزونة تجمع بين الواقعية والاتساق وسلامة التسميم

ينتج النظام درجة ثقة (0-1) لكل استجابة RAG، مما يتيح الكشف الآلي عن هجمات تسميم المعرفة والمحتوى الهلوسي.

هذا المستودع هو النتاج البحثي لورقة مؤتمر ICSEA 2026 التي تحمل العنوان نفسه. راجع [Conference_ICSEA2026/](https://github.com/gpt-laboratory/trustworthyrag/blob/HEAD/Conference_ICSEA2026/) للحصول على مصادر LaTeX، وقسم الورقة أدناه.

البنية

root@kitploit:~
User Query
    |
    v
+-------------------+
|     RETRIEVER     |   Embedding (MiniLM-L6-v2 or Snowflake Arctic Embed2) + FAISS
+--------+----------+
         |
         v
+-------------------+
|     GENERATOR     |   Llama 3.3 70B / Qwen 3.5 35B / Mistral 7B Instruct via FARMI API
+--------+----------+
         |
         v
+--------------------------------------------+
|           EVALUATION AGENT                 |
|                                            |
|  NLI Verifier    Poison Detector           |
|  (factuality)    (5 detection methods)     |
|       |                |                   |
|       v                v                   |
|     Trust Index Calculator                 |
|     T = 0.4*F + 0.35*C + 0.25*(1-P)       |
+--------------------------------------------+
         |
         v
   Answer + Trust Score + Evaluation Report

هيكل المشروع

root@kitploit:~
src/
  retriever/              # Document retrieval (embeddings, FAISS, chunking)
  generator/              # LLM response generation (FARMI client, prompts)
  evaluation_agent/       # Core evaluation (NLI, poison detection, trust index)
  experiments/            # Experiment framework (poisoned datasets, runner)
  pipeline/               # End-to-end RAG pipeline orchestrator

tests/                    # Unit tests (78 tests, pytest)
configs/config.yaml       # All configuration parameters
figures/                  # Auto-generated charts (7 figures, 300 DPI)
run_experiment.py         # Experiment CLI (main entry point)
generate_charts.py        # Visualization generator
requirements.txt          # Python dependencies

الإعداد

root@kitploit:~
# Create and activate virtual environment
python -m venv venv
.\venv\Scripts\Activate.ps1    # Windows PowerShell
# source venv/bin/activate     # Linux/Mac

# Install dependencies
pip install -r requirements.txt

# Configure FARMI API access (required for LLM generation)
# Copy the template and fill in your own credentials:
#   cp .env.example .env       # then edit .env and set FARMI_API_KEY
# The .env file is .gitignored - never commit it or hardcode keys in source.

الاستخدام

تشغيل مجموعة التجارب الكاملة

root@kitploit:~
python run_experiment.py --all

يشغّل هذا جميع التجارب ويولّد الرسوم البيانية تلقائيًا:

  • تجربة TruthfulQA الرئيسية (100 عينة، تسميم مختلط)
  • تجارب حسب الاستراتيجية (100 عينة لكل منها: الحقن، التناقض، استبدال الكيان، الخفي)
  • تجربة مجموعة بيانات FEVER (100 عينة)
  • دراسة الاجتثاث (5 إعدادات أوزان، 60 عينة لكل منها)

خيارات التجارب الأخرى

root@kitploit:~
python run_experiment.py --quick          # Quick test (10 samples)
python run_experiment.py --samples 30     # Custom sample count
python run_experiment.py --per-strategy   # Per-strategy breakdown only
python run_experiment.py --fever          # Include FEVER dataset
python run_experiment.py --ablation       # Ablation study only
python run_experiment.py --grid           # 2x2 factorial grid (all LLM x embedding combos)
python run_experiment.py --grid --samples 50  # Full grid run (100 samples per config)

يتيح لك الموجه التفاعلي اختيار:

  • LLM: Llama 3.3 70B (أساسي)، Qwen 3.5 35B أو Mistral 7B Instruct (للمقارنة)
  • التضمين: all-MiniLM-L6-v2 (محلي) أو snowflake-arctic-embed2 (API)
  • K: عمق الاسترجاع — K=3 (أسرع) أو K=5 (قياسي، افتراضي)

يمكنك أيضًا تثبيت المولّد دون تفاعل عبر متغير البيئة LLM_MODEL (بما يطابق configs/config.yaml وMODEL_DESCRIPTIONS في run_experiment.py):

root@kitploit:~
$env:LLM_MODEL = "mistral-7b-instruct"   # or "qwen3.5:35b", "llama3.3:70b"
python run_experiment.py --all

حالة استخدام SDLC للبرمجة الآمنة

أعد إنتاج تجربة مساعد البرمجة الآمنة (40 قاعدة OWASP/CWE) من جذر المشروع. يعيد استخدام ExperimentRunner وPoisonedDatasetGenerator الحاليين ويكتب النتائج إلى data/experiments/seccode_*.json:

root@kitploit:~
$env:LLM_MODEL = "llama3.3:70b"; $env:HF_HUB_OFFLINE = "1"; $env:TRANSFORMERS_OFFLINE = "1"
python Conference_ICSEA2026/run_seccode_usecase.py
# Set $env:SECCODE_N = "4" first for a quick smoke run over a few rules.

إعادة توليد الرسوم البيانية فقط

root@kitploit:~
python generate_charts.py

تشغيل الاختبارات

root@kitploit:~
pytest                    # All tests (includes slow model-loading tests)
pytest -m "not slow"      # Fast tests only (~0.4s)
pytest --cov=src          # With coverage report

النتائج الرئيسية

النتائج الأساسية (Llama 3.3 70B + all-MiniLM-L6-v2، TruthfulQA، K=5، 100 عينة)

خط الأساس الساذج الذي يثق دائمًا: 85% (TruthfulQA)، 85% (FEVER).

أداء FEVER أدنى من خط الأساس — يتطلب مؤشر الثقة معايرة خاصة بالمجال للادعاءات الواقعية القصيرة.

مع فواصل ثقة 95% (Wilson للنسب، bootstrap المئوي B=20,000 لـ F1)، تكون النتيجة المختلطة الأساسية لـ TruthfulQA: دقة 91% (CI 83.8–95.2)، استدعاء 40% (CI 19.8–64.3)، F1 بنسبة 57.1% (CI 25.0–80.0)، Δ=0.225. الفواصل واسعة لأن كل تشغيلة تحتوي على 15 عينة مسمومة فقط، لذلك نذكرها لتجنب المبالغة في تقدير الدقة.

الكشف حسب الاستراتيجية (TruthfulQA، 100 عينة لكل منها)

الشبكة العاملية 2×2 (K=3، TruthfulQA، 100 عينة)

النتائج الرئيسية:

  • ثبات التضمين بالنسبة إلى Llama: ينتج نموذجا التضمين نتائج كشف متطابقة — مؤشر الثقة مدفوع بـ LLM وليس بالاسترجاع
  • مشكلة أسلوب توليد Qwen: المخرجات المطوّلة/المراوغة تقلل من استلزام NLI للعينات النظيفة → دقة 71%، أقل بـ 14 نقطة مئوية من خط الأساس الساذج البالغ 85%
  • نتيجة صفرية لحساسية K: ينتج K=5 أداء كشف مطابقًا لـ K=3 بالنسبة إلى Llama 3.3 70B — لا يتغير فصل درجة الثقة إلا بمقدار 0.015؛ الكشف مقيد بصعوبة استراتيجية الهجوم، وليس بعمق الاسترجاع

حالة استخدام SDLC للبرمجة الآمنة (OWASP/CWE)

تطبيق هندسي برمجي للوكيل: مساعد برمجة آمنة يسترجع من قاعدة معرفية منسقة تضم 40 قاعدة مستمدة من OWASP Top 10 وCWE (مثل الاستعلامات المعلّمة لمنع حقن SQL، وتجزئة كلمات المرور التكيفية، وإعداد TLS). يسترجع استعلام المطوّر إرشادات يفحصها وكيل التقييم قبل أن يصدر LLM توصيته. نسمّم 30% من القواعد باستخدام الاستراتيجيات الخمس كحمولات أمنية (مثل توجيه CORRECTION: زائف، أو معرف CWE مستبدل).

الكشف حسب الاستراتيجية (Llama 3.3 70B + all-MiniLM-L6-v2، K=5):

  • يُحجب الحقن بشكل شبه مثالي (F1 92.3%، Δ=0.54): يلتقط الوكيل بشكل موثوق المحاولات العلنية لإدراج نصائح غير آمنة (مثل تعطيل التحقق من المدخلات) قبل وصولها إلى المطوّر.
  • يرتفع استدعاء استبدال الكيان إلى 58% (مقابل 0% على TruthfulQA مفتوح المجال): تغيير معرف CWE المنظم يُدخل تناقضات عبر المستندات يمكن لإشارات NLI التقاطها.
  • لا يزال التناقض والتلاعب الخفي يتفاديان الكشف (استدعاء 0%): التوصية المُوهَنة بهدوء لا تحمل أي أثر سطحي وتجتاز المراجعة — الحالة الخطرة منخفضة الرؤية في سير عمل أمني.

مقارنة ثلاثة نماذج LLM واستقلالية العتبة

إلى جانب نقطة التشغيل τ=0.5، يمتلك مؤشر الثقة إشارة قوية مستقلة عن العتبة عبر ثلاثة نماذج LLM (تشغيلات مجمعة بمزيج من الاستراتيجيات):

  • أسلوب التوليد > حجم النموذج: يتفوق Mistral 7B على Qwen 3.5 35B رغم كونه أصغر بنحو ~5× — إجابات Qwen المراوغة والمطوّلة تخفض استلزام NLI.
  • τ معامل تشعبي خاص بكل LLM: تحتاج النماذج الثلاثة إلى ثلاث عتبات مثلى مختلفة (0.71 / 0.58 / 0.43). معايرة τ على درجات العينات النظيفة فقط تعيد دقة Qwen من 65.5% إلى 74.5% عبر خفض الإيجابيات الكاذبة.
  • تقع النماذج الثلاثة جميعها أعلى بكثير من الصدفة (ROC-AUC > 0.70)، لذا فإن دقة Qwen الضعيفة عند τ=0.5 هي أثر عتبة وليس غيابًا للإشارة.

الاستقرار والعبء الإضافي

  • التباين من تشغيل لآخر منخفض: عبر 5 تكرارات مستقلة، تسجل الإعدادات المختلطة دقة 90.6 ± 0.5% وF1 بمقدار 56.1 ± 1.3%؛ الحقن ثابت عند 99.0 ± 0.0%. الأحكام مدفوعة بالأدلة المسترجعة، وليس بصياغة توليد واحدة.
  • العبء الإضافي: يضيف التقييم ≈14.7 ثانية/عينة (≈17× مقارنة بـ RAG الأساسي)، ويهيمن عليه ما يصل إلى 20 تمريرة NLI على CPU عند K=5. هذا مناسب للاستخدام الدفعي/غير المتزامن (مثل بوابة مراجعة الكود/CI)؛ ومن المتوقع أن يخفض استدلال GPU هذا إلى أقل من ثانيتين.

الرصة التقنية

  • نماذج LLM: Llama 3.3 70B (أساسي)، Qwen 3.5 35B وMistral 7B Instruct (للمقارنة) — عنقود FARMI، جامعة تامبيري
  • نموذج NLI: facebook/bart-large-mnli
  • التضمينات: all-MiniLM-L6-v2 (384-بعد)، snowflake-arctic-embed2 (1024-بعد)
  • متجر المتجهات: FAISS (CPU)
  • مجموعات البيانات: TruthfulQA، FEVER (HuggingFace)، وقاعدة معرفة للبرمجة الآمنة تضم 40 قاعدة منسقة من OWASP Top 10 / CWE
  • الإطار: Python 3.10+، PyTorch، Transformers، LangChain

صيغة مؤشر الثقة

root@kitploit:~
Trust = alpha * Factuality + beta * Consistency + gamma * (1 - PoisonProbability)

Default weights: alpha=0.4, beta=0.35, gamma=0.25

يُطبَّق مخمّد غير خطي عندما تتجاوز احتمالية التسميم 0.7: delta = 1 - 0.4 * (P - 0.70) / 0.30 — عند P=1.0، تنخفض الثقة بنسبة 40%.

المساهمات

  • وكيل تقييم مستقل يعمل كبرمجية وسيطة دفاعية داخل حلقة استدلال RAG
  • كاشف تسميم بخمس إشارات مع تجميع مرجّح بالأهمية (لغوي، بنيوي، NLI داخل/عبر المستندات، شاذ دلالي)
  • مؤشر ثقة مركّب مع مخمّد غير خطي لسياقات التلوث العالي
  • توصيف تسلسل هرمي للكشف حسب الاستراتيجية (الحقن مُحل → استبدال الكيان غير مكتشف)
  • أدلة على أن أسلوب التوليد أهم من حجم النموذج، بالإضافة إلى طريقة معايرة عتبة لكل LLM
  • حالة استخدام SDLC للبرمجة الآمنة (OWASP/CWE) في الهندسة البرمجية
  • إطار قابل لإعادة الإنتاج، ومولّد هجمات، وإصدار تجارب

الورقة

  • ورقة مؤتمر — Trustworthy RAG: An Evaluation Agent for Detecting Misinformation and Knowledge Poisoning in Generative AI Systems، ICSEA 2026. مصادر LaTeX موجودة في [Conference_ICSEA2026/](https://github.com/gpt-laboratory/trustworthyrag/blob/HEAD/Conference_ICSEA2026/).

لا يتضمن هذا الإصدار ملف PDF المجمَّع عن قصد؛ يمكنك بناؤه من مصادر LaTeX.

المؤلفون والتواصل

مؤلفو ورقة مؤتمر ICSEA 2026 — جامعة تامبيري (TUNI).

Balkrishna Giri، باحث ماجستير، كلية تكنولوجيا المعلومات وعلوم الاتصال، جامعة تامبيري
البريد الإلكتروني: [email protected]، [email protected]

Md Toufique Hasan، باحث دكتوراه، مختبر GPT، كلية تكنولوجيا المعلومات وعلوم الاتصال، جامعة تامبيري
البريد الإلكتروني: [email protected]

المؤلفون المشاركون — كلية تكنولوجيا المعلومات وعلوم الاتصال، جامعة تامبيري:

  • د. Jussi Rasku — [email protected]
  • د. Muhammad Waseem — [email protected]
  • أ.د. Pekka Abrahamsson — [email protected]

طُوّر في مختبر GPT بجامعة تامبيري.

تنزيل الأداة
مجموعة البياناتالدقةالضبطالاستدعاءدرجة F1مقابل خط الأساس
TruthfulQA (مختلط)91%100%40%57.1%+7%
FEVER (تشغيل كامل)73%20%26.7%22.9%−12%
الاستراتيجيةالدقةالضبطالاستدعاءF1الفصل
الحقن99%93.8%100%96.8%0.498
التناقض92%88.9%53.3%66.7%0.311
الخفي88%100%20.0%33.3%0.149
استبدال الكيان85%—0%0%0.053
LLMالتضمينالدقةالضبطالاستدعاءF1ثقة العينات النظيفةالفصل
Llama 3.3 70Ball-MiniLM-L6-v291%100%40%57.1%0.8300.240
Llama 3.3 70Bsnowflake-arctic-embed291%100%40%57.1%0.7990.188
Qwen 3.5 35Ball-MiniLM-L6-v271%25.0%46.7%32.6%0.6330.161
Qwen 3.5 35Bsnowflake-arctic-embed271%28.1%60.0%38.3%0.6530.199
الاستراتيجيةالدقةالضبطالاستدعاءF1Δ
حقن التعليمات97.5%85.7%100.0%92.3%0.542
التناقض85.0%—0.0%0.0%0.156
التلاعب الخفي85.0%—0.0%0.0%0.066
استبدال الكيان72.5%29.2%58.3%38.9%0.291
مختلط86.2%100.0%8.3%15.4%0.163
LLMالدقة (τ=0.5)ROC-AUCτ* الأمثل
Llama 3.3 70B91%0.810.71
Mistral 7B Instruct87%0.790.58
Qwen 3.5 35B69–71%0.730.43
مستوى الثقة
نطاق الدرجة
المعنى
HIGH> 0.8موثوق
MEDIUM0.5 - 0.8تحقق إذا كان مهمًا
LOW0.3 - 0.5من المحتمل أن به مشكلات
VERY_LOW< 0.3لا تثق به