Skip to content
KitploitKITPLOIT
उपकरणब्लॉग
जमा करें
उपकरणब्लॉग
जमा करें

हैकिंग, पेनटेस्ट और साइबर सुरक्षा उपकरण आपके सुरक्षा शस्त्रागार के लिए!

Kitploit हैकिंग, साइबर सुरक्षा और पेंटेस्टिंग टूल्स की एक निर्देशिका है। कमजोरियों को खोजने, सिस्टम का विश्लेषण करने, परीक्षण को स्वचालित करने और अपनी सुरक्षा को मजबूत करने के लिए नवीनतम प्रोजेक्ट अपडेट खोजें।

··फ़ीड·संपर्क·गोपनीयता·© 2026 Kitploit

टूल निर्देशिका

श्रेणियाँ

सभी श्रेणियाँ देखें
Loading categories
TrustworthyRAG — रिट्रीवल-ऑगमेंटेड जनरेशन सिस्टम में गलत सूचना और ज्ञान विषाक्तता (नॉलेज पॉइज़निंग) का पता लगाने के लिए एक मूल्यांकन एजेंट। | Kitploit
उपकरण/GitHubGitHub/gpt-laboratory/trustworthyrag
कोड विश्लेषणमशीन लर्निंगपेपर और शोधAI सुरक्षाविसंगति का पता लगाना
GitHubgpt-laboratory/trustworthyrag

TrustworthyRAG

रिट्रीवल-ऑगमेंटेड जनरेशन सिस्टम में गलत सूचना और ज्ञान विषाक्तता (नॉलेज पॉइज़निंग) का पता लगाने के लिए एक मूल्यांकन एजेंट।

रिपॉजिटरी देखें
1 महीना पहलेअभी तक समीक्षित नहीं

सबसे लोकप्रिय

सभी देखें →

हमारे समुदाय द्वारा सबसे अधिक उपयोग किए जाने वाले उपकरण खोजें।

सभी उपकरण खोजें

हमारे उपकरणों का संग्रह ब्राउज़ करें

सभी उपकरण देखें →
साझा करें

विश्वसनीय RAG

रिट्रीवल-ऑगमेंटेड जनरेशन सिस्टम में गलत सूचना और नॉलेज पॉइज़निंग का पता लगाने के लिए एक मूल्यांकन एजेंट।

अवलोकन

यह प्रोजेक्ट एक एकीकृत मूल्यांकन एजेंट के साथ विश्वसनीय RAG फ्रेमवर्क लागू करता है, जो तीन पूरक विश्लेषण घटकों का उपयोग करके RAG प्रतिक्रियाओं की विश्वसनीयता का आकलन करता है:

  • NLI सत्यापनकर्ता - नेचुरल लैंग्वेज इन्फ्रेंस (BART-MNLI) के माध्यम से तथ्यात्मक स्थिरता जाँच
  • पॉइज़न डिटेक्टर - मल्टी-सिग्नल प्रतिकूल सामग्री पहचान (भाषाई, संरचनात्मक, सिमेंटिक, इंट्रा/क्रॉस-डॉक्यूमेंट NLI)
  • ट्रस्ट इंडेक्स कैलकुलेटर - तथ्यात्मकता, स्थिरता और पॉइज़न सुरक्षा को संयोजित करने वाला भारित समग्र स्कोर

सिस्टम प्रत्येक RAG प्रतिक्रिया के लिए एक ट्रस्ट स्कोर (0-1) उत्पन्न करता है, जिससे नॉलेज पॉइज़निंग हमलों और हैलुसिनेटेड सामग्री का स्वचालित पता लगाना संभव होता है।

यह रिपॉजिटरी उसी शीर्षक वाले ICSEA 2026 सम्मेलन पेपर का शोध आर्टिफैक्ट है। LaTeX स्रोतों के लिए [Conference_ICSEA2026/](https://github.com/gpt-laboratory/trustworthyrag/blob/HEAD/Conference_ICSEA2026/) देखें, और नीचे पेपर अनुभाग देखें।

आर्किटेक्चर

root@kitploit:~
User Query
    |
    v
+-------------------+
|     RETRIEVER     |   Embedding (MiniLM-L6-v2 or Snowflake Arctic Embed2) + FAISS
+--------+----------+
         |
         v
+-------------------+
|     GENERATOR     |   Llama 3.3 70B / Qwen 3.5 35B / Mistral 7B Instruct via FARMI API
+--------+----------+
         |
         v
+--------------------------------------------+
|           EVALUATION AGENT                 |
|                                            |
|  NLI Verifier    Poison Detector           |
|  (factuality)    (5 detection methods)     |
|       |                |                   |
|       v                v                   |
|     Trust Index Calculator                 |
|     T = 0.4*F + 0.35*C + 0.25*(1-P)       |
+--------------------------------------------+
         |
         v
   Answer + Trust Score + Evaluation Report

प्रोजेक्ट संरचना

root@kitploit:~
src/
  retriever/              # Document retrieval (embeddings, FAISS, chunking)
  generator/              # LLM response generation (FARMI client, prompts)
  evaluation_agent/       # Core evaluation (NLI, poison detection, trust index)
  experiments/            # Experiment framework (poisoned datasets, runner)
  pipeline/               # End-to-end RAG pipeline orchestrator

tests/                    # Unit tests (78 tests, pytest)
configs/config.yaml       # All configuration parameters
figures/                  # Auto-generated charts (7 figures, 300 DPI)
run_experiment.py         # Experiment CLI (main entry point)
generate_charts.py        # Visualization generator
requirements.txt          # Python dependencies

सेटअप

root@kitploit:~
# Create and activate virtual environment
python -m venv venv
.\venv\Scripts\Activate.ps1    # Windows PowerShell
# source venv/bin/activate     # Linux/Mac

# Install dependencies
pip install -r requirements.txt

# Configure FARMI API access (required for LLM generation)
# Copy the template and fill in your own credentials:
#   cp .env.example .env       # then edit .env and set FARMI_API_KEY
# The .env file is .gitignored - never commit it or hardcode keys in source.

उपयोग

पूर्ण प्रयोग सूट चलाएँ

root@kitploit:~
python run_experiment.py --all

यह सभी प्रयोग चलाता है और स्वचालित रूप से चार्ट जनरेट करता है:

  • TruthfulQA मुख्य प्रयोग (100 सैंपल, मिश्रित पॉइज़निंग)
  • प्रति-रणनीति प्रयोग (प्रत्येक 100 सैंपल: इंजेक्शन, विरोधाभास, एंटिटी स्वैप, सूक्ष्म)
  • FEVER डेटासेट प्रयोग (100 सैंपल)
  • एब्लेशन अध्ययन (5 वेट कॉन्फ़िगरेशन, प्रत्येक 60 सैंपल)

अन्य प्रयोग विकल्प

root@kitploit:~
python run_experiment.py --quick          # Quick test (10 samples)
python run_experiment.py --samples 30     # Custom sample count
python run_experiment.py --per-strategy   # Per-strategy breakdown only
python run_experiment.py --fever          # Include FEVER dataset
python run_experiment.py --ablation       # Ablation study only
python run_experiment.py --grid           # 2x2 factorial grid (all LLM x embedding combos)
python run_experiment.py --grid --samples 50  # Full grid run (100 samples per config)

इंटरैक्टिव प्रॉम्प्ट आपको चयन करने देता है:

  • LLM: Llama 3.3 70B (प्राथमिक), Qwen 3.5 35B या Mistral 7B Instruct (तुलना)
  • एम्बेडिंग: all-MiniLM-L6-v2 (लोकल) या snowflake-arctic-embed2 (API)
  • K: रिट्रीवल गहराई — K=3 (तेज़) या K=5 (मानक, डिफ़ॉल्ट)

आप LLM_MODEL एनवायरनमेंट वेरिएबल के माध्यम से जनरेटर को गैर-इंटरैक्टिव रूप से भी पिन कर सकते हैं (configs/config.yaml और run_experiment.py के MODEL_DESCRIPTIONS से मेल खाते हुए):

root@kitploit:~
$env:LLM_MODEL = "mistral-7b-instruct"   # or "qwen3.5:35b", "llama3.3:70b"
python run_experiment.py --all

सुरक्षित-कोडिंग SDLC उपयोग केस

प्रोजेक्ट रूट से सुरक्षित-कोडिंग सहायक प्रयोग (40 OWASP/CWE नियम) को पुनः उत्पन्न करें। यह मौजूदा ExperimentRunner + PoisonedDatasetGenerator का पुनः उपयोग करता है और परिणाम data/experiments/seccode_*.json में लिखता है:

root@kitploit:~
$env:LLM_MODEL = "llama3.3:70b"; $env:HF_HUB_OFFLINE = "1"; $env:TRANSFORMERS_OFFLINE = "1"
python Conference_ICSEA2026/run_seccode_usecase.py
# Set $env:SECCODE_N = "4" first for a quick smoke run over a few rules.

केवल चार्ट पुनः जनरेट करें

root@kitploit:~
python generate_charts.py

टेस्ट चलाएँ

root@kitploit:~
pytest                    # All tests (includes slow model-loading tests)
pytest -m "not slow"      # Fast tests only (~0.4s)
pytest --cov=src          # With coverage report

प्रमुख परिणाम

प्राथमिक परिणाम (Llama 3.3 70B + all-MiniLM-L6-v2, TruthfulQA, K=5, 100 सैंपल)

हमेशा भरोसा करने वाली नेव बेसलाइन: 85% (TruthfulQA), 85% (FEVER)। FEVER बेसलाइन से कम प्रदर्शन करता है — ट्रस्ट इंडेक्स को छोटे तथ्यात्मक दावों के लिए डोमेन-विशिष्ट कैलिब्रेशन की आवश्यकता होती है।

95% कॉन्फिडेंस इंटरवल (अनुपात के लिए विल्सन, F1 के लिए पर्सेंटाइल बूटस्ट्रैप B=20,000) के साथ, प्राथमिक TruthfulQA मिश्रित परिणाम है: सटीकता 91% (CI 83.8–95.2), रिकॉल 40% (CI 19.8–64.3), F1 57.1% (CI 25.0–80.0), Δ=0.225। इंटरवल चौड़े हैं क्योंकि प्रत्येक रन में केवल 15 पॉइज़न्ड सैंपल होते हैं, इसलिए हम प्रिसिजन को बढ़ा-चढ़ाकर न बताने के लिए उन्हें रिपोर्ट करते हैं।

रणनीति-वार पहचान (TruthfulQA, प्रत्येक 100 सैंपल)

2×2 फैक्टोरियल ग्रिड (K=3, TruthfulQA, 100 सैंपल)

प्रमुख निष्कर्ष:

  • Llama के लिए एम्बेडिंग अपरिवर्तनशीलता: दोनों एम्बेडिंग मॉडल समान पहचान परिणाम देते हैं — ट्रस्ट इंडेक्स LLM-संचालित है, रिट्रीवल-संचालित नहीं
  • Qwen जनरेशन-शैली समस्या: विस्तृत/सतर्क आउटपुट क्लीन सैंपलों के लिए NLI एन्टेलमेंट कम करते हैं → 71% सटीकता, 85% नेव बेसलाइन से 14 प्रतिशत अंक नीचे
  • K संवेदनशीलता शून्य परिणाम: Llama 3.3 70B के लिए K=5, K=3 के समान पहचान प्रदर्शन उत्पन्न करता है — ट्रस्ट स्कोर सेपरेशन केवल 0.015 बदलता है; पहचान हमले की रणनीति की कठिनाई से सीमित है, रिट्रीवल गहराई से नहीं

सुरक्षित-कोडिंग SDLC उपयोग केस (OWASP/CWE)

एजेंट का एक सॉफ्टवेयर-इंजीनियरिंग अनुप्रयोग: एक सुरक्षित-कोडिंग सहायक जो OWASP Top 10 और CWE से लिए गए 40 नियमों के क्यूरेटेड ज्ञान आधार से रिट्रीव करता है (जैसे SQL इंजेक्शन के लिए पैरामीटराइज़्ड क्वेरी, अनुकूली पासवर्ड हैशिंग, TLS कॉन्फ़िगरेशन)। एक डेवलपर क्वेरी मार्गदर्शन प्राप्त करती है जिसे मूल्यांकन एजेंट LLM द्वारा अनुशंसा जारी करने से पहले जाँचता है। हम 30% नियमों को पाँच रणनीतियों के साथ सुरक्षा पेलोड के रूप में पॉइज़न करते हैं (जैसे नकली CORRECTION: निर्देश, स्वैप किया गया CWE पहचानकर्ता)।

रणनीति के अनुसार पहचान (Llama 3.3 70B + all-MiniLM-L6-v2, K=5):

  • इंजेक्शन लगभग पूर्ण रूप से अवरुद्ध होता है (F1 92.3%, Δ=0.54): एजेंट डेवलपर तक पहुँचने से पहले असुरक्षित सलाह (जैसे इनपुट वैलिडेशन अक्षम करना) डालने के खुले प्रयासों को मज़बूती से पकड़ लेता है।
  • एंटिटी स्वैप 58% रिकॉल तक बढ़ जाता है (ओपन-डोमेन TruthfulQA पर 0% की तुलना में): संरचित CWE पहचानकर्ता को बदलने से क्रॉस-डॉक्यूमेंट असंगतियाँ उत्पन्न होती हैं जिन्हें NLI सिग्नल पकड़ सकते हैं।
  • विरोधाभास और सूक्ष्म हेरफेर अभी भी पहचान से बच जाते हैं (0% रिकॉल): चुपचाप कमज़ोर की गई अनुशंसा में कोई सतही कलाकृति नहीं होती और वह समीक्षा पास कर जाती है — सुरक्षा वर्कफ़्लो में खतरनाक, कम-दृश्यता वाला मामला।

तीन-LLM तुलना और थ्रेशोल्ड स्वतंत्रता

τ=0.5 ऑपरेटिंग बिंदु से परे, ट्रस्ट इंडेक्स में तीनों LLM में मजबूत थ्रेशोल्ड-स्वतंत्र सिग्नल है (पूल्ड मिक्स्ड-स्ट्रैटेजी रन):

  • जनरेशन शैली > मॉडल आकार: Mistral 7B, ~5× छोटा होने के बावजूद Qwen 3.5 35B से बेहतर प्रदर्शन करता है — Qwen के सतर्क, विस्तृत उत्तर NLI एन्टेलमेंट को दबा देते हैं।
  • τ एक LLM-विशिष्ट हाइपरपैरामीटर है: तीनों मॉडलों को तीन अलग-अलग इष्टतम थ्रेशोल्ड (0.71 / 0.58 / 0.43) की आवश्यकता होती है। केवल-क्लीन स्कोर पर τ को कैलिब्रेट करने से फॉल्स पॉज़िटिव काटकर Qwen की सटीकता 65.5% → 74.5% हो जाती है।
  • तीनों संयोग से काफी ऊपर हैं (ROC-AUC > 0.70), इसलिए τ=0.5 पर Qwen की कमज़ोर सटीकता थ्रेशोल्डिंग की कलाकृति है, सिग्नल की अनुपस्थिति नहीं।

स्थिरता और ओवरहेड

  • रन-दर-रन भिन्नता कम है: 5 स्वतंत्र दोहरावों में मिश्रित कॉन्फ़िगरेशन 90.6 ± 0.5% सटीकता और 56.1 ± 1.3% F1 स्कोर करता है; इंजेक्शन 99.0 ± 0.0% पर अपरिवर्तनीय है। निर्णय रिट्रीव किए गए साक्ष्य द्वारा संचालित होते हैं, किसी एकल जनरेशन की शब्दावली से नहीं।
  • ओवरहेड: मूल्यांकन ≈14.7 सेकंड/सैंपल जोड़ता है (बेसलाइन RAG से ≈17× अधिक), जिसमें K=5 पर 20 तक CPU NLI पास प्रमुख हैं। यह बैच/असिंक्रोनस उपयोग (जैसे कोड-रिव्यू/CI गेट) के लिए उपयुक्त है; GPU इन्फ्रेंस से इसे 2 सेकंड से नीचे लाने का अनुमान है।

टेक स्टैक

  • LLM: Llama 3.3 70B (प्राथमिक), Qwen 3.5 35B और Mistral 7B Instruct (तुलना) — FARMI क्लस्टर, टाम्पेरे विश्वविद्यालय
  • NLI मॉडल: facebook/bart-large-mnli
  • एम्बेडिंग: all-MiniLM-L6-v2 (384-डिम), snowflake-arctic-embed2 (1024-डिम)
  • वेक्टर स्टोर: FAISS (CPU)
  • डेटासेट: TruthfulQA, FEVER (HuggingFace), और 40 क्यूरेटेड OWASP Top 10 / CWE नियमों का सुरक्षित-कोडिंग ज्ञान आधार
  • फ्रेमवर्क: Python 3.10+, PyTorch, Transformers, LangChain

ट्रस्ट इंडेक्स फॉर्मूला

root@kitploit:~
Trust = alpha * Factuality + beta * Consistency + gamma * (1 - PoisonProbability)

Default weights: alpha=0.4, beta=0.35, gamma=0.25

जब पॉइज़न प्रोबेबिलिटी 0.7 से अधिक होती है तो एक नॉन-लीनियर डैम्पनर लागू होता है: delta = 1 - 0.4 * (P - 0.70) / 0.30 — P=1.0 पर, ट्रस्ट 40% कम हो जाता है।

योगदान

  • एक स्वायत्त मूल्यांकन एजेंट जो RAG इन्फ्रेंस लूप के अंदर रक्षात्मक मिडलवेयर के रूप में कार्य करता है
  • एक पाँच-सिग्नल पॉइज़न डिटेक्टर जिसमें प्रासंगिकता-भारित एकत्रीकरण होता है (भाषाई, संरचनात्मक, इंट्रा-/क्रॉस-डॉक्यूमेंट NLI, सिमेंटिक-आउटलायर)
  • उच्च-संदूषण संदर्भों के लिए नॉन-लीनियर डैम्पनर के साथ एक समग्र ट्रस्ट इंडेक्स
  • एक प्रति-रणनीति पहचान पदानुक्रम का लक्षण वर्णन (इंजेक्शन हल → एंटिटी स्वैप अनपहचाना)
  • साक्ष्य कि जनरेशन शैली मॉडल आकार से अधिक मायने रखती है, साथ ही एक प्रति-LLM थ्रेशोल्ड कैलिब्रेशन विधि
  • एक सॉफ्टवेयर-इंजीनियरिंग सुरक्षित-कोडिंग (OWASP/CWE) SDLC उपयोग केस
  • एक पुनरुत्पादनीय फ्रेमवर्क, हमला जनरेटर और प्रयोग रिलीज़

पेपर

  • सम्मेलन पेपर — Trustworthy RAG: An Evaluation Agent for Detecting Misinformation and Knowledge Poisoning in Generative AI Systems, ICSEA 2026। LaTeX स्रोत [Conference_ICSEA2026/](https://github.com/gpt-laboratory/trustworthyrag/blob/HEAD/Conference_ICSEA2026/) में हैं।

संकलित PDF जानबूझकर इस रिलीज़ में शामिल नहीं है; इसे LaTeX स्रोतों से बनाएँ।

लेखक और संपर्क

ICSEA 2026 सम्मेलन पेपर के लेखक — टाम्पेरे विश्वविद्यालय (TUNI)।

Balkrishna Giri, MSc शोधकर्ता, सूचना प्रौद्योगिकी और संचार विज्ञान संकाय, टाम्पेरे विश्वविद्यालय
ईमेल: [email protected], [email protected]

Md Toufique Hasan, डॉक्टोरल शोधकर्ता, GPT लैब, सूचना प्रौद्योगिकी और संचार विज्ञान संकाय, टाम्पेरे विश्वविद्यालय
ईमेल: [email protected]

सह-लेखक — सूचना प्रौद्योगिकी और संचार विज्ञान संकाय, टाम्पेरे विश्वविद्यालय:

  • Dr. Jussi Rasku — [email protected]
  • Dr. Muhammad Waseem — [email protected]
  • Professor Dr. Pekka Abrahamsson — [email protected]

GPT लैब, टाम्पेरे विश्वविद्यालय में विकसित।

टूल डाउनलोड करें
डेटासेटसटीकताप्रिसिजनरिकॉलF1 स्कोरबेसलाइन की तुलना में
TruthfulQA (मिश्रित)91%100%40%57.1%+7%
FEVER (पूर्ण रन)73%20%26.7%22.9%−12%
रणनीतिसटीकताप्रिसिजनरिकॉलF1सेपरेशन
इंजेक्शन99%93.8%100%96.8%0.498
विरोधाभास92%88.9%53.3%66.7%0.311
सूक्ष्म88%100%20.0%33.3%0.149
एंटिटी स्वैप85%—0%0%0.053
LLMएम्बेडिंगसटीकताप्रिसिजनरिकॉलF1क्लीन ट्रस्टसेपरेशन
Llama 3.3 70Ball-MiniLM-L6-v291%100%40%57.1%0.8300.240
Llama 3.3 70Bsnowflake-arctic-embed291%100%40%57.1%0.7990.188
Qwen 3.5 35Ball-MiniLM-L6-v271%25.0%46.7%32.6%0.6330.161
Qwen 3.5 35Bsnowflake-arctic-embed271%28.1%60.0%38.3%0.6530.199
रणनीतिसटीकताप्रिसिजनरिकॉलF1Δ
निर्देश इंजेक्शन97.5%85.7%100.0%92.3%0.542
विरोधाभास85.0%—0.0%0.0%0.156
सूक्ष्म हेरफेर85.0%—0.0%0.0%0.066
एंटिटी स्वैप72.5%29.2%58.3%38.9%0.291
मिश्रित86.2%100.0%8.3%15.4%0.163
LLMसटीकता (τ=0.5)ROC-AUCइष्टतम τ*
Llama 3.3 70B91%0.810.71
Mistral 7B Instruct87%0.790.58
Qwen 3.5 35B69–71%0.730.43
ट्रस्ट स्तर
स्कोर रेंज
अर्थ
HIGH> 0.8विश्वसनीय
MEDIUM0.5 - 0.8महत्वपूर्ण हो तो सत्यापित करें
LOW0.3 - 0.5संभवतः समस्याएँ हैं
VERY_LOW< 0.3भरोसा न करें