🐢 LLM एजेंटों के लिए ओपन-सोर्स मूल्यांकन एवं परीक्षण लाइब्रेरी
[!IMPORTANT] Giskard v3 AI एजेंटों के डायनामिक, मल्टी-टर्न परीक्षण के लिए डिज़ाइन किया गया एक नया रीराइट है। यह रिलीज़ बेहतर दक्षता के लिए भारी निर्भरताओं को हटाती है, साथ ही एक अधिक शक्तिशाली AI भेद्यता स्कैनर और उन्नत RAG मूल्यांकन पेश करती है — दोनों अब
giskard-scanमें मूल रूप से शामिल हैं, जिनकी v2 पर कोई निर्भरता नहीं है। केवल tabular/ML मॉडल के लिए लीगेसी स्कैन v2-केवल बना हुआ है। Giskard v2 उपलब्ध है लेकिन अब सक्रिय रूप से अनुरक्षित नहीं है। प्रगति का अनुसरण करें → v3 घोषणा पढ़ें · रोडमैप
pip install giskard # checks (+ agents, llm, core)
pip install "giskard[scan]" # + vulnerability / quality scan
pip install "giskard[openai]" # provider SDK for LLM judges / generators
Python 3.12+ की आवश्यकता है।
| Extra | जोड़ता है |
|---|---|
| (कोई नहीं) | giskard-checks और निर्भरताएँ |
scan | giskard-scan |
openai / anthropic / … | provider SDKs (देखें pyproject.toml वैकल्पिक निर्भरताएँ) |
टेलीमेट्री: giskard-core के माध्यम से वैकल्पिक समग्र विश्लेषण। कोई प्रॉम्प्ट या आउटपुट नहीं भेजे जाते।
Giskard आयात करने से पहले ऑप्ट-आउट करें: export DO_NOT_TRACK=1 या export GISKARD_TELEMETRY_DISABLED=1।
विवरण: giskard-core README।
Giskard एक ओपन-सोर्स Python लाइब्रेरी है जो एजेंटिक सिस्टम के परीक्षण और मूल्यांकन के लिए है। v3 आर्किटेक्चर केंद्रित पैकेजों का एक मॉड्यूलर सेट है — प्रत्येक केवल उन निर्भरताओं को ले जाता है जिनकी उसे आवश्यकता होती है — जो किसी भी चीज़ को लपेटने के लिए शुरू से बनाया गया है: एक LLM, एक ब्लैक-बॉक्स एजेंट, या एक मल्टी-स्टेप पाइपलाइन।
| स्थिति | पैकेज | विवरण |
|---|---|---|
| ✅ स्थिर | giskard-checks | परीक्षण और मूल्यांकन — परिदृश्य API, अंतर्निहित जाँचें, LLM-as-judge |
| ✅ स्थिर | giskard-scan | एजेंट भेद्यता स्कैनर + RAG/गुणवत्ता मूल्यांकन — red teaming, प्रॉम्प्ट इंजेक्शन, jailbreaks और हानिकारक सामग्री (vulnerability_scan, v2 Scan का उत्तराधिकारी), साथ ही ज्ञान-आधार गुणवत्ता मूल्यांकन (quality_scan, v2 RAGET का उत्तराधिकारी) |
ये तीन मूलभूत लाइब्रेरियों पर निर्मित हैं — giskard-core (साझा उपयोगिताएँ और टेलीमेट्री), giskard-llm (provider-agnostic LLM रूटिंग), और giskard-agents (एजेंट और वर्कफ़्लो ऑर्केस्ट्रेशन) — जो स्वचालित रूप से खींची जाती हैं और शायद ही कभी सीधे उपयोग की जाती हैं।
pip install giskard-checks
Giskard Checks एक हल्की लाइब्रेरी है जो LLM-आधारित सिस्टम का परीक्षण करने वाले मूल्यांकन (evals) बनाने के लिए है — सरल assertions से लेकर LLM-as-judge आकलन तक। पारंपरिक यूनिट टेस्ट के विपरीत, evals गैर-नियतात्मक आउटपुट के लिए डिज़ाइन किए गए हैं जहाँ समान इनपुट अलग-अलग मान्य प्रतिक्रियाएँ उत्पन्न कर सकता है।
Giskard Checks का उपयोग करें:
अंतर्निहित evals में स्ट्रिंग मिलान, तुलना, regex, शब्दार्थ समानता, और LLM-as-judge जाँचें (Groundedness, Conformity, LLMJudge) शामिल हैं।
(inputs) -> outputs (वैकल्पिक रूप से trace के साथ)giskard.agents.Generator वर्कफ़्लो/जजों के लिए एक LLM क्लाइंट है — यह giskard.checks इनपुट जनरेटर (LLMGenerator) के समान नहीं है जो उपयोगकर्ता संदेशों को संश्लेषित करते हैं।
import asyncio
from giskard.checks import Scenario, Groundedness
def get_answer(inputs: str) -> str:
return "Paris" # replace with your model / agent
async def main() -> None:
scenario = (
Scenario("test_france_capital")
.interact(inputs="What is the capital of France?", outputs=get_answer)
.check(
Groundedness(
name="answer is grounded",
context="France is in Western Europe. Its capital is Paris.",
)
)
)
result = await scenario.run()
result.print_report()
asyncio.run(main())
Groundedness एक LLM जज है — एक provider extra इंस्टॉल करें (जैसे pip install "giskard[openai]") और संबंधित API कुंजी सेट करें। डिफ़ॉल्ट मॉडल: openai/gpt-4o-mini।
Suites, LLMJudge, मल्टी-टर्न परिदृश्यों और अधिक के लिए पूर्ण दस्तावेज़ देखें।
pip install "giskard[scan]" # या: pip install giskard-scan
Giskard Scan एजेंटिक सिस्टम के लिए red-teaming और भेद्यता स्कैनिंग परत है। यह आपके एजेंट के सादे-भाषा विवरण से स्वचालित रूप से प्रतिकूल परीक्षण सुइट उत्पन्न करता है, जिसमें प्रॉम्प्ट इंजेक्शन, हानिकारक सामग्री, रूढ़ियाँ, गलत सूचना और बहुत कुछ शामिल है।
Giskard Scan का उपयोग करें: