Skip to content
KitploitKITPLOIT
ToolsBlog
Einreichen
ToolsBlog
Einreichen

Hacking-, PenTest- und Cybersicherheits-Tools für Ihr Sicherheitsarsenal!

Kitploit ist ein Verzeichnis von Hacking-, Cybersicherheits- und Pentesting-Tools. Entdecken Sie die neuesten Projekt-Updates, um Schwachstellen zu finden, Systeme zu analysieren, Tests zu automatisieren und Ihre Sicherheit zu stärken.

··Feeds·Kontakt·Datenschutz·© 2026 Kitploit

Tool-Verzeichnis

Kategorien

Alle Kategorien anzeigen
Loading categories
giskard-oss — 🐢 Open-Source-Bibliothek für Evaluierung & Tests von LLM-Agenten | Kitploit
Tools/GitHubGitHub/giskard-ai/giskard-oss
SchwachstellenscannerFuzzingMaschinelles LernenRed TeamingKI-SicherheitAdversarial-Angriff
GitHubgiskard-ai/giskard-oss

giskard-oss

🐢 Open-Source-Bibliothek für Evaluierung & Tests von LLM-Agenten

Repository anzeigen
5.8k522vor 3 TagenVon Kitploit geprüft

Beliebteste

Alle anzeigen →

Entdecken Sie die meistgenutzten Tools unserer Community.

Alle Tools erkunden

Durchsuchen Sie unsere Tool-Sammlung

Alle Tools anzeigen →
Teilen
Webseite

giskardlogo giskardlogo

Evals, Red Teaming und Testgenerierung für agentische Systeme

Modular, leichtgewichtig, dynamisch und Async-first

GitHub release License Downloads CI Giskard on Discord

Dokumentation • Website • Community


[!IMPORTANT] Giskard v3 ist eine komplett neue Implementierung, die für dynamische, mehrschrittige Tests von KI-Agenten entwickelt wurde. Dieses Release verwirft schwere Abhängigkeiten zugunsten besserer Effizienz und führt gleichzeitig einen leistungsfähigeren KI-Schwachstellenscanner und eine verbesserte RAG-Evaluierung ein – beides jetzt nativ in giskard-scan (Beta), ohne Abhängigkeit von v2. Nur der Legacy-Scan für tabellarische/ML-Modelle bleibt v2-only. Giskard v2 bleibt verfügbar, wird aber nicht mehr aktiv gepflegt. Fortschritt verfolgen → v3-Ankündigung lesen · Roadmap

Installation

root@kitploit:~
pip install giskard           # checks (+ agents, llm, core)
pip install "giskard[scan]"   # + vulnerability / quality scan
pip install "giskard[openai]" # provider SDK for LLM judges / generators

Erfordert Python 3.12+.

ExtraFügt hinzu

Telemetrie: optionale aggregierte Analysen über giskard-core. Es werden keine Prompts oder Ausgaben gesendet. Abmelden vor dem Import von Giskard: export DO_NOT_TRACK=1 oder export GISKARD_TELEMETRY_DISABLED=1. Details: giskard-core README.


Giskard ist eine Open-Source-Python-Bibliothek zum Testen und Evaluieren von agentischen Systemen. Die v3-Architektur ist eine modulare Sammlung fokussierter Pakete – jedes enthält nur die Abhängigkeiten, die es benötigt – die von Grund auf entwickelt wurde, um alles zu kapseln: ein LLM, einen Black-Box-Agenten oder eine mehrstufige Pipeline.

Diese bauen auf drei grundlegenden Bibliotheken auf – giskard-core (gemeinsame Hilfsprogramme & Telemetrie), giskard-llm (providerunabhängiges LLM-Routing) und giskard-agents (Agenten- & Workflow-Orchestrierung) – die automatisch installiert und selten direkt verwendet werden.

Giskard Checks – Evals für Agententests erstellen und anwenden

root@kitploit:~
pip install giskard-checks

Giskard Checks ist eine leichtgewichtige Bibliothek zum Erstellen von Evaluierungen (Evals), die LLM-basierte Systeme testen – von einfachen Assertions bis hin zu LLM-as-Judge-Bewertungen. Anders als herkömmliche Unit-Tests sind Evals für nicht-deterministische Ausgaben konzipiert, bei denen dieselbe Eingabe unterschiedliche gültige Antworten erzeugen kann.

Verwenden Sie Giskard Checks, um:

  • Regressionen erkennen – überprüfen, ob Ihr System nach Änderungen weiterhin korrekt funktioniert
  • RAG-Qualität validieren – prüfen, ob Antworten im abgerufenen Kontext verankert sind
  • Sicherheitsregeln durchsetzen – sicherstellen, dass Ausgaben Ihren Inhaltsrichtlinien entsprechen
  • Multi-Turn-Agenten evaluieren – vollständige Unterhaltungen testen, nicht nur einzelne Austausche

Integrierte Evals umfassen String-Matching, Vergleiche, Regex, semantische Ähnlichkeit und LLM-as-Judge-Checks (Groundedness, Conformity, LLMJudge).

Konzepte

  • Target – Ihr zu testendes System: eine beliebige synchrone/asynchrone aufrufbare Funktion (inputs) -> outputs (optional mit trace)
  • Szenario – ein Eval: Interaktionen + Checks
  • Check – Assertion oder LLM-Judge über den Trace
  • Suite – viele Szenarien laufen zusammen

giskard.agents.Generator ist ein LLM-Client für Workflows/Judges – nicht dasselbe wie die Eingabegeneratoren von giskard.checks (LLMGenerator), die Benutzernachrichten synthetisieren.

Schnellstart

root@kitploit:~
import asyncio
from giskard.checks import Scenario, Groundedness


def get_answer(inputs: str) -> str:
    return "Paris"  # replace with your model / agent


async def main() -> None:
    scenario = (
        Scenario("test_france_capital")
        .interact(inputs="What is the capital of France?", outputs=get_answer)
        .check(
            Groundedness(
                name="answer is grounded",
                context="France is in Western Europe. Its capital is Paris.",
            )
        )
    )
    result = await scenario.run()
    result.print_report()


asyncio.run(main())

Groundedness ist ein LLM-Judge – installieren Sie ein Provider-Extra (z. B. pip install "giskard[openai]") und setzen Sie den passenden API-Schlüssel. Standardmodell: openai/gpt-4o-mini.

Weitere Informationen zu Suites, LLMJudge, Multi-Turn-Szenarien und mehr finden Sie in der vollständigen Dokumentation.


Giskard Scan – Schwachstellenscanner für KI-Agenten

root@kitploit:~
pip install "giskard[scan]"   # or: pip install giskard-scan

Giskard Scan ist die Red-Teaming- und Schwachstellen-Scan-Schicht für agentische Systeme. Es generiert automatisch adversarial Test-Suiten aus einer Beschreibung Ihres Agenten in natürlicher Sprache, einschließlich Prompt-Injection, schädliche Inhalte, Stereotype, Fehlinformationen u. v. m.

Verwenden Sie Giskard Scan, um:

  • Red-Teaming für Ihren Agenten betreiben – automatisch adversarial Eingaben über die OWASP-LLM-Top-10-Bedrohungskategorien generieren
  • Prompt-Injection-Probes ausführen – integrierter Datensatz an Injection-Payloads, einsatzbereit
  • Mit benutzerdefinierten Generatoren erweitern – eigene ScenarioGenerator-Instanzen an generate_suite übergeben oder auf vulnerability_suite_generator_registry registrieren

Schnellstart

root@kitploit:~
import asyncio
from giskard.scan import vulnerability_scan


async def my_agent(inputs: str) -> str:
    # Replace with your agent / model call
    return f"Echo: {inputs}"


async def main() -> None:
    await vulnerability_scan(
        target=my_agent,
        description="A customer support chatbot for an e-commerce platform.",
        languages=["en"],
    )


asyncio.run(main())

Scan-Generatoren benötigen ebenfalls ein LLM-Provider-Extra und einen API-Schlüssel (wie die Judges der Checks oben).

Auf der Suche nach Giskard v2?

Giskard v2 enthielt Scan (automatische Schwachstellenerkennung) und RAGET (Generierung von Testdatensätzen für die RAG-Evaluierung).

Für LLM-Agenten werden beide in v3 durch giskard-scan ersetzt: Verwenden Sie vulnerability_scan anstelle des v2-LLM-Scans und quality_scan (mit KnowledgeBase) anstelle von RAGET.

v3 funktioniert auch mit ML-Modellen – kapseln Sie eines als Target und evaluieren Sie es mit giskard-checks oder giskard-scan. Was die Beispiele unten abdecken, ist der nur in v2 verfügbare automatische Tabellen-Scan – die Detektor-Suite, die ein giskard.Model + giskard.Dataset untersucht, um Leistungs-, Bias- und Robustheitsprobleme automatisch zu erkennen – zusammen mit der ML-Testsuite von giskard.testing und dem Giskard Hub. Diese sind nicht für v3 geplant.

root@kitploit:~
pip install "giskard[llm]>2,<3"

Scan – Leistungs-, Bias- und Sicherheitsprobleme automatisch erkennen

Kapseln Sie Ihr Modell und führen Sie den Scan aus:

root@kitploit:~
import giskard
import pandas as pd


# Replace my_llm_chain with your actual LLM chain or model inference logic
def model_predict(df: pd.DataFrame):
    """The function takes a DataFrame and must return a list of outputs (one per row)."""
    return [my_llm_chain.run({"query": question}) for question in df["question"]]


giskard_model = giskard.Model(
    model=model_predict,
    model_type="text_generation",
    name="My LLM Application",
    description="A question answering assistant",
    feature_names=["question"],
)

scan_results = giskard.scan(giskard_model)
display(scan_results)

Scan-Beispiel

RAGET – Evaluierungsdatensätze für RAG-Anwendungen generieren

Generieren Sie automatisch Fragen, Referenzantworten und Kontext aus Ihrer Wissensbasis:

root@kitploit:~
import pandas as pd
from giskard.rag import generate_testset, KnowledgeBase

# Load your knowledge base documents
df = pd.read_csv("path/to/your/knowledge_base.csv")
knowledge_base = KnowledgeBase.from_pandas(df, columns=["column_1", "column_2"])

testset = generate_testset(
    knowledge_base,
    num_questions=60,
    language="en",
    agent_description="A customer support chatbot for company X",
)

RAGET-Beispiel

Vollständige v2-Dokumentation

👋 Community

Wir freuen uns über Beiträge aus der KI-Community! Lesen Sie diesen Leitfaden, um loszulegen, und treten Sie unserer lebendigen Community auf Discord bei.

Verfolgen Sie den Fortschritt und teilen Sie Feedback: v3-Ankündigung · Roadmap

🌟 Hinterlassen Sie uns einen Stern – das hilft dem Projekt, von anderen entdeckt zu werden, und motiviert uns, großartige Open-Source-Tools zu entwickeln! 🌟

❤️ Wenn Sie unsere Arbeit nützlich finden, erwägen Sie bitte, uns auf GitHub zu sponsern. Mit einem monatlichen Sponsoring können Sie ein Sponsor-Badge erhalten, Ihr Unternehmen in dieser README anzeigen und eine Priorisierung Ihrer Fehlermeldungen erhalten. Wir bieten auch einmaliges Sponsoring an, wenn Sie möchten, dass wir uns in ein Beratungsprojekt einbringen, einen Workshop durchführen oder einen Vortrag bei Ihrem Unternehmen halten.

Tool herunterladen
(keine)
giskard-checks und Abhängigkeiten
scangiskard-scan
openai / anthropic / …Provider-SDKs (siehe optionale Abhängigkeiten in pyproject.toml)
StatusPaketBeschreibung
✅ Betagiskard-checksTests & Evaluierung – Szenario-API, eingebaute Checks, LLM-as-Judge
✅ Betagiskard-scanAgent-Schwachstellenscanner + RAG/Qualitätsevaluierung – Red Teaming, Prompt-Injection, Jailbreaks & schädliche Inhalte (vulnerability_scan, Nachfolger des v2 Scans), plus Wissensbasis-Qualitätsevaluierung (quality_scan, Nachfolger von v2 RAGET)