🐢 Open-Source-Bibliothek für Evaluierung & Tests von LLM-Agenten
[!IMPORTANT] Giskard v3 ist eine vollständige Neuentwicklung, die für dynamische Multi-Turn-Tests von KI-Agenten entwickelt wurde. Diese Version entfernt schwere Abhängigkeiten für mehr Effizienz und führt gleichzeitig einen leistungsfähigeren KI-Schwachstellenscanner und eine verbesserte RAG-Evaluierung ein – beide jetzt nativ in
giskard-scanenthalten, ohne Abhängigkeit von v2. Nur der Legacy-Scan für tabellarische/ML-Modelle bleibt v2-exklusiv. Giskard v2 bleibt verfügbar, wird aber nicht mehr aktiv gewartet. Fortschritt verfolgen → Lies die v3-Ankündigung · Roadmap
pip install giskard # checks (+ agents, llm, core)
pip install "giskard[scan]" # + vulnerability / quality scan
pip install "giskard[openai]" # provider SDK für LLM-Judges / Generatoren
Erfordert Python 3.12+.
| Extra | Fügt hinzu |
|---|---|
| (keines) | giskard-checks und Abhängigkeiten |
scan | giskard-scan |
openai / anthropic / … | Provider-SDKs (siehe optionale Abhängigkeiten in pyproject.toml) |
Telemetrie: optionale aggregierte Analysen über giskard-core. Es werden keine Prompts oder Ausgaben gesendet.
Deaktivieren vor dem Import von Giskard: export DO_NOT_TRACK=1 oder export GISKARD_TELEMETRY_DISABLED=1.
Details: giskard-core README.
Giskard ist eine Open-Source-Python-Bibliothek zum Testen und Evaluieren agentischer Systeme. Die v3-Architektur ist ein modularer Satz fokussierter Pakete – jedes trägt nur die Abhängigkeiten, die es benötigt – von Grund auf neu gebaut, um alles zu umhüllen: ein LLM, einen Black-Box-Agenten oder eine mehrstufige Pipeline.
| Status | Paket | Beschreibung |
|---|---|---|
| ✅ Stabil | giskard-checks | Testen & Evaluierung – Szenario-API, integrierte Checks, LLM-as-Judge |
| ✅ Stabil | giskard-scan | Agent-Schwachstellenscanner + RAG/Qualitäts-Evaluierung – Red Teaming, Prompt Injection, Jailbreaks & schädliche Inhalte (vulnerability_scan, Nachfolger des v2 Scan), plus Wissensbasis-Qualitäts-Evaluierung (quality_scan, Nachfolger von v2 RAGET) |
Diese bauen auf drei grundlegenden Bibliotheken auf – giskard-core (gemeinsame Dienstprogramme & Telemetrie), giskard-llm (provider-agnostisches LLM-Routing) und giskard-agents (Agenten- & Workflow-Orchestrierung) – die automatisch mitinstalliert werden und selten direkt verwendet werden.
pip install giskard-checks
Giskard Checks ist eine leichtgewichtige Bibliothek zum Erstellen von Evaluierungen (Evals), die LLM-basierte Systeme testen – von einfachen Assertions bis hin zu LLM-as-Judge-Bewertungen. Im Gegensatz zu herkömmlichen Unit-Tests sind Evals für nicht-deterministische Ausgaben konzipiert, bei denen dieselbe Eingabe verschiedene gültige Antworten erzeugen kann.
Verwende Giskard Checks, um:
Integrierte Evals umfassen String-Matching, Vergleiche, Regex, semantische Ähnlichkeit und LLM-as-Judge-Checks (Groundedness, Conformity, LLMJudge).
(inputs) -> outputs (optional mit trace)giskard.agents.Generator ist ein LLM-Client für Workflows/Judges – nicht dasselbe wie
die Eingabegeneratoren von giskard.checks (LLMGenerator), die Benutzernachrichten synthetisieren.
import asyncio
from giskard.checks import Scenario, Groundedness
def get_answer(inputs: str) -> str:
return "Paris" # durch dein Modell / deinen Agenten ersetzen
async def main() -> None:
scenario = (
Scenario("test_france_capital")
.interact(inputs="What is the capital of France?", outputs=get_answer)
.check(
Groundedness(
name="answer is grounded",
context="France is in Western Europe. Its capital is Paris.",
)
)
)
result = await scenario.run()
result.print_report()
asyncio.run(main())
Groundedness ist ein LLM-Judge – installiere ein Provider-Extra (z. B. pip install "giskard[openai]") und setze den passenden API-Schlüssel. Standardmodell: openai/gpt-4o-mini.
Siehe die vollständige Dokumentation für Suites, LLMJudge, Multi-Turn-Szenarien und mehr.
pip install "giskard[scan]" # oder: pip install giskard-scan