
🐢 Librería de código abierto para la evaluación y pruebas de agentes de LLM
[!IMPORTANT] Giskard v3 es una reescritura completa diseñada para pruebas dinámicas y multiturno de agentes de IA. Esta versión elimina las dependencias pesadas para lograr una mayor eficiencia, a la vez que introduce un escáner de vulnerabilidades de IA más potente y una evaluación RAG mejorada — ambos disponibles ahora de forma nativa en
giskard-scan(beta), sin dependencia de v2. Solo el scan heredado para modelos tabulares/ML sigue siendo exclusivo de v2. Giskard v2 sigue estando disponible, pero ya no recibe mantenimiento activo. Sigue el progreso → Lee el anuncio de v3 · Hoja de ruta
pip install giskard # checks (+ agents, llm, core)
pip install "giskard[scan]" # + vulnerability / quality scan
pip install "giskard[openai]" # provider SDK for LLM judges / generators
Requiere Python 3.12+.
| Extra | Añade |
|---|---|
Telemetría: analíticas agregadas opcionales a través de giskard-core. No se envían prompts ni salidas.
Desactívala antes de importar Giskard: export DO_NOT_TRACK=1 o export GISKARD_TELEMETRY_DISABLED=1.
Detalles: README de giskard-core.
Giskard es una librería Python de código abierto para probar y evaluar sistemas agénticos. La arquitectura v3 es un conjunto modular de paquetes especializados — cada uno con solo las dependencias que necesita — construidos desde cero para envolver cualquier cosa: un LLM, un agente de caja negra o un pipeline de varios pasos.
Estos se apoyan en tres librerías fundamentales — giskard-core (utilidades compartidas y telemetría), giskard-llm (enrutamiento de LLM independiente del proveedor) y giskard-agents (orquestación de agentes y flujos de trabajo) — que se instalan automáticamente y rara vez se usan directamente.
pip install giskard-checks
Giskard Checks es una librería ligera para crear evaluaciones (evals) que ponen a prueba sistemas basados en LLM — desde aserciones simples hasta evaluaciones con LLM como juez. A diferencia de las pruebas unitarias tradicionales, los evals están diseñados para salidas no deterministas, donde la misma entrada puede producir diferentes respuestas válidas.
Usa Giskard Checks para:
Los evals integrados incluyen coincidencia de cadenas, comparaciones, regex, similitud semántica y checks con LLM como juez (Groundedness, Conformity, LLMJudge).
(inputs) -> outputs (opcionalmente con trace)giskard.agents.Generator es un cliente LLM para flujos de trabajo/jueces — no es lo mismo que los generadores de entrada de giskard.checks (LLMGenerator), que sintetizan mensajes de usuario.
import asyncio
from giskard.checks import Scenario, Groundedness
def get_answer(inputs: str) -> str:
return "Paris" # replace with your model / agent
async def main() -> None:
scenario = (
Scenario("test_france_capital")
.interact(inputs="What is the capital of France?", outputs=get_answer)
.check(
Groundedness(
name="answer is grounded",
context="France is in Western Europe. Its capital is Paris.",
)
)
)
result = await scenario.run()
result.print_report()
asyncio.run(main())
Groundedness es un juez LLM — instala un extra de proveedor (p. ej. pip install "giskard[openai]") y configura la clave API correspondiente. Modelo por defecto: openai/gpt-4o-mini.
Consulta la documentación completa sobre Suites, LLMJudge, escenarios multiturno y más.
pip install "giskard[scan]" # or: pip install giskard-scan
Giskard Scan es la capa de red teaming y escaneo de vulnerabilidades para sistemas agénticos. Genera automáticamente suites de pruebas adversariales a partir de una descripción en lenguaje natural de tu agente, cubriendo inyección de prompts, contenido dañino, estereotipos, desinformación y más.
Usa Giskard Scan para:
ScenarioGenerator a generate_suite, o regístralas en vulnerability_suite_generator_registryimport asyncio
from giskard.scan import vulnerability_scan
async def my_agent(inputs: str) -> str:
# Replace with your agent / model call
return f"Echo: {inputs}"
async def main() -> None:
await vulnerability_scan(
target=my_agent,
description="A customer support chatbot for an e-commerce platform.",
languages=["en"],
)
asyncio.run(main())
Los generadores de Scan también necesitan un extra de proveedor LLM y una clave API (al igual que los jueces de Checks anteriores).
Giskard v2 incluía Scan (detección automática de vulnerabilidades) y RAGET (generación de conjuntos de pruebas de evaluación RAG).
Para agentes LLM, ambos quedan superados en v3 por giskard-scan: usa vulnerability_scan en lugar del scan de LLM de v2, y quality_scan (con KnowledgeBase) en lugar de RAGET.
v3 también funciona con modelos de ML — envuelve uno como target y evalúalo con giskard-checks o giskard-scan. Lo que cubren los ejemplos siguientes es el scan tabular automático exclusivo de v2 — la suite de detectores que inspecciona un giskard.Model + giskard.Dataset para detectar automáticamente problemas de rendimiento, sesgo y robustez — junto con la suite de pruebas ML giskard.testing y el Giskard Hub. No están planificados para v3.
pip install "giskard[llm]>2,<3"
Envuelve tu modelo y ejecuta el scan:
import giskard
import pandas as pd
# Replace my_llm_chain with your actual LLM chain or model inference logic
def model_predict(df: pd.DataFrame):
"""The function takes a DataFrame and must return a list of outputs (one per row)."""
return [my_llm_chain.run({"query": question}) for question in df["question"]]
giskard_model = giskard.Model(
model=model_predict,
model_type="text_generation",
name="My LLM Application",
description="A question answering assistant",
feature_names=["question"],
)
scan_results = giskard.scan(giskard_model)
display(scan_results)
Genera automáticamente preguntas, respuestas de referencia y contexto a partir de tu base de conocimiento:
import pandas as pd
from giskard.rag import generate_testset, KnowledgeBase
# Load your knowledge base documents
df = pd.read_csv("path/to/your/knowledge_base.csv")
knowledge_base = KnowledgeBase.from_pandas(df, columns=["column_1", "column_2"])
testset = generate_testset(
knowledge_base,
num_questions=60,
language="en",
agent_description="A customer support chatbot for company X",
)
¡Damos la bienvenida a las contribuciones de la comunidad de IA! Lee esta guía para empezar y únete a nuestra próspera comunidad en Discord.
Sigue el progreso y comparte tus comentarios: Anuncio de v3 · Hoja de ruta
🌟 Déjanos una estrella, ayuda a que el proyecto sea descubierto por otros y nos mantiene motivados para crear increíbles herramientas de código abierto. 🌟
❤️ Si nuestro trabajo te resulta útil, considera patrocinarnos en GitHub. Con un patrocinio mensual puedes obtener una insignia de patrocinador, mostrar tu empresa en este readme y hacer que tus informes de errores tengan prioridad. También ofrecemos patrocinio único si quieres que participemos en un proyecto de consultoría, realicemos un taller o demos una charla en tu empresa.
giskard-checks y dependencias |
scan | giskard-scan |
openai / anthropic / … | SDKs de proveedores (consulta las dependencias opcionales en pyproject.toml) |
| Estado | Paquete | Descripción |
|---|
| ✅ Beta | giskard-checks | Pruebas y evaluación — API de escenarios, checks integrados, LLM como juez |
| ✅ Beta | giskard-scan | Escáner de vulnerabilidades de agentes + evaluación RAG/calidad — red teaming, inyección de prompts, jailbreaks y contenido dañino (vulnerability_scan, sucesor del Scan de v2), además de la evaluación de calidad de bases de conocimiento (quality_scan, sucesor de RAGET de v2) |