Skip to content
KitploitKITPLOIT
HerramientasBlog
Enviar
HerramientasBlog
Enviar

¡Herramientas de Hacking, PenTest y Ciberseguridad para tu Arsenal de Seguridad!

Kitploit es un directorio de herramientas de hacking, ciberseguridad y pentesting. Descubre las últimas actualizaciones de proyectos para encontrar vulnerabilidades, analizar sistemas, automatizar pruebas y fortalecer tu seguridad.

··Feeds·Contacto·Privacidad·© 2026 Kitploit

Directorio de Herramientas

Categorías

Ver todas las categorías
Loading categories
Herramientas/GitHubGitHub/giskard-ai/giskard-oss
Escáneres de VulnerabilidadesFuzzingAprendizaje AutomáticoRed TeamingSeguridad de IAAtaque Adversario
GitHubgiskard-ai/giskard-oss

giskard-oss

🐢 Librería de código abierto para la evaluación y pruebas de agentes de LLM

Ver Repositorio
5.8k522hace 3 díasRevisado por Kitploit

Más Populares

Ver todos →

Descubre las herramientas más usadas por nuestra comunidad.

Explora todas las herramientas

Explora nuestra colección de herramientas

Ver todas las herramientas →
Compartir
Sitio web

giskardlogo giskardlogo

Evals, Red Teaming y generación de pruebas para sistemas agénticos

Modular, ligero, dinámico y async-first

GitHub release License Downloads CI Giskard on Discord

Documentación • Sitio web • Comunidad


[!IMPORTANT] Giskard v3 es una reescritura completa diseñada para pruebas dinámicas y multiturno de agentes de IA. Esta versión elimina las dependencias pesadas para lograr una mayor eficiencia, a la vez que introduce un escáner de vulnerabilidades de IA más potente y una evaluación RAG mejorada — ambos disponibles ahora de forma nativa en giskard-scan (beta), sin dependencia de v2. Solo el scan heredado para modelos tabulares/ML sigue siendo exclusivo de v2. Giskard v2 sigue estando disponible, pero ya no recibe mantenimiento activo. Sigue el progreso → Lee el anuncio de v3 · Hoja de ruta

Instalación

root@kitploit:~
pip install giskard           # checks (+ agents, llm, core)
pip install "giskard[scan]"   # + vulnerability / quality scan
pip install "giskard[openai]" # provider SDK for LLM judges / generators

Requiere Python 3.12+.

ExtraAñade

Telemetría: analíticas agregadas opcionales a través de giskard-core. No se envían prompts ni salidas. Desactívala antes de importar Giskard: export DO_NOT_TRACK=1 o export GISKARD_TELEMETRY_DISABLED=1. Detalles: README de giskard-core.


Giskard es una librería Python de código abierto para probar y evaluar sistemas agénticos. La arquitectura v3 es un conjunto modular de paquetes especializados — cada uno con solo las dependencias que necesita — construidos desde cero para envolver cualquier cosa: un LLM, un agente de caja negra o un pipeline de varios pasos.

Estos se apoyan en tres librerías fundamentales — giskard-core (utilidades compartidas y telemetría), giskard-llm (enrutamiento de LLM independiente del proveedor) y giskard-agents (orquestación de agentes y flujos de trabajo) — que se instalan automáticamente y rara vez se usan directamente.

Giskard Checks — crea y aplica evals para probar agentes

root@kitploit:~
pip install giskard-checks

Giskard Checks es una librería ligera para crear evaluaciones (evals) que ponen a prueba sistemas basados en LLM — desde aserciones simples hasta evaluaciones con LLM como juez. A diferencia de las pruebas unitarias tradicionales, los evals están diseñados para salidas no deterministas, donde la misma entrada puede producir diferentes respuestas válidas.

Usa Giskard Checks para:

  • Detectar regresiones — verifica que tu sistema siga comportándose correctamente tras los cambios
  • Validar la calidad de RAG — comprueba si las respuestas están fundamentadas en el contexto recuperado
  • Aplicar reglas de seguridad — asegúrate de que las salidas cumplen tus políticas de contenido
  • Evaluar agentes multiturno — prueba conversaciones completas, no solo intercambios individuales

Los evals integrados incluyen coincidencia de cadenas, comparaciones, regex, similitud semántica y checks con LLM como juez (Groundedness, Conformity, LLMJudge).

Conceptos

  • Target — tu sistema bajo prueba: cualquier callable síncrono/asíncrono (inputs) -> outputs (opcionalmente con trace)
  • Scenario — un eval: interacciones + checks
  • Check — aserción o juez LLM sobre el trace
  • Suite — muchos escenarios ejecutados juntos

giskard.agents.Generator es un cliente LLM para flujos de trabajo/jueces — no es lo mismo que los generadores de entrada de giskard.checks (LLMGenerator), que sintetizan mensajes de usuario.

Inicio rápido

root@kitploit:~
import asyncio
from giskard.checks import Scenario, Groundedness


def get_answer(inputs: str) -> str:
    return "Paris"  # replace with your model / agent


async def main() -> None:
    scenario = (
        Scenario("test_france_capital")
        .interact(inputs="What is the capital of France?", outputs=get_answer)
        .check(
            Groundedness(
                name="answer is grounded",
                context="France is in Western Europe. Its capital is Paris.",
            )
        )
    )
    result = await scenario.run()
    result.print_report()


asyncio.run(main())

Groundedness es un juez LLM — instala un extra de proveedor (p. ej. pip install "giskard[openai]") y configura la clave API correspondiente. Modelo por defecto: openai/gpt-4o-mini.

Consulta la documentación completa sobre Suites, LLMJudge, escenarios multiturno y más.


Giskard Scan — escáner de vulnerabilidades para agentes de IA

root@kitploit:~
pip install "giskard[scan]"   # or: pip install giskard-scan

Giskard Scan es la capa de red teaming y escaneo de vulnerabilidades para sistemas agénticos. Genera automáticamente suites de pruebas adversariales a partir de una descripción en lenguaje natural de tu agente, cubriendo inyección de prompts, contenido dañino, estereotipos, desinformación y más.

Usa Giskard Scan para:

  • Hacer red teaming a tu agente — genera automáticamente entradas adversariales en todas las categorías de amenazas del OWASP LLM Top-10
  • Ejecutar sondas de inyección de prompts — dataset integrado de payloads de inyección listos para usar
  • Ampliar con generadores personalizados — pasa tus propias instancias de ScenarioGenerator a generate_suite, o regístralas en vulnerability_suite_generator_registry

Inicio rápido

root@kitploit:~
import asyncio
from giskard.scan import vulnerability_scan


async def my_agent(inputs: str) -> str:
    # Replace with your agent / model call
    return f"Echo: {inputs}"


async def main() -> None:
    await vulnerability_scan(
        target=my_agent,
        description="A customer support chatbot for an e-commerce platform.",
        languages=["en"],
    )


asyncio.run(main())

Los generadores de Scan también necesitan un extra de proveedor LLM y una clave API (al igual que los jueces de Checks anteriores).

¿Buscas Giskard v2?

Giskard v2 incluía Scan (detección automática de vulnerabilidades) y RAGET (generación de conjuntos de pruebas de evaluación RAG).

Para agentes LLM, ambos quedan superados en v3 por giskard-scan: usa vulnerability_scan en lugar del scan de LLM de v2, y quality_scan (con KnowledgeBase) en lugar de RAGET.

v3 también funciona con modelos de ML — envuelve uno como target y evalúalo con giskard-checks o giskard-scan. Lo que cubren los ejemplos siguientes es el scan tabular automático exclusivo de v2 — la suite de detectores que inspecciona un giskard.Model + giskard.Dataset para detectar automáticamente problemas de rendimiento, sesgo y robustez — junto con la suite de pruebas ML giskard.testing y el Giskard Hub. No están planificados para v3.

root@kitploit:~
pip install "giskard[llm]>2,<3"

Scan — detecta automáticamente problemas de rendimiento, sesgo y seguridad

Envuelve tu modelo y ejecuta el scan:

root@kitploit:~
import giskard
import pandas as pd


# Replace my_llm_chain with your actual LLM chain or model inference logic
def model_predict(df: pd.DataFrame):
    """The function takes a DataFrame and must return a list of outputs (one per row)."""
    return [my_llm_chain.run({"query": question}) for question in df["question"]]


giskard_model = giskard.Model(
    model=model_predict,
    model_type="text_generation",
    name="My LLM Application",
    description="A question answering assistant",
    feature_names=["question"],
)

scan_results = giskard.scan(giskard_model)
display(scan_results)

Ejemplo de Scan

RAGET — genera conjuntos de datos de evaluación para aplicaciones RAG

Genera automáticamente preguntas, respuestas de referencia y contexto a partir de tu base de conocimiento:

root@kitploit:~
import pandas as pd
from giskard.rag import generate_testset, KnowledgeBase

# Load your knowledge base documents
df = pd.read_csv("path/to/your/knowledge_base.csv")
knowledge_base = KnowledgeBase.from_pandas(df, columns=["column_1", "column_2"])

testset = generate_testset(
    knowledge_base,
    num_questions=60,
    language="en",
    agent_description="A customer support chatbot for company X",
)

Ejemplo de RAGET

Documentación completa de v2

👋 Comunidad

¡Damos la bienvenida a las contribuciones de la comunidad de IA! Lee esta guía para empezar y únete a nuestra próspera comunidad en Discord.

Sigue el progreso y comparte tus comentarios: Anuncio de v3 · Hoja de ruta

🌟 Déjanos una estrella, ayuda a que el proyecto sea descubierto por otros y nos mantiene motivados para crear increíbles herramientas de código abierto. 🌟

❤️ Si nuestro trabajo te resulta útil, considera patrocinarnos en GitHub. Con un patrocinio mensual puedes obtener una insignia de patrocinador, mostrar tu empresa en este readme y hacer que tus informes de errores tengan prioridad. También ofrecemos patrocinio único si quieres que participemos en un proyecto de consultoría, realicemos un taller o demos una charla en tu empresa.

Descargar herramienta
(ninguno)
giskard-checks y dependencias
scangiskard-scan
openai / anthropic / …SDKs de proveedores (consulta las dependencias opcionales en pyproject.toml)
EstadoPaqueteDescripción
✅ Betagiskard-checksPruebas y evaluación — API de escenarios, checks integrados, LLM como juez
✅ Betagiskard-scanEscáner de vulnerabilidades de agentes + evaluación RAG/calidad — red teaming, inyección de prompts, jailbreaks y contenido dañino (vulnerability_scan, sucesor del Scan de v2), además de la evaluación de calidad de bases de conocimiento (quality_scan, sucesor de RAGET de v2)