
🐢 Библиотека с открытым исходным кодом для оценки и тестирования LLM-агентов
[!IMPORTANT] Giskard v3 — это полностью переписанная версия, предназначенная для динамического многоэтапного тестирования AI-агентов. Этот релиз избавляется от тяжёлых зависимостей ради повышения эффективности и при этом включает более мощный сканер уязвимостей ИИ и улучшенную оценку RAG — обе функции теперь поставляются нативно в составе
giskard-scan(бета), без зависимости от v2. Только устаревшее сканирование для табличных/ML-моделей остаётся доступным только в v2. Giskard v2 остаётся доступным, но больше активно не поддерживается. Следите за прогрессом → Прочитать анонс v3 · Дорожная карта
pip install giskard # checks (+ agents, llm, core)
pip install "giskard[scan]" # + vulnerability / quality scan
pip install "giskard[openai]" # provider SDK for LLM judges / generators
Требуется Python 3.12+.
| Дополнение | Добавляет |
|---|---|
Телеметрия: опциональная агрегированная аналитика через giskard-core. Никакие промпты и выходные данные не отправляются.
Отключить до импорта Giskard: export DO_NOT_TRACK=1 или export GISKARD_TELEMETRY_DISABLED=1.
Подробнее: giskard-core README.
Giskard — это библиотека Python с открытым исходным кодом для тестирования и оценки агентных систем. Архитектура v3 представляет собой модульный набор специализированных пакетов — каждый несёт только те зависимости, которые ему нужны, — созданных с нуля для обёртывания чего угодно: LLM, агента «чёрного ящика» или многоэтапного конвейера.
В основе лежат три фундаментальные библиотеки — giskard-core (общие утилиты и телеметрия), giskard-llm (маршрутизация LLM независимо от провайдера) и giskard-agents (оркестрация агентов и рабочих процессов), — которые подтягиваются автоматически и редко используются напрямую.
pip install giskard-checks
Giskard Checks — это лёгкая библиотека для создания оценок (evals), которые тестируют системы на основе LLM, — от простых утверждений до проверок с LLM в роли судьи. В отличие от традиционных модульных тестов, оценки (evals) предназначены для недетерминированных выходных данных, когда один и тот же вход может давать разные допустимые ответы.
Используйте Giskard Checks, чтобы:
Встроенные оценки включают сопоставление строк, сравнения, регулярные выражения (regex), семантическую близость и проверки с LLM в роли судьи (Groundedness, Conformity, LLMJudge).
(inputs) -> outputs (опционально с trace)giskard.agents.Generator — это LLM-клиент для рабочих процессов и судей — не то же самое, что
генераторы входных данных giskard.checks (LLMGenerator), которые синтезируют пользовательские сообщения.
import asyncio
from giskard.checks import Scenario, Groundedness
def get_answer(inputs: str) -> str:
return "Paris" # replace with your model / agent
async def main() -> None:
scenario = (
Scenario("test_france_capital")
.interact(inputs="What is the capital of France?", outputs=get_answer)
.check(
Groundedness(
name="answer is grounded",
context="France is in Western Europe. Its capital is Paris.",
)
)
)
result = await scenario.run()
result.print_report()
asyncio.run(main())
Groundedness — это LLM-судья: установите дополнительный пакет провайдера (например, pip install "giskard[openai]") и задайте соответствующий API-ключ. Модель по умолчанию: openai/gpt-4o-mini.
Подробнее о Suites, LLMJudge, многоходовых сценариях и не только см. в полной документации.
pip install "giskard[scan]" # or: pip install giskard-scan
Giskard Scan — это уровень red teaming'а и сканирования уязвимостей для агентных систем. Он автоматически генерирует состязательные (adversarial) тестовые наборы на основе описания вашего агента на простом языке, покрывая инъекции промптов, вредоносный контент, стереотипы, дезинформацию и многое другое.
Используйте Giskard Scan, чтобы:
ScenarioGenerator в generate_suite или регистрируйте их в vulnerability_suite_generator_registryimport asyncio
from giskard.scan import vulnerability_scan
async def my_agent(inputs: str) -> str:
# Replace with your agent / model call
return f"Echo: {inputs}"
async def main() -> None:
await vulnerability_scan(
target=my_agent,
description="A customer support chatbot for an e-commerce platform.",
languages=["en"],
)
asyncio.run(main())
Генераторам сканирования также требуется дополнительный пакет LLM-провайдера и API-ключ (как и судьям в Checks выше).
Giskard v2 включал Scan (автоматическое обнаружение уязвимостей) и RAGET (генерацию тестовых наборов для оценки RAG).
Для LLM-агентов обе функции в v3 заменены на giskard-scan: используйте vulnerability_scan вместо сканирования LLM из v2 и quality_scan (с KnowledgeBase) вместо RAGET.
v3 также работает с ML-моделями — оберните модель как target и оценивайте её с помощью giskard-checks или giskard-scan. Примеры ниже описывают автоматическое сканирование табличных данных, доступное только в v2, — набор детекторов, который анализирует giskard.Model + giskard.Dataset для автоматического обнаружения проблем с производительностью, смещениями (bias) и устойчивостью, — а также ML-тестовый набор giskard.testing и Giskard Hub. Их перенос в v3 не планируется.
pip install "giskard[llm]>2,<3"
Оберните свою модель и запустите сканирование:
import giskard
import pandas as pd
# Replace my_llm_chain with your actual LLM chain or model inference logic
def model_predict(df: pd.DataFrame):
"""The function takes a DataFrame and must return a list of outputs (one per row)."""
return [my_llm_chain.run({"query": question}) for question in df["question"]]
giskard_model = giskard.Model(
model=model_predict,
model_type="text_generation",
name="My LLM Application",
description="A question answering assistant",
feature_names=["question"],
)
scan_results = giskard.scan(giskard_model)
display(scan_results)
Автоматически генерируйте вопросы, эталонные ответы и контекст из вашей базы знаний:
import pandas as pd
from giskard.rag import generate_testset, KnowledgeBase
# Load your knowledge base documents
df = pd.read_csv("path/to/your/knowledge_base.csv")
knowledge_base = KnowledgeBase.from_pandas(df, columns=["column_1", "column_2"])
testset = generate_testset(
knowledge_base,
num_questions=60,
language="en",
agent_description="A customer support chatbot for company X",
)
Мы приветствуем вклад от AI-сообщества! Прочитайте это руководство, чтобы начать, и присоединяйтесь к нашему процветающему сообществу в Discord.
Следите за прогрессом и делитесь обратной связью: Анонс v3 · Дорожная карта
🌟 Поставьте нам звезду — это помогает проекту стать заметнее для других и мотивирует нас создавать классные инструменты с открытым исходным кодом! 🌟
❤️ Если вы находите нашу работу полезной, пожалуйста, рассмотрите возможность спонсировать нас на GitHub. При ежемесячном спонсировании вы можете получить бейдж спонсора, разместить свою компанию в этом readme и получить приоритет при обработке ваших отчётов об ошибках. Мы также предлагаем разовое спонсирование, если вы хотите привлечь нас к консалтинговому проекту, проведению воркшопа или выступлению в вашей компании.
giskard-checks и зависимости |
scan | giskard-scan |
openai / anthropic / … | SDK провайдеров (см. опциональные зависимости в pyproject.toml) |
| Статус | Пакет | Описание |
|---|
| ✅ Beta | giskard-checks | Тестирование и оценка — API сценариев, встроенные проверки, LLM в роли судьи (LLM-as-judge) |
| ✅ Beta | giskard-scan | Сканер уязвимостей агентов + оценка RAG/качества — red teaming, инъекции промптов, джейлбрейки и вредоносный контент (vulnerability_scan, преемник v2 Scan), а также оценка качества базы знаний (quality_scan, преемник v2 RAGET) |