🐢 Библиотека с открытым исходным кодом для оценки и тестирования LLM-агентов
[!IMPORTANT] Giskard v3 — это полностью переписанная версия, предназначенная для динамического многоходового тестирования AI-агентов. Этот релиз отбрасывает тяжёлые зависимости ради повышения эффективности, одновременно внедряя более мощный сканер уязвимостей ИИ и улучшенную оценку RAG — обе функции теперь поставляются нативно в
giskard-scanбез зависимости от v2. Только устаревшее сканирование для табличных/ML-моделей остаётся доступным только в v2. Giskard v2 остаётся доступным, но больше не поддерживается активно. Следите за прогрессом → Прочитайте анонс v3 · Дорожная карта
pip install giskard # проверки (+ agents, llm, core)
pip install "giskard[scan]" # + сканирование уязвимостей / качества
pip install "giskard[openai]" # SDK провайдера для LLM-судей / генераторов
Требуется Python 3.12+.
| Extra | Добавляет |
|---|---|
| (нет) | giskard-checks и зависимости |
scan | giskard-scan |
openai / anthropic / … | SDK провайдеров (см. опциональные зависимости в pyproject.toml) |
Телеметрия: опциональная агрегированная аналитика через giskard-core. Промпты и выходные данные не отправляются.
Отключите до импорта Giskard: export DO_NOT_TRACK=1 или export GISKARD_TELEMETRY_DISABLED=1.
Подробности: giskard-core README.
Giskard — это библиотека Python с открытым исходным кодом для тестирования и оценки агентных систем. Архитектура v3 представляет собой модульный набор узкоспециализированных пакетов — каждый несёт только те зависимости, которые ему нужны, — созданных с нуля для обёртывания чего угодно: LLM, black-box агента или многоэтапного конвейера.
| Статус | Пакет | Описание |
|---|---|---|
| ✅ Стабильный | giskard-checks | Тестирование и оценка — API сценариев, встроенные проверки, LLM-как-судья |
| ✅ Стабильный | giskard-scan | Сканер уязвимостей агентов + оценка RAG/качества — red teaming, prompt injection, jailbreaks и вредоносный контент (vulnerability_scan, преемник v2 Scan), а также оценка качества базы знаний (quality_scan, преемник v2 RAGET) |
Они построены на трёх фундаментальных библиотеках — giskard-core (общие утилиты и телеметрия), giskard-llm (независимая от провайдера маршрутизация LLM) и giskard-agents (оркестрация агентов и рабочих процессов) — которые подтягиваются автоматически и редко используются напрямую.
pip install giskard-checks
Giskard Checks — это лёгкая библиотека для создания оценок (эвалов), которые тестируют системы на основе LLM — от простых утверждений до оценок LLM-как-судья. В отличие от традиционных модульных тестов, эвалы предназначены для недетерминированных выходных данных, где один и тот же вход может давать разные допустимые ответы.
Используйте Giskard Checks для:
Встроенные эвалы включают сопоставление строк, сравнения, регулярные выражения, семантическое сходство и проверки LLM-как-судья (Groundedness, Conformity, LLMJudge).
(inputs) -> outputs (опционально с trace)giskard.agents.Generator — это LLM-клиент для рабочих процессов/судей — не то же самое, что
генераторы входных данных giskard.checks (LLMGenerator), которые синтезируют пользовательские сообщения.
import asyncio
from giskard.checks import Scenario, Groundedness
def get_answer(inputs: str) -> str:
return "Paris" # замените на вашу модель / агента
async def main() -> None:
scenario = (
Scenario("test_france_capital")
.interact(inputs="What is the capital of France?", outputs=get_answer)
.check(
Groundedness(
name="answer is grounded",
context="France is in Western Europe. Its capital is Paris.",
)
)
)
result = await scenario.run()
result.print_report()
asyncio.run(main())
Groundedness — это LLM-судья — установите extra провайдера (например, pip install "giskard[openai]") и задайте соответствующий API-ключ. Модель по умолчанию: openai/gpt-4o-mini.
См. полную документацию о Suites, LLMJudge, многоходовых сценариях и многом другом.
pip install "giskard[scan]" # или: pip install giskard-scan
Giskard Scan — это уровень red teaming и сканирования уязвимостей для агентных систем. Он автоматически генерирует наборы состязательных тестов на основе описания вашего агента на простом языке, охватывая prompt injection, вредоносный контент, стереотипы, дезинформацию и многое другое.