Skip to content
KitploitKITPLOIT
ИнструментыБлог
Отправить
ИнструментыБлог
Отправить

Инструменты для хакинга, пентеста и кибербезопасности — ваш арсенал защиты!

Kitploit — это каталог инструментов для хакинга, кибербезопасности и пентестинга. Находите последние обновления проектов для поиска уязвимостей, анализа систем, автоматизации тестирования и усиления вашей безопасности.

··Ленты·Контакты·Конфиденциальность·© 2026 Kitploit

Каталог инструментов

Категории

Все категории
Loading categories
giskard-oss — 🐢 Библиотека с открытым исходным кодом для оценки и тестирования LLM-агентов | Kitploit
Инструменты/GitHubGitHub/giskard-ai/giskard-oss
Сканеры уязвимостейФаззингМашинное ОбучениеRed TeamingБезопасность ИИСостязательная Атака
GitHubgiskard-ai/giskard-oss

giskard-oss

🐢 Библиотека с открытым исходным кодом для оценки и тестирования LLM-агентов

Репозиторий
5.8k5223 дней назадПроверено Kitploit

Популярное

Смотреть все →

Откройте для себя самые используемые инструменты нашего сообщества.

Изучить все инструменты

Просмотрите нашу коллекцию инструментов

Смотреть все инструменты →
Поделиться
Сайт

giskardlogo giskardlogo

Evals, Red Teaming и генерация тестов для агентных систем

Модульный, лёгкий, динамичный и Async-first

GitHub release License Downloads CI Giskard on Discord

Документация • Сайт • Сообщество


[!IMPORTANT] Giskard v3 — это полностью переписанная версия, предназначенная для динамического многоэтапного тестирования AI-агентов. Этот релиз избавляется от тяжёлых зависимостей ради повышения эффективности и при этом включает более мощный сканер уязвимостей ИИ и улучшенную оценку RAG — обе функции теперь поставляются нативно в составе giskard-scan (бета), без зависимости от v2. Только устаревшее сканирование для табличных/ML-моделей остаётся доступным только в v2. Giskard v2 остаётся доступным, но больше активно не поддерживается. Следите за прогрессом → Прочитать анонс v3 · Дорожная карта

Установка

root@kitploit:~
pip install giskard           # checks (+ agents, llm, core)
pip install "giskard[scan]"   # + vulnerability / quality scan
pip install "giskard[openai]" # provider SDK for LLM judges / generators

Требуется Python 3.12+.

ДополнениеДобавляет

Телеметрия: опциональная агрегированная аналитика через giskard-core. Никакие промпты и выходные данные не отправляются. Отключить до импорта Giskard: export DO_NOT_TRACK=1 или export GISKARD_TELEMETRY_DISABLED=1. Подробнее: giskard-core README.


Giskard — это библиотека Python с открытым исходным кодом для тестирования и оценки агентных систем. Архитектура v3 представляет собой модульный набор специализированных пакетов — каждый несёт только те зависимости, которые ему нужны, — созданных с нуля для обёртывания чего угодно: LLM, агента «чёрного ящика» или многоэтапного конвейера.

В основе лежат три фундаментальные библиотеки — giskard-core (общие утилиты и телеметрия), giskard-llm (маршрутизация LLM независимо от провайдера) и giskard-agents (оркестрация агентов и рабочих процессов), — которые подтягиваются автоматически и редко используются напрямую.

Giskard Checks — создавайте и применяйте оценки (evals) для тестирования агентов

root@kitploit:~
pip install giskard-checks

Giskard Checks — это лёгкая библиотека для создания оценок (evals), которые тестируют системы на основе LLM, — от простых утверждений до проверок с LLM в роли судьи. В отличие от традиционных модульных тестов, оценки (evals) предназначены для недетерминированных выходных данных, когда один и тот же вход может давать разные допустимые ответы.

Используйте Giskard Checks, чтобы:

  • Выявлять регрессии — проверять, что ваша система по-прежнему работает корректно после изменений
  • Проверять качество RAG — убеждаться, что ответы основаны на извлечённом контексте
  • Соблюдать правила безопасности — гарантировать, что выходные данные соответствуют вашим политикам контента
  • Оценивать многоходовых агентов — тестировать полные диалоги, а не только отдельные обмены сообщениями

Встроенные оценки включают сопоставление строк, сравнения, регулярные выражения (regex), семантическую близость и проверки с LLM в роли судьи (Groundedness, Conformity, LLMJudge).

Концепции

  • Target — ваша тестируемая система: любая синхронная или асинхронная вызываемая функция (inputs) -> outputs (опционально с trace)
  • Scenario — одна оценка: взаимодействия и проверки
  • Check — утверждение или LLM-судья по результатам trace
  • Suite — множество сценариев, запускаемых вместе

giskard.agents.Generator — это LLM-клиент для рабочих процессов и судей — не то же самое, что генераторы входных данных giskard.checks (LLMGenerator), которые синтезируют пользовательские сообщения.

Быстрый старт

root@kitploit:~
import asyncio
from giskard.checks import Scenario, Groundedness


def get_answer(inputs: str) -> str:
    return "Paris"  # replace with your model / agent


async def main() -> None:
    scenario = (
        Scenario("test_france_capital")
        .interact(inputs="What is the capital of France?", outputs=get_answer)
        .check(
            Groundedness(
                name="answer is grounded",
                context="France is in Western Europe. Its capital is Paris.",
            )
        )
    )
    result = await scenario.run()
    result.print_report()


asyncio.run(main())

Groundedness — это LLM-судья: установите дополнительный пакет провайдера (например, pip install "giskard[openai]") и задайте соответствующий API-ключ. Модель по умолчанию: openai/gpt-4o-mini.

Подробнее о Suites, LLMJudge, многоходовых сценариях и не только см. в полной документации.


Giskard Scan — сканер уязвимостей для AI-агентов

root@kitploit:~
pip install "giskard[scan]"   # or: pip install giskard-scan

Giskard Scan — это уровень red teaming'а и сканирования уязвимостей для агентных систем. Он автоматически генерирует состязательные (adversarial) тестовые наборы на основе описания вашего агента на простом языке, покрывая инъекции промптов, вредоносный контент, стереотипы, дезинформацию и многое другое.

Используйте Giskard Scan, чтобы:

  • Проводить red teaming вашего агента — автоматически генерировать состязательные входные данные по категориям угроз из OWASP LLM Top-10
  • Запускать зондирование на инъекции промптов — встроенный набор готовых инъекционных нагрузок (payloads)
  • Расширять с помощью собственных генераторов — передавайте свои экземпляры ScenarioGenerator в generate_suite или регистрируйте их в vulnerability_suite_generator_registry

Быстрый старт

root@kitploit:~
import asyncio
from giskard.scan import vulnerability_scan


async def my_agent(inputs: str) -> str:
    # Replace with your agent / model call
    return f"Echo: {inputs}"


async def main() -> None:
    await vulnerability_scan(
        target=my_agent,
        description="A customer support chatbot for an e-commerce platform.",
        languages=["en"],
    )


asyncio.run(main())

Генераторам сканирования также требуется дополнительный пакет LLM-провайдера и API-ключ (как и судьям в Checks выше).

Ищете Giskard v2?

Giskard v2 включал Scan (автоматическое обнаружение уязвимостей) и RAGET (генерацию тестовых наборов для оценки RAG).

Для LLM-агентов обе функции в v3 заменены на giskard-scan: используйте vulnerability_scan вместо сканирования LLM из v2 и quality_scan (с KnowledgeBase) вместо RAGET.

v3 также работает с ML-моделями — оберните модель как target и оценивайте её с помощью giskard-checks или giskard-scan. Примеры ниже описывают автоматическое сканирование табличных данных, доступное только в v2, — набор детекторов, который анализирует giskard.Model + giskard.Dataset для автоматического обнаружения проблем с производительностью, смещениями (bias) и устойчивостью, — а также ML-тестовый набор giskard.testing и Giskard Hub. Их перенос в v3 не планируется.

root@kitploit:~
pip install "giskard[llm]>2,<3"

Scan — автоматическое обнаружение проблем производительности, смещений и угроз безопасности

Оберните свою модель и запустите сканирование:

root@kitploit:~
import giskard
import pandas as pd


# Replace my_llm_chain with your actual LLM chain or model inference logic
def model_predict(df: pd.DataFrame):
    """The function takes a DataFrame and must return a list of outputs (one per row)."""
    return [my_llm_chain.run({"query": question}) for question in df["question"]]


giskard_model = giskard.Model(
    model=model_predict,
    model_type="text_generation",
    name="My LLM Application",
    description="A question answering assistant",
    feature_names=["question"],
)

scan_results = giskard.scan(giskard_model)
display(scan_results)

Пример Scan

RAGET — генерация оценочных наборов данных для RAG-приложений

Автоматически генерируйте вопросы, эталонные ответы и контекст из вашей базы знаний:

root@kitploit:~
import pandas as pd
from giskard.rag import generate_testset, KnowledgeBase

# Load your knowledge base documents
df = pd.read_csv("path/to/your/knowledge_base.csv")
knowledge_base = KnowledgeBase.from_pandas(df, columns=["column_1", "column_2"])

testset = generate_testset(
    knowledge_base,
    num_questions=60,
    language="en",
    agent_description="A customer support chatbot for company X",
)

Пример RAGET

Полная документация v2

👋 Сообщество

Мы приветствуем вклад от AI-сообщества! Прочитайте это руководство, чтобы начать, и присоединяйтесь к нашему процветающему сообществу в Discord.

Следите за прогрессом и делитесь обратной связью: Анонс v3 · Дорожная карта

🌟 Поставьте нам звезду — это помогает проекту стать заметнее для других и мотивирует нас создавать классные инструменты с открытым исходным кодом! 🌟

❤️ Если вы находите нашу работу полезной, пожалуйста, рассмотрите возможность спонсировать нас на GitHub. При ежемесячном спонсировании вы можете получить бейдж спонсора, разместить свою компанию в этом readme и получить приоритет при обработке ваших отчётов об ошибках. Мы также предлагаем разовое спонсирование, если вы хотите привлечь нас к консалтинговому проекту, проведению воркшопа или выступлению в вашей компании.

Скачать инструмент
(нет)
giskard-checks и зависимости
scangiskard-scan
openai / anthropic / …SDK провайдеров (см. опциональные зависимости в pyproject.toml)
СтатусПакетОписание
✅ Betagiskard-checksТестирование и оценка — API сценариев, встроенные проверки, LLM в роли судьи (LLM-as-judge)
✅ Betagiskard-scanСканер уязвимостей агентов + оценка RAG/качества — red teaming, инъекции промптов, джейлбрейки и вредоносный контент (vulnerability_scan, преемник v2 Scan), а также оценка качества базы знаний (quality_scan, преемник v2 RAGET)