Skip to content
KitploitKITPLOIT
工具博客
提交
工具博客
提交

黑客、渗透测试和网络安全工具,武装您的安全武器库!

Kitploit 是一个黑客、网络安全和渗透测试工具的目录。发现最新的项目更新,查找漏洞、分析系统、自动化测试并加强你的安全。

··订阅源·联系·隐私·© 2026 Kitploit

工具目录

分类

查看所有分类
Loading categories
giskard-oss — 🐢 用于 LLM 智能体的开源评估与测试库 | Kitploit
工具/GitHubGitHub/giskard-ai/giskard-oss
漏洞扫描器模糊测试机器学习红队AI 安全对抗性攻击
GitHubgiskard-ai/giskard-oss

giskard-oss

🐢 用于 LLM 智能体的开源评估与测试库

查看仓库
5.8k5223天前Kitploit 审核通过

最受欢迎

查看全部 →

发现我们社区最常用的工具。

探索所有工具

浏览我们的工具集合

查看所有工具 →
分享
网站

giskardlogo giskardlogo

智能体系统的评估、红队测试与测试生成

模块化、轻量、动态且异步优先

GitHub release License Downloads CI Giskard on Discord

文档 • 官网 • 社区


[!IMPORTANT] Giskard v3 是为 AI 智能体进行动态、多轮测试而做的全新重写。此版本移除了沉重的依赖以提升效率,同时引入了更强大的 AI 漏洞扫描器和增强的 RAG 评估——两者现在都原生随 giskard-scan(测试版)提供,且不依赖 v2。只有针对表格/ML 模型的旧版扫描仍仅由 v2 提供。 Giskard v2 仍然可用,但已不再积极维护。 关注进展 → 阅读 v3 公告 · 路线图

安装

root@kitploit:~
pip install giskard           # checks (+ agents, llm, core)
pip install "giskard[scan]"   # + vulnerability / quality scan
pip install "giskard[openai]" # provider SDK for LLM judges / generators

需要 Python 3.12+。

附加项添加内容
(无)giskard-checks 及其依赖

遥测: 通过 giskard-core 提供可选的聚合分析。不会发送任何提示词或输出。 如需退出,请在导入 Giskard 之前设置:export DO_NOT_TRACK=1 或 export GISKARD_TELEMETRY_DISABLED=1。 详情:giskard-core README。


Giskard 是一个用于测试和评估智能体系统的开源 Python 库。v3 架构由一组模块化的聚焦包组成——每个包只携带其所需的依赖——完全从头构建,可封装任何东西:LLM、黑盒智能体或多步骤流水线。

这些包构建在三个基础库之上——giskard-core(共享工具与遥测)、giskard-llm(与提供商无关的 LLM 路由)以及 giskard-agents(智能体与工作流编排)——它们会被自动引入,极少被直接使用。

Giskard Checks —— 创建并应用评估以测试智能体

root@kitploit:~
pip install giskard-checks

Giskard Checks 是一个轻量级库,用于创建测试基于 LLM 的系统的评估(evals)——从简单的断言到 LLM-as-judge 评估。与传统单元测试不同,evals 专为非确定性输出而设计,即相同的输入可能产生不同的有效响应。

使用 Giskard Checks 可以:

  • 捕获回归 —— 验证您的系统在更改后仍能正确运行
  • 验证 RAG 质量 —— 检查答案是否基于检索到的上下文
  • 执行安全规则 —— 确保输出符合您的内容策略
  • 评估多轮智能体 —— 测试完整对话,而不仅仅是单次交互

内置评估包括字符串匹配、比较、正则表达式、语义相似度以及 LLM-as-judge 检查(Groundedness、Conformity、LLMJudge)。

核心概念

  • Target —— 被测系统:任意同步/异步可调用对象 (inputs) -> outputs(可选带 trace)
  • Scenario —— 一个评估:交互 + 检查
  • Check —— 对 trace 的断言或 LLM 评判
  • Suite —— 多个场景一起运行

giskard.agents.Generator 是用于工作流/评判器的 LLM 客户端——不同于 giskard.checks 中用于合成用户消息的输入生成器(LLMGenerator)。

快速开始

root@kitploit:~
import asyncio
from giskard.checks import Scenario, Groundedness


def get_answer(inputs: str) -> str:
    return "Paris"  # replace with your model / agent


async def main() -> None:
    scenario = (
        Scenario("test_france_capital")
        .interact(inputs="What is the capital of France?", outputs=get_answer)
        .check(
            Groundedness(
                name="answer is grounded",
                context="France is in Western Europe. Its capital is Paris.",
            )
        )
    )
    result = await scenario.run()
    result.print_report()


asyncio.run(main())

Groundedness 是一个 LLM 评判器——安装一个提供商附加包(例如 pip install "giskard[openai]")并设置相应的 API 密钥。默认模型:openai/gpt-4o-mini。

有关 Suites、LLMJudge、多轮场景等更多信息,请参阅完整文档。


Giskard Scan —— AI 智能体漏洞扫描器

root@kitploit:~
pip install "giskard[scan]"   # or: pip install giskard-scan

Giskard Scan 是面向智能体系统的红队测试与漏洞扫描层。它会根据您智能体的自然语言描述自动生成对抗性测试套件,涵盖提示注入、有害内容、刻板印象、错误信息等。

使用 Giskard Scan 可以:

  • 对您的智能体进行红队测试 —— 自动生成覆盖 OWASP LLM Top-10 威胁类别的对抗性输入
  • 运行提示注入探测 —— 内置可直接使用的注入载荷数据集
  • 通过自定义生成器扩展 —— 将您自己的 ScenarioGenerator 实例传给 generate_suite,或在 vulnerability_suite_generator_registry 上注册它们

快速开始

root@kitploit:~
import asyncio
from giskard.scan import vulnerability_scan


async def my_agent(inputs: str) -> str:
    # Replace with your agent / model call
    return f"Echo: {inputs}"


async def main() -> None:
    await vulnerability_scan(
        target=my_agent,
        description="A customer support chatbot for an e-commerce platform.",
        languages=["en"],
    )


asyncio.run(main())

扫描生成器同样需要 LLM 提供商附加包和 API 密钥(与上面的 Checks 评判器相同)。

在寻找 Giskard v2 吗?

Giskard v2 包含 Scan(自动漏洞检测)和 RAGET(RAG 评估测试集生成)。

对于 LLM 智能体,两者在 v3 中都被 giskard-scan 取代:使用 vulnerability_scan 替代 v2 的 LLM 扫描,使用 quality_scan(配合 KnowledgeBase)替代 RAGET。

v3 也适用于 ML 模型——将一个模型封装为目标,然后用 giskard-checks 或 giskard-scan 进行评估。下面示例所涵盖的是仅限 v2 的自动表格扫描——即通过检查 giskard.Model + giskard.Dataset 来自动检测性能、偏差和鲁棒性问题的检测器套件——以及 giskard.testing ML 测试套件和 Giskard Hub。这些功能未计划在 v3 中提供。

root@kitploit:~
pip install "giskard[llm]>2,<3"

Scan —— 自动检测性能、偏差与安全问题

封装您的模型并运行扫描:

root@kitploit:~
import giskard
import pandas as pd


# Replace my_llm_chain with your actual LLM chain or model inference logic
def model_predict(df: pd.DataFrame):
    """The function takes a DataFrame and must return a list of outputs (one per row)."""
    return [my_llm_chain.run({"query": question}) for question in df["question"]]


giskard_model = giskard.Model(
    model=model_predict,
    model_type="text_generation",
    name="My LLM Application",
    description="A question answering assistant",
    feature_names=["question"],
)

scan_results = giskard.scan(giskard_model)
display(scan_results)

扫描示例

RAGET —— 为 RAG 应用生成评估数据集

从您的知识库中自动生成问题、参考答案和上下文:

root@kitploit:~
import pandas as pd
from giskard.rag import generate_testset, KnowledgeBase

# Load your knowledge base documents
df = pd.read_csv("path/to/your/knowledge_base.csv")
knowledge_base = KnowledgeBase.from_pandas(df, columns=["column_1", "column_2"])

testset = generate_testset(
    knowledge_base,
    num_questions=60,
    language="en",
    agent_description="A customer support chatbot for company X",
)

RAGET 示例

完整的 v2 文档

👋 社区

我们欢迎 AI 社区的贡献!阅读本指南开始参与,并加入我们在 Discord 上蓬勃发展的社区。

关注进展并分享反馈: v3 公告 · 路线图

🌟 给我们点个 Star,这有助于项目被更多人发现,并激励我们持续构建出色的开源工具!🌟

❤️ 如果您觉得我们的工作有用,请考虑在 GitHub 上赞助我们。通过按月赞助,您可以获得赞助徽章、在此 readme 中展示您的公司,并获得 bug 报告的优先处理。如果您希望我们参与咨询项目、举办工作坊或在贵公司进行演讲,我们也提供一次性赞助。

下载工具
scangiskard-scan
openai / anthropic / …提供商 SDK(参见 pyproject.toml 可选依赖)
状态包名称描述
✅ 测试版giskard-checks测试与评估 —— 场景 API、内置检查、LLM-as-judge
✅ 测试版giskard-scan智能体漏洞扫描器 + RAG/质量评估 —— 红队测试、提示注入、越狱与有害内容(vulnerability_scan,是 v2 Scan 的继任者),以及知识库质量评估(quality_scan,是 v2 RAGET 的继任者)