Skip to content
KitploitKITPLOIT
工具博客
提交
工具博客
提交

黑客、渗透测试和网络安全工具,武装您的安全武器库!

Kitploit 是一个黑客、网络安全和渗透测试工具的目录。发现最新的项目更新,查找漏洞、分析系统、自动化测试并加强你的安全。

··订阅源·联系·隐私·© 2026 Kitploit

工具目录

分类

查看所有分类
Loading categories
PurpleLlama — 用于评估和改进LLM安全性的一组工具。 | Kitploit
工具/GitHubGitHub/meta-llama/purplellama
防御工具漏洞分析代码分析论文与研究红队AI 安全对抗性攻击对抗性攻击 分类第 10 名AI 安全 分类第 4 名
GitHub
4.4k7736425天前Kitploit 审核通过

最受欢迎

查看全部 →

发现我们社区最常用的工具。

探索所有工具

浏览我们的工具集合

查看所有工具 →
分享
meta-llama/purplellama

PurpleLlama

用于评估和改进LLM安全性的一组工具。

查看仓库

🤗 Hugging Face 上的模型  | 博客  | 网站  | CyberSec Eval 论文   | Llama Guard 论文 


Purple Llama

Purple Llama 是一个总括性项目,随着时间推移,将汇集各种工具和评估(evals),帮助社区负责任地使用开放生成式 AI 模型进行开发。初始版本将包含面向网络安全及输入/输出安全防护的工具和评估,但我们计划在不久的将来贡献更多。

为什么是紫色?

借用网络安全领域的一个概念,我们认为要真正缓解生成式 AI 带来的挑战,需要同时采取攻击(红队)和防御(蓝队)两种姿态。紫队(Purple teaming)由红队和蓝队的职责共同组成,是一种评估和缓解潜在风险的协作方法,同样的理念也适用于生成式 AI,因此我们对 Purple Llama 的投入将是全面的。

许可证

Purple Llama 项目中的组件将采用宽松许可证,支持研究和商业使用。我们相信,这是促成社区协作、推动生成式 AI 开发中信任与安全工具的开发和使用走向标准化的重要一步。具体而言,评估(evals)和基准测试(benchmarks)采用 MIT 许可证,而任何模型则使用相应的 Llama 社区许可证。请参见下表:

组件类型组件许可证
评估/基准测试网络安全评估(其他即将推出)MIT
安全防护Llama GuardLlama 2 Community License
安全防护Llama Guard 2Llama 3 Community License
安全防护Llama Guard 3-8BLlama 3.2 Community License
安全防护Llama Guard 3-1BLlama 3.2 Community License
安全防护Llama Guard 3-11B-visionLlama 3.2 Community License
安全防护Prompt GuardLlama 3.2 Community License
安全防护Code ShieldMIT

系统级安全防护

正如我们在 Llama 3 的 《负责任使用指南》 中所概述的,我们建议根据适合具体应用的内容准则,对 LLM 的所有输入和输出进行检查和过滤。

Llama Guard

Llama Guard 3 由一系列高性能的输入和输出审核模型组成,旨在帮助开发者检测各类常见的违规内容。

它们基于 Meta-Llama 3.1 和 3.2 模型微调而成,并针对支持检测 MLCommons 标准危害分类法进行了优化,以满足多种开发者用例。它们支撑了 Llama 3.2 功能的发布,包括 7 种新语言、128k 上下文窗口以及图像推理。Llama Guard 3 模型还经过优化,可检测有助于网络攻击的响应,并防止 LLM 输出的恶意代码在使用代码解释器的 Llama 系统托管环境中执行。

Prompt Guard

Prompt Guard 是一款功能强大的工具,可保护由 LLM 驱动的应用程序免受恶意提示词的侵害,确保其安全性和完整性。

提示攻击的类别包括提示注入和越狱(jailbreaking):

  • 提示注入(Prompt Injections)是一种输入,利用第三方不可信数据被纳入模型上下文窗口的机会,诱使模型执行非预期的指令。
  • 越狱(Jailbreaks)是旨在覆盖模型内置安全防护功能的恶意指令。

Code Shield

Code Shield 新增了对 LLM 生成的不安全代码进行推理时过滤的支持。Code Shield 可降低不安全代码建议的风险、防止代码解释器被滥用,并确保命令的安全执行。CodeShield 示例 Notebook。

评估与基准测试

网络安全

CyberSec Eval v1

CyberSec Eval v1 是我们认为的业内首个面向 LLM 的网络安全评估套件。这些基准测试基于行业指导与标准(如 CWE 和 MITRE ATT&CK),并与我们的安全领域专家协作构建。我们旨在提供有助于应对 白宫关于开发负责任 AI 的承诺 中所述部分风险的工具,包括:

  • 用于量化 LLM 网络安全风险的指标。
  • 用于评估不安全代码建议出现频率的工具。
  • 用于评估 LLM、使其更难生成恶意代码或协助实施网络攻击的工具。

我们相信,这些工具将降低 LLM 建议不安全的 AI 生成代码的频率,并减少它们对网络对手的助益。我们的初步结果表明,LLM 在推荐不安全代码和遵从恶意请求两方面都存在显著的网络安全风险。更多详情请参阅我们的 CyberSec Eval 论文。

CyberSec Eval 2

CyberSec Eval 2 在先前版本的基础上进行了扩展,增加了对 LLM 滥用代码解释器的倾向、进攻性网络安全能力以及易受提示注入影响程度的衡量。你可以此处阅读论文。

你也可以此处查看 🤗 排行榜。

CyberSec Eval 3

新发布的 CyberSec Eval 3 新增了三个测试套件:视觉提示注入测试、鱼叉式网络钓鱼能力测试,以及自主进攻性网络行动测试。

快速开始

作为 Llama 参考系统 的一部分,我们正在集成一个安全层,以促进这些防护措施的采用和部署。这些防护措施的相关入门资源可在 Llama-recipe GitHub 仓库 中获取。

常见问题

如需查看不断更新的常见问题列表,不仅涵盖 Purple Llama 组件,也包括 Llama 模型的常见问题,请参阅此处的 FAQ。

加入 Purple Llama 社区

有关如何提供帮助,请参阅 CONTRIBUTING 文件。

下载工具