用于评估和改进LLM安全性的一组工具。
🤗 Hugging Face 上的模型 | 博客 | 网站 | CyberSec Eval 论文 | Llama Guard 论文
Purple Llama 是一个总括性项目,随着时间推移,将汇集各种工具和评估(evals),帮助社区负责任地使用开放生成式 AI 模型进行开发。初始版本将包含面向网络安全及输入/输出安全防护的工具和评估,但我们计划在不久的将来贡献更多。
借用网络安全领域的一个概念,我们认为要真正缓解生成式 AI 带来的挑战,需要同时采取攻击(红队)和防御(蓝队)两种姿态。紫队(Purple teaming)由红队和蓝队的职责共同组成,是一种评估和缓解潜在风险的协作方法,同样的理念也适用于生成式 AI,因此我们对 Purple Llama 的投入将是全面的。
Purple Llama 项目中的组件将采用宽松许可证,支持研究和商业使用。我们相信,这是促成社区协作、推动生成式 AI 开发中信任与安全工具的开发和使用走向标准化的重要一步。具体而言,评估(evals)和基准测试(benchmarks)采用 MIT 许可证,而任何模型则使用相应的 Llama 社区许可证。请参见下表:
| 组件类型 | 组件 | 许可证 |
|---|---|---|
| 评估/基准测试 | 网络安全评估(其他即将推出) | MIT |
| 安全防护 | Llama Guard | Llama 2 Community License |
| 安全防护 | Llama Guard 2 | Llama 3 Community License |
| 安全防护 | Llama Guard 3-8B | Llama 3.2 Community License |
| 安全防护 | Llama Guard 3-1B | Llama 3.2 Community License |
| 安全防护 | Llama Guard 3-11B-vision | Llama 3.2 Community License |
| 安全防护 | Prompt Guard | Llama 3.2 Community License |
| 安全防护 | Code Shield | MIT |
正如我们在 Llama 3 的 《负责任使用指南》 中所概述的,我们建议根据适合具体应用的内容准则,对 LLM 的所有输入和输出进行检查和过滤。
Llama Guard 3 由一系列高性能的输入和输出审核模型组成,旨在帮助开发者检测各类常见的违规内容。
它们基于 Meta-Llama 3.1 和 3.2 模型微调而成,并针对支持检测 MLCommons 标准危害分类法进行了优化,以满足多种开发者用例。它们支撑了 Llama 3.2 功能的发布,包括 7 种新语言、128k 上下文窗口以及图像推理。Llama Guard 3 模型还经过优化,可检测有助于网络攻击的响应,并防止 LLM 输出的恶意代码在使用代码解释器的 Llama 系统托管环境中执行。
Prompt Guard 是一款功能强大的工具,可保护由 LLM 驱动的应用程序免受恶意提示词的侵害,确保其安全性和完整性。
提示攻击的类别包括提示注入和越狱(jailbreaking):
Code Shield 新增了对 LLM 生成的不安全代码进行推理时过滤的支持。Code Shield 可降低不安全代码建议的风险、防止代码解释器被滥用,并确保命令的安全执行。CodeShield 示例 Notebook。
CyberSec Eval v1 是我们认为的业内首个面向 LLM 的网络安全评估套件。这些基准测试基于行业指导与标准(如 CWE 和 MITRE ATT&CK),并与我们的安全领域专家协作构建。我们旨在提供有助于应对 白宫关于开发负责任 AI 的承诺 中所述部分风险的工具,包括:
我们相信,这些工具将降低 LLM 建议不安全的 AI 生成代码的频率,并减少它们对网络对手的助益。我们的初步结果表明,LLM 在推荐不安全代码和遵从恶意请求两方面都存在显著的网络安全风险。更多详情请参阅我们的 CyberSec Eval 论文。
CyberSec Eval 2 在先前版本的基础上进行了扩展,增加了对 LLM 滥用代码解释器的倾向、进攻性网络安全能力以及易受提示注入影响程度的衡量。你可以此处阅读论文。
你也可以此处查看 🤗 排行榜。
新发布的 CyberSec Eval 3 新增了三个测试套件:视觉提示注入测试、鱼叉式网络钓鱼能力测试,以及自主进攻性网络行动测试。
作为 Llama 参考系统 的一部分,我们正在集成一个安全层,以促进这些防护措施的采用和部署。这些防护措施的相关入门资源可在 Llama-recipe GitHub 仓库 中获取。
如需查看不断更新的常见问题列表,不仅涵盖 Purple Llama 组件,也包括 Llama 模型的常见问题,请参阅此处的 FAQ。
有关如何提供帮助,请参阅 CONTRIBUTING 文件。