Skip to content
KitploitKITPLOIT
工具漏洞利用博客
Log in
提交
工具漏洞利用博客
提交

黑客、渗透测试和网络安全工具,武装您的安全武器库!

Kitploit 是一个黑客、网络安全和渗透测试工具的目录。发现最新的项目更新,查找漏洞、分析系统、自动化测试并加强你的安全。

··订阅源·联系·隐私·© 2026 Kitploit

工具目录

分类

查看所有分类
Loading categories
Meta_SecAlign — 用于防御提示注入攻击的开源权重LLM及训练/评估代码,附带针对代理工具调用和指令遵循安全性的基准测试。 | Kitploit
工具/GitHubGitHub/facebookresearch/meta_secalign
防御工具机器学习论文与研究学习与教育AI 安全对抗性攻击
GitHubfacebookresearch/meta_secalign

Meta_SecAlign

用于防御提示注入攻击的开源权重LLM及训练/评估代码,附带针对代理工具调用和指令遵循安全性的基准测试。

查看仓库
7118103个月前Kitploit 审核通过

最受欢迎

查看全部 →

发现我们社区最常用的工具。

探索所有工具

浏览我们的工具集合

查看所有工具 →
分享

Meta SecAlign:一个抵御提示注入攻击的安全基础 LLM

Sizhe Chen*、Arman Zharmagambetov、David Wagner、Chuan Guo*(* 表示同等技术贡献)

🔥 Meta-SecAlign 模型现已根据 Llama 社区许可证获得商业使用许可,尽管此代码库仅限非商业用途。

Meta-SecAlign-70B 是首个完全开源的商业级 LLM,内置提示注入防御——在智能体(工具/网络)安全方面可与 gpt-5 和 gemini-3-pro 相媲美。我们最先进的训练配方基于迄今为止最全面的评估,在各种效用分数上均未出现明显下降。

环境设置

  • 硬件要求:Meta-SecAlign-8B 训练需要 4×80 GB A100,评估需要一块 16 GB GPU。Meta-SecAlign-70B 训练需要 8×141 GB H200,评估需要 4 块(为提升效率,我们推荐 8 块)80 GB A100。
  • 安装 uv(一款 Python 包管理工具)。
  • 安装 Meta-SecAlign 包依赖:

git clone --recurse-submodules https://github.com/facebookresearch/Meta_SecAlign.git
cd Meta_SecAlign
uv venv metasecalign --python 3.13
source metasecalign/bin/activate
uv pip install -r requirements.txt
uv pip install torchtune==0.6.0 --index-url https://download.pytorch.org/whl/cu126

  • 安装 Meta-SecAlign 数据依赖(包括用于 SEP 效用评估的依赖,前提是你有可用的 GPU):

python setup.py

  • 在 data/openai_configs.yaml 中配置 OpenAI 密钥(用于效用评估)。该文件包含通过 AzureOpenAI 访问 OpenAI API 的示例。更详细的示例见此处。
  • [可选] 如果你想评估 Gemini 模型,请在 data/gemini_configs.yaml 中配置 Gemini 密钥。

演示

  • demo.py 包含使用我们两个 Meta-SecAlign 模型的最小代码。欢迎尝试新的样本和提示注入,或在你的代码库上测试这些模型:

python demo.py

评估

  • run_tests.py 包含复现我们论文中报告的评估结果的命令。它会依次调用 tests.py、test_lm_eval.py、test_agentdojo.py 和 test_injecagent.py。结果将记录到 [model_path]/summary.tsv。

python run_tests.py -m [model_path] --lora_alpha [lora_alpha]

  • model_path 是被测模型的路径。我们支持:
    • 本地模型(vLLM 推理)
      • meta-llama/Llama-3.1-8B-Instruct_SecAlign(由 setup.py 下载的 Meta-SecAlign-8B):首个完全开放、具备最先进提示注入防御的模型
      • meta-llama/Llama-3.3-70B-Instruct_SecAlign(由 setup.py 下载的 Meta-SecAlign-70B):首个完全开放、具备最先进提示注入防御的模型
      • meta-llama/Llama-3.1-8B-Instruct
      • meta-llama/Llama-3.3-70B-Instruct
      • 其他 Hugging Face 开放权重模型也可能原生支持。
    • OpenAI GPT 模型
      • gpt-4o-mini:首个商业模型,具备指令层级提示注入防御。
      • gpt-4o:后续旗舰模型,同样具备提示注入防御。
      • gpt-5:我们评估中最新且最安全的商业模型;可通过指定 --gpt5_reasoning_effort 更改推理级别(默认为 high)。
    • Google Gemini 模型
      • gemini-2.0-flash:一款 Google 商业模型,声称具备提示注入防御
      • gemini-2.5-flash:一款 Google 商业模型,声称具备提示注入防御
      • gemini-2.0-pro:Google 旗舰模型(未声称包含提示注入防御)
      • gemini-2.5-pro:Google 旗舰模型(未声称包含提示注入防御)
      • gemini-3-pro-preview:具备强大提示注入防御的最先进 Google 模型
  • [可选] lora_alpha 是 Meta-SecAlign 模型的测试时超参数。默认值为 8,即使用完全按训练得到的 Meta-SecAlign 模型。介于 0 和 8 之间的 lora_alpha 值会在未防御模型和我们的防御模型之间进行插值,以实现灵活的效用–安全权衡。将 lora_alpha 外推到 8 以上是可能的,但未经测试。
  • 我们为社区支持以下提示注入基准评估:
    • 6 个安全基准
      • 指令遵循:AlpacaFarm-Hacked、SEP、TaskTracker、CyberSecEval2
      • 智能体工具调用:InjecAgent、AgentDojo
    • 8 个效用基准
      • 通用知识(来自 lm_eval):MMLU、MMLU-Pro、BBH、IFEval、GPQA Diamond
      • 指令遵循:AlpacaEval2、SEP(在 SEP 中,我们使用 AlpacaEval2 提示方式与来自 meta-llama/Meta-Llama-3-8B-Instruct 的参考回复进行比较)
      • 智能体工具调用:AgentDojo

防御性微调(SecAlign++)

  • secalign_plus_plus.py 提供命令,使用我们的训练配方 SecAlign++ 将 meta-llama/Llama-3.1-8B-Instruct(默认)或 meta-llama/Llama-3.3-70B-Instruct(取消注释相应行以微调它)防御性微调为稳健的 LoRA 模型。

python secalign_plus_plus.py

代码致谢

Meta-SecAlign 代码在 SecAlign 基础上进行了显著改进,其大部分代码根据 CC-BY-NC 许可。项目部分内容依据单独的许可条款提供:AgentDojo、TaskTracker 和 lm-evaluation-harness 根据 MIT 许可。来自其他仓库的代码包括 AgentDojo(agentdojo)、TaskTracker(setup.py)和 lm_eval_harness(lm_eval_config)。本软件和/或数据已于 2025 年存入 BAIR Open Research Commons 仓库。

下载工具