Sizhe Chen*、Arman Zharmagambetov、David Wagner、Chuan Guo*(* 表示同等技术贡献)
🔥 Meta-SecAlign 模型现已根据 Llama 社区许可证获得商业使用许可,尽管此代码库仅限非商业用途。
Meta-SecAlign-70B 是首个完全开源的商业级 LLM,内置提示注入防御——在智能体(工具/网络)安全方面可与 gpt-5 和 gemini-3-pro 相媲美。我们最先进的训练配方基于迄今为止最全面的评估,在各种效用分数上均未出现明显下降。
git clone --recurse-submodules https://github.com/facebookresearch/Meta_SecAlign.git
cd Meta_SecAlign
uv venv metasecalign --python 3.13
source metasecalign/bin/activate
uv pip install -r requirements.txt
uv pip install torchtune==0.6.0 --index-url https://download.pytorch.org/whl/cu126
python setup.py
data/openai_configs.yaml 中配置 OpenAI 密钥(用于效用评估)。该文件包含通过 AzureOpenAI 访问 OpenAI API 的示例。更详细的示例见此处。data/gemini_configs.yaml 中配置 Gemini 密钥。demo.py 包含使用我们两个 Meta-SecAlign 模型的最小代码。欢迎尝试新的样本和提示注入,或在你的代码库上测试这些模型:python demo.py
run_tests.py 包含复现我们论文中报告的评估结果的命令。它会依次调用 tests.py、test_lm_eval.py、test_agentdojo.py 和 test_injecagent.py。结果将记录到 [model_path]/summary.tsv。python run_tests.py -m [model_path] --lora_alpha [lora_alpha]
model_path 是被测模型的路径。我们支持:
meta-llama/Llama-3.1-8B-Instruct_SecAlign(由 setup.py 下载的 Meta-SecAlign-8B):首个完全开放、具备最先进提示注入防御的模型meta-llama/Llama-3.3-70B-Instruct_SecAlign(由 setup.py 下载的 Meta-SecAlign-70B):首个完全开放、具备最先进提示注入防御的模型meta-llama/Llama-3.1-8B-Instructmeta-llama/Llama-3.3-70B-Instructgemini-2.0-flash:一款 Google 商业模型,声称具备提示注入防御gemini-2.5-flash:一款 Google 商业模型,声称具备提示注入防御gemini-2.0-pro:Google 旗舰模型(未声称包含提示注入防御)gemini-2.5-pro:Google 旗舰模型(未声称包含提示注入防御)gemini-3-pro-preview:具备强大提示注入防御的最先进 Google 模型lora_alpha 是 Meta-SecAlign 模型的测试时超参数。默认值为 8,即使用完全按训练得到的 Meta-SecAlign 模型。介于 0 和 8 之间的 lora_alpha 值会在未防御模型和我们的防御模型之间进行插值,以实现灵活的效用–安全权衡。将 lora_alpha 外推到 8 以上是可能的,但未经测试。meta-llama/Meta-Llama-3-8B-Instruct 的参考回复进行比较)secalign_plus_plus.py 提供命令,使用我们的训练配方 SecAlign++ 将 meta-llama/Llama-3.1-8B-Instruct(默认)或 meta-llama/Llama-3.3-70B-Instruct(取消注释相应行以微调它)防御性微调为稳健的 LoRA 模型。python secalign_plus_plus.py
Meta-SecAlign 代码在 SecAlign 基础上进行了显著改进,其大部分代码根据 CC-BY-NC 许可。项目部分内容依据单独的许可条款提供:AgentDojo、TaskTracker 和 lm-evaluation-harness 根据 MIT 许可。来自其他仓库的代码包括 AgentDojo(agentdojo)、TaskTracker(setup.py)和 lm_eval_harness(lm_eval_config)。本软件和/或数据已于 2025 年存入 BAIR Open Research Commons 仓库。