Skip to content
KitploitKITPLOIT
工具漏洞利用博客
Log in
提交
工具漏洞利用博客
提交

黑客、渗透测试和网络安全工具,武装您的安全武器库!

Kitploit 是一个黑客、网络安全和渗透测试工具的目录。发现最新的项目更新,查找漏洞、分析系统、自动化测试并加强你的安全。

订阅源联系隐私© 2026 Kitploit

工具目录

分类

查看所有分类
Loading categories
ASCENT — 微调框架,对LLM应用一阶最优安全校准和周期性重校准,在提升下游任务效用的同时保留安全兼容的更新。 | Kitploit
工具/GitHubGitHub/zju-llm-safety/ascent
防御工具机器学习论文与研究AI 安全对抗性攻击
GitHubzju-llm-safety/ascent

ASCENT

微调框架,对LLM应用一阶最优安全校准和周期性重校准,在提升下游任务效用的同时保留安全兼容的更新。

查看仓库
1134天前尚未审核

最受欢迎

查看全部 →

发现我们社区最常用的工具。

探索所有工具

浏览我们的工具集合

查看所有工具 →
分享

ASCENT

通过重校准实现安全–效用协同增强的一阶最优微调

ASCENT 推导出一阶最优安全校准更新及相应的安全相关结构,优化下游任务更新以保留安全兼容组件并抑制安全退化组件,并在微调过程中定期重校准该结构,从而协同提升安全性和下游效用。

方法 · 快速开始 · 数据 · 配置 · 评估

🧠 方法概览

ASCENT 框架:安全校准、安全保持的任务优化以及定期重校准。

  1. 一阶最优安全校准。 使用安全评判器估计当前模型的安全 梯度。其前 r 个奇异分量定义了一个校准更新,在固定秩和 Frobenius 范数预算下最大化预测的一阶安全提升。
  2. 安全保持的任务优化。 保留安全兼容的任务更新 分量,并选择性地抑制那些具有负一阶安全效应的分量。 闭式更新在接近原始任务更新与对安全冲突的 惩罚之间取得平衡,并以奇异值加权。
  3. 定期重校准。 在校准点之间执行任务更新,然后 合并有效任务更新并在更新后的模型上重新估计安全相关结构。 校准计划在 config.toml 中设置。

🚀 快速开始

环境要求: Python 3.12 和本地模型检查点。训练使用两块 CUDA GPU,一块用于目标模型,一块用于 Llama Guard;每个模型必须能放入其 GPU。

pip install -r requirements.txt
cp config.example.toml config.toml

按照 config.toml 中的行内注释填写空值,然后运行:

python run.py \
  --config config.toml \
  --model-path /path/to/target-model \
  --guard-model-path /path/to/Llama-Guard-3-8B \
  --data-root data \
  --output-dir /path/to/new-run \
  --target-gpu 0 --guard-gpu 1

添加 --execute 以进行训练、生成响应或保存评估结果。

选择一个位于仓库之外、有足够空间存放检查点的新输出目录。 训练完成时会打印最终合并模型的路径。

📁 数据

提供包含所配置记录数量的 JSON 数组:

  • 校准:<data-root>/calibration/prompts.json
  • 任务数据:<data-root>/<task>/{train,test}.json,训练/测试输入互不重叠。
数据集必需字段
SAMSumdialogue、summary
AGNewstext、label_name:World、Sports、Business 或 Sci/Tech
GSM8Kquestion、answer,其中包含 #### 最终答案
OpenBookQAquestion_stem、choice_labels:["A","B","C","D"]、四个 choice_texts、answer_key:A–D
HarmBench仅 goal;可选 id、source;不存储响应

⚙️ 配置

在 config.toml 中设置你的模型、任务和超参数。模型加载 和矩阵选择遵循 model.key。

📊 评估

两种模式均使用 evaluate.py;生成需要完全合并的本地模型。 请提供你自己的数据和外部安全评分。不捆绑任何数据集、在线评判器或 API 配置。

效用

python evaluate.py utility --task gsm8k --data /path/to/test.json \
  --model-path /path/to/merged-model --output-dir /path/to/task-evaluation --execute

任务:samsum、agnews、gsm8k、openbookqa。指标为 SAMSum 的 ROUGE-L 以及其他任务的准确率/精确匹配,以百分比报告。要对已保存的 响应进行评分,请将 --model-path 替换为 --responses /path/to/responses.json。

安全

将固定提示作为记录提供,包含 id、goal 以及可选的 prompt(默认为 goal)。将原始有害目标与攻击提示分开保存。

生成响应:

python evaluate.py safety --data /path/to/prompts.json \
  --model-path /path/to/merged-model --output-dir /path/to/safety-responses --execute

汇总外部评分:

python evaluate.py safety \
  --responses /path/to/safety-responses/responses.json --judgments /path/to/scores.json \
  --output-dir /path/to/safety-metrics --execute

评分为 JSON 记录 { "id": "...", "score": 1 },使用响应 ID 和 1–5 的评分(失败的评判为 null)。评分 4–5 计为成功攻击; 使用 --success-threshold 5 可仅计 5 分。缺失或失败的评判不会产生最终 ASR。

对于任一模式,经过聊天格式化后超过 --max-input-tokens 的输入 会被拒绝,而非截断。请在模型的上下文容量内设置该限制, 为生成的 token 留出空间。

下载工具