Skip to content
KitploitKITPLOIT
工具博客
提交
工具博客
提交

黑客、渗透测试和网络安全工具,武装您的安全武器库!

Kitploit 是一个黑客、网络安全和渗透测试工具的目录。发现最新的项目更新,查找漏洞、分析系统、自动化测试并加强你的安全。

··订阅源·联系·隐私·© 2026 Kitploit

工具目录

分类

查看所有分类
Loading categories
Learning-to-Detect — 检测大型视觉语言模型中的未知越狱攻击,利用隐藏状态分析和自编码器,并提供训练与评估流程,以实现稳健的安全监控。 | Kitploit
工具/GitHubGitHub/shuangliangx/learning-to-detect
防御工具漏洞分析机器学习AI 安全异常检测
GitHubshuangliangx/learning-to-detect

Learning-to-Detect

检测大型视觉语言模型中的未知越狱攻击,利用隐藏状态分析和自编码器,并提供训练与评估流程,以实现稳健的安全监控。

查看仓库
183个月前尚未审核

最受欢迎

查看全部 →

发现我们社区最常用的工具。

探索所有工具

浏览我们的工具集合

查看所有工具 →
分享

学习检测大型视觉语言模型中的未知越狱攻击

本仓库提供了 “学习检测大型视觉语言模型中的未知越狱攻击” 的官方实现。

目录

  • 基础模型

  • 越狱攻击检测

  • 数据集

基础模型

我们的方法使用以下两个基础模型:

LLaVA-v1.6-Vicuna 是一个强大的视觉语言模型,它将视觉编码器与 Vicuna 语言模型相结合,以处理多模态输入并生成自然语言响应。

LlamaGuard3 是由 Meta AI 开发的安全护栏模型,专门用于检测和防止有害内容的生成,并能有效识别潜在不安全的请求和响应。

请下载模型权重并将其放置在 code/asset/weights 目录中。

越狱攻击检测

1. 数据处理与隐藏状态提取

(可选,因为处理后的数据和提取的状态已保存在仓库中。)

在 $I^-$(AdvBench)和 $I^+$(GQA)上查询模型

root@kitploit:~
python code/vicuna/qa.py --file code/vicuna/instructions/advbench.json
python code/vicuna/qa.py --file code/vicuna/instructions/GQA.json

评估模型响应并划分为训练/测试数据集

root@kitploit:~
    python code/llama3_guard.py --file code/vicuna/instructions/advbench.json
    python code/vicuna/instructions/process.py 

提取用于 LoD 训练和基准评估的隐藏状态

root@kitploit:~
    python code/vicuna/qa-baseline.py 

2. 训练和测试 MSCAV 分类器

训练和测试分类器

root@kitploit:~
    python code/vicuna/train.py --train
    python code/vicuna/train.py --test

3. 训练安全模式自动编码器(SPAE)

root@kitploit:~
    python code/autoencoder.py

4. 评估检测性能

root@kitploit:~
    python code/test.py

数据集

数据集详情
MM-SafetyBench
HADES

请下载数据集并将其放置在 code/asset 目录中。

下载工具