
Benchmark avaliado por humanos para avaliar o desempenho de LLM na identificação, explicação e remediação de vulnerabilidades do mundo real em mais de 15 idiomas com contexto de vários arquivos.
Repositório Oficial no GitHub: https://github.com/AfterQuery/vader
Conjunto de Dados Hugging Face: https://huggingface.co/datasets/AfterQuery/vader
VADER é um benchmark avaliado por humanos projetado para medir o quão bem os modelos de linguagem grandes (LLMs) lidam com vulnerabilidades de software do mundo real. Ele contém 174 casos reais de vulnerabilidades (selecionados de repositórios de código aberto) abrangendo quatro tarefas:
Esses casos abrangem 15+ linguagens de programação (por exemplo, JavaScript, Python, Go, C/C++, PHP, etc.) e frequentemente incluem contexto de múltiplos arquivos, imitando ambientes de desenvolvimento do mundo real.
Clone o repositório e instale as dependências:
git clone https://github.com/AfterQuery/vader.git
cd vader
pip install -r requirements.txt