
Benchmark évalué par des humains pour mesurer les performances des LLM dans l'identification, l'explication et la remédiation de vulnérabilités réelles, dans plus de 15 langues avec un contexte multi-fichiers.
Dépôt GitHub officiel : https://github.com/AfterQuery/vader
Jeu de données Hugging Face : https://huggingface.co/datasets/AfterQuery/vader
VADER est un benchmark évalué par des humains conçu pour mesurer dans quelle mesure les grands modèles de langage (LLM) gèrent les vulnérabilités logicielles réelles. Il contient 174 cas de vulnérabilités réelles (sélectionnés à partir de dépôts open-source) couvrant quatre tâches :
Ces cas couvrent plus de 15 langages de programmation (p. ex. JavaScript, Python, Go, C/C++, PHP, etc.) et incluent souvent un contexte multi-fichiers, imitant les environnements de développement réels.
Clonez le dépôt et installez les dépendances :
git clone https://github.com/AfterQuery/vader.git
cd vader
pip install -r requirements.txt