
Benchmark con valutazione umana per valutare le prestazioni degli LLM nell'identificazione, spiegazione e correzione di vulnerabilità reali in oltre 15 linguaggi, con contesto multi-file.
Repository GitHub ufficiale: https://github.com/AfterQuery/vader
Dataset Hugging Face: https://huggingface.co/datasets/AfterQuery/vader
VADER è un benchmark con valutazione umana progettato per misurare quanto bene i modelli linguistici di grandi dimensioni (LLM) gestiscono le vulnerabilità software reali. Contiene 174 casi di vulnerabilità reali (selezionati da repository open-source) che coprono quattro attività:
Questi casi coprono più di 15 linguaggi di programmazione (ad es. JavaScript, Python, Go, C/C++, PHP, ecc.) e spesso includono contesti multi-file, riproducendo ambienti di sviluppo reali.
Clona il repository e installa le dipendenze:
git clone https://github.com/AfterQuery/vader.git
cd vader
pip install -r requirements.txt