
Punto de referencia evaluado por humanos para evaluar el rendimiento de los LLM en la identificación, explicación y remediación de vulnerabilidades del mundo real en más de 15 idiomas con contexto de múltiples archivos.
Repositorio oficial de GitHub: https://github.com/AfterQuery/vader
Dataset de Hugging Face: https://huggingface.co/datasets/AfterQuery/vader
VADER es un benchmark evaluado por humanos diseñado para medir qué tan bien los modelos de lenguaje de gran tamaño (LLMs) manejan vulnerabilidades de software del mundo real. Contiene 174 casos de vulnerabilidades reales (seleccionados de repositorios de código abierto) que cubren cuatro tareas:
Estos casos abarcan 15+ lenguajes de programación (p. ej., JavaScript, Python, Go, C/C++, PHP, etc.) y a menudo incluyen contexto de múltiples archivos, imitando entornos de desarrollo del mundo real.
Clona el repositorio e instala las dependencias:
git clone https://github.com/AfterQuery/vader.git
cd vader
pip install -r requirements.txt