Repositorio oficial de GitHub: https://github.com/AfterQuery/vader
Dataset de Hugging Face: https://huggingface.co/datasets/AfterQuery/vader
VADER es un benchmark evaluado por humanos diseñado para medir qué tan bien los modelos de lenguaje de gran tamaño (LLMs) manejan vulnerabilidades de software del mundo real. Contiene 174 casos de vulnerabilidades reales (seleccionados de repositorios de código abierto) que cubren cuatro tareas:
- Identificación y clasificación de vulnerabilidades (CWE)
- Explicación de la causa raíz
- Parche (remediación)
- Generación de planes de prueba
Estos casos abarcan 15+ lenguajes de programación (p. ej., JavaScript, Python, Go, C/C++, PHP, etc.) y a menudo incluyen contexto de múltiples archivos, imitando entornos de desarrollo del mundo real.
📌 Características Principales
- ✅ 174 vulnerabilidades reales: Verificadas y anotadas por expertos en seguridad con experiencia.
- 🛠️ Evaluación en múltiples etapas: Valoración, detección, explicación, remediación y pruebas.
- 🌐 Lenguajes: JavaScript, Python, PHP, Go, TypeScript, C/C++, HTML/CSS, Shell, Solidity, Java, Ruby y más.
- 🧠 Rúbrica de puntuación humana: Basada en prácticas reales de ciberseguridad. Las puntuaciones se ponderan en un 50 % hacia la calidad de la remediación.
- 📊 Escenarios de múltiples archivos: Más del 75 % de los ejemplos incluyen múltiples archivos o lenguajes.
- 🚨 Conciencia de la severidad: El 61 % de los ejemplos son de severidad "Alta" o "Crítica".
📦 Instalación
Clona el repositorio e instala las dependencias:
git clone https://github.com/AfterQuery/vader.git
cd vader
pip install -r requirements.txt