
Оцененный человеком бенчмарк для оценки производительности LLM при выявлении, объяснении и исправлении реальных уязвимостей на 15+ языках с многофайловым контекстом.
Официальный GitHub-репозиторий: https://github.com/AfterQuery/vader
Датасет на Hugging Face: https://huggingface.co/datasets/AfterQuery/vader
VADER — это человечески оценённый бенчмарк, предназначенный для измерения того, насколько хорошо большие языковые модели (LLM) справляются с реальными уязвимостями программного обеспечения. Он содержит 174 реальных случая уязвимостей (отобранных из репозиториев с открытым исходным кодом), охватывающих четыре задачи:
Эти случаи охватывают более 15 языков программирования (например, JavaScript, Python, Go, C/C++, PHP и т. д.) и часто включают многофайловый контекст, имитируя реальные среды разработки.
Клонируйте репозиторий и установите зависимости:
git clone https://github.com/AfterQuery/vader.git
cd vader
pip install -r requirements.txt