
Menschlich bewerteter Benchmark zur Bewertung der LLM-Leistung bei der Identifizierung, Erklärung und Behebung realer Schwachstellen in über 15 Sprachen mit Multi-Datei-Kontext.
Offizielles GitHub-Repository: https://github.com/AfterQuery/vader
Hugging-Face-Datensatz: https://huggingface.co/datasets/AfterQuery/vader
VADER ist ein menschlich bewerteter Benchmark, der misst, wie gut große Sprachmodelle (LLMs) mit realen Software-Schwachstellen umgehen. Er enthält 174 reale Schwachstellenfälle (kuratiert aus Open-Source-Repositories), die vier Aufgaben abdecken:
Diese Fälle erstrecken sich über 15+ Programmiersprachen (z. B. JavaScript, Python, Go, C/C++, PHP usw.) und umfassen häufig dateiübergreifenden Kontext, was reale Entwicklungsumgebungen nachbildet.
Klonen Sie das Repository und installieren Sie die Abhängigkeiten:
git clone https://github.com/AfterQuery/vader.git
cd vader
pip install -r requirements.txt