
Forschungs-Repository, das die Generalisierungsgrenzen von LLMs bei der Erkennung von Sicherheitslücken im Code dokumentiert, mit Kreuzauswertung über synthetische und reale Datensätze (Juliet, OWASP, CVEfixes, VUDENC) für SQL-Injection, Path-Traversal und Zugriffskontrollfehler.
Organisation: Bytepro AI
Status: Aktive Forschung — privates Repository
Ziel: arXiv Q3 2026 + ARC Prize Paper Track Nov 2026
Empirisch dokumentieren, dass sich die bei mathematischem Schlussfolgern beobachtete Single-Prompt-Grenze (SAIR, arXiv:2504.18897) bei der Erkennung von Schwachstellen in der Codesicherheit reproduzieren lässt, was die Router-Hypothese als domänenunabhängig bestätigt.
gpt-oss-20b + strukturierter Spickzettel erreicht die Leistung von Frontier-Modellen auf synthetischen Verteilungen (Juliet, OWASP Benchmark), bricht jedoch unter Verteilungsverschiebung bei realen Daten zusammen (CVEfixes, VUDENC), was eine Generalisierungsgrenze bei LLMs für Codesicherheitsaufgaben dokumentiert.
| Kategorie | CWE | Datenquelle |
|---|---|---|
| SQL-Injection | CWE-89 | VUDENC + Juliet + synthetisch |
| Pfad-Traversal | CWE-22 | VUDENC + Juliet + synthetisch |
| Hartkodierte Anmeldedaten | CWE-798 | Juliet + synthetisch |
| N+1-Abfragemuster | — | Nur synthetisch |
| Fehlerhafte Zugriffskontrolle | CWE-284 | Nur synthetisch |
Kreuzauswertungsmatrix: