
Dépôt de recherche documentant les plafonds de généralisation des LLM dans la détection de vulnérabilités de sécurité du code, avec une évaluation croisée sur des ensembles de données synthétiques et réels (Juliet, OWASP, CVEfixes, VUDENC) pour les injections SQL, les traversées de chemin et les défauts de contrôle d'accès.
Organisation : Bytepro AI
Statut : Recherche active — dépôt privé
Cible : arXiv Q3 2026 + ARC Prize Paper Track Nov 2026
Documenter empiriquement que le plafond de la requête unique observé dans le raisonnement mathématique (SAIR, arXiv:2504.18897) se reproduit dans la détection de vulnérabilités de sécurité du code, confirmant que l'hypothèse du routeur est indépendante du domaine.
gpt-oss-20b + une antisèche structurée égalise les modèles de pointe sur les distributions synthétiques (Juliet, OWASP Benchmark) mais s'effondre sous un changement de distribution vers des données réelles (CVEfixes, VUDENC), documentant un plafond de généralisation dans les LLM pour les tâches de sécurité du code.
| Catégorie | CWE | Source de données |
|---|---|---|
| Injection SQL | CWE-89 | VUDENC + Juliet + synthétique |
| Traversée de chemin | CWE-22 | VUDENC + Juliet + synthétique |
| Identifiants codés en dur | CWE-798 | Juliet + synthétique |
| Modèle de requête N+1 | — | Synthétique uniquement |
| Contrôle d'accès cassé | CWE-284 | Synthétique uniquement |
Matrice d'évaluation croisée :