Repository di ricerca che documenta i limiti di generalizzazione degli LLM nel rilevamento di vulnerabilità di sicurezza nel codice, con valutazione incrociata su dataset sintetici e reali (Juliet, OWASP, CVEfixes, VUDENC) per SQL injection, path traversal e difetti di controllo degli accessi.
Organizzazione: Bytepro AI
Stato: Ricerca attiva — repository privato
Obiettivo: arXiv Q3 2026 + ARC Prize Paper Track Nov 2026
Documentare empiricamente che il limite del singolo prompt osservato nel ragionamento matematico (SAIR, arXiv:2504.18897) si ripresenta nel rilevamento delle vulnerabilità di sicurezza nel codice, confermando che l'ipotesi del router è indipendente dal dominio.
gpt-oss-20b + cheatsheet strutturato eguaglia i modelli frontier sulle distribuzioni sintetiche (Juliet, OWASP Benchmark) ma crolla sotto lo shift distribuzionale verso i dati reali (CVEfixes, VUDENC), documentando un limite di generalizzazione negli LLM per i compiti di sicurezza del codice.
| Categoria | CWE | Fonte dati |
|---|---|---|
| Iniezione SQL | CWE-89 | VUDENC + Juliet + sintetico |
| Attraversamento di percorso | CWE-22 | VUDENC + Juliet + sintetico |
| Credenziali hardcoded | CWE-798 | Juliet + sintetico |
| Pattern di query N+1 | — | Solo sintetico |
| Controllo degli accessi non funzionante | CWE-284 | Solo sintetico |
Matrice di valutazione incrociata: