Repositorio de investigación que documenta los límites de generalización de los LLM en la detección de vulnerabilidades de seguridad en código, con evaluación cruzada sobre conjuntos de datos sintéticos y del mundo real (Juliet, OWASP, CVEfixes, VUDENC) para inyección SQL, path traversal y fallos de control de acceso.
Organización: Bytepro AI
Estado: Investigación activa — repositorio privado
Objetivo: arXiv Q3 2026 + ARC Prize Paper Track nov 2026
Documentar empíricamente que el techo de prompt único observado en el razonamiento matemático (SAIR, arXiv:2504.18897) se replica en la detección de vulnerabilidades de seguridad en código, confirmando que la hipótesis del router es independiente del dominio.
gpt-oss-20b + cheatsheet estructurada iguala a los modelos de frontera en distribuciones sintéticas (Juliet, OWASP Benchmark), pero colapsa ante un cambio de distribución hacia datos del mundo real (CVEfixes, VUDENC), documentando un techo de generalización en los LLM para tareas de seguridad de código.
| Categoría | CWE | Fuente de datos |
|---|
| Inyección SQL | CWE-89 | VUDENC + Juliet + sintético |
| Path Traversal | CWE-22 | VUDENC + Juliet + sintético |
| Credenciales codificadas | CWE-798 | Juliet + sintético |
| Patrón de consulta N+1 | — | Solo sintético |
| Control de acceso roto | CWE-284 | Solo sintético |
Matriz de evaluación cruzada: