
Repositório de pesquisa que documenta os limites de generalização de LLMs na detecção de vulnerabilidades de segurança em código, com avaliação cruzada em conjuntos de dados sintéticos e do mundo real (Juliet, OWASP, CVEfixes, VUDENC) para injeção SQL, travessia de diretório e falhas de controle de acesso.
Organização: Bytepro AI
Status: Pesquisa ativa — repositório privado
Alvo: arXiv Q3 2026 + ARC Prize Paper Track Nov 2026
Documentar empiricamente que o teto de prompt único observado em raciocínio matemático (SAIR, arXiv:2504.18897) se replica em detecção de vulnerabilidades de segurança de código, confirmando a hipótese do roteador é independente de domínio.
gpt-oss-20b + cheatsheet estruturada iguala modelos de fronteira em distribuições sintéticas (Juliet, OWASP Benchmark) mas colapsa sob mudança de distribuição para dados do mundo real (CVEfixes, VUDENC), documentando um teto de generalização em LLMs para tarefas de segurança de código.
| Categoria | CWE | Fonte de Dados |
|---|---|---|
| Injeção de SQL | CWE-89 | VUDENC + Juliet + sintético |
| Path Traversal | CWE-22 | VUDENC + Juliet + sintético |
| Credenciais Hardcoded | CWE-798 | Juliet + sintético |
| Padrão de Consulta N+1 | — | Apenas sintético |
| Controle de Acesso Quebrado | CWE-284 | Apenas sintético |
Matriz de avaliação cruzada: