
Репозиторий исследований, документирующий потолки обобщения LLM в обнаружении уязвимостей безопасности кода, с перекрестной оценкой на синтетических и реальных наборах данных (Juliet, OWASP, CVEfixes, VUDENC) для SQL-инъекций, обхода путей и дефектов контроля доступа.
Организация: Bytepro AI
Статус: Активное исследование — приватный репозиторий
Цель: arXiv Q3 2026 + ARC Prize Paper Track ноябрь 2026
Эмпирически задокументировать, что потолок однопромптового подхода, наблюдаемый в математических рассуждениях (SAIR, arXiv:2504.18897), воспроизводится в обнаружении уязвимостей безопасности кода, подтверждая, что гипотеза маршрутизатора является доменно-независимой.
gpt-oss-20b + структурированная шпаргалка сравнимы с передовыми моделями на синтетических распределениях (Juliet, OWASP Benchmark), но терпят крах при смещении распределения на реальные данные (CVEfixes, VUDENC), документируя потолок обобщения в LLM для задач безопасности кода.
| Категория | CWE | Источник данных |
|---|---|---|
| SQL-инъекция | CWE-89 | VUDENC + Juliet + synthetic |
| Path Traversal | CWE-22 | VUDENC + Juliet + synthetic |
| Жестко закодированные учетные данные | CWE-798 | Juliet + synthetic |
| Шаблон запроса N+1 | — | Только синтетика |
| Нарушенный контроль доступа | CWE-284 | Только синтетика |
Матрица перекрестной оценки: