组织: Bytepro AI
状态: 活跃研究 — 私有仓库
目标: arXiv Q3 2026 + ARC Prize 论文赛道 Nov 2026
实证记录在数学推理(SAIR,arXiv:2504.18897)中观察到的单次提示上限在代码安全漏洞检测中复现, 从而证实路由假设是领域无关的。
gpt-oss-20b + 结构化速查表在合成分布(Juliet、OWASP Benchmark)上可媲美前沿模型, 但在分布偏移到真实世界数据(CVEfixes、VUDENC)时崩溃, 记录了 LLM 在代码安全任务上的泛化上限。
| 类别 | CWE | 数据来源 |
|---|---|---|
| SQL 注入 | CWE-89 | VUDENC + Juliet + 合成 |
| 路径遍历 | CWE-22 | VUDENC + Juliet + 合成 |
| 硬编码凭据 | CWE-798 | Juliet + 合成 |
| N+1 查询模式 | — | 仅合成 |
| 失效的访问控制 | CWE-284 | 仅合成 |
交叉评估矩阵: