
組織: Bytepro AI
ステータス: アクティブな研究 — プライベートリポジトリ
ターゲット: arXiv Q3 2026 + ARC Prize Paper Track Nov 2026
数学的推論(SAIR、arXiv:2504.18897)で観測された単一プロンプトの上限が、 コードセキュリティの脆弱性検出でも再現されることを実証的に記録し、 ルーター仮説がドメイン非依存であることを確認する。
gpt-oss-20b + 構造化チートシートは、合成分布(Juliet、OWASP Benchmark)では フロンティアモデルに匹敵するが、実世界データ(CVEfixes、VUDENC)への 分布シフトでは崩壊し、コードセキュリティタスクにおけるLLMの汎化上限を 記録する。
| カテゴリ | CWE | データソース |
|---|
| SQLインジェクション | CWE-89 | VUDENC + Juliet + 合成 |
| パストラバーサル | CWE-22 | VUDENC + Juliet + 合成 |
| ハードコードされた認証情報 | CWE-798 | Juliet + 合成 |
| N+1クエリパターン | — | 合成のみ |
| アクセス制御の欠陥 | CWE-284 | 合成のみ |
相互評価マトリクス: