
코드 보안 취약점 탐지에서 LLM 일반화 상한선을 문서화한 연구 저장소로, SQL 인젝션, 경로 탐색, 접근 제어 결함에 대해 합성 데이터셋과 실세계 데이터셋(Juliet, OWASP, CVEfixes, VUDENC)을 교차 평가합니다.
조직: Bytepro AI
상태: 연구 진행 중 — 비공개 저장소
목표: arXiv 2026년 3분기 + ARC Prize 논문 트랙 2026년 11월
수학적 추론(SAIR, arXiv:2504.18897)에서 관찰된 단일 프롬프트 한계가 코드 보안 취약점 탐지에서도 재현된다는 것을 경험적으로 입증하여, 라우터 가설이 도메인 독립적임을 확인한다.
gpt-oss-20b + 구조화된 치트시트는 합성 분포(Juliet, OWASP Benchmark)에서 프론티어 모델에 필적하지만, 실세계 데이터(CVEfixes, VUDENC)로의 분포 이동에서는 붕괴되어, 코드 보안 작업에서 LLM의 일반화 한계를 문서화한다.
| 범주 | CWE | 데이터 소스 |
|---|---|---|
| SQL 인젝션 | CWE-89 | VUDENC + Juliet + 합성 |
| 경로 탐색 | CWE-22 | VUDENC + Juliet + 합성 |
| 하드코딩된 자격 증명 | CWE-798 | Juliet + 합성 |
| N+1 쿼리 패턴 | — | 합성만 |
| 취약한 접근 제어 | CWE-284 | 합성만 |
교차 평가 행렬: