
مستودع بحثي يوثّق حدود التعميم لنماذج اللغات الكبيرة (LLM) في كشف ثغرات أمان الشيفرات البرمجية، مع تقييم متبادل عبر مجموعات بيانات اصطناعية وواقعية (Juliet, OWASP, CVEfixes, VUDENC) لحقن SQL، وتجاوز المسار، وعيوب التحكم في الوصول.
المنظمة: Bytepro AI
الحالة: بحث نشط — مستودع خاص
الهدف: arXiv Q3 2026 + مسار ورقة جائزة ARC نوفمبر 2026
توثيق تجريبي أن سقف الاستعلام الواحد (single-prompt) الملاحظ في التفكير الرياضي (SAIR, arXiv:2504.18897) يتكرر في اكتشاف الثغرات الأمنية في الكود، مما يؤكد أن فرضية الموجه (router hypothesis) مستقلة عن المجال.
gpt-oss-20b + ورقة غش منظمة (structured cheatsheet) تطابق النماذج الحدودية على التوزيعات الاصطناعية (Juliet, معيار OWASP) ولكنها تنهار تحت تحول التوزيع إلى بيانات العالم الحقيقي (CVEfixes, VUDENC)، مما يوثق سقف التعميم في نماذج اللغة الكبيرة (LLMs) لمهام أمان الكود.
| الفئة | CWE | مصدر البيانات |
|---|
| حقن SQL | CWE-89 | VUDENC + Juliet + اصطناعي |
| اجتياز المسار | CWE-22 | VUDENC + Juliet + اصطناعي |
| بيانات اعتماد مثبتة (Hardcoded Credentials) | CWE-798 | Juliet + اصطناعي |
| نمط استعلام N+1 | — | اصطناعي فقط |
| التحكم في الوصول المكسور | CWE-284 | اصطناعي فقط |
مصفوفة التقييم المتقاطع: