
مجموعة أدوات لتقييم وتحسين أمان LLM.
🤗 النماذج على Hugging Face | المدونة | الموقع الإلكتروني | ورقة CyberSec Eval البحثية | ورقة Llama Guard البحثية
Purple Llama هو مشروع شامل سيجمع مع مرور الوقت الأدوات والتقييمات لمساعدة المجتمع على البناء بمسؤولية باستخدام نماذج الذكاء الاصطناعي التوليدية مفتوحة المصدر. سيتضمن الإصدار الأولي أدوات وتقييمات للأمن السيبراني وضوابط الإدخال/الإخراج، لكننا نخطط لإضافة المزيد في المستقبل القريب.
باستعارة مفهوم من عالم الأمن السيبراني، نعتقد أنه للتخفيف حقًا من التحديات التي يطرحها الذكاء الاصطناعي التوليدي، نحتاج إلى تبني مواقف الهجوم (الفريق الأحمر) والدفاع (الفريق الأزرق) معًا. إن العمل الجماعي الأرجواني، الذي يتكون من مسؤوليات الفريقين الأحمر والأزرق، هو نهج تعاوني لتقييم وتخفيف المخاطر المحتملة، وينطبق نفس المنهج على الذكاء الاصطناعي التوليدي، ومن هنا سيكون استثمارنا في Purple Llama شاملاً.
سيتم ترخيص المكونات داخل مشروع Purple Llama بتراخيص متساهلة تتيح الاستخدام البحثي والتجاري على حد سواء. نعتقد أن هذه خطوة رئيسية نحو تمكين التعاون المجتمعي وتوحيد تطوير واستخدام أدوات الثقة والأمان لتطوير الذكاء الاصطناعي التوليدي. وبشكل أكثر تحديدًا، يتم ترخيص التقييمات والمعايير بموجب ترخيص MIT بينما تستخدم أي نماذج ترخيص Llama Community المقابل. انظر الجدول أدناه:
كما أوضحنا في دليل الاستخدام المسؤول الخاص بـ Llama 3، نوصي بفحص جميع المدخلات والمخرجات إلى LLM وتصفيتها وفقًا لإرشادات المحتوى المناسبة للتطبيق.
يتكون Llama Guard 3 من سلسلة من نماذج الإشراف على الإدخال والإخراج عالية الأداء المصممة لمساعدة المطورين على اكتشاف أنواع شائعة مختلفة من المحتوى المخالف.
تم بناؤها عن طريق الضبط الدقيق لنماذج Meta-Llama 3.1 و 3.2 وتحسينها لدعم اكتشاف تصنيف مخاطر معايير MLCommons، لتلبية مجموعة من حالات استخدام المطورين. وهي تدعم إصدار قدرات Llama 3.2، بما في ذلك 7 لغات جديدة، ونافذة سياقية بحجم 128 ألف رمز، والاستدلال على الصور. تم أيضًا تحسين نماذج Llama Guard 3 لاكتشاف الاستجابات الضارة المتعلقة بالهجمات السيبرانية ومنع تنفيذ التعليمات البرمجية الخبيثة الناتجة عن LLMs في البيئات المضيفة لأنظمة Llama التي تستخدم مفسرات التعليمات البرمجية.
Prompt Guard هو أداة قوية لحماية التطبيقات المدعومة بـ LLM من المطالبات الخبيثة لضمان أمنها وسلامتها.
تشمل فئات هجمات المطالبات حقن المطالبات والاختراق:
يضيف Code Shield دعمًا لتصفية التعليمات البرمجية غير الآمنة التي تنتجها LLMs في وقت الاستدلال. يوفر Code Shield تخفيفًا لمخاطر اقتراحات التعليمات البرمجية غير الآمنة، ومنع إساءة استخدام مفسر التعليمات البرمجية، والتنفيذ الآمن للأوامر. دفتر أمثلة CodeShield.
كان CyberSec Eval v1 أول مجموعة تقييمات للأمن السيبراني للـ LLMs على مستوى الصناعة على حد علمنا. تستند هذه المعايير إلى إرشادات ومعايير الصناعة (مثل CWE و MITRE ATT&CK) وتم بناؤها بالتعاون مع خبراء الأمن لدينا. نهدف إلى توفير أدوات تساعد في معالجة بعض المخاطر الموضحة في تعهدات البيت الأبيض بشأن تطوير الذكاء الاصطناعي المسؤول، بما في ذلك:
نعتقد أن هذه الأدوات ستقلل من تكرار قيام LLMs باقتراح تعليمات برمجية غير آمنة من إنشاء الذكاء الاصطناعي وتقلل من فائدتها للخصوم السيبرانيين. تظهر نتائجنا الأولية أن هناك مخاطر ذات دلالة في الأمن السيبراني للـ LLMs، سواء في التوصية بتعليمات برمجية غير آمنة أو في الامتثال للطلبات الخبيثة. راجع ورقة Cybersec Eval لمزيد من التفاصيل.
يوسع CyberSec Eval 2 نطاق سابقه من خلال قياس ميل LLM إلى إساءة استخدام مفسر التعليمات البرمجية، وقدرات الهجوم السيبراني الهجومية، وقابلية التأثر بحقن المطالبات. يمكنك قراءة الورقة البحثية هنا.
يمكنك أيضًا الاطلاع على لوحة المتصدرين 🤗 هنا.
يتميز الإصدار الجديد من CyberSec Eval 3 بثلاث مجموعات اختبار إضافية: اختبارات حقن المطالبات المرئية، واختبارات قدرات التصيد الاحتيالي الموجه، واختبارات العمليات الهجومية السيبرانية المستقلة.
كجزء من النظام المرجعي Llama، نقوم بدمج طبقة أمان لتسهيل تبني ونشر هذه الضوابط الوقائية. الموارد اللازمة للبدء في استخدام الضوابط الوقائية متاحة في مستودع Llama-recipe على GitHub.
للحصول على قائمة محدثة باستمرار من الأسئلة الشائعة، ليس فقط لمكونات Purple Llama ولكن أيضًا بشكل عام لنماذج Llama، راجع الأسئلة الشائعة هنا.
راجع ملف المساهمة لمعرفة كيفية المساعدة.
| نوع المكوّن | المكوّنات | الترخيص |
|---|
| التقييمات/المعايير | Cyber Security Eval (وأخرى قادمة) | MIT |
| الضوابط الوقائية | Llama Guard | Llama 2 Community License |
| الضوابط الوقائية | Llama Guard 2 | Llama 3 Community License |
| الضوابط الوقائية | Llama Guard 3-8B | Llama 3.2 Community License |
| الضوابط الوقائية | Llama Guard 3-1B | Llama 3.2 Community License |
| الضوابط الوقائية | Llama Guard 3-11B-vision | Llama 3.2 Community License |
| الضوابط الوقائية | Prompt Guard | Llama 3.2 Community License |
| الضوابط الوقائية | Code Shield | MIT |