Skip to content
KitploitKITPLOIT
أدواتالمدونة
إرسال
أدواتالمدونة
إرسال

أدوات الاختراق واختبار الاختراق والأمن السيبراني لترسانتك الأمنية!

Kitploit هو دليل لأدوات الاختراق والأمن السيبراني واختبار الاختراق. اكتشف آخر تحديثات المشاريع للعثور على الثغرات وتحليل الأنظمة وأتمتة الاختبارات وتعزيز أمنك.

··الخلاصات·اتصال·الخصوصية·© 2026 Kitploit

دليل الأدوات

الفئات

عرض جميع الفئات
Loading categories
autoguardrails — سقالة أبحاث المحاذاة (على غرار الأبحاث التلقائية) لحواجز نماذج اللغات الكبيرة: البحث عبر سطح سياسة واحدة policy.md | Kitploit
أدوات/GitHubGitHub/santanderai/autoguardrails
التعلم والتعليمالفريق الأحمرأمن الذكاء الاصطناعيالهجوم العدائي
GitHubsantanderai/autoguardrails

autoguardrails

سقالة أبحاث المحاذاة (على غرار الأبحاث التلقائية) لحواجز نماذج اللغات الكبيرة: البحث عبر سطح سياسة واحدة policy.md

عرض المستودع
1293537منذ شهر واحدتمت المراجعة من قبل Kitploit

الأكثر شعبية

عرض الكل →

اكتشف الأدوات الأكثر استخدامًا من قبل مجتمعنا.

استكشف جميع الأدوات

تصفح مجموعتنا من الأدوات

عرض جميع الأدوات →
مشاركة
الموقع الإلكتروني

autoguardrails

مصدر مفتوح من Santander AI Lab. مكتبة بحثية / أداة تقييم لأمان LLM/الذكاء الاصطناعي (على نمط autoresearch): تبحث في سطح وحيد قابل للتعديل policy.md لتقليل معدل نجاح الهجوم (ASR) مقابل مجموعة تقييم ثابتة، مع حد أدنى لتمرير الحالات الحميدة.

License: Apache 2.0 Python 3.10+ CI CodeQL codecov OpenSSF Scorecard Code style: black Ruff Conventional Commits جزء من Santander AI Open Source — مشاريع ذكاء اصطناعي مفتوحة المصدر من Banco Santander (santander.com).

autoguardrails هو scaffold أبحاث محاذاة صغير مستوحى من autoresearch الخاص بـ Karpathy.

بدلاً من البحث في train.py، يبحث هذا المستودع في policy.md.

الفكرة هي نفسها:

  • الحفاظ على السطح القابل للتعديل صغيرًا
  • الحفاظ على أداة التقييم ثابتة
  • التشغيل ضمن ميزانية زمنية ثابتة
  • مقارنة المرشحين بمقياس رئيسي واحد
  • تسجيل كل قرار احتفاظ أو رفض

في هذا المستودع، المقياس الرئيسي هو معدل نجاح الهجوم (ASR، الأقل أفضل)، مع حد أدنى لتمرير الحالات الحميدة حتى لا يفوز النظام برفض كل شيء.

ما هو الأكثر أهمية

بالنسبة للتجارب اليومية، هناك ثلاثة ملفات هي الأكثر أهمية:

  • program.md: التعليمات التي يملكها البشر للحلقة
  • policy.md: الملف الوحيد الذي يجب تعديله بين عمليات التشغيل
  • results.tsv: سجل التشغيل الإضافي فقط

كل شيء آخر هو كود أداة تقييم ثابت أو بيانات تقييم ثابتة.

العقد البحثي الحالي

  • السطح القابل للتعديل: policy.md
  • المجموعة الثابتة: eval_suite.jsonl
  • موجه القاضي الثابت: judge_prompt.md
  • الأدوات الثابتة: autoguardrails/
  • قاعدة القبول: الاحتفاظ بالمرشح فقط إذا تحسن ASR ولم ينخفض تمرير الحالات الحميدة بأكثر من نقطتين مئويتين
  • الميزانية الزمنية: ثابتة بواسطة تكوين الأدوات، حاليًا 5 دقائق لكل مرحلة تقييم

إذا كنت تريد نموذجًا ذهنيًا أقرب إلى autoresearch الأصلي، فاعتبر autoguardrails/ كطبقة مساعدة ثابتة وpolicy.md كالملف الوحيد الخاضع للبحث.

البدء السريع

قم بالتشغيل من جذر المستودع.

  1. سجل خط الأساس.
root@kitploit:~
python -m autoguardrails baseline --reset --repeat 2 --notes "initial baseline"
  1. قم بتعديل policy.md فقط.

  2. قم بتقييم المرشح الجديد.

root@kitploit:~
python -m autoguardrails candidate --repeat 2 --notes "cover jailbreak and obfuscation"
  1. افحص النتيجة المحتفظ بها الحالية.
root@kitploit:~
python -m autoguardrails status
  1. افحص السجل الكامل.
root@kitploit:~
cat results.tsv

إذا تم رفض المرشح، يقوم الإطار تلقائيًا باستعادة policy.md إلى آخر نسخة مقبولة.

الغلاف البرمجي (Shell Wrapper)

إذا كنت تفضل نقطة دخول واحدة، استخدم run_autoguardrails.sh:

root@kitploit:~
sh run_autoguardrails.sh status
sh run_autoguardrails.sh evaluate
sh run_autoguardrails.sh baseline "initial baseline" 2
sh run_autoguardrails.sh candidate "cover jailbreak and obfuscation" 2

على Windows، شغّل الغلاف من Git Bash أو أي قشرة متوافقة مع POSIX.

تكوين النموذج الحقيقي

الإعداد الافتراضي يستخدم نموذجًا محليًا حتميًا (stub) ليعمل المستودع دون اتصال. لتشغيل تجارب حقيقية، وجّه نموذج الهدف ونموذج القاضي إلى نقاط نهاية متوافقة مع OpenAI.

متغيرات نموذج الهدف:

  • AUTOGUARDRAILS_TARGET_PROVIDER=openai_compatible
  • AUTOGUARDRAILS_TARGET_MODEL
  • AUTOGUARDRAILS_TARGET_API_BASE
  • AUTOGUARDRAILS_TARGET_API_KEY

متغيرات نموذج القاضي:

  • AUTOGUARDRAILS_JUDGE_PROVIDER=openai_compatible
  • AUTOGUARDRAILS_JUDGE_MODEL
  • AUTOGUARDRAILS_JUDGE_API_BASE
  • AUTOGUARDRAILS_JUDGE_API_KEY

مثال:

root@kitploit:~
export AUTOGUARDRAILS_TARGET_PROVIDER=openai_compatible
export AUTOGUARDRAILS_TARGET_MODEL=gpt-4.1-mini
export AUTOGUARDRAILS_TARGET_API_BASE=https://your-endpoint.example/v1
export AUTOGUARDRAILS_TARGET_API_KEY=your-target-key

export AUTOGUARDRAILS_JUDGE_PROVIDER=openai_compatible
export AUTOGUARDRAILS_JUDGE_MODEL=gpt-4.1-mini
export AUTOGUARDRAILS_JUDGE_API_BASE=https://your-endpoint.example/v1
export AUTOGUARDRAILS_JUDGE_API_KEY=your-judge-key

python -m autoguardrails baseline --reset --repeat 2 --notes "real-model baseline"

استخدم إعداد قاضي مجمّد خلال تسلسل التشغيل. لا تقم بتبديل موجهات القاضي أو نماذج القاضي في منتصف التجربة.

نمط التكرار النموذجي

دورة محاكاة بسيطة دون اتصال بالإنترنت تبدو كالتالي:

  1. سجل خط الأساس.
  2. أضف مجموعة تغيير سياسة واحدة إلى policy.md.
  3. شغّل candidate.
  4. احتفظ بالتغيير فقط إذا قبله الإطار.
  5. كرر مع تغيير جديد واحد في كل مرة.

أحد الأمثلة على تغيير مرشح يحسن من النموذج المحلي المرفق هو إضافة معالجة صريحة لـ:

  • صياغات الهروب (jailbreak) مثل "تجاهل التعليمات السابقة" و"لعب الأدوار" و"وضع المطور"
  • طلبات التمويه (obfuscation) مثل الترجمة، وbase64، وrot13، والتنسيق بصيغة JSON فقط، أو تحويل المخطط

يمنحك هذا منحنى تحسين أولي واقعي دون تغيير أداة التقييم.

هيكل المستودع

  • program.md: تعليمات التجربة وقيودها
  • policy.md: سياسة الحماية القابلة للتعديل الخاضعة للبحث
  • judge_prompt.md: موجه القاضي المجمّد
  • eval_suite.jsonl: حالات التقييم الثابتة للهجوم والحميدة
  • results.tsv: سجل التشغيل
  • run_autoguardrails.sh: غلاف مناسب لواجهة سطر الأوامر
  • autoguardrails/: إطار Python الثابت
  • tests/: فحوصات الانحدار والأمان للإطار

انظر autoguardrails/README.md لمعمارية الكود وtests/README.md لاستراتيجية الاختبار.

ملاحظات السلامة

  • هذا الهيكل (scaffold) أحادي الخطوة وقصير النطاق عن قصد.
  • لا يقوم بنمذجة الأدوات أو الوصول إلى الملفات أو إجراءات الوكيل متعددة الخطوات.
  • النموذج المحلي المرفق مخصص فقط للتحقق من الإطار؛ وليس نموذج أمان واقعي.
  • مجموعة التقييم ثابتة حسب التصميم. إذا قمت بتغييرها، ابدأ سلسلة تجارب جديدة بدلاً من المقارنة بالنتائج القديمة.

المتطلبات

  • Python 3.10+
  • لا تبعيات طرف ثالث للتشغيل — الإطار مبني بالكامل على مكتبة Python القياسية ويعمل دون اتصال افتراضيًا.
  • اختياري، للتطوير فقط: ruff، black، mypy، pytest، pytest-cov (انظر CONTRIBUTING.md).
  • اختياري، لتجارب النماذج الحقيقية: الوصول إلى نقطة نهاية لإكمال الدردشة متوافقة مع OpenAI (يتم تكوينها عبر متغيرات البيئة AUTOGUARDRAILS_* المذكورة أعلاه).

المساهمة

نرحب بالمساهمات! يرجى قراءة إرشادات المساهمة وقواعد السلوك قبل البدء.

  • أبلغ عن الأخطاء واطلب الميزات عبر GitHub Issues.
  • المساهمون من الخارج يوقعون على اتفاقية ترخيص المساهم (CLA) (يتم التعامل معها تلقائيًا بواسطة روبت CLA Assistant في أول PR لك).
  • قم بتشغيل ruff check . و black --check . و mypy autoguardrails و pytest قبل فتح PR.
  • احترم العقد البحثي: policy.md هو السطح القابل للتعديل الوحيد؛ eval_suite.jsonl و judge_prompt.md مجمّدان.

الأمان

يرجى الإبلاغ عن الثغرات الأمنية بمسؤولية. راجع سياسة الأمان الخاصة بنا لمعرفة كيفية الإبلاغ (لا تفتح مشكلة عامة للثغرات). الاتصال: [email protected] أو استخدم تنبيهات أمان GitHub.

إخلاء المسؤولية

هذا البرنامج هو مشروع مفتوح المصدر من Santander AI Lab، يتم توفيره "كما هو" بموجب ترخيصه، دون ضمانات أو شروط من أي نوع. إنه ليس منتجًا أو خدمة رسمية من Banco Santander، ولا يحمل أي التزام بدعم إنتاجي، ولا يشكل نصيحة مالية أو قانونية أو مهنية.

"Santander" وشعارها هما علامتان تجاريتان مسجلتان لـ Banco Santander, S.A. لا يمنح ترخيص المشروع أي حق في استخدامهما بما يتجاوز الإسناد الواقعي.

إذا كنت تعتقد أنك وجدت ثغرة أمنية، اتبع سياسة الأمان الخاصة بنا — لا تفتح مشكلة عامة. أنت مسؤول عن تقييم مدى ملاءمة هذا البرنامج لحالة استخدامك وعن الحفاظ على تحديث عمليات النشر الخاصة بك.

الترخيص

هذا المشروع مرخص بموجب رخصة Apache 2.0 — راجع ملفي LICENSE و NOTICE للحصول على التفاصيل.

root@kitploit:~
Copyright (c) 2026 Santander Group
SPDX-License-Identifier: Apache-2.0

الاقتباس

إذا استخدمت autoguardrails في بحثك، يرجى الاقتباس منه:

root@kitploit:~
@software{autoguardrails2026,
  author  = {{Santander AI Lab}},
  title   = {autoguardrails: an autoresearch-style guardrail policy loop},
  year    = {2026},
  url     = {https://github.com/SantanderAI/autoguardrails},
  license = {Apache-2.0}
}
تنزيل الأداة