
دفاع تدقيق الإجراءات قبل التنفيذ الذي يكتشف ويحجب حقن الأوامر غير المباشر في وكلاء LLM المستخدمين للأدوات باستخدام استرجاع التضمين وتقييم الاحتمال اللوغاريتمي التبايني.
ActGuard هو دفاع تدقيق إجراءات قبل التنفيذ ضد حقن الأوامر غير المباشر في وكلاء LLM المستخدمين للأدوات. يحتوي هذا المستودع على تنفيذ ActGuard النهائي وبيئة التشغيل المبنية على AgentDojo اللازمة لتقييمه.
يحتوي هذا الإصدار على تكوين ActGuard النهائي والكامل فقط. لا تزال المكونات الداخلية تستخدم المعرّف reflective_audit للتوافق مع معيار AgentDojo وتنسيقات التتبع.
meta-llama/Meta-Llama-3.1-8B-Instruct، أو نقطة تحقق محلية مكافئةيُوصى باستخدام uv:
uv sync --frozen --extra actguard
بدلاً من ذلك، ثبّت في بيئة Python مُفعّلة:
python -m pip install -e '.[actguard]'
من جذر المستودع:
export OPENROUTER_API_KEY=...
uv run --frozen --extra actguard ./scripts/run_actguard.sh
إذا تم تثبيت المشروع باستخدام pip، شغّل:
export OPENROUTER_API_KEY=...
./scripts/run_actguard.sh
يقيّم السكربت مجموعة workspace باستخدام هجوم important_instructions. يستخدم OpenRouter للوكيل الرئيسي والمدقق، ونماذج محلية متوافقة مع Hugging Face لاسترجاع التضمينات وإسناد الاحتمالات اللوغاريتمية التباينية. قد تكون مصادقة Hugging Face مطلوبة قبل تنزيل نقطة تحقق Llama الافتراضية المقيّدة.
لاستخدام نقاط تحقق مُنزّلة، استبدل قيم --reflective-audit-embedding-model و --reflective-audit-logprob-model في scripts/run_actguard.sh بمساراتها المحلية. استخدم uv run --frozen actguard-benchmark --help لعرض جميع خيارات المعيار.
تُكتب النتائج أسفل:
runs/openai_gpt-4o-mini-2024-07-18-reflective_audit/actguard/
يتم تجاهل دليل runs/ بواسطة Git.
شغّل اختبارات الانحدار الخاصة بـ ActGuard:
uv run --frozen pytest -q tests/test_agent_pipeline/test_reflective_audit.py
src/agentdojo/agent_pipeline/reflective_audit.py: تنفيذ ActGuardsrc/agentdojo/agent_pipeline/agent_pipeline.py: تكامل خط الأنابيبsrc/agentdojo/scripts/benchmark.py: واجهة سطر أوامر المعيارsrc/agentdojo/default_suites/: مجموعات التقييم وتعريفات المهامtests/test_agent_pipeline/test_reflective_audit.py: اختبارات الانحدارsrc/agentdojo/reflective_audit_trace.py: إنشاء التتبع وفحصهسجلات التشغيل، والبيئات المحلية، وبيانات الاعتماد، ومسودات الأوراق، ومخرجات التحليل المؤقتة، ودفاعات المقارنة مستبعدة عمدًا من هذا الإصدار.
يُوزَّع هذا المشروع بموجب ترخيص MIT. يتضمن بيئة تشغيل معيارية مشتقة من AgentDojo؛ راجع LICENSE للحصول على إشعار حقوق النشر الأصلية المحتفظ به.
| المعامل | الإعداد |
|---|
| نموذج الخلفية | openai/gpt-4o-mini-2024-07-18 عبر OpenRouter |
| درجة حرارة نموذج الخلفية | 0 |
| طول المقطع | 80--180 حرفًا |
| نموذج التضمين | sentence-transformers/all-MiniLM-L6-v2 |
| المقاطع المسترجعة | k = 3 |
| نموذج الاحتمال اللوغاريتمي التبايني | meta-llama/Meta-Llama-3.1-8B-Instruct |
| عتبة الاحتمال اللوغاريتمي | 0 |
| عتبة تجميع المقاطع المتشابهة | 0.9 |
| سياق نتيجة الأداة | سجل التدقيق الكامل |
| نموذج المدقق | openai/gpt-5-mini عبر OpenRouter |
| درجة حرارة المدقق | 0 |
| حجم مجموعة الأدوات التالية المتوقعة | 1--3 |
| توسيع المقاطع المجاورة | مقطع واحد على كل جانب |
| الحد الأقصى لمحاولات الإصلاح لكل إجراء | 2 |
| نص الإخفاء المحلي | [Removed suspicious instruction from external tool result.] |