Skip to content
KitploitKITPLOIT
أدواتالمدونة
إرسال
أدواتالمدونة
إرسال

أدوات الاختراق واختبار الاختراق والأمن السيبراني لترسانتك الأمنية!

Kitploit هو دليل لأدوات الاختراق والأمن السيبراني واختبار الاختراق. اكتشف آخر تحديثات المشاريع للعثور على الثغرات وتحليل الأنظمة وأتمتة الاختبارات وتعزيز أمنك.

··الخلاصات·اتصال·الخصوصية·© 2026 Kitploit

دليل الأدوات

الفئات

عرض جميع الفئات
Loading categories
terminal-bench-2 — معيار لتقييم وكلاء الذكاء الاصطناعي في مهام واقعية تشمل حل الثغرات، وتصحيح الأخطاء البرمجية، وتجميع البروتينات في بيئات محتواة. يُستخدم من قبل مختبرات متطورة لقياس قدرات الوكلاء. | Kitploit
أدوات/GitHubGitHub/harbor-framework/terminal-bench-2
تحليل الثغرات الأمنيةالبرمجة النصية والأتمتةالمحاكاة الافتراضية للأمانCTFاختبار الاختراقDevSecOpsالتعلم والتعليممختبرات وتدريب عملي
GitHub
harbor-framework/terminal-bench-2

terminal-bench-2

معيار لتقييم وكلاء الذكاء الاصطناعي في مهام واقعية تشمل حل الثغرات، وتصحيح الأخطاء البرمجية، وتجميع البروتينات في بيئات محتواة. يُستخدم من قبل مختبرات متطورة لقياس قدرات الوكلاء.

عرض المستودع
37110911منذ 4 أشهرتمت المراجعة من قبل Kitploit

الأكثر شعبية

عرض الكل →

اكتشف الأدوات الأكثر استخدامًا من قبل مجتمعنا.

استكشف جميع الأدوات

تصفح مجموعتنا من الأدوات

عرض جميع الأدوات →
مشاركة

Terminal-Bench 2.0

root@kitploit:~

######################################################################
#  _____                   _             _       ______________      #
# |_   _|__ _ __ _ __ ___ (_)_ __   __ _| |     ||            ||     #
#   | |/ _ \ '__| '_ ` _ \| | '_ \ / _` | |     || >          ||     #
#   | |  __/ |  | | | | | | | | | | (_| | |     ||            ||     #
#   |_|\___|_|  |_| |_| |_|_|_| |_|\__,_|_|     ||____________||     #
#   ____                  _       ____    ___   |______________|     #
#  | __ )  ___ _ __   ___| |__   |___ \  / _ \  \\############\\     #
#  |  _ \ / _ \ '_ \ / __| '_ \    __) || | | |  \\############\\    # 
#  | |_) |  __/ | | | (__| | | |  / __/ | |_| |   \      ____    \   #
#  |____/ \___|_| |_|\___|_| |_| |_____(_)___/     \_____\___\____\  #
#                                                                    #
######################################################################

Docs

Terminal-Bench هو معيار قياس شعبي لقياس قدرات الوكلاء ونماذج اللغة على أداء أعمال قيّمة في بيئات مُحاوِية. تشمل المهام تجميع البروتينات للتخليق، وتصحيح أخطاء الأكواد غير المتزامنة، وحل الثغرات الأمنية.

يُستخدم من قبل جميع مختبرات الحدود تقريباً.

البدء

أولاً، قم بتثبيت Harbor، حزمة تقييم وتحسين الوكلاء الخاصة بنا:

root@kitploit:~
uv tool install harbor

أو

root@kitploit:~
pip install harbor

يجب أن تكون الآن قادرًا على تشغيل TB 2.0! اختبر ذلك عن طريق تشغيل حلول مجموعة البيانات الأساسية في حاويات Docker محليًا:

root@kitploit:~
uv run harbor run --dataset [email protected] \
   --agent oracle \
   --n-concurrent 4 

يقوم هذا الأمر تلقائيًا بتنزيل مهام المعيار. يمكنك الاطلاع عليها على https://github.com/laude-institute/terminal-bench-2

يمكنك أيضًا التشغيل باستخدام Terminus:

root@kitploit:~
export ANTHROPIC_API_KEY=<YOUR-KEY>
uv run harbor run --dataset [email protected] \
   --agent terminus-2 \
   --model anthropic/claude-opus-4-1 \
   --n-concurrent 4 

أو أحد الوكلاء التابعين لجهات خارجية والمثبتة:

root@kitploit:~
export ANTHROPIC_API_KEY=<YOUR-KEY> 
uv run harbor run --dataset [email protected] \
   --agent claude-code \
   --model anthropic/claude-opus-4-1 \
   --n-concurrent 4 

الترحيل من منصة Terminal-Bench القديمة إلى Harbor

إذا كنت قد اختبرت وكيلك أو نموذجك سابقًا داخل مستودع Terminal-Bench القديم، فإن الترحيل إلى Harbor يجب أن يكون مباشرًا. ما عليك سوى توجيه نفس نقطة نهاية النموذج إلى الوسيط --model الخاص بأمر harbor run.

بالنسبة للوكلاء، ستحتاج إلى إنشاء فئة فرعية من BaseInstalledAgent أو BaseAgent. للحصول على مثال، راجع كيف ندعم Claude Code.

ديسكورد

إذا كان لديك أي أسئلة متبقية، فيرجى التواصل عبر ديسكورد: https://discord.gg/6xWPKhGDbA
سنراقب قناة #tb-2.

الأسئلة الشائعة

س: لماذا قمتم بإنشاء نسخة جديدة من المعيار؟
ج: كنا نعلم دائمًا أنه مع زيادة قدرات النماذج، سنحتاج إلى تحديث Terminal-Bench لمواكبة قدرات الحدود. تم بناء TB2.0 بمهام أكثر صعوبة لاختبار هذه القدرات. بالإضافة إلى ذلك، أردنا دفع الحدود مع استمرار التركيز على جودة المهام. كل مهمة في TB2.0 تلقت عدة ساعات من التحقق البشري والمساعدة من النماذج اللغوية لضمان أن المهام (1) قابلة للحل، (2) واقعية، و(3) محددة بشكل جيد. سنشارك المزيد حول كيفية قيامنا بذلك في النشرة الأولية القادمة.

س: ما هو "Harbor" ولماذا يجب علي استخدامه؟
ج: Harbor هو إطارنا الجديد لتشغيل التقييمات العاملة وتوليد نشرات التعلم المعزز. نخطط لإطلاقه للاستخدام العام في وقت لاحق من هذا الشهر. أخذنا كل ما تعلمناه حول تقييمات الوكلاء وأعدنا كتابة منصة التقييم الأصلية لـ Terminal-Bench من الأساس لتحسين الموثوقية، والملاحظة، وقابلية التوسع، والأداء.

الاستشهاد بـ Terminal-Bench

إذا وجدت معيارنا مفيدًا، فيرجى التفكير في استخدام الاقتباس التالي:

root@kitploit:~
@misc{tbench_2025,
      title={Terminal-Bench: A Benchmark for AI Agents in Terminal Environments}, 
      url={https://github.com/laude-institute/terminal-bench}, 
      author={The Terminal-Bench Team}, year={2025}, month={Apr}} 
تنزيل الأداة