معيار لتقييم وكلاء الذكاء الاصطناعي في مهام واقعية تشمل حل الثغرات، وتصحيح الأخطاء البرمجية، وتجميع البروتينات في بيئات محتواة. يُستخدم من قبل مختبرات متطورة لقياس قدرات الوكلاء.
######################################################################
# _____ _ _ ______________ #
# |_ _|__ _ __ _ __ ___ (_)_ __ __ _| | || || #
# | |/ _ \ '__| '_ ` _ \| | '_ \ / _` | | || > || #
# | | __/ | | | | | | | | | | | (_| | | || || #
# |_|\___|_| |_| |_| |_|_|_| |_|\__,_|_| ||____________|| #
# ____ _ ____ ___ |______________| #
# | __ ) ___ _ __ ___| |__ |___ \ / _ \ \\############\\ #
# | _ \ / _ \ '_ \ / __| '_ \ __) || | | | \\############\\ #
# | |_) | __/ | | | (__| | | | / __/ | |_| | \ ____ \ #
# |____/ \___|_| |_|\___|_| |_| |_____(_)___/ \_____\___\____\ #
# #
######################################################################
Terminal-Bench هو معيار قياس شعبي لقياس قدرات الوكلاء ونماذج اللغة على أداء أعمال قيّمة في بيئات مُحاوِية. تشمل المهام تجميع البروتينات للتخليق، وتصحيح أخطاء الأكواد غير المتزامنة، وحل الثغرات الأمنية.
يُستخدم من قبل جميع مختبرات الحدود تقريباً.
أولاً، قم بتثبيت Harbor، حزمة تقييم وتحسين الوكلاء الخاصة بنا:
uv tool install harbor
أو
pip install harbor
يجب أن تكون الآن قادرًا على تشغيل TB 2.0! اختبر ذلك عن طريق تشغيل حلول مجموعة البيانات الأساسية في حاويات Docker محليًا:
uv run harbor run --dataset [email protected] \
--agent oracle \
--n-concurrent 4
يقوم هذا الأمر تلقائيًا بتنزيل مهام المعيار. يمكنك الاطلاع عليها على https://github.com/laude-institute/terminal-bench-2
يمكنك أيضًا التشغيل باستخدام Terminus:
export ANTHROPIC_API_KEY=<YOUR-KEY>
uv run harbor run --dataset [email protected] \
--agent terminus-2 \
--model anthropic/claude-opus-4-1 \
--n-concurrent 4
أو أحد الوكلاء التابعين لجهات خارجية والمثبتة:
export ANTHROPIC_API_KEY=<YOUR-KEY>
uv run harbor run --dataset [email protected] \
--agent claude-code \
--model anthropic/claude-opus-4-1 \
--n-concurrent 4
إذا كنت قد اختبرت وكيلك أو نموذجك سابقًا داخل مستودع Terminal-Bench القديم، فإن الترحيل إلى Harbor يجب أن يكون مباشرًا. ما عليك سوى توجيه نفس نقطة نهاية النموذج إلى الوسيط --model الخاص بأمر harbor run.
بالنسبة للوكلاء، ستحتاج إلى إنشاء فئة فرعية من BaseInstalledAgent أو BaseAgent. للحصول على مثال، راجع كيف ندعم Claude Code.
إذا كان لديك أي أسئلة متبقية، فيرجى التواصل عبر ديسكورد: https://discord.gg/6xWPKhGDbA
سنراقب قناة #tb-2.
س: لماذا قمتم بإنشاء نسخة جديدة من المعيار؟
ج: كنا نعلم دائمًا أنه مع زيادة قدرات النماذج، سنحتاج إلى تحديث Terminal-Bench لمواكبة قدرات الحدود. تم بناء TB2.0 بمهام أكثر صعوبة لاختبار هذه القدرات. بالإضافة إلى ذلك، أردنا دفع الحدود مع استمرار التركيز على جودة المهام. كل مهمة في TB2.0 تلقت عدة ساعات من التحقق البشري والمساعدة من النماذج اللغوية لضمان أن المهام (1) قابلة للحل، (2) واقعية، و(3) محددة بشكل جيد. سنشارك المزيد حول كيفية قيامنا بذلك في النشرة الأولية القادمة.
س: ما هو "Harbor" ولماذا يجب علي استخدامه؟
ج: Harbor هو إطارنا الجديد لتشغيل التقييمات العاملة وتوليد نشرات التعلم المعزز. نخطط لإطلاقه للاستخدام العام في وقت لاحق من هذا الشهر. أخذنا كل ما تعلمناه حول تقييمات الوكلاء وأعدنا كتابة منصة التقييم الأصلية لـ Terminal-Bench من الأساس لتحسين الموثوقية، والملاحظة، وقابلية التوسع، والأداء.
إذا وجدت معيارنا مفيدًا، فيرجى التفكير في استخدام الاقتباس التالي:
@misc{tbench_2025,
title={Terminal-Bench: A Benchmark for AI Agents in Terminal Environments},
url={https://github.com/laude-institute/terminal-bench},
author={The Terminal-Bench Team}, year={2025}, month={Apr}}