
AI एजेंटों का मूल्यांकन करने के लिए बेंचमार्क जिसमें वास्तविक दुनिया के कार्य शामिल हैं: कंटेनरीकृत वातावरण में भेद्यता समाधान, कोड डिबगिंग और प्रोटीन संयोजन। फ्रंटियर प्रयोगशालाओं द्वारा एजेंट क्षमताओं को मापने के लिए उपयोग किया जाता है।
######################################################################
# _____ _ _ ______________ #
# |_ _|__ _ __ _ __ ___ (_)_ __ __ _| | || || #
# | |/ _ \ '__| '_ ` _ \| | '_ \ / _` | | || > || #
# | | __/ | | | | | | | | | | | (_| | | || || #
# |_|\___|_| |_| |_| |_|_|_| |_|\__,_|_| ||____________|| #
# ____ _ ____ ___ |______________| #
# | __ ) ___ _ __ ___| |__ |___ \ / _ \ \\############\\ #
# | _ \ / _ \ '_ \ / __| '_ \ __) || | | | \\############\\ #
# | |_) | __/ | | | (__| | | | / __/ | |_| | \ ____ \ #
# |____/ \___|_| |_|\___|_| |_| |_____(_)___/ \_____\___\____\ #
# #
######################################################################
Terminal-Bench कंटेनरीकृत वातावरण में मूल्यवान कार्य करने के लिए एजेंटों और भाषा मॉडलों की क्षमताओं को मापने के लिए एक लोकप्रिय बेंचमार्क है। कार्यों में संश्लेषण के लिए प्रोटीन को असेंबल करना, एसिंक कोड को डिबग करना और सुरक्षा कमजोरियों को हल करना शामिल है।
इसका उपयोग लगभग सभी अग्रणी प्रयोगशालाओं द्वारा किया जाता है।
पहले, हमारा पैकेज Harbor स्थापित करें, जो एजेंटों के मूल्यांकन और अनुकूलन के लिए है:
uv tool install harbor
या
pip install harbor
अब आप TB 2.0 चला पाएंगे! इसे स्थानीय डॉकर कंटेनरों में डेटासेट ओरेकल समाधानों को चलाकर परीक्षण करें:
uv run harbor run --dataset [email protected] \
--agent oracle \
--n-concurrent 4
यह कमांड स्वचालित रूप से बेंचमार्क के कार्यों को डाउनलोड करता है। आप उन्हें https://github.com/laude-institute/terminal-bench-2 पर देख सकते हैं।
आप Terminus का उपयोग करके भी चला सकते हैं:
export ANTHROPIC_API_KEY=<YOUR-KEY>
uv run harbor run --dataset [email protected] \
--agent terminus-2 \
--model anthropic/claude-opus-4-1 \
--n-concurrent 4
या स्थापित तृतीय-पक्ष एजेंटों में से किसी एक का उपयोग करें:
export ANTHROPIC_API_KEY=<YOUR-KEY>
uv run harbor run --dataset [email protected] \
--agent claude-code \
--model anthropic/claude-opus-4-1 \
--n-concurrent 4
यदि आपने पहले अपने एजेंट या मॉडल का परीक्षण पुराने Terminal-Bench रिपॉजिटरी में किया था, तो Harbor में माइग्रेट करना सीधा होना चाहिए। बस उसी मॉडल एंडपॉइंट को harbor run के --model आर्ग्युमेंट पर इंगित करें।
एजेंटों के लिए, आपको BaseInstalledAgent या BaseAgent को सबक्लास करना होगा। एक उदाहरण के लिए, देखें कि हम Claude Code को कैसे सपोर्ट करते हैं।
यदि आपके कोई और प्रश्न हैं, तो कृपया Discord पर संपर्क करें: https://discord.gg/6xWPKhGDbA
हम #tb-2 चैनल की निगरानी कर रहे होंगे।
प्रश्न: आपने बेंचमार्क का नया संस्करण क्यों बनाया?
उत्तर: हम हमेशा से जानते थे कि जैसे-जैसे मॉडल क्षमताएँ बढ़ेंगी, हमें terminal-bench को अग्रणी क्षमताओं के अनुरूप अद्यतित रखना होगा। TB2.0 इन क्षमताओं का परीक्षण करने के लिए कठिन कार्यों के साथ बनाया गया है। इसके अलावा, हम कार्य गुणवत्ता पर निरंतर जोर देते हुए सीमा को आगे बढ़ाना चाहते थे। TB2.0 में प्रत्येक कार्य को कई घंटों के मानव और LM-सहायता प्राप्त सत्यापन से गुजारा गया है ताकि यह सुनिश्चित हो सके कि कार्य (1) हल करने योग्य हैं, (2) यथार्थवादी हैं, और (3) अच्छी तरह से निर्दिष्ट हैं। हम आगामी प्रीप्रिंट में इस पर और अधिक जानकारी साझा करेंगे।
प्रश्न: "Harbor" क्या है और मुझे इसका उपयोग क्यों करना होगा?
उत्तर: Harbor एजेंटिक इवैल्यूएशन चलाने और RL रोलआउट उत्पन्न करने का हमारा नया फ्रेमवर्क है। हम इसे इस महीने के अंत में सामान्य उपयोग के लिए जारी करने की योजना बना रहे हैं। हमने एजेंट इवैल्यूएशन के बारे में जो कुछ भी सीखा, उसे लिया और मूल Terminal-Bench इवैल्यूएशन हार्नेस को नए सिरे से लिखा – बेहतर विश्वसनीयता, अवलोकन क्षमता, स्केलेबिलिटी और प्रदर्शन के लिए।
यदि आपको हमारा बेंचमार्क उपयोगी लगा, तो कृपया निम्नलिखित उद्धरण का उपयोग करने पर विचार करें:
@misc{tbench_2025,
title={Terminal-Bench: A Benchmark for AI Agents in Terminal Environments},
url={https://github.com/laude-institute/terminal-bench},
author={The Terminal-Bench Team}, year={2025}, month={Apr}}