Skip to content
KitploitKITPLOIT
उपकरणब्लॉग
जमा करें
उपकरणब्लॉग
जमा करें

हैकिंग, पेनटेस्ट और साइबर सुरक्षा उपकरण आपके सुरक्षा शस्त्रागार के लिए!

Kitploit हैकिंग, साइबर सुरक्षा और पेंटेस्टिंग टूल्स की एक निर्देशिका है। कमजोरियों को खोजने, सिस्टम का विश्लेषण करने, परीक्षण को स्वचालित करने और अपनी सुरक्षा को मजबूत करने के लिए नवीनतम प्रोजेक्ट अपडेट खोजें।

··फ़ीड·संपर्क·गोपनीयता·© 2026 Kitploit

टूल निर्देशिका

श्रेणियाँ

सभी श्रेणियाँ देखें
Loading categories
terminal-bench-2 — AI एजेंटों का मूल्यांकन करने के लिए बेंचमार्क जिसमें वास्तविक दुनिया के कार्य शामिल हैं: कंटेनरीकृत वातावरण में भेद्यता समाधान, कोड डिबगिंग और प्रोटीन संयोजन। फ्रंटियर प्रयोगशालाओं द्वारा एजेंट क्षमताओं को मापने के लिए उपयोग किया जाता है। | Kitploit
उपकरण/GitHubGitHub/harbor-framework/terminal-bench-2
भेद्यता विश्लेषणस्क्रिप्टिंग और स्वचालनसुरक्षा वर्चुअलाइजेशनCTFपेनिट्रेशन टेस्टिंगDevSecOpsलर्निंग और शिक्षालैब और अभ्यास

सबसे लोकप्रिय

सभी देखें →

हमारे समुदाय द्वारा सबसे अधिक उपयोग किए जाने वाले उपकरण खोजें।

सभी उपकरण खोजें

हमारे उपकरणों का संग्रह ब्राउज़ करें

सभी उपकरण देखें →
साझा करें
GitHub
harbor-framework/terminal-bench-2

terminal-bench-2

AI एजेंटों का मूल्यांकन करने के लिए बेंचमार्क जिसमें वास्तविक दुनिया के कार्य शामिल हैं: कंटेनरीकृत वातावरण में भेद्यता समाधान, कोड डिबगिंग और प्रोटीन संयोजन। फ्रंटियर प्रयोगशालाओं द्वारा एजेंट क्षमताओं को मापने के लिए उपयोग किया जाता है।

रिपॉजिटरी देखें
3711093 महीने पहलेKitploit द्वारा समीक्षित

Terminal-Bench 2.0

root@kitploit:~

######################################################################
#  _____                   _             _       ______________      #
# |_   _|__ _ __ _ __ ___ (_)_ __   __ _| |     ||            ||     #
#   | |/ _ \ '__| '_ ` _ \| | '_ \ / _` | |     || >          ||     #
#   | |  __/ |  | | | | | | | | | | (_| | |     ||            ||     #
#   |_|\___|_|  |_| |_| |_|_|_| |_|\__,_|_|     ||____________||     #
#   ____                  _       ____    ___   |______________|     #
#  | __ )  ___ _ __   ___| |__   |___ \  / _ \  \\############\\     #
#  |  _ \ / _ \ '_ \ / __| '_ \    __) || | | |  \\############\\    # 
#  | |_) |  __/ | | | (__| | | |  / __/ | |_| |   \      ____    \   #
#  |____/ \___|_| |_|\___|_| |_| |_____(_)___/     \_____\___\____\  #
#                                                                    #
######################################################################

Docs

Terminal-Bench कंटेनरीकृत वातावरण में मूल्यवान कार्य करने के लिए एजेंटों और भाषा मॉडलों की क्षमताओं को मापने के लिए एक लोकप्रिय बेंचमार्क है। कार्यों में संश्लेषण के लिए प्रोटीन को असेंबल करना, एसिंक कोड को डिबग करना और सुरक्षा कमजोरियों को हल करना शामिल है।

इसका उपयोग लगभग सभी अग्रणी प्रयोगशालाओं द्वारा किया जाता है।

आरंभ करना

पहले, हमारा पैकेज Harbor स्थापित करें, जो एजेंटों के मूल्यांकन और अनुकूलन के लिए है:

root@kitploit:~
uv tool install harbor

या

root@kitploit:~
pip install harbor

अब आप TB 2.0 चला पाएंगे! इसे स्थानीय डॉकर कंटेनरों में डेटासेट ओरेकल समाधानों को चलाकर परीक्षण करें:

root@kitploit:~
uv run harbor run --dataset [email protected] \
   --agent oracle \
   --n-concurrent 4 

यह कमांड स्वचालित रूप से बेंचमार्क के कार्यों को डाउनलोड करता है। आप उन्हें https://github.com/laude-institute/terminal-bench-2 पर देख सकते हैं।

आप Terminus का उपयोग करके भी चला सकते हैं:

root@kitploit:~
export ANTHROPIC_API_KEY=<YOUR-KEY>
uv run harbor run --dataset [email protected] \
   --agent terminus-2 \
   --model anthropic/claude-opus-4-1 \
   --n-concurrent 4 

या स्थापित तृतीय-पक्ष एजेंटों में से किसी एक का उपयोग करें:

root@kitploit:~
export ANTHROPIC_API_KEY=<YOUR-KEY> 
uv run harbor run --dataset [email protected] \
   --agent claude-code \
   --model anthropic/claude-opus-4-1 \
   --n-concurrent 4 

Terminal-Bench Harness से Harbor में माइग्रेट करना

यदि आपने पहले अपने एजेंट या मॉडल का परीक्षण पुराने Terminal-Bench रिपॉजिटरी में किया था, तो Harbor में माइग्रेट करना सीधा होना चाहिए। बस उसी मॉडल एंडपॉइंट को harbor run के --model आर्ग्युमेंट पर इंगित करें।

एजेंटों के लिए, आपको BaseInstalledAgent या BaseAgent को सबक्लास करना होगा। एक उदाहरण के लिए, देखें कि हम Claude Code को कैसे सपोर्ट करते हैं।

Discord

यदि आपके कोई और प्रश्न हैं, तो कृपया Discord पर संपर्क करें: https://discord.gg/6xWPKhGDbA
हम #tb-2 चैनल की निगरानी कर रहे होंगे।

FAQ

प्रश्न: आपने बेंचमार्क का नया संस्करण क्यों बनाया?
उत्तर: हम हमेशा से जानते थे कि जैसे-जैसे मॉडल क्षमताएँ बढ़ेंगी, हमें terminal-bench को अग्रणी क्षमताओं के अनुरूप अद्यतित रखना होगा। TB2.0 इन क्षमताओं का परीक्षण करने के लिए कठिन कार्यों के साथ बनाया गया है। इसके अलावा, हम कार्य गुणवत्ता पर निरंतर जोर देते हुए सीमा को आगे बढ़ाना चाहते थे। TB2.0 में प्रत्येक कार्य को कई घंटों के मानव और LM-सहायता प्राप्त सत्यापन से गुजारा गया है ताकि यह सुनिश्चित हो सके कि कार्य (1) हल करने योग्य हैं, (2) यथार्थवादी हैं, और (3) अच्छी तरह से निर्दिष्ट हैं। हम आगामी प्रीप्रिंट में इस पर और अधिक जानकारी साझा करेंगे।

प्रश्न: "Harbor" क्या है और मुझे इसका उपयोग क्यों करना होगा?
उत्तर: Harbor एजेंटिक इवैल्यूएशन चलाने और RL रोलआउट उत्पन्न करने का हमारा नया फ्रेमवर्क है। हम इसे इस महीने के अंत में सामान्य उपयोग के लिए जारी करने की योजना बना रहे हैं। हमने एजेंट इवैल्यूएशन के बारे में जो कुछ भी सीखा, उसे लिया और मूल Terminal-Bench इवैल्यूएशन हार्नेस को नए सिरे से लिखा – बेहतर विश्वसनीयता, अवलोकन क्षमता, स्केलेबिलिटी और प्रदर्शन के लिए।

Terminal-Bench का हवाला देना

यदि आपको हमारा बेंचमार्क उपयोगी लगा, तो कृपया निम्नलिखित उद्धरण का उपयोग करने पर विचार करें:

root@kitploit:~
@misc{tbench_2025,
      title={Terminal-Bench: A Benchmark for AI Agents in Terminal Environments}, 
      url={https://github.com/laude-institute/terminal-bench}, 
      author={The Terminal-Bench Team}, year={2025}, month={Apr}} 
टूल डाउनलोड करें