Skip to content
KitploitKITPLOIT
StrumentiBlog
Invia
StrumentiBlog
Invia

Strumenti di Hacking, PenTest e Cybersecurity per il tuo Arsenale di Sicurezza!

Kitploit è una directory di strumenti di hacking, cybersecurity e pentesting. Scopri gli ultimi aggiornamenti dei progetti per trovare vulnerabilità, analizzare sistemi, automatizzare i test e rafforzare la tua sicurezza.

··Feed·Contatto·Privacy·© 2026 Kitploit

Directory degli strumenti

Categorie

Vedi tutte le categorie
Loading categories
terminal-bench-2 — Benchmark per valutare agenti AI su compiti del mondo reale, tra cui risoluzione di vulnerabilità, debug del codice e assemblaggio di proteine in ambienti containerizzati. Utilizzato da laboratori all'avanguardia per misurare le capacità degli agenti. | Kitploit
Strumenti/GitHubGitHub/harbor-framework/terminal-bench-2
Analisi delle VulnerabilitàScripting e AutomazioneVirtualizzazione per la SicurezzaCTFPenetration TestingDevSecOpsApprendimento e FormazioneLab e Pratica
GitHub
harbor-framework/terminal-bench-2

terminal-bench-2

Benchmark per valutare agenti AI su compiti del mondo reale, tra cui risoluzione di vulnerabilità, debug del codice e assemblaggio di proteine in ambienti containerizzati. Utilizzato da laboratori all'avanguardia per misurare le capacità degli agenti.

Vedi Repository
371109114 mesi faRevisionato da Kitploit

Più Popolari

Vedi tutti →

Scopri gli strumenti più utilizzati dalla nostra community.

Esplora tutti gli strumenti

Sfoglia la nostra collezione di strumenti

Vedi tutti gli strumenti →
Condividi

Terminal-Bench 2.0

root@kitploit:~

######################################################################
#  _____                   _             _       ______________      #
# |_   _|__ _ __ _ __ ___ (_)_ __   __ _| |     ||            ||     #
#   | |/ _ \ '__| '_ ` _ \| | '_ \ / _` | |     || >          ||     #
#   | |  __/ |  | | | | | | | | | | (_| | |     ||            ||     #
#   |_|\___|_|  |_| |_| |_|_|_| |_|\__,_|_|     ||____________||     #
#   ____                  _       ____    ___   |______________|     #
#  | __ )  ___ _ __   ___| |__   |___ \  / _ \  \\############\\     #
#  |  _ \ / _ \ '_ \ / __| '_ \    __) || | | |  \\############\\    # 
#  | |_) |  __/ | | | (__| | | |  / __/ | |_| |   \      ____    \   #
#  |____/ \___|_| |_|\___|_| |_| |_____(_)___/     \_____\___\____\  #
#                                                                    #
######################################################################

Docs

Terminal-Bench è un popolare benchmark per misurare le capacità degli agenti e dei modelli linguistici di svolgere lavoro utile in ambienti containerizzati. I task includono l'assemblaggio di proteine per la sintesi, il debug di codice asincrono e la risoluzione di vulnerabilità di sicurezza.

È utilizzato praticamente da tutti i laboratori all'avanguardia.

Per Iniziare

Innanzitutto, installa Harbor, il nostro pacchetto per valutare e ottimizzare gli agenti:

root@kitploit:~
uv tool install harbor

oppure

root@kitploit:~
pip install harbor

A questo punto dovresti essere in grado di eseguire TB 2.0! Prova testando le soluzioni oracle del dataset in contenitori Docker localmente:

root@kitploit:~
uv run harbor run --dataset [email protected] \
   --agent oracle \
   --n-concurrent 4 

Questo comando scarica automaticamente i task per il benchmark. Puoi visualizzarli su https://github.com/laude-institute/terminal-bench-2

Puoi anche eseguirlo utilizzando Terminus:

root@kitploit:~
export ANTHROPIC_API_KEY=<YOUR-KEY>
uv run harbor run --dataset [email protected] \
   --agent terminus-2 \
   --model anthropic/claude-opus-4-1 \
   --n-concurrent 4 

Oppure uno degli agenti di terze parti installati:

root@kitploit:~
export ANTHROPIC_API_KEY=<YOUR-KEY> 
uv run harbor run --dataset [email protected] \
   --agent claude-code \
   --model anthropic/claude-opus-4-1 \
   --n-concurrent 4 

Migrare dall'infrastruttura di valutazione di Terminal-Bench a Harbor

Se in precedenza hai testato il tuo agente o modello all'interno del vecchio repository Terminal-Bench, la migrazione a Harbor dovrebbe essere semplice. Basta puntare lo stesso endpoint del modello all'argomento --model di harbor run.

Per gli agenti, dovrai creare una sottoclasse di BaseInstalledAgent o BaseAgent. Per un esempio, vedi come supportiamo Claude Code.

Discord

Se hai ulteriori domande, contattaci su Discord: https://discord.gg/6xWPKhGDbA
Monitoreremo il canale #tb-2.

FAQ

D: Perché avete creato una nuova versione del benchmark?
R: Sapevamo fin dall'inizio che, con l'aumento delle capacità dei modelli, avremmo dovuto mantenere aggiornato terminal-bench con le capacità di frontiera. TB2.0 è costruito con task più difficili per testare queste capacità. Inoltre, volevamo spingere oltre la frontiera con un'enfasi continua sulla qualità dei task. Ogni task in TB2.0 ha ricevuto diverse ore di validazione umana e assistita da LM per garantire che i task siano (1) risolvibili, (2) realistici e (3) ben specificati. Condivideremo maggiori dettagli su come abbiamo fatto nel nostro prossimo preprint.

D: Cos'è "Harbor" e perché devo usarlo?
R: Harbor è il nostro nuovo framework per eseguire valutazioni agentiche e generare rollout RL. Prevediamo di rilasciarlo per uso generale entro la fine del mese. Abbiamo preso tutto ciò che abbiamo imparato sulle valutazioni degli agenti e riscritto da zero l'infrastruttura di valutazione originale di Terminal-Bench per migliorare affidabilità, osservabilità, scalabilità e prestazioni.

Citare Terminal-Bench

Se hai trovato utile il nostro benchmark, considera di utilizzare la seguente citazione:

root@kitploit:~
@misc{tbench_2025,
      title={Terminal-Bench: A Benchmark for AI Agents in Terminal Environments}, 
      url={https://github.com/laude-institute/terminal-bench}, 
      author={The Terminal-Bench Team}, year={2025}, month={Apr}} 
Scarica lo strumento