
Semplice, ma intelligente, web crawler multi-thread per raccogliere casualmente enormi elenchi di nomi di dominio unici.
dcrawl è un web crawler semplice ma intelligente e multi-thread per raccogliere casualmente enormi elenchi di nomi di dominio unici.

dcrawl prende un URL di un sito come input e rileva tutti i link <a href=...> nel corpo del sito. Ogni link trovato viene inserito nella coda. Successivamente, ogni link in coda viene esplorato allo stesso modo, ramificandosi verso più URL trovati nei link del corpo di ogni sito.
Come funziona lo smart crawling:
go build dcrawl.go
./dcrawl -url http://wired.com -out ~/domain_lists/domains1.txt -t 8
___ __
__| _/________________ __ _ _| |
/ __ |/ ___\_ __ \__ \\ \/ \/ / |
/ /_/ \ \___| | \// __ \\ /| |__
\____ |\___ >__| (____ /\/\_/ |____/
\/ \/ \/ v.1.0
utilizzo: dcrawl -url URL -out OUTPUT_FILE -t THREADS
-ms int
massimo di sottodomini diversi per dominio (def. 10) (default 10)
-mu int
numero massimo di link da spider per hostname (def. 5) (default 5)
-out string
file di output su cui salvare gli hostname
-t int
numero di thread concorrenti (def. 8) (default 8)
-url string
URL da cui iniziare lo scraping
-v bool
verbose (default false)
dcrawl è stato creato da Kuba Gretzky di breakdev.org e rilasciato sotto licenza MIT.