
Простой, но умный многопоточный веб-сканер для случайного сбора огромных списков уникальных доменных имен.
dcrawl — это простой, но умный многопоточный веб-краулер для случайного сбора огромных списков уникальных доменных имен.

dcrawl принимает один URL сайта в качестве входных данных и обнаруживает все ссылки <a href=...> в теле сайта. Каждая найденная ссылка помещается в очередь. Последовательно каждая ссылка из очереди обрабатывается таким же образом, разветвляясь на большее количество URL, найденных в ссылках на теле каждого сайта.
Как работает умный краулинг:
go build dcrawl.go
./dcrawl -url http://wired.com -out ~/domain_lists/domains1.txt -t 8
___ __
__| _/________________ __ _ _| |
/ __ |/ ___\_ __ \__ \\ \/ \/ / |
/ /_/ \ \___| | \// __ \\ /| |__
\____ |\___ >__| (____ /\/\_/ |____/
\/ \/ \/ v.1.0
usage: dcrawl -url URL -out OUTPUT_FILE -t THREADS
-ms int
maximum different subdomains for one domain (def. 10) (default 10)
-mu int
maximum number of links to spider per hostname (def. 5) (default 5)
-out string
output file to save hostnames to
-t int
number of concurrent threads (def. 8) (default 8)
-url string
URL to start scraping from
-v bool
verbose (default false)
dcrawl был создан Kuba Gretzky из breakdev.org и выпущен под лицензией MIT.