
Web crawler simples, mas inteligente, multi-threaded para coletar aleatoriamente grandes listas de nomes de domínio únicos.
dcrawl é um rastreador web simples, mas inteligente, multi-threaded, para coletar aleatoriamente grandes listas de nomes de domínio únicos.

O dcrawl recebe uma URL de site como entrada e detecta todos os links <a href=...> no corpo do site. Cada link encontrado é colocado na fila. Sucessivamente, cada link na fila é rastreado da mesma forma, ramificando-se para mais URLs encontradas em links no corpo de cada site.
Como funciona o crawling inteligente:
go build dcrawl.go
./dcrawl -url http://wired.com -out ~/domain_lists/domains1.txt -t 8
___ __
__| _/________________ __ _ _| |
/ __ |/ ___\_ __ \__ \\ \/ \/ / |
/ /_/ \ \___| | \// __ \\ /| |__
\____ |\___ >__| (____ /\/\_/ |____/
\/ \/ \/ v.1.0
uso: dcrawl -url URL -out ARQUIVO_SAIDA -t THREADS
-ms int
máximo de subdomínios diferentes para um domínio (padrão: 10)
-mu int
número máximo de links para rastrear por hostname (padrão: 5)
-out string
arquivo de saída para salvar os hostnames
-t int
número de threads concorrentes (padrão: 8)
-url string
URL para iniciar a raspagem
-v bool
verbose (padrão: falso)
dcrawl foi criado por Kuba Gretzky do breakdev.org e lançado sob a licença MIT.