
Crawler web simple pero inteligente y multiproceso para recopilar aleatoriamente enormes listas de nombres de dominio únicos.
dcrawl es un rastreador web simple, pero inteligente, de múltiples hilos para recolectar aleatoriamente enormes listas de nombres de dominio únicos.

dcrawl toma una URL de sitio como entrada y detecta todos los enlaces <a href=...> en el cuerpo del sitio. Cada enlace encontrado se coloca en la cola. Sucesivamente, cada enlace en la cola se rastrea de la misma manera, ramificándose a más URL encontradas en los enlaces del cuerpo de cada sitio.
Cómo funciona el rastreo inteligente:
go build dcrawl.go
./dcrawl -url http://wired.com -out ~/domain_lists/domains1.txt -t 8
___ __
__| _/________________ __ _ _| |
/ __ |/ ___\_ __ \__ \\ \/ \/ / |
/ /_/ \ \___| | \// __ \\ /| |__
\____ |\___ >__| (____ /\/\_/ |____/
\/ \/ \/ v.1.0
usage: dcrawl -url URL -out OUTPUT_FILE -t THREADS
-ms int
máximo de subdominios diferentes para un dominio (def. 10) (default 10)
-mu int
número máximo de enlaces a rastrear por nombre de host (def. 5) (default 5)
-out string
archivo de salida para guardar los nombres de host
-t int
número de hilos concurrentes (def. 8) (default 8)
-url string
URL desde la que comenzar el raspado
-v bool
modo verbose (default false)
dcrawl fue creado por Kuba Gretzky de breakdev.org y está publicado bajo la licencia MIT.