
Simple, mais intelligent, crawler web multi-threadé pour collecter aléatoirement d'énormes listes de noms de domaine uniques.
dcrawl est un robot d'exploration Web simple mais intelligent, multi-thread, pour collecter aléatoirement d'énormes listes de noms de domaine uniques.

dcrawl prend une URL de site en entrée et détecte tous les liens <a href=...> dans le corps du site. Chaque lien trouvé est mis dans la file d'attente. Successivement, chaque lien de la file est exploré de la même manière, en se ramifiant vers plus d'URL trouvées dans les liens de chaque corps de site.
Comment fonctionne le crawling intelligent :
go build dcrawl.go
./dcrawl -url http://wired.com -out ~/domain_lists/domains1.txt -t 8
___ __
__| _/________________ __ _ _| |
/ __ |/ ___\_ __ \__ \\ \/ \/ / |
/ /_/ \ \___| | \// __ \\ /| |__
\____ |\___ >__| (____ /\/\_/ |____/
\/ \/ \/ v.1.0
utilisation : dcrawl -url URL -out FICHIER_SORTIE -t THREADS
-ms int
nombre maximum de sous-domaines différents pour un domaine (déf. 10) (par défaut 10)
-mu int
nombre maximum de liens à explorer par nom d'hôte (déf. 5) (par défaut 5)
-out string
fichier de sortie pour sauvegarder les noms d'hôte
-t int
nombre de threads simultanés (déf. 8) (par défaut 8)
-url string
URL à partir de laquelle commencer le scraping
-v bool
verbose (par défaut faux)
dcrawl a été créé par Kuba Gretzky de breakdev.org et publié sous licence MIT.