
Einfacher, aber intelligenter, mehrfädiger Web-Crawler zum zufälligen Sammeln riesiger Listen eindeutiger Domainnamen.
dcrawl ist ein einfacher, aber intelligenter, mehrthreaded Webcrawler zum zufälligen Sammeln riesiger Listen eindeutiger Domainnamen.

dcrawl nimmt eine Site-URL als Eingabe und erkennt alle <a href=...> Links im Body der Site. Jeder gefundene Link wird in die Warteschlange eingereiht. Nacheinander wird jeder in der Warteschlange befindliche Link auf die gleiche Weise gecrawlt, wobei zu weiteren URLs verzweigt wird, die in Links auf dem Body jeder Site gefunden werden.
Wie intelligentes Crawlen funktioniert:
go build dcrawl.go
./dcrawl -url http://wired.com -out ~/domain_lists/domains1.txt -t 8
___ __
__| _/________________ __ _ _| |
/ __ |/ ___\_ __ \__ \\ \/ \/ / |
/ /_/ \ \___| | \// __ \\ /| |__
\____ |\___ >__| (____ /\/\_/ |____/
\/ \/ \/ v.1.0
usage: dcrawl -url URL -out OUTPUT_FILE -t THREADS
-ms int
maximale verschiedene Subdomains für eine Domain (Std. 10) (Standard 10)
-mu int
maximale Anzahl zu crawlen der Links pro Hostname (Std. 5) (Standard 5)
-out string
Ausgabedatei zum Speichern der Hostnamen
-t int
Anzahl gleichzeitiger Threads (Std. 8) (Standard 8)
-url string
URL, von der das Scraping gestartet werden soll
-v bool
verbose (Standard false)
dcrawl wurde von Kuba Gretzky von breakdev.org erstellt und unter der MIT-Lizenz veröffentlicht.