
सरल, लेकिन स्मार्ट, बहु-थ्रेडेड वेब क्रॉलर जो यादृच्छिक रूप से अद्वितीय डोमेन नामों की विशाल सूचियाँ एकत्र करता है।
dcrawl एक सरल, लेकिन स्मार्ट, मल्टी-थ्रेडेड वेब क्रॉलर है जो यादृच्छिक रूप से अद्वितीय डोमेन नामों की विशाल सूची एकत्र करता है।

dcrawl एक साइट URL को इनपुट के रूप में लेता है और साइट के बॉडी में सभी <a href=...> लिंक का पता लगाता है। प्रत्येक मिले लिंक को क्यू में डाल दिया जाता है। क्रमिक रूप से, प्रत्येक क्यू किए गए लिंक को उसी तरह क्रॉल किया जाता है, जो प्रत्येक साइट के बॉडी में लिंक में मिले अधिक URL में शाखा करता है।
स्मार्ट क्रॉलिंग कैसे काम करती है:
go build dcrawl.go
./dcrawl -url http://wired.com -out ~/domain_lists/domains1.txt -t 8
___ __
__| _/________________ __ _ _| |
/ __ |/ ___\_ __ \__ \\ \/ \/ / |
/ /_/ \ \___| | \// __ \\ /| |__
\____ |\___ >__| (____ /\/\_/ |____/
\/ \/ \/ v.1.0
usage: dcrawl -url URL -out OUTPUT_FILE -t THREADS
-ms int
एक डोमेन के लिए अधिकतम अलग-अलग सबडोमेन (डिफ़ॉल्ट 10) (default 10)
-mu int
प्रति होस्टनाम स्पाइडर करने के लिए लिंक की अधिकतम संख्या (डिफ़ॉल्ट 5) (default 5)
-out string
होस्टनाम सहेजने के लिए आउटपुट फ़ाइल
-t int
समवर्ती थ्रेड्स की संख्या (डिफ़ॉल्ट 8) (default 8)
-url string
स्क्रैपिंग शुरू करने के लिए URL
-v bool
वर्बोज़ (default false)
dcrawl को Kuba Gretzky द्वारा breakdev.org से बनाया गया था और MIT लाइसेंस के तहत जारी किया गया है।