
वेब लक्ष्यों को स्पाइडर और स्क्रैप करें ताकि S3 बकेट, Azure Blobs, और DigitalOcean Spaces सहित उजागर क्लाउड संसाधनों को regex-आधारित पहचान का उपयोग करके खोजा जा सके।

गैर-मानक Python लाइब्रेरीज़:
Python 3.6 के साथ बनाया गया
यह उपकरण Bryce Kunz द्वारा दिए गए एक हालिया टॉक से प्रेरित था। टॉक Blue Cloud of Death: Red Teaming Azure हमें हमेशा सामान्य S3 बकेट के अलावा कुछ कम ज्ञात सामान्य जानकारी प्रकटीकरण के बारे में बताता है।
usage: CloudScraper.py [-h] [-v] [-p Processes] [-d DEPTH] [-u URL] [-l TARGETLIST]
optional arguments:
-h, --help show this help message and exit
-u URL Target Scope
-d DEPTH Max Depth of links Default: 5
-l TARGETLIST Location of text file of Line Delimited targets
-v Verbose Verbose output
-p Processes Number of processes to be executed in parallel. Default: 2
--no-verify Skip TLS verification
example: python3 CloudScraper.py -u https://rottentomatoes.com
कीवर्ड जोड़ने के लिए, बस पार्सर फंक्शन में सूची में जोड़ें।
साझा करना देखभाल है! पुल रिक्वेस्ट का स्वागत है, अधिक डिटेक्शन के लिए समर्थन जोड़ना, मल्टीथ्रेडिंग आदि जैसी चीज़ें अत्यधिक वांछित हैं :)
तो Bryce Kunz ने वास्तव में कुछ ऐसा ही करने के लिए एक उपकरण बनाया था लेकिन इसमें scrapy का उपयोग किया गया था और मैं कुछ ऐसा बनाना चाहता था जो Python2 या scrapy जैसे किसी स्क्रैपिंग मॉड्यूल पर निर्भर न हो। मैंने अंततः केवल स्पाइडरिंग के लिए href लिंक पार्स करने के लिए BeautifulSoup का उपयोग किया। इस प्रकार, CloudScraper का जन्म हुआ। href लिंक पार्स करने के बजाय रॉ रेगेक्स का उपयोग करने का लाभ यह है कि कई बार, ये href लिंक में शामिल नहीं होते, वे JS या अन्य विभिन्न स्थानों में दबे हो सकते हैं। CloudScraper पूरे पृष्ठ को लेता है और लिंक खोजने के लिए रेगेक्स का उपयोग करता है। इसके अपने दोष भी हैं जैसे बहुत अधिक या बहुत कम पकड़ना, लेकिन कम से कम हम जानते हैं कि हम अपनी जमीन को कवर कर रहे हैं :)