
Spidern und scrapen Sie Web-Ziele, um exponierte Cloud-Ressourcen einschließlich S3-Buckets, Azure-Blobs und DigitalOcean-Spaces mittels regex-basierter Erkennung zu entdecken.

Nicht standardmäßige Python-Bibliotheken:
Erstellt mit Python 3.6
Dieses Tool wurde von einem kürzlichen Vortrag von Bryce Kunz inspiriert. Der Vortrag Blue Cloud of Death: Red Teaming Azure führt uns durch einige der weniger bekannten häufigen Informationslecks außerhalb der allgegenwärtigen S3-Buckets.
usage: CloudScraper.py [-h] [-v] [-p Processes] [-d DEPTH] [-u URL] [-l TARGETLIST]
optional arguments:
-h, --help show this help message and exit
-u URL Target Scope
-d DEPTH Max Depth of links Default: 5
-l TARGETLIST Location of text file of Line Delimited targets
-v Verbose Verbose output
-p Processes Number of processes to be executed in parallel. Default: 2
--no-verify Skip TLS verification
example: python3 CloudScraper.py -u https://rottentomatoes.com
Um Schlüsselwörter hinzuzufügen, füge sie einfach der Liste in der Parser-Funktion hinzu.
Teilen ist wichtig! Pull-Requests sind willkommen, insbesondere Dinge wie die Unterstützung weiterer Erkennungen, Multithreading usw. sind sehr erwünscht :)
Bryce Kunz hat tatsächlich ein Tool erstellt, das etwas Ähnliches tut, aber es verwendete Scrapy, und ich wollte selbst etwas bauen, das nicht von Python2 oder Scraping-Modulen wie Scrapy abhängig ist. Ich habe letztendlich BeautifulSoup verwendet, um nur href-Links für das Crawlen zu parsen. So wurde CloudScraper geboren. Der Vorteil der Verwendung von rohen Regex anstelle des Parsens von href-Links ist, dass diese oft nicht in href-Links enthalten sind, sondern in JS oder anderen Orten vergraben sein können. CloudScraper greift die gesamte Seite ab und verwendet eine Regex, um nach Links zu suchen. Das hat auch seine Nachteile, wie das Erfassen von zu viel oder zu wenig, aber zumindest wissen wir, dass wir alle Basis abdecken :)