
Explorez et scrapez des cibles web pour découvrir des ressources cloud exposées, notamment des buckets S3, des blobs Azure et des espaces DigitalOcean, grâce à une détection basée sur des expressions régulières.

Bibliothèques Python non standard :
Créé avec Python 3.6
Cet outil a été inspiré par une récente conférence de Bryce Kunz. La conférence Blue Cloud of Death: Red Teaming Azure nous présente certaines divulgations d'informations courantes moins connues en dehors des S3 Buckets très communs.
usage: CloudScraper.py [-h] [-v] [-p Processes] [-d DEPTH] [-u URL] [-l TARGETLIST]
optional arguments:
-h, --help show this help message and exit
-u URL Target Scope
-d DEPTH Max Depth of links Default: 5
-l TARGETLIST Location of text file of Line Delimited targets
-v Verbose Verbose output
-p Processes Number of processes to be executed in parallel. Default: 2
--no-verify Skip TLS verification
example: python3 CloudScraper.py -u https://rottentomatoes.com
Pour ajouter des mots-clés, ajoutez-les simplement à la liste dans la fonction d'analyse.
Partager, c'est prendre soin ! Les pull requests sont les bienvenues, des choses comme l'ajout de support pour plus de détections, le multithreading, etc. sont très souhaitées :)
Alors Bryce Kunz a en fait créé un outil pour faire quelque chose de similaire mais il utilisait scrapy et je voulais construire quelque chose moi-même qui ne dépende pas de Python2 ou de modules de scraping comme scrapy. J'ai fini par utiliser BeautifulSoup pour analyser les liens href uniquement pour l'exploration. Ainsi, CloudScraper est né. L'avantage d'utiliser des regex bruts plutôt que d'analyser les liens href est que, souvent, ces liens ne sont pas inclus dans les attributs href, ils peuvent être enfouis dans du JS ou d'autres endroits. CloudScraper récupère la page entière et utilise une regex pour chercher des liens. Cela a aussi ses défauts comme récupérer trop ou trop peu, mais au moins nous savons que nous couvrons les bases :)