
Rastrea y extrae contenido de objetivos web para descubrir recursos en la nube expuestos, incluidos buckets S3, Azure Blobs y DigitalOcean Spaces, mediante detección basada en expresiones regulares.

Librerías Python no estándar:
Creado con Python 3.6
Esta herramienta se inspiró en una reciente charla de Bryce Kunz. La charla Blue Cloud of Death: Red Teaming Azure nos muestra algunas de las divulgaciones de información común menos conocidas, más allá de los siempre comunes S3 Buckets.
usage: CloudScraper.py [-h] [-v] [-p Processes] [-d DEPTH] [-u URL] [-l TARGETLIST]
optional arguments:
-h, --help show this help message and exit
-u URL Target Scope
-d DEPTH Max Depth of links Default: 5
-l TARGETLIST Location of text file of Line Delimited targets
-v Verbose Verbose output
-p Processes Number of processes to be executed in parallel. Default: 2
--no-verify Skip TLS verification
example: python3 CloudScraper.py -u https://rottentomatoes.com
Para añadir palabras clave, simplemente agrégalas a la lista en la función parser.
¡Compartir es cuidar! Se aceptan pull requests; cosas como añadir soporte para más detecciones, multihilo, etc., son muy deseadas :)
Bueno, Bryce Kunz en realidad creó una herramienta para hacer algo similar, pero usaba scrapy y yo quería construir algo propio que no dependiera de Python2 ni de módulos de scraping como scrapy. Terminé usando BeautifulSoup solo para analizar enlaces href para el rastreo. Así nació CloudScraper. La ventaja de usar expresiones regulares en lugar de analizar enlaces href es que muchas veces estos no están incluidos en enlaces href, sino que pueden estar ocultos en JS u otros lugares. CloudScraper obtiene toda la página y usa una expresión regular para buscar enlaces. Esto también tiene sus fallos, como obtener demasiado o demasiado poco, pero al menos sabemos que cubrimos nuestras bases :)