
Rastrear e extrair alvos web para descobrir recursos de nuvem expostos, incluindo buckets S3, Azure Blobs e DigitalOcean Spaces usando detecção baseada em regex.

Bibliotecas Python não padronizadas:
Criado com Python 3.6
Esta ferramenta foi inspirada por uma palestra recente de Bryce Kunz. A palestra Blue Cloud of Death: Red Teaming Azure nos guia por algumas das divulgações de informações comuns menos conhecidas além dos sempre comuns buckets S3.
usage: CloudScraper.py [-h] [-v] [-p Processes] [-d DEPTH] [-u URL] [-l TARGETLIST]
optional arguments:
-h, --help show this help message and exit
-u URL Target Scope
-d DEPTH Max Depth of links Default: 5
-l TARGETLIST Location of text file of Line Delimited targets
-v Verbose Verbose output
-p Processes Number of processes to be executed in parallel. Default: 2
--no-verify Skip TLS verification
example: python3 CloudScraper.py -u https://rottentomatoes.com
Para adicionar palavras-chave, basta adicioná-las à lista na função de análise.
Compartilhar é se importar! Pull requests são bem-vindos, coisas como adicionar suporte para mais detecções, multithreading etc são altamente desejadas :)
Então, Bryce Kunz na verdade criou uma ferramenta para fazer algo semelhante, mas usava scrapy e eu queria construir algo por conta própria que não dependesse de Python2 ou de módulos de scraping como scrapy. Acabei usando BeautifulSoup para analisar links href apenas para rastreamento. Daí, CloudScraper nasceu. A vantagem de usar expressões regulares em vez de analisar links href é que muitas vezes estes não estão incluídos em links href; podem estar embutidos em JS ou outros locais diversos. CloudScraper captura a página inteira e usa uma regex para procurar links. Isso também tem suas falhas, como capturar demais ou de menos, mas pelo menos sabemos que estamos cobrindo nossas bases :)