
Webターゲットをクロールとスクレイピングし、regexベースの検出を使用して、S3バケット、Azure Blobs、DigitalOcean Spacesなどの露出したクラウドリソースを発見します。

標準外のPythonライブラリ:
Python 3.6で作成
このツールは、Bryce Kunzによる最近の講演に触発されました。講演「Blue Cloud of Death: Red Teaming Azure」では、よく知られたS3バケット以外の、あまり知られていない一般的な情報漏洩について紹介されています。
usage: CloudScraper.py [-h] [-v] [-p Processes] [-d DEPTH] [-u URL] [-l TARGETLIST]
optional arguments:
-h, --help show this help message and exit
-u URL Target Scope
-d DEPTH Max Depth of links Default: 5
-l TARGETLIST Location of text file of Line Delimited targets
-v Verbose Verbose output
-p Processes Number of processes to be executed in parallel. Default: 2
--no-verify Skip TLS verification
example: python3 CloudScraper.py -u https://rottentomatoes.com
キーワードを追加するには、パーサー関数内のリストに追加するだけです。
共有は思いやり!プルリクエスト歓迎です。より多くの検出のサポート追加やマルチスレッド化などが大いに望まれています:)
Bryce Kunzが実際に同様のことを行うツールを作成しましたが、それはScrapyを使用していました。私はPython2やScrapyなどのスクレイピングモジュールに依存しないものを自分で作りたかったのです。スパイダリング用のhrefリンクの解析にはBeautifulSoupを使用しました。こうしてCloudScraperが誕生しました。hrefリンクの代わりに生の正規表現を使用する利点は、多くの場合、これらのリンクはhrefリンクに含まれず、JSや他の場所に埋め込まれている可能性があることです。CloudScraperはページ全体を取得し、正規表現を使用してリンクを探します。これには、取得しすぎたり少なすぎたりする欠点もありますが、少なくともベースをカバーしていることは確かです:)