
シンプルだがスマートな、ランダムに大量のユニークドメイン名を収集するためのマルチスレッドWebクローラ。
dcrawl は、ユニークなドメイン名の巨大なリストをランダムに収集するための、シンプルでありながらスマートなマルチスレッドウェブクローラーです。

dcrawl は 1 つのサイト URL を入力として受け取り、サイトの本文内のすべての <a href=...> リンクを検出します。見つかった各リンクはキューに追加されます。続けて、キューに入った各リンクも同様にクロールされ、各サイト本文のリンクで見つかったさらに多くの URL に分岐していきます。
スマートクローリング の仕組み:
go build dcrawl.go
./dcrawl -url http://wired.com -out ~/domain_lists/domains1.txt -t 8
___ __
__| _/________________ __ _ _| |
/ __ |/ ___\_ __ \__ \\ \/ \/ / |
/ /_/ \ \___| | \// __ \\ /| |__
\____ |\___ >__| (____ /\/\_/ |____/
\/ \/ \/ v.1.0
usage: dcrawl -url URL -out OUTPUT_FILE -t THREADS
-ms int
1 つのドメインに対する異なるサブドメインの最大数 (デフォルト: 10) (default 10)
-mu int
ホスト名ごとにスパイダーするリンクの最大数 (デフォルト: 5) (default 5)
-out string
ホスト名を保存する出力ファイル
-t int
同時スレッド数 (デフォルト: 8) (default 8)
-url string
スクレイピングを開始する URL
-v bool
詳細出力 (デフォルト: false)
dcrawl は breakdev.org の Kuba Gretzky によって作成され、MIT ライセンスの下で公開されています。