dcrawl 是一个简单但智能的多线程网页爬虫,用于随机收集海量独特域名列表。

dcrawl 以一个网站 URL 作为输入,检测该网站页面中的所有 <a href=...> 链接。每个找到的链接都会被放入队列中。随后,每个队列中的链接会以同样的方式被爬取,通过每个网页上的链接分支到更多 URL。
智能爬取 的工作方式:
go build dcrawl.go
./dcrawl -url http://wired.com -out ~/domain_lists/domains1.txt -t 8
___ __
__| _/________________ __ _ _| |
/ __ |/ ___\_ __ \__ \\ \/ \/ / |
/ /_/ \ \___| | \// __ \\ /| |__
\____ |\___ >__| (____ /\/\_/ |____/
\/ \/ \/ v.1.0
usage: dcrawl -url URL -out OUTPUT_FILE -t THREADS
-ms int
一个域名允许的最大不同子域名数量(默认 10) (default 10)
-mu int
每个主机名最大爬取链接数(默认 5) (default 5)
-out string
保存主机名的输出文件
-t int
并发线程数(默认 8) (default 8)
-url string
开始抓取的 URL
-v bool
详细输出(默认 false)
dcrawl 由 Kuba Gretzky 从 breakdev.org 开发,并基于 MIT 许可证发布。