
간단하지만 똑똑한, 멀티 스레드 웹 크롤러로, 고유한 도메인 이름의 방대한 목록을 무작위로 수집합니다.
dcrawl는 단순하지만 스마트한 멀티스레드 웹 크롤러로, 무작위로 수많은 고유 도메인 이름을 수집합니다.

dcrawl는 하나의 사이트 URL을 입력받아 해당 사이트 본문에서 모든 <a href=...> 링크를 탐지합니다. 발견된 각 링크는 큐에 추가됩니다. 이후 각 큐에 추가된 링크를 같은 방식으로 크롤링하며, 각 사이트 본문의 링크에서 더 많은 URL로 분기합니다.
스마트 크롤링 작동 방식:
go build dcrawl.go
./dcrawl -url http://wired.com -out ~/domain_lists/domains1.txt -t 8
___ __
__| _/________________ __ _ _| |
/ __ |/ ___\_ __ \__ \\ \/ \/ / |
/ /_/ \ \___| | \// __ \\ /| |__
\____ |\___ >__| (____ /\/\_/ |____/
\/ \/ \/ v.1.0
사용법: dcrawl -url URL -out OUTPUT_FILE -t THREADS
-ms int
하나의 도메인에 대한 최대 서브도메인 수 (기본값: 10)
-mu int
호스트명당 크롤링할 최대 링크 수 (기본값: 5)
-out string
호스트명을 저장할 출력 파일
-t int
동시 스레드 수 (기본값: 8)
-url string
크롤링을 시작할 URL
-v bool
자세한 출력 (기본값: false)
dcrawl는 breakdev.org의 Kuba Gretzky가 제작했으며 MIT 라이선스로 배포됩니다.