
웹사이트를 크롤링하여 추가 링크를 검색하는 Golang 유틸리티입니다.
웹사이트를 크롤링하여 JavaScript 렌더링을 지원하며 추가 링크를 검색하는 golang 유틸리티입니다.
go get -u github.com/iamstoxe/urlgrab
Usage of urlgrab:
-cache-dir string
캐싱을 사용할 디렉토리를 지정합니다. 세션 간에도 작동합니다.
-debug
매우 상세한 디버깅 출력입니다. 주로 개발에 유용합니다.
-delay int
요청 사이에 무작위로 적용할 지연 시간(밀리초)입니다. (기본값 2000)
-depth int
방문한 URL의 재귀 깊이에 대한 최대 제한입니다. (기본값 2)
-headless
true이면 크롤링 중에 브라우저가 표시됩니다.
참고: render-js 플래그가 필요합니다.
참고: 브라우저 표시 사용법: --headless=false (기본값 true)
-ignore-query
URL의 쿼리 부분을 제거한 후 방문 여부를 결정합니다.
-ignore-ssl
유효하지 않은 SSL 인증서가 있는 페이지를 스크래핑합니다.
-js-timeout int
JavaScript를 렌더링하는 요청이 타임아웃되기까지의 시간(초)입니다. (기본값 10)
-json string
출력 JSON 파일을 저장할 파일 이름입니다.
-max-body int
검색된 응답 본문의 최대 크기(킬로바이트)입니다.
0은 무제한을 의미합니다.
이 값을 킬로바이트 단위로 입력하세요. (예: 10 * 1024kb = 10MB) (기본값 10240)
-no-head
사전 검증을 위해 GET 이전에 HEAD 요청을 보내지 않습니다.
-output-all string
출력 파일을 저장할 디렉토리입니다.
-proxy string
사용할 SOCKS5 프록시 (형식: socks5://127.0.0.1:8080 또는 http://127.0.0.1:8080).
쉼표로 구분하여 여러 프록시를 지정할 수 있습니다.
-random-agent
무작위 사용자 에이전트 문자열을 사용합니다.
-render-js
JavaScript를 렌더링하기 위해 headless chrome 인스턴스를 사용할지 결정합니다.
-root-domain string
링크를 매칭할 루트 도메인입니다.
지정하지 않으면 --url의 호스트를 기본값으로 사용합니다.
예: --root-domain google.com
-threads int
사용할 스레드 수입니다. (기본값 5)
-timeout int
요청이 타임아웃되기까지의 시간(초)입니다. (기본값 10)
-url string
크롤링을 시작할 URL입니다.
-urls string
시작 URL로 제공할 URL 목록이 포함된 파일 경로입니다.
--root-domain 플래그가 필요합니다.
-user-agent string
사용자 에이전트 (예: Mozilla/5.0 (Windows NT 6.1; Win64; x64; rv:47.0) Gecko/20100101 Firefox/47.0).
-verbose
자세한 출력
다음 명령으로 플랫폼에 맞는 바이너리를 bin 디렉토리에 쉽게 빌드할 수 있습니다:
make build
Windows, Linux 및 MacOS용 바이너리를 만들어 CLI를 배포하려면 다음 명령을 실행하세요:
make cross
모든 바이너리는 dist 디렉토리에서 사용할 수 있습니다.
👤 Devin Stokes
기여, 이슈 및 기능 요청은 언제나 환영합니다!
이슈 페이지를 확인해 주세요.
이 프로젝트가 도움이 되었다면 ⭐를 눌러주세요!