
वेबपेजों को पुनरावर्ती रूप से स्पाइडर करें, लिंक का अनुसरण करके, साइटमैप और robots.txt फ़ाइलों को पार्स करके सभी URL खोजें। सुरक्षा टोही और सामग्री खोज के लिए आदर्श।
xcrawl3r एक कमांड-लाइन उपयोगिता है जो URL के लिए वेबपेजों को पुनरावर्ती रूप से क्रॉल करने के लिए डिज़ाइन की गई है। यह वेबसाइटों पर सक्रिय रूप से नेविगेट करके काम करता है - वेबपेजों में एम्बेडेड लिंक का अनुसरण करके, और फाइलों (साइटमैप और robots.txt सहित) को पार्स करके - प्रत्येक URL का पता लगाने के लिए।
xurlfind3r के विपरीत जो लक्ष्य के साथ सीधे संपर्क नहीं करता, xcrawl3r अपने पृष्ठों को रीयल टाइम में स्पाइडर करके सीधे लक्ष्य के साथ संपर्क करता है। यह सक्रिय दृष्टिकोण इसे उन URL का पता लगाने की अनुमति देता है जो छिपे या अनुक्रमित नहीं हो सकते हैं, वेबसाइट के नेविगेशन प्रवाह और सामग्री वितरण की पूरी तस्वीर प्रदान करता है। यह xcrawl3r को सुरक्षा शोधकर्ताओं, आईटी पेशेवरों और वेबसाइटों से जुड़े URL के बारे में जानकारी प्राप्त करने के इच्छुक किसी भी व्यक्ति के लिए एक शक्तिशाली उपकरण बनाता है।
robots.txt सहित) से URL निकालता हैstdin और stdout का समर्थन करता हैरिलीज़ पेज पर जाएँ और अपने ऑपरेटिंग सिस्टम और आर्किटेक्चर के लिए उपयुक्त आर्काइव खोजें। आर्काइव को अपने ब्राउज़र से डाउनलोड करें या इसका URL कॉपी करें और wget या curl से प्राप्त करें:
...wget के साथ:
wget https://github.com/hueristiq/xcrawl3r/releases/download/v<version>/xcrawl3r-<version>-linux-amd64.tar.gz
...या, curl के साथ:
curl -OL https://github.com/hueristiq/xcrawl3r/releases/download/v<version>/xcrawl3r-<version>-linux-amd64.tar.gz
...फिर, बायनरी निकालें:
tar xf xcrawl3r-<version>-linux-amd64.tar.gz
[!TIP] उपरोक्त चरणों, डाउनलोड और निकालना, को इस ऑनलाइनर के साथ एक ही चरण में जोड़ा जा सकता है
curl -sL https://github.com/hueristiq/xcrawl3r/releases/download/v<version>/xcrawl3r-<version>-linux-amd64.tar.gz | tar -xzv
[!NOTE] Windows सिस्टम पर, आप
xcrawl3rनिष्पादन योग्य निकालने के लिए ज़िप आर्काइव पर डबल-क्लिक कर सकते हैं।
...xcrawl3r बायनरी को अपने PATH में किसी स्थान पर ले जाएँ। उदाहरण के लिए, GNU/Linux और OS X सिस्टम पर:
sudo mv xcrawl3r /usr/local/bin/
[!NOTE] Windows उपयोगकर्ता अपने
PATHमेंxcrawl3rजोड़ने के लिए How to: Add Tool Locations to the PATH Environment Variable का पालन कर सकते हैं।
स्रोत से स्थापित करने से पहले, सुनिश्चित करें कि आपके सिस्टम पर Go स्थापित है। आप अपने ऑपरेटिंग सिस्टम के लिए आधिकारिक निर्देशों का पालन करके Go स्थापित कर सकते हैं। यहाँ, हम मान लेंगे कि Go पहले से स्थापित है।
go install ...go install -v github.com/hueristiq/xcrawl3r/cmd/xcrawl3r@latest
go build ... डेवलपमेंट संस्करणरिपॉजिटरी क्लोन करें
git clone https://github.com/hueristiq/xcrawl3r.git
उपयोगिता बनाएँ
cd xcrawl3r/cmd/xcrawl3r && \
go build .
xcrawl3r बायनरी को अपने PATH में किसी स्थान पर ले जाएँ। उदाहरण के लिए, GNU/Linux और OS X सिस्टम पर:
sudo mv xcrawl3r /usr/local/bin/
Windows उपयोगकर्ता अपने PATH में xcrawl3r जोड़ने के लिए How to: Add Tool Locations to the PATH Environment Variable का पालन कर सकते हैं।
[!CAUTION] जबकि डेवलपमेंट संस्करण रिलीज़ होने से पहले
xcrawl3rकी नवीनतम सुविधाओं पर एक नज़र डालने का एक अच्छा तरीका है, यह ध्यान रखें कि इसमें बग हो सकते हैं। आधिकारिक रूप से जारी संस्करण आमतौर पर अधिक स्थिर होंगे।
Docker पर xcrawl3r स्थापित करने के लिए:
Docker इमेज खींचें:
docker pull hueristiq/xcrawl3r:latest
इमेज का उपयोग करके xcrawl3r चलाएँ:
docker run --rm hueristiq/xcrawl3r:latest -h
xcrawl3r स्थापना के तुरंत बाद काम करेगा। हालाँकि, कुछ कॉन्फ़िगरेशन को $HOME/.config/xcrawl3r/config.yaml पर एक कॉन्फ़िगरेशन फ़ाइल में जोड़ा जा सकता है, जो पहली बार चलाने पर बनाई जाती है, या पर्यावरण चर के रूप में सेट किया जा सकता है।
पर्यावरण चर का उदाहरण:
XCRAWL3R_REQUEST_TIMEOUT=10
xcrawl3r का उपयोग शुरू करने के लिए, अपना टर्मिनल खोलें और विकल्पों की सूची के लिए निम्न कमांड चलाएँ:
xcrawl3r -h
यहाँ सहायता संदेश कैसा दिखता है:
_ _____
__ _____ _ __ __ ___ _| |___ / _ __
\ \/ / __| '__/ _` \ \ /\ / / | |_ \| '__|
> < (__| | | (_| |\ V V /| |___) | |
/_/\_\___|_| \__,_| \_/\_/ |_|____/|_|
v1.2.0
USAGE:
xcrawl3r [OPTIONS]
CONFIGURATION:
-c, --configuration string (default: $HOME/.config/xcrawl3r/config.yaml)
INPUT:
-u, --url string[] target URL
-l, --list string target URLs file path
For multiple URLs, use comma(,) separated value with `--url`,
specify multiple `--url`, load from file with `--list` or load from stdin.
SCOPE:
-d, --domain string[] match domain(s) URLs
For multiple domains, use comma(,) separated value with `--domain`
or specify multiple `--domain`.
--include-subdomains bool with domain(s), match subdomains' URLs
REQUEST:
--delay int delay between each request in seconds
-H, --header string[] header to include in 'header:value' format
For multiple headers, use comma(,) separated value with `--header`
or specify multiple `--header`.
--timeout int time to wait for request in seconds (default: 10)
PROXY:
-p, --proxy string[] Proxy (e.g: http://127.0.0.1:8080)
For multiple proxies use comma(,) separated value with `--proxy`
or specify multiple `--proxy`.
OPTIMIZATION:
--depth int maximum depth to crawl, `0` for infinite (default: 1)
-C, --concurrency int number of concurrent inputs to process (default: 5)
-P, --parallelism int number of concurrent fetchers to use (default: 5)
DEBUG:
--debug bool enable debug mode
OUTPUT:
--jsonl bool output in JSONL(ines)
-o, --output string output write file path
-m, --monochrome bool stdout in monochrome
-s, --silent bool stdout in silent mode
-v, --verbose bool stdout in verbose mode
योगदान का स्वागत है और प्रोत्साहित किया जाता है! कृपया पुल रिक्वेस्ट सबमिट करें या समस्याएँ रिपोर्ट करें। अधिक विवरण के लिए, योगदान दिशानिर्देश देखें।
आपके निरंतर समर्थन के लिए सभी योगदानकर्ताओं को बहुत-बहुत धन्यवाद!
यह पैकेज MIT लाइसेंस के अंतर्गत लाइसेंस प्राप्त है। आप लाइसेंस की शर्तों का पालन करते हुए इसका उपयोग, संशोधन और वितरण करने के लिए स्वतंत्र हैं। आप रिपॉजिटरी में पूर्ण लाइसेंस टेक्स्ट पा सकते हैं - Full MIT license text.