
बेहतर recon के लिए Urls de-duplication टूल।
यह उपकरण URL की एक सूची लेता है, और उन URL पैटर्न के आधार पर 'डुप्लिकेट' पृष्ठों को हटाता है जो संभवतः दोहराए जाने वाले हैं और एक ही वेब टेम्पलेट की ओर इशारा करते हैं।
उदाहरण के लिए:
https://www.example.com/product/123
https://www.example.com/product/456
https://www.example.com/product/123?is_prod=false
https://www.example.com/product/222?is_debug=true
उपरोक्त सभी संभवतः एक ही उत्पाद 'टेम्पलेट' की ओर इशारा करते हैं। इसलिए हमारे विभिन्न स्कैनर्स द्वारा इनमें से केवल कुछ URL को स्कैन करना पर्याप्त होना चाहिए।
उपरोक्त का UDdup के बाद परिणाम होना चाहिए:
https://www.example.com/product/123?is_prod=false
https://www.example.com/product/222?is_debug=true
ज्यादातर बेहतर (स्वचालित) टोही प्रक्रिया के लिए, कम शोर के साथ (परीक्षक और लक्ष्य दोनों के लिए)।
demo.txt पर एक नज़र डालें जो कच्चे URL फ़ाइल है जिसके परिणामस्वरूप demo-results.txt मिलता है।
pip install uddup
# Clone the repository.
git clone https://github.com/rotemreiss/uddup.git
# Install the Python requirements.
cd uddup
pip install -r requirements.txt
uddup -u demo.txt -o ./demo-result.txt
uddup -h
कस्टम पथ पैटर्न को फ़िल्टर करने की अनुमति देता है। उदाहरण के लिए, यदि हम उन सभी पथों को फ़िल्टर करना चाहते हैं जो /product से शुरू होते हैं, तो हमें चलाना होगा:
# Single Regex
uddup -u demo.txt -fp "^product"
इनपुट:
https://www.example.com/
https://www.example.com/privacy-policy
https://www.example.com/product/1
https://www.example2.com/product/2
https://www.example3.com/product/4
आउटपुट:
https://www.example.com/
https://www.example.com/privacy-policy
uddup -u demo.txt -fp "(^product)|(^category)"
बेझिझक रिपॉजिटरी को फोर्क करें और पुल-रिक्वेस्ट सबमिट करें।
धन्यवाद कहना चाहते हैं? :) मुझे Linkedin पर संदेश भेजें
| संक्षिप्त रूप | लंबा रूप | विवरण |
|---|
| -h | --help | यह सहायता संदेश दिखाएं और बाहर निकलें |
| -u | --urls | URL सूची वाली फ़ाइल |
| -o | --output | परिणामों को फ़ाइल में सहेजें |
| -s | --silent | केवल परिणाम URL प्रिंट करें |
| -fp | --filter-path | दिए गए Regex द्वारा पथ फ़िल्टर करें |