
أداة إزالة تكرار عناوين URL لتحسين الاستطلاع.
تحصل الأداة على قائمة بعناوين URL، وتزيل الصفحات "المكررة" بمعنى أنماط URL التي من المحتمل أن تكون متكررة وتشير إلى نفس القالب من الويب.
على سبيل المثال:
https://www.example.com/product/123
https://www.example.com/product/456
https://www.example.com/product/123?is_prod=false
https://www.example.com/product/222?is_debug=true
جميع الأمثلة أعلاه من المحتمل أنها تشير إلى نفس "القالب" للمنتج. لذلك يجب أن يكون كافياً مسح بعض عناوين URL هذه فقط بواسطة ماسحاتنا المختلفة.
النتيجة بعد UDdup للأمثلة أعلاه يجب أن تكون:
https://www.example.com/product/123?is_prod=false
https://www.example.com/product/222?is_debug=true
بشكل أساسي لتحسين عملية الاستطلاع (المؤتمتة)، مع تقليل الضوضاء (لكلاً من المختبر والهدف).
ألق نظرة على demo.txt وهو ملف عناوين URL الخام الذي ينتج عنه demo-results.txt.
pip install uddup
# استنساخ المستودع.
git clone https://github.com/rotemreiss/uddup.git
# تثبيت متطلبات Python.
cd uddup
pip install -r requirements.txt
uddup -u demo.txt -o ./demo-result.txt
uddup -h
يسمح بتصفية أنماط المسارات المخصصة.
على سبيل المثال، إذا أردنا تصفية جميع المسارات التي تبدأ بـ /product سنحتاج إلى تشغيل:
# تعبير عادي واحد
uddup -u demo.txt -fp "^product"
الإدخال:
https://www.example.com/
https://www.example.com/privacy-policy
https://www.example.com/product/1
https://www.example2.com/product/2
https://www.example3.com/product/4
الإخراج:
https://www.example.com/
https://www.example.com/privacy-policy
uddup -u demo.txt -fp "(^product)|(^category)"
لا تتردد في عمل fork للمستودع وتقديم طلبات السحب (pull-requests).
تريد أن تقول شكراً؟ :) راسلني على Linkedin
| النموذج القصير | النموذج الطويل | الوصف |
|---|
| -h | --help | عرض رسالة المساعدة هذه والخروج |
| -u | --urls | ملف يحتوي على قائمة عناوين URL |
| -o | --output | حفظ النتائج في ملف |
| -s | --silent | طباعة عناوين URL الناتجة فقط |
| -fp | --filter-path | تصفية المسارات باستخدام تعبير عادي (Regex) معين |