
このツールはURLのリストを受け取り、おそらく反復的で同じWebテンプレートを指すURLパターンという意味での「重複」ページを除去します。
例:
https://www.example.com/product/123
https://www.example.com/product/456
https://www.example.com/product/123?is_prod=false
https://www.example.com/product/222?is_debug=true
上記はすべて、おそらく同じ製品「テンプレート」を指しています。したがって、私たちの各種スキャナーでこれらのURLの一部だけをスキャンすれば十分です。
UDdup適用後の上記の結果は次のようになります。
https://www.example.com/product/123?is_prod=false
https://www.example.com/product/222?is_debug=true
主に、より優れた(自動化された)偵察プロセスのためであり、ノイズが少なくなります(テスターとターゲットの両方にとって)。
生のURLファイルであるdemo.txtと、その結果であるdemo-results.txtをご確認ください。
pip install uddup
# リポジトリをクローン
git clone https://github.com/rotemreiss/uddup.git
# Pythonの依存関係をインストール
cd uddup
pip install -r requirements.txt
uddup -u demo.txt -o ./demo-result.txt
uddup -h
カスタムパスパターンのフィルタリングを可能にします。
例えば、/productで始まるすべてのパスをフィルタリングしたい場合は、次を実行します。
# 単一の正規表現
uddup -u demo.txt -fp "^product"
入力:
https://www.example.com/
https://www.example.com/privacy-policy
https://www.example.com/product/1
https://www.example2.com/product/2
https://www.example3.com/product/4
出力:
https://www.example.com/
https://www.example.com/privacy-policy
uddup -u demo.txt -fp "(^product)|(^category)"
リポジトリをフォークし、プルリクエストを送信してください。
感謝の気持ちを伝えたいですか?:) Linkedinでメッセージを送ってください
| 短縮形 | 長形 | 説明 |
|---|
| -h | --help | このヘルプメッセージを表示して終了 |
| -u | --urls | URLリストを含むファイル |
| -o | --output | 結果をファイルに保存 |
| -s | --silent | 結果のURLのみを出力 |
| -fp | --filter-path | 指定された正規表現でパスをフィルタリング |