
Riordina un elenco di URL
Questo è uno strumento usato per ripulire una lista di URL. Come punto di partenza, ho preso il fantastico strumento uro di Somdev Sangwan. Ma volevo cambiare alcune cose, fare alcuni miglioramenti (come gestire i GUID) e renderlo più personalizzabile.
urless supporta Python 3.
Installa urless nell'ambiente python predefinito (globale).
pip install urless
OPPURE
pip install git+https://github.com/xnl-h4ck3r/urless.git -v
Puoi aggiornare con
pip install --upgrade urless
Configurazione rapida in un ambiente python isolato usando pipx
pipx install git+https://github.com/xnl-h4ck3r/urless.git
| Argomento | Argomento lungo | Descrizione |
|---|---|---|
| -i | --input | Un file di URL da ripulire. |
| -o | --output | Il file di output che conterrà l'elenco di URL ripuliti (predefinito: output.txt). Se l'output viene passato tramite pipe a un altro programma, verrà scritto su STDOUT. |
| -fk | --filter-keywords | Un elenco separato da virgole di parole chiave per escludere i link (se non ci sono parametri). Questo sovrascriverà l'elenco FILTER_KEYWORDS specificato in config.yml |
| -fe | --filter-extensions | Un elenco separato da virgole di estensioni di file da escludere. Questo sovrascriverà l'elenco FILTER_EXTENSIONS specificato in config.yml |
| -rp | --remove-params | Un elenco separato da virgole di parametri case sensitive da rimuovere da TUTTI gli URL. Questo sovrascriverà l'elenco REMOVE_PARAMS specificato in config.yml. Questo può essere utile per rimuovere, ad esempio, i parametri cache buster.** |
| -ks | --keep-slash | Uno slash finale alla fine di un URL di input non verrà rimosso. Pertanto, potrebbero esserci URL identici in output, uno con e uno senza slash finale. |
| -khw | --keep-human-written | Per impostazione predefinita, qualsiasi URL con una parte di percorso che contiene più di 3 trattini (-) viene rimosso perché si presume sia contenuto scritto da umani (es. post di un blog) e non interessante. Passare questo argomento li manterrà nell'output. |
| -kym | --keep-yyyymm | Per impostazione predefinita, qualsiasi URL con un percorso contenente /YYYY/MM (dove YYYY è un anno e MM il mese) viene rimosso perché si presume sia contenuto di blog/notizie e non interessante. Passare questo argomento li manterrà nell'output. |
| -rcid | --regex-custom-id | USARE CON CAUTELA! Espressione regex per un ID personalizzato utilizzato dal tuo target. Assicurati che il valore venga passato tra virgolette. Vedi la sezione seguente per maggiori dettagli. |
| -iq | --ignore-querystring | Rimuovi la query string (inclusi i frammenti di URL #) così l'output contiene solo percorsi univoci. |
| -fnp | --fragment-not-param | Non trattare i frammenti di URL # allo stesso modo dei parametri, es. se un link ha una parola chiave di filtro e un frammento (o parametro), il link viene solitamente mantenuto, ma se questo argomento viene passato e un link ha una parola di filtro e un frammento, il link verrà rimosso. Inoltre, se questo argomento viene passato e viene usato -iq / --ignore-querystring, il frammento NON verrà rimosso dai link se nel link non c'è una query string. |
| -lang | --language | Se passato e ci sono più URL con diversi codici lingua come parte del percorso, verrà restituita solo una versione dell'URL. I codici sono specificati nella sezione LANGUAGE di config.yml. |
| -c | --config | Percorso del file di configurazione YML. Se non passato, cerca il file config.yml nella directory di configurazione predefinita, es. ~/.config/urless/. |