
Extrait des URL d'archives OSINT pour des informations de sécurité
Extrait les URL des archives OSINT pour des analyses de sécurité.
Urx est un outil en ligne de commande conçu pour collecter des URL à partir d'archives OSINT, telles que la Wayback Machine et Common Crawl. Développé en Rust pour plus d'efficacité, il exploite le traitement asynchrone pour interroger rapidement de multiples sources de données. Cet outil simplifie le processus de collecte d'informations sur les URL pour un domaine donné, en fournissant un jeu de données complet pouvant servir à diverses fins, notamment les tests et l'analyse de sécurité.
--cdx-endpoint URL, sans modification de code-H, --cookie et --user-agent s'appliquent à chaque requête qu'urx envoie à la cible (--check-status, --extract-links, --extract-js-endpoints, --expand-specs) et ne sont délibérément jamais envoyés à une archive--match-regex / --filter-regex)--meta-*) : filtrer sur la date de première/dernière capture, le type MIME enregistré et le statut enregistré, uniformément sur tous les fournisseurs, après collecteurx example.com/shop pousse la portée directement dans la requête CDX (url=example.com/shop*), de sorte qu'un sous-arbre d'un grand site coûte une fraction de l'index entier au lieu d'être filtré côté client--scope-file) : la propre liste *.example.com / !admin.example.com d'un programme utilisée telle quelle, répétable et unie, les exclusions l'emportant toujours--dedup-similar)wordlist — les segments de chemin et les noms de paramètres à partir desquels la cible est construite, en omettant les identifiants, les hachages et les dates--params (l'inventaire complet des paramètres de la cible), --params-by-endpoint (quel endpoint accepte quoi) et --fuzz-placeholder FUZZ (une URL modélisée par signature de paramètre, prête pour ffuf ou dalfox)first_seen, last_seen, mime, archive_status et digest sont renvoyés avec chaque URL signalée par une archive CDX, sans coût réseau supplémentaire--stream) : les URL sont écrites au fur et à mesure que chaque fournisseur les signale, de sorte qu'un pipeline commence à fonctionner immédiatement au lieu d'attendre l'archive la plus lente--archive-body), afin que les pages qui n'existent plus livrent encore les liens qu'elles contenaient — une requête par corps distinct, grâce à la déduplication par digest CDX--extract-js-endpoints, explorer aussi le JavaScript archivé : un bundle nommé par un hachage de build renvoie un 404 dès que le site est redéployé, et l'archive est le seul endroit où sa surface d'API existe encore--archive-body-dir) comme corpus à fouiller pour ce qu'aucun extracteur de liens ne recherche — commentaires de développeurs, identifiants en ligne, noms d'hôtes internes — sans requêtes supplémentaires--expand-specs) : documents OpenAPI 3.x, Swagger 2.0 et introspection GraphQL, JSON ou YAML, transformés en chaque route qu'ils décrivent — une requête achète toute la surface documentée--check-status enregistre aussi Location, Content-Length et Content-Type, et --check-title ajoute le <title> HTML--archived-discovery) : chaque version distincte conservée par la Wayback Machine, de sorte qu'un Disallow: de 2015 nomme encore les chemins que le site a cessé de mentionner depuisurx cache pour inspecter et maintenir le cache : stats, list, prune, drop <domain>, clear
cargo install urx
### Depuis Homebrew```bash
# https://formulae.brew.sh/formula/urx
brew install urx
git clone https://github.com/hahwul/urx.git cd urx cargo build --release
Le binaire compilé sera disponible à l'emplacement `target/release/urx`.
### Depuis Docker
[ghcr.io/hahwul/urx](https://github.com/hahwul/urx/pkgs/container/urx)