
Extrae URLs de archivos OSINT para obtener información de seguridad.
Extrae URLs de archivos OSINT para obtener información de seguridad.
Urx es una herramienta de línea de comandos diseñada para recopilar URLs de archivos OSINT, como Wayback Machine y Common Crawl. Construida con Rust para mayor eficiencia, aprovecha el procesamiento asíncrono para consultar rápidamente múltiples fuentes de datos. Esta herramienta simplifica el proceso de recopilación de información de URLs para un dominio específico, proporcionando un conjunto de datos completo que puede utilizarse para diversos fines, incluidos las pruebas de seguridad y el análisis.
--cdx-endpoint URL, sin necesidad de cambiar el código-H, --cookie y --user-agent se aplican a cada solicitud que urx realiza al objetivo (--check-status, --extract-links, --extract-js-endpoints, --expand-specs) y deliberadamente nunca se envían a un archivo--match-regex / --filter-regex)--meta-*): filtra por fecha de primera/última captura, tipo MIME registrado y estado registrado de forma uniforme en todos los proveedores, tras la recopilaciónurx example.com/shop envía el alcance directamente a la consulta CDX (url=example.com/shop*), por lo que un subárbol de un sitio grande cuesta una fracción del índice completo en lugar de filtrarse del lado del cliente--scope-file): la propia lista *.example.com / !admin.example.com de un programa utilizada textualmente, repetible y unida, con las exclusiones siempre prevaleciendo--dedup-similar)wordlist — los segmentos de ruta y nombres de parámetros con los que se construye el objetivo, dejando fuera ids, hashes y fechas--params (el inventario completo de parámetros del objetivo), --params-by-endpoint (qué endpoint acepta qué) y --fuzz-placeholder FUZZ (una URL con plantilla por firma de parámetro, lista para ffuf o dalfox)first_seen, last_seen, mime, archive_status y digest se devuelven con cada URL que un archivo CDX reportó, sin coste de red adicional--stream): las URLs se escriben a medida que cada proveedor las reporta, por lo que un pipeline empieza a funcionar de inmediato en lugar de esperar al archivo más lento--archive-body), de modo que las páginas que ya no existen siguen entregando los enlaces que contenían — una solicitud por cuerpo distinto, gracias a la deduplicación por digest de CDX--extract-js-endpoints, mina también el JavaScript archivado: un bundle nombrado por hash de compilación devuelve 404 en el momento en que el sitio se redespliega, y el archivo es el único lugar donde su superficie de API sigue existiendo--archive-body-dir) como un corpus para buscar con grep lo que ningún extractor de enlaces busca — comentarios de desarrolladores, credenciales incrustadas, nombres de host internos — sin solicitudes adicionales--expand-specs): documentos OpenAPI 3.x, Swagger 2.0 e introspección de GraphQL, en JSON o YAML, convertidos en cada ruta que describen — una solicitud compra toda la superficie documentada--check-status también registra Location, Content-Length y Content-Type, y --check-title añade el <title> HTML--archived-discovery): cada versión distinta que conserva Wayback Machine, de modo que un Disallow: de 2015 sigue nombrando las rutas que el sitio ha dejado de mencionar desde entoncesurx cache para inspeccionar y mantener la caché: stats, list, prune, drop <domain>, clear
cargo install urx
### Desde Homebrew```bash
# https://formulae.brew.sh/formula/urx
brew install urx
git clone https://github.com/hahwul/urx.git cd urx cargo build --release
El binario compilado estará disponible en `target/release/urx`.
### Desde Docker
[ghcr.io/hahwul/urx](https://github.com/hahwul/urx/pkgs/container/urx)
### Autocompletado de Shell