
CLI para descargar los JS/CSS/assets reales de los sitios web (no HTML aplanado)
Una herramienta CLI de Python que captura todos los recursos cargados por una página web (como la pestaña Sources de las DevTools del navegador) y los guarda conservando la estructura de directorios original.
pip install pagesource
# IMPORTANT: Install Playwright browser after package installation
playwright install chromium
# Capture all resources from a webpage
pagesource https://example.com
Esto guardará todos los recursos en ./pagesource_output/ conservando la estructura de directorios.
# Specify custom output directory
pagesource https://example.com -o ./my-output
# Wait extra time for JavaScript content (useful for SPAs)
pagesource https://example.com --wait 5
# Include external resources (CDN assets, third-party scripts)
pagesource https://example.com --include-external
# Combine options
pagesource https://example.com -o ./output --wait 3 --include-external
pagesource <url> [OPTIONS]
Arguments:
url URL of the webpage to capture resources from
Options:
-o, --output PATH Output directory (default: ./pagesource_output)
-w, --wait INTEGER Additional seconds to wait after page load
-e, --include-external Include external resources (CDN, third-party)
-v, --version Show version and exit
--help Show help message
Los recursos se guardan conservando la estructura de la ruta URL:
pagesource_output/
└── example.com/
├── index.html
├── assets/
│ ├── css/
│ │ └── style.css
│ └── js/
│ └── app.js
└── images/
└── logo.png
Si se usa --include-external, los recursos externos se guardan en sus propios directorios de host:
pagesource_output/
├── example.com/
│ └── ...
├── cdn.example.com/
│ └── libs/
│ └── library.js
└── fonts.googleapis.com/
└── css/
└── font.css
MIT