
CLI per scaricare i JS/CSS/asset effettivi dei siti web (non HTML appiattito)
Uno strumento CLI Python che cattura tutte le risorse caricate da una pagina web (come la scheda Sources degli strumenti di sviluppo del browser) e le salva mantenendo la struttura originale delle directory.
pip install pagesource
# IMPORTANT: Install Playwright browser after package installation
playwright install chromium
# Capture all resources from a webpage
pagesource https://example.com
Tutte le risorse verranno salvate in ./pagesource_output/ con la struttura delle directory preservata.
# Specify custom output directory
pagesource https://example.com -o ./my-output
# Wait extra time for JavaScript content (useful for SPAs)
pagesource https://example.com --wait 5
# Include external resources (CDN assets, third-party scripts)
pagesource https://example.com --include-external
# Combine options
pagesource https://example.com -o ./output --wait 3 --include-external
pagesource <url> [OPTIONS]
Arguments:
url URL of the webpage to capture resources from
Options:
-o, --output PATH Output directory (default: ./pagesource_output)
-w, --wait INTEGER Additional seconds to wait after page load
-e, --include-external Include external resources (CDN, third-party)
-v, --version Show version and exit
--help Show help message
Le risorse vengono salvate mantenendo la struttura del percorso URL:
pagesource_output/
└── example.com/
├── index.html
├── assets/
│ ├── css/
│ │ └── style.css
│ └── js/
│ └── app.js
└── images/
└── logo.png
Se si usa --include-external, le risorse esterne vengono salvate nelle rispettive directory host:
pagesource_output/
├── example.com/
│ └── ...
├── cdn.example.com/
│ └── libs/
│ └── library.js
└── fonts.googleapis.com/
└── css/
└── font.css
MIT