
CLI pour télécharger les véritables JS/CSS/assets des sites web (pas du HTML aplati)
Un outil CLI Python qui capture toutes les ressources chargées par une page web (comme l'onglet Sources des DevTools du navigateur) et les enregistre avec la structure de répertoire d'origine.
pip install pagesource
# IMPORTANT: Install Playwright browser after package installation
playwright install chromium
# Capture all resources from a webpage
pagesource https://example.com
Cela enregistrera toutes les ressources dans ./pagesource_output/ en conservant la structure de répertoire.
# Specify custom output directory
pagesource https://example.com -o ./my-output
# Wait extra time for JavaScript content (useful for SPAs)
pagesource https://example.com --wait 5
# Include external resources (CDN assets, third-party scripts)
pagesource https://example.com --include-external
# Combine options
pagesource https://example.com -o ./output --wait 3 --include-external
pagesource <url> [OPTIONS]
Arguments :
url URL de la page web dont capturer les ressources
Options :
-o, --output PATH Répertoire de sortie (par défaut : ./pagesource_output)
-w, --wait INTEGER Secondes supplémentaires à attendre après le chargement de la page
-e, --include-external Inclure les ressources externes (CDN, tiers)
-v, --version Afficher la version et quitter
--help Afficher le message d'aide
Les ressources sont enregistrées en conservant la structure du chemin URL :
pagesource_output/
└── example.com/
├── index.html
├── assets/
│ ├── css/
│ │ └── style.css
│ └── js/
│ └── app.js
└── images/
└── logo.png
Si --include-external est utilisé, les ressources externes sont enregistrées dans leurs propres répertoires hôtes :
pagesource_output/
├── example.com/
│ └── ...
├── cdn.example.com/
│ └── libs/
│ └── library.js
└── fonts.googleapis.com/
└── css/
└── font.css
MIT