
CLI для скачивания реальных JS/CSS/ресурсов веб-сайтов (не сплющенного HTML)
Инструмент командной строки на Python, который захватывает все ресурсы, загружаемые веб-страницей (как вкладка Sources в инструментах разработчика браузера), и сохраняет их с оригинальной структурой каталогов.
pip install pagesource
# IMPORTANT: Install Playwright browser after package installation
playwright install chromium
# Capture all resources from a webpage
pagesource https://example.com
Это сохранит все ресурсы в ./pagesource_output/ с сохранением структуры каталогов.
# Specify custom output directory
pagesource https://example.com -o ./my-output
# Wait extra time for JavaScript content (useful for SPAs)
pagesource https://example.com --wait 5
# Include external resources (CDN assets, third-party scripts)
pagesource https://example.com --include-external
# Combine options
pagesource https://example.com -o ./output --wait 3 --include-external
pagesource <url> [OPTIONS]
Arguments:
url URL веб-страницы для захвата ресурсов
Options:
-o, --output PATH Выходная директория (по умолчанию: ./pagesource_output)
-w, --wait INTEGER Дополнительное время ожидания после загрузки страницы (в секундах)
-e, --include-external Включать внешние ресурсы (CDN, сторонние)
-v, --version Показать версию и выйти
--help Показать справку
Ресурсы сохраняются с сохранением структуры URL-путей:
pagesource_output/
└── example.com/
├── index.html
├── assets/
│ ├── css/
│ │ └── style.css
│ └── js/
│ └── app.js
└── images/
└── logo.png
Если используется --include-external, внешние ресурсы сохраняются в собственных каталогах хостов:
pagesource_output/
├── example.com/
│ └── ...
├── cdn.example.com/
│ └── libs/
│ └── library.js
└── fonts.googleapis.com/
└── css/
└── font.css
MIT