
웹사이트의 실제 JS/CSS/자산(플래트 HTML이 아닌)을 다운로드하는 CLI
웹페이지에서 로드된 모든 리소스(브라우저 DevTools Sources 탭과 유사)를 캡처하여 원래 디렉토리 구조를 유지한 상태로 저장하는 Python CLI 도구입니다.
pip install pagesource
# 중요: 패키지 설치 후 Playwright 브라우저를 설치하세요
playwright install chromium
# 웹페이지에서 모든 리소스 캡처
pagesource https://example.com
이 명령은 모든 리소스를 ./pagesource_output/ 디렉토리에 원래 디렉토리 구조를 유지한 채 저장합니다.
# 사용자 정의 출력 디렉토리 지정
pagesource https://example.com -o ./my-output
# JavaScript 콘텐츠를 위한 추가 대기 시간 (SPA에 유용)
pagesource https://example.com --wait 5
# 외부 리소스 포함 (CDN 자산, 타사 스크립트)
pagesource https://example.com --include-external
# 옵션 조합
pagesource https://example.com -o ./output --wait 3 --include-external
pagesource <url> [OPTIONS]
인자:
url 리소스를 캡처할 웹페이지의 URL
옵션:
-o, --output PATH 출력 디렉토리 (기본값: ./pagesource_output)
-w, --wait INTEGER 페이지 로드 후 추가 대기 시간 (초)
-e, --include-external 외부 리소스 포함 (CDN, 타사)
-v, --version 버전 표시 후 종료
--help 도움말 표시
리소스는 URL 경로 구조를 유지한 채 저장됩니다:
pagesource_output/
└── example.com/
├── index.html
├── assets/
│ ├── css/
│ │ └── style.css
│ └── js/
│ └── app.js
└── images/
└── logo.png
--include-external을 사용하면 외부 리소스는 각 호스트 디렉토리에 저장됩니다:
pagesource_output/
├── example.com/
│ └── ...
├── cdn.example.com/
│ └── libs/
│ └── library.js
└── fonts.googleapis.com/
└── css/
└── font.css
MIT